Перейти к содержанию
Публикация AiManual

BLOOMZ на Habana Gaudi2: бенчмарк инференса против NVIDIA A100

Gaudi2 против A100: инференс BLOOMZ 176B и 7B. Ускорение в 1.42 и 2.89 раза, архитектура HPU, цена за токен и инструкции по воспроизведению тестов с Optimum Hab

Коротко

Что будет в материале

  1. 01

    Ключевые результаты: Gaudi2 обгоняет A100 в инференсе BLOOMZ

  2. 02

    Методология тестирования: как мы сравнивали

  3. 03

    Архитектура Habana Gaudi2: почему она быстрее для LLM

  4. 04

    Ценовая эффективность: Gaudi2 против A100

Ключевые результаты: Gaudi2 обгоняет A100 в инференсе BLOOMZ

Habana Gaudi2 показывает существенное преимущество перед NVIDIA A100 80GB в инференсе моделей семейства BLOOMZ. Для BLOOMZ 176B на 8 устройствах Gaudi2 оказывается в 1.42 раза быстрее A100. Для BLOOMZ-7B на одном устройстве разрыв увеличивается до 2.89 раза при использовании DeepSpeed-inference. Эти цифры получены при batch size 1, sequence length 2048 и точности FP16/BF16.

Ценовая эффективность первого поколения Gaudi для 7B модели оказывается лучше, чем у A100. Это делает Gaudi2 практичным выбором для команд, которые разворачивают инференс LLM среднего размера и считают стоимость на токен.

Если вы уже работаете с open-weight моделями, посмотрите наш разбор релизов 2026 года с бенчмарками на H100 и RTX 4090.

Методология тестирования: как мы сравнивали

Сравнение проводилось в двух конфигурациях: масштабируемая для большой модели и однокарточная для компактной. Обе конфигурации используют DeepSpeed-inference для оптимизации вычислительного графа и снижения накладных расходов.

Конфигурация для BLOOMZ 176B

Для модели с 176 миллиардами параметров использовались 8 устройств Gaudi2 и 8 устройств A100 80GB. Применялся tensor parallelism для распределения весов и активаций между картами. Параметры запуска: batch size 1, sequence length 2048, точность FP16/BF16. Такая конфигурация проверяет масштабируемость и пропускную способность межсоединений при работе с моделью, которая не помещается на один ускоритель.

Конфигурация для BLOOMZ-7B

Для модели с 7 миллиардами параметров использовалось одно устройство Gaudi2 и одно устройство A100 80GB. Параметры те же: batch size 1, sequence length 2048, точность FP16/BF16. Однокарточный сценарий важен для оценки латентности в реальных сервисах, где запросы обрабатываются независимо и важна минимальная задержка ответа.

Версии библиотек: SynapseAI для Gaudi2, Optimum Habana от Hugging Face для интеграции с трансформерами. На стороне NVIDIA использовались стандартные сборки PyTorch и DeepSpeed-inference.

Архитектура Habana Gaudi2: почему она быстрее для LLM

Gaudi2 оснащён 96 ГБ памяти HBM2e с пропускной способностью 2.45 ТБ/с. Для сравнения, A100 80GB имеет 80 ГБ HBM2e с пропускной способностью 2.0 ТБ/с. Больший объём памяти позволяет держать более крупные порции весов и KV-кэша на устройстве, что снижает обращения к хосту и ускоряет декодирование.

В Gaudi2 интегрированы специализированные тензорные ядра, ориентированные на матричные операции, характерные для трансформеров. Аппаратная поддержка RoCE позволяет объединять до 8 ускорителей в единый домен с высокой пропускной способностью, что критично для моделей уровня 176B.

SynapseAI и HPU-графы: программная оптимизация

SynapseAI компилирует модель в оптимизированный граф вычислений, который исполняется на HPU с минимальными задержками. Вместо запуска множества отдельных ядер с накладными расходами на синхронизацию, HPU-графы объединяют операции в целостный вычислительный поток. Это снижает оверхед на запуск ядер и позволяет эффективнее использовать вычислительные блоки при инференсе с малым batch size.

Для команд, которые ищут бюджетные варианты инференса, полезен наш тест CPU-only инференса на Celeron N5095, где видно, как упирается в пропускную способность памяти даже 8B модель.

Ценовая эффективность: Gaudi2 против A100

Ориентировочная стоимость одного Gaudi2 составляет около 10-12 тысяч долларов, A100 80GB - около 15 тысяч долларов. Для BLOOMZ-7B на одном устройстве Gaudi2 даёт ускорение в 2.89 раза при меньшей цене карты. Стоимость за токен снижается примерно в 3.5-4 раза.

Для BLOOMZ 176B требуется 8 устройств в обоих случаях. Стоимость стенда на Gaudi2 оказывается ниже за счёт цены отдельных карт, а производительность выше в 1.42 раза. Первое поколение Gaudi для 7B модели даёт лучшее соотношение цена/производительность, чем A100, что подтверждает экономическую привлекательность платформы Habana для инференса.

Если вы сравниваете стоимость инференса разных моделей, посмотрите разбор Minimax 2.7, DeepSeek V4 Flash и Laguna S 2.1 на 192 ГБ VRAM с конкретными цифрами по цене и скорости.

Воспроизведение бенчмарка с Optimum Habana

Библиотека Optimum Habana от Hugging Face предоставляет готовые скрипты для запуска инференса моделей на ускорителях Gaudi. Основные шаги:

  1. Установите SynapseAI и драйверы Habana.
  2. Установите Optimum Habana через pip.
  3. Загрузите модель BLOOMZ из Hugging Face Hub.
  4. Запустите скрипт инференса с DeepSpeed-inference.

Для воспроизведения потребуется доступ к Gaudi2: локально или через облачный сервис с такими ускорителями. Скрипты принимают параметры batch size, sequence length и precision, что позволяет повторить условия теста.

Для тех, кто работает с локальными сборками, будет полезен разбор сборки на четырёх Tesla P100, где показаны реальные замеры токенов в секунду на бюджетном железе.

Ограничения и выводы

Результаты зависят от версий SynapseAI, Optimum Habana и DeepSpeed-inference. Обновления библиотек могут изменить цифры как в лучшую, так и в худшую сторону. Gaudi2 менее распространён, чем A100, и поддержка в некоторых фреймворках может быть ограничена. Перед закупкой стоит проверить совместимость с вашим стеком.

Gaudi2 - серьёзный конкурент для инференса LLM. Для моделей среднего размера, таких как BLOOMZ-7B, он даёт ускорение в 2.89 раза и лучшую цену за токен. Для крупных моделей уровня 176B преимущество скромнее, но остаётся значимым. Если вы планируете разворачивать инференс open-weight моделей, Gaudi2 заслуживает оценки в вашем сценарии.

Свежие сравнения open-weight моделей с бенчмарками и рекомендациями по выбору собраны в обзоре релизов 2026 года.

Подписаться на канал