Перейти к содержанию
Публикация AiManual

Qwen3-8 2.4T на NVIDIA GB300 NVL72: рекордные 288k токенов/с и что это значит для инференса гигантских моделей

NVIDIA GB300 NVL72 выдаёт 288k токенов/с на Qwen3-8 2.4T в FP8. Разбираем цифры, сравнение с GB200 и H100, экономику инференса и потенциал NVFP4.

Коротко

Что будет в материале

  1. 01

    Введение: новый рекорд инференса для гигантских моделей

  2. 02

    Архитектура NVIDIA GB300 NVL72: почему она так эффективна для MoE

  3. 03

    Qwen3-8: гигантская модель с разреженной активацией

  4. 04

    Производительность в цифрах: 288k токенов/с на систему

Введение: новый рекорд инференса для гигантских моделей

NVIDIA заявила о пропускной способности более 4k токенов в секунду на каждый из 72 GPU в системе GB300 NVL72 при обслуживании модели Qwen3-8 с 2.4 триллиона параметров. Суммарная производительность достигает 288k токенов/с в конфигурации FP8. Это рекорд для моделей такого масштаба.

Скорость 350 токенов/с на пользователя меняет требования к реальным продакшн-системам. Данные основаны на заявлениях NVIDIA и требуют независимой проверки, но уже сейчас они показывают, насколько эффективно масштабируется инференс для архитектур с разреженной активацией Mixture of Experts.

Для сравнения: локальный запуск Qwen3.8 2.4T на связке из двух RTX 5090 и трёх RTX 3090 дал лишь 0.25 токена в секунду. Разрыв между потребительским железом и серверными платформами достигает шести порядков. Подробный разбор этого кейса доступен в статье о границах локального инференса Qwen3.8 2.4T.

Архитектура NVIDIA GB300 NVL72: почему она так эффективна для MoE

GB300 NVL72 объединяет 72 GPU в единую систему с высокоскоростными интерконнектами и увеличенной памятью HBM. Архитектура оптимизирована для моделей с разреженной активацией, где на каждый токен активируется лишь подмножество экспертов. Эффективная коммуникация между GPU критична: эксперты распределены по разным устройствам, и задержка при передаче данных напрямую влияет на общую пропускную способность.

Роль NVLink и NVSwitch в масштабировании инференса

NVLink и NVSwitch обеспечивают высокую пропускную способность между GPU, что критично для MoE. При разреженной активации разные эксперты обрабатывают разные токены, и данные должны быстро перемещаться между устройствами. Пропускная способность интерконнекта в GB300 NVL72 значительно превосходит PCIe, что позволяет избежать узких мест при распределении нагрузки.

Увеличенная память HBM: хранение 2.4T параметров

Каждый GPU в GB300 NVL72 оснащён 192 ГБ HBM3e, суммарный объём системы превышает 13 ТБ. Это позволяет хранить все параметры Qwen3-8 в памяти без оффлоадинга на CPU или NVMe. Для модели с 2.4 триллиона параметров в FP8 требуется около 2.4 ТБ видеопамяти, что укладывается в суммарный объём системы с запасом под KV-кэш и промежуточные активации.

Qwen3-8: гигантская модель с разреженной активацией

Qwen3-8 использует архитектуру Mixture of Experts. Из 2.4 триллиона параметров на каждый токен активируется лишь небольшая часть, что снижает вычислительные затраты по сравнению с dense-моделями аналогичного размера. Точное число экспертов и количество активируемых на токен не раскрыто в официальных материалах, но типичные MoE-модели такого масштаба активируют 8-16 экспертов из сотен доступных.

Модель разработана Alibaba Cloud и доступна на Hugging Face. Открытые веса позволяют исследователям тестировать инференс на разном железе, от потребительских GPU до серверных платформ. Практический опыт запуска MoE-моделей на ограниченных ресурсах описан в материале о MoE-моделях с 2B активных параметров.

Производительность в цифрах: 288k токенов/с на систему

Официальные цифры NVIDIA: более 4k токенов/с на GPU в FP8, суммарно 288k токенов/с на систему из 72 GPU. Это throughput при батч-обработке, когда несколько запросов обрабатываются параллельно. Показатель демонстрирует масштабируемость платформы: производительность растёт почти линейно с числом GPU.

Сравнение с GB200 и H100: эволюция производительности

Точные сравнительные данные для Qwen3-8 на GB200 и H100 отсутствуют, но косвенные оценки показывают значительный прогресс. H100 с 80 ГБ HBM не может разместить модель 2.4T параметров даже в FP8 без оффлоадинга, что делает его непригодным для этой задачи. GB200 NVL72 с 192 ГБ HBM3e на GPU уже способен хранить модель целиком, но пропускная способность интерконнекта и вычислительная мощность уступают GB300. Переход на GB300 даёт прирост за счёт более быстрой памяти и оптимизированной сетевой подсистемы.

Влияние формата данных: FP8 vs NVFP4

FP8 - 8-битное число с плавающей запятой, обеспечивающее баланс точности и скорости. Для Qwen3-8 в FP8 требуется около 2.4 ТБ памяти под веса. NVFP4 - 4-битный формат, который обещает удвоение производительности при незначительной потере точности. Переход на NVFP4 сократит требования к памяти вдвое и позволит либо обслуживать больше пользователей, либо запускать ещё более крупные модели.

Что означает 350 токенов/с на пользователя для продакшн-систем

При 288k токенов/с система может обслуживать около 823 одновременных пользователей при скорости 350 токенов/с на каждого. Расчёт: 288000 / 350 ≈ 823. Для комфортного чтения человеку достаточно 20-50 токенов/с, поэтому 350 токенов/с - избыточная скорость для одного пользователя, но она позволяет обслуживать больше одновременных сессий.

Экономика инференса: стоимость на токен

Высокая пропускная способность снижает стоимость на токен. Точная цена системы GB300 NVL72 не раскрыта, но серверные платформы такого класса стоят миллионы долларов. При амортизации за 3-5 лет и энергопотреблении в десятки киловатт стоимость инференса для гигантских моделей становится сопоставимой с облачными сервисами, а при полной загрузке - ниже.

Требования к инфраструктуре для развертывания

GB300 NVL72 - стоечное решение с жидкостным охлаждением. Требования к электропитанию исчисляются десятками киловатт на стойку. Для большинства компаний такое железо избыточно: если задача не требует обслуживания тысяч одновременных пользователей на модели 2T+ параметров, облачные инстансы или меньшие конфигурации практичнее. Опыт запуска моделей на одном B300 описан в техническом разборе DeepSeek-V4-Flash.

Потенциал NVFP4: следующий шаг в производительности

NVFP4 - 4-битный формат с плавающей запятой, поддерживаемый новыми GPU NVIDIA. Он может удвоить производительность по сравнению с FP8 при незначительной потере точности. Для MoE-моделей с разреженной активацией квантизация особенно эффективна: активируемые эксперты чувствительны к точности меньше, чем dense-слои.

Переход на NVFP4 потребует калибровки и адаптации моделей. Не все архитектуры одинаково хорошо переносят 4-битную квантизацию. Практические примеры квантизации на потребительском железе разобраны в бенчмарках Gemma 4 и Qwen 3.6 MoE на APU AMD 6800H.

Будущее инференса гигантских моделей: тренды и прогнозы

Рост производительности железа стимулирует создание ещё более крупных моделей. Тенденция к MoE-архитектурам усиливается: разреженная активация позволяет наращивать число параметров без пропорционального роста вычислительных затрат. В ближайшие годы вероятно появление моделей с десятками триллионов параметров, обслуживаемых на системах класса GB300 NVL72.

Роль программного обеспечения: NVIDIA Dynamo и GPU Memory Service

Производительность зависит от софта не меньше, чем от железа. NVIDIA Dynamo - фреймворк для инференса LLM, оптимизирующий распределение нагрузки между GPU. GPU Memory Service (GMS) позволяет нескольким движкам отображать одни и те же веса без дублирования в HBM, экономя память. Shadow Engine Recovery сокращает время восстановления после сбоя с 283 до 7.3 секунд - бенчмарк на GLM-5.2 с NVIDIA B200 показал ускорение в 39 раз.

Заключение: что это значит для индустрии и для вас

GB300 NVL72 демонстрирует впечатляющую производительность для гигантских MoE-моделей: 288k токенов/с на систему, 350 токенов/с на пользователя. Это снижает стоимость инференса и открывает новые возможности для приложений, требующих модели уровня 2T+ параметров.

Для большинства компаний такие системы пока избыточны. Тренд указывает на демократизацию доступа к мощным моделям через облачные сервисы. Следите за развитием NVFP4 и оптимизациями софта, оценивайте свои потребности и рассматривайте облачные варианты для старта. Практические замеры на меньших конфигурациях помогут понять, какая производительность реально нужна вашей задаче - например, тест Strix Halo под нагрузкой показывает, чего можно достичь на компактных системах.

Подписаться на канал