Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

NVIDIA ModelExpress: ускорение загрузки моделей до скорости света через GPU-to-GPU RDMA

NVIDIA ModelExpress сокращает время старта DeepSeek-V4 Pro с 8 минут до менее чем 2 минут через прямую передачу весов между GPU по RDMA. Разбираем архитектуру,

Коротко

Что будет в материале

  1. 01

    Как ModelExpress решает проблему долгой загрузки моделей

  2. 02

    Архитектура ModelExpress: прямая передача весов и кэширование

  3. 03

    Практические результаты: тестирование на DeepSeek-V4 Pro

  4. 04

    Сценарии применения: от инференса до post-training RL

Загрузка весов большой языковой модели в сотни GPU-ускорителей - это узкое место, которое съедает минуты вычислительного времени. NVIDIA представила ModelExpress (MX), сервис распределения весов и управления кэшем в составе платформы NVIDIA Dynamo. Результат: время старта модели DeepSeek-V4 Pro сократилось с 8 минут до менее чем 2 минут. Ускорение достигается за счёт прямого обмена данными между GPU через RDMA, минуя централизованные широковещательные рассылки.

Инференс-воркеры получают обновлённые веса напрямую от других ускорителей по протоколу NIXL. Перемещение данных выводится из критического пути, а кэши ядер (kernel caches) переиспользуются между запусками. Этот подход применим не только на этапе инференса, но и в процессе post-training reinforcement learning, где каждая минута простоя GPU-кластера обходится дорого.

Как ModelExpress решает проблему долгой загрузки моделей

Традиционная схема загрузки весов выглядит так: центральный узел считывает модель из хранилища и рассылает копии всем инференс-воркерам. При масштабе в сотни GPU этот процесс упирается в пропускную способность одного источника. Возникает каскадная задержка - пока последний воркер не получит полный набор весов, система простаивает.

ModelExpress заменяет централизованную рассылку на прямую передачу GPU-to-GPU через RDMA. Технология RDMA позволяет сетевому адаптеру читать и писать данные напрямую в память GPU, обходя CPU и оперативную память хоста. Задержки снижаются, пропускная способность растёт. Протокол NIXL, оптимизированный под коллективные операции в инференсе, координирует асинхронную передачу: воркер, уже получивший веса, сам становится источником для соседей.

Сервис входит в состав NVIDIA Dynamo - платформы для оркестрации инференс-нагрузок. Помимо распределения весов, ModelExpress управляет кэшами ядер. После первого запуска модели скомпилированные ядра сохраняются и переиспользуются при повторных стартах. Это экономит время на JIT-компиляцию и инициализацию, которое для тяжёлых моделей может составлять десятки секунд.

Цифры подтверждают эффективность: DeepSeek-V4 Pro, одна из самых ресурсоёмких моделей на рынке, стартует быстрее в 4 раза. Вместо 8 минут ожидания инженер получает готовый к работе инференс-сервер менее чем за 2 минуты. Для production-среды с частыми обновлениями моделей такая разница означает принципиально иной уровень доступности сервиса.

Если вы работаете с MoE-моделями, посмотрите руководство по запуску MoE-моделей на одной видеокарте - там разбираются техники управления VRAM-кэшем и offload экспертов для llama.cpp.

Архитектура ModelExpress: прямая передача весов и кэширование

ModelExpress состоит из двух ключевых компонентов: сервиса распределения весов и менеджера кэша. Первый отвечает за маршрутизацию данных между GPU, второй - за сохранение и восстановление скомпилированных ядер. Оба компонента интегрированы в планировщик NVIDIA Dynamo и работают прозрачно для инференс-рантаймов вроде vLLM или TensorRT-LLM.

Роль RDMA и NIXL в ускорении передачи весов

RDMA - это не просто «быстрая сеть». Это механизм прямого доступа к памяти устройства, который исключает копирование данных через буферы CPU. Сетевой адаптер с поддержкой RDMA (InfiniBand или RoCE) читает блок весов из GPU-памяти отправителя и записывает его напрямую в GPU-память получателя. Задержка измеряется микросекундами, а пропускная способность приближается к теоретическому пределу сетевого интерфейса.

NIXL - протокол уровня приложения, спроектированный NVIDIA для коллективных операций в инференсе. Он реализует топологию «peer-to-peer broadcast»: каждый воркер, получивший полный набор весов, становится источником для следующего. Это напоминает лавинную рассылку, где скорость распространения растёт экспоненциально с числом участников. В отличие от классического all-reduce, NIXL оптимизирован под однонаправленный поток данных и не требует синхронизации всех участников на каждом шаге.

Перемещение весов выводится из критического пути. Пока воркер ждёт недостающие блоки, он может начинать инициализацию кэша ядер или загружать KV-кэш из предыдущих сессий. Асинхронная модель NIXL позволяет совмещать передачу данных с подготовительными операциями, дополнительно сокращая общее время старта.

Управление кэшем ядер: сокращение накладных расходов

Kernel caches - это скомпилированные под конкретный GPU варианты вычислительных ядер. При первом запуске модели рантайм компилирует сотни ядер: матричные умножения, attention-операции, активационные функции. Для MoE-моделей вроде DeepSeek-V4 Pro количество уникальных ядер исчисляется тысячами из-за комбинаций экспертов и размеров батчей.

ModelExpress сохраняет скомпилированные ядра в распределённый кэш и привязывает их к хэшу конфигурации модели. При повторном старте или масштабировании воркеры получают готовые ядра от соседних GPU, избегая повторной компиляции. Это сокращает время инициализации на 15-30 секунд для крупных моделей. Кэш обновляется инкрементально: при смене версии модели перекомпилируются только изменившиеся ядра.

Для тех, кто экспериментирует с разными инференс-рантаймами, будет полезен технический разбор запуска DeepSeek-V4-Flash на одном B300 - там детально описаны проблемы MoE-ядер без expert parallel и деградация DSpark в насыщенном батче.

Практические результаты: тестирование на DeepSeek-V4 Pro

NVIDIA провела замеры на конфигурации с DeepSeek-V4 Pro - моделью, чей размер весов превышает 700 ГБ в FP8. Без ModelExpress загрузка занимала 8 минут: централизованная рассылка через CPU-буферы упиралась в пропускную способность одного узла. С включённым ModelExpress и RDMA-сетью время старта сократилось до менее чем 2 минут.

Детали тестовой конфигурации NVIDIA не раскрыла полностью. Известно, что использовалась RDMA-совместимая сеть (предположительно InfiniBand NDR400) и GPU архитектуры Hopper. Количество ускорителей не уточняется, но для модели такого размера речь идёт о 16-32 GPU. Важно понимать: выигрыш от ModelExpress растёт с масштабом кластера. На 4-8 GPU разница с централизованной загрузкой будет менее заметна, на 64+ GPU - кратность ускорения приближается к 4-5x.

Помимо времени старта, косвенно снижается нагрузка на хранилище. Вместо того чтобы каждый воркер читал полную копию модели с диска, данные однократно загружаются на несколько «seed»-GPU и распространяются через RDMA. Это уменьшает требования к пропускной способности storage-системы и снижает износ SSD при частых перезапусках.

Сценарии применения: от инференса до post-training RL

ModelExpress решает две конкретные проблемы: долгий холодный старт инференс-сервера и простои GPU при итеративной перезагрузке весов в процессе обучения. Оба сценария критичны для команд, работающих с большими моделями на дорогих кластерах.

Инференс: минимизация времени холодного старта

В production-среде модели обновляются часто: новые чекпоинты, A/B-тестирование версий, ротация по расписанию. Каждое обновление требует перезагрузки весов на всех воркерах. При времени старта 8 минут и 10 обновлениях в день кластер простаивает 80 минут - это потерянные деньги и пропускная способность.

С ModelExpress время простоя сокращается до 20 минут в день. Для сервиса с SLA 99.9% это разница между соблюдением метрики и её нарушением. Быстрый старт также упрощает автомасштабирование: новые воркеры включаются в работу за 2 минуты вместо 8, что позволяет оперативнее реагировать на всплески нагрузки.

Кэширование ядер даёт дополнительный выигрыш при запуске нескольких копий одной модели. Первый воркер компилирует ядра и сохраняет их в кэш, остальные получают готовые. На практике это экономит 20-40 секунд на каждую дополнительную реплику. При сравнении моделей для агентных задач обратите внимание на прямое сравнение Minimax 2.7, DeepSeek V4 Flash и Laguna S 2.1 - там замеры качества кода, скорости и стоимости на стенде с 192 ГБ VRAM.

Обучение с подкреплением: сокращение простоев GPU

Post-training reinforcement learning (RLHF, DPO, GRPO) подразумевает итеративный процесс: модель генерирует ответы, reward-модель оценивает их, веса основной модели обновляются. Каждая итерация требует перезагрузки обновлённых весов на инференс-воркеры. Без ModelExpress кластер простаивает на каждой итерации, ожидая завершения централизованной рассылки.

С прямой передачей GPU-to-GPU время перезагрузки сокращается пропорционально размеру модели. Для DeepSeek-V4 Pro это экономия 6 минут на каждой итерации. При тысячах итераций RL-тренировки суммарная экономия измеряется днями вычислительного времени. Стоимость часа аренды GPU-кластера такого уровня - тысячи долларов, поэтому окупаемость ModelExpress наступает быстро.

Механизм переиспользования кэша ядер здесь тоже работает: архитектура модели не меняется между итерациями RL, поэтому ядра компилируются однократно. Обновляются только значения весов, которые передаются через RDMA без затрагивания скомпилированного кода.

Ограничения и требования к внедрению

ModelExpress - не универсальное решение. Первое и главное требование: RDMA-совместимая сеть. Это InfiniBand (HDR, NDR) или RoCE v2 на базе Ethernet-адаптеров с поддержкой RDMA (ConnectX-6 и новее). Обычный Ethernet без RDMA не подойдёт - задержки и нагрузка на CPU нивелируют весь выигрыш.

Второе ограничение - совместимость с GPU. Исходя из архитектуры, ModelExpress ориентирован на GPU с аппаратной поддержкой RDMA-транзакций между устройствами. Это архитектуры Hopper (H100, H200) и Blackwell (B100, B200). Более старые поколения (Ampere, Ada) могут работать через RDMA на уровне хоста, но не получат полного ускорения GPU-to-GPU.

Третье: ModelExpress - компонент NVIDIA Dynamo. Развёртывание требует установки и настройки всей платформы, что добавляет операционные затраты. Для небольших инференс-установок на 2-4 GPU выигрыш от ModelExpress минимален, а сложность внедрения может не окупиться.

Четвёртое: информация о совместимости с моделями, отличными от DeepSeek, пока ограничена. NVIDIA анонсировала поддержку основных архитектур (Llama, Mixtral, Nemotron), но конкретные цифры ускорения для них не опубликованы. Если ваш пайплайн завязан на специфическую модель, стоит дождаться независимых бенчмарков или протестировать в изолированной среде.

Пятое: кэш ядер привязан к конкретной версии GPU-драйвера, CUDA и рантайма. Обновление любого из этих компонентов инвалидирует кэш и требует повторной компиляции. В средах с частыми обновлениями драйверов эффект от кэширования будет снижен.

ModelExpress в экосистеме NVIDIA Dynamo

NVIDIA Dynamo - платформа для оркестрации инференса, объединяющая несколько сервисов: планировщик запросов, менеджер KV-кэша, сервис распределения весов (ModelExpress) и мониторинг. Платформа абстрагирует инфраструктурный слой, позволяя инференс-рантаймам фокусироваться на вычислениях.

ModelExpress интегрируется с другими компонентами Dynamo. Планировщик запросов учитывает статус загрузки весов на каждом воркере и не направляет запросы на неподготовленные GPU. Менеджер KV-кэша координирует миграцию контекста между воркерами одновременно с передачей весов. Это обеспечивает сквозную оптимизацию: модель загружается, кэш ядер восстанавливается, KV-кэш переносится - и воркер готов принимать запросы.

Для команд, использующих облачные инференс-решения, ModelExpress снижает время развёртывания новых инстансов. В комбинации с быстрыми VM на новых сериях AMD, такими как Azure ND MI455X v7 на AMD Instinct, можно построить инференс-пайплайн с минимальными задержками на всех этапах - от выделения ресурсов до обработки первого запроса.

В перспективе NVIDIA планирует расширить ModelExpress на сценарии тренировки моделей (pre-training), где загрузка чекпоинтов при восстановлении после сбоев также критична. Для MoE-моделей с экспертами, распределёнными по сотням GPU, прямая передача весов через RDMA может сократить время восстановления с десятков минут до единиц минут.

Подписаться на канал