Перейти к содержанию
Публикация AiManual

Западные open-модели для локального продакшена на 4×H100: что разворачивать при запрете китайских моделей

Разбираем западные open-модели класса 120B+ с поддержкой зрения для кластера 4×H100: Inkling Small, Command A+ и варианты без vision. Арифметика VRAM, оценка ск

Коротко

Что будет в материале

  1. 01

    Почему выбор западных open-моделей 120B+ - это отдельная задача

  2. 02

    Критерии выбора: что важно для локального продакшена на 4×H100

  3. 03

    Основные западные open-модели 120B+ с поддержкой зрения

  4. 04

    Сравнение с китайскими SOTA-моделями: насколько велик разрыв

Кластер из четырёх NVIDIA H100 даёт 320 ГБ памяти HBM3: по 80 ГБ на карту. Этого хватает, чтобы держать модель класса 120B в FP8 с запасом под KV-кэш, и не хватает, чтобы перебирать варианты наугад. Если руководство запрещает китайские open-модели, привычный шорткат ломается: GLM, Qwen и DeepSeek занимают верх открытых рейтингов, а в категории 120B+ с поддержкой зрения западных альтернатив единицы.

Короткий ответ по набору кандидатов такой. Thinking Machines Inkling Small закрывает большую часть требований, включая работу с изображениями, но отстаёт от GLM 5.3 Flash примерно на 16 пунктов по оценке Artificial Analysis (AA). Cohere Command A+ проходит по большинству критериев, но упирается в контекстное окно 128k. Poolside Laguna S 2.1 и Nvidia Nemotron 3 Super годятся для текстовых задач, однако поддержки зрения у них нет. Получается четыре имени, и каждое требует компромисса.

Дальше: чек-лист критериев, арифметика VRAM и скорости под 4×H100, разбор практических сценариев и методология, в которой AA-оценка модели - только одна переменная из нескольких.

Цифры по Inkling Small, Command A+, Laguna S 2.1, Nemotron 3 Super и разнице в 16 пунктов AA взяты из исходной постановки задачи и независимо не подтверждены. Перед развёртыванием сверяйте их с актуальными карточками моделей и свежими замерами: открытые релизы обновляются каждые несколько недель.

Почему выбор западных open-моделей 120B+ - это отдельная задача

Открытые веса перестали означать «слабее закрытых». Верх открытого сегмента в 2026 году держат китайские лаборатории: GLM, Qwen и DeepSeek. В категории 120B+ с поддержкой зрения разрыв виднее, чем в текстовой, потому что западные команды в этом размере чаще выпускают модели без vision либо ограничивают окно контекста.

Запрет на китайские модели выбивает из шортлиста самые сильные варианты по соотношению качества и стоимости инференса на своём железе. Решение приходится собирать из того, что осталось. Практические следствия:

  • Кандидатов мало, поэтому каждая модель оценивается сразу по нескольким осям: качество, vision, контекст, память, лицензия.
  • Выбор превращается в компромисс: сильная модель без vision проваливается на мультимодальных задачах, а модель с vision и коротким контекстом упирается в RAG.
  • Аргументацию для руководства строят на пунктах AA-оценки и на замерах на своих данных, а не на общих словах про «лучшую модель».

Точка отсчёта в исходной задаче - GLM 5.3 Flash. Inkling Small отстаёт от неё примерно на 16 пунктов AA. Индекс Artificial Analysis агрегирует несколько бенчмарков сразу, поэтому 16 пунктов означают заметную разницу в сложных рассуждениях и следовании инструкциям, но не приговор. На узкой задаче с хорошо подготовленным контекстом и проверяемым результатом разрыв часто сжимается до нескольких процентов по доле успешных прогонов.

Критерии выбора: что важно для локального продакшена на 4×H100

Чек-лист, по которому стоит прогонять каждого кандидата:

  1. Класс параметров. 120B и выше. Младшие модели дешевле по памяти, но на сложных промптах требуют больше итераций и внешней инфраструктуры.
  2. Поддержка зрения. Нужна, если в пайплайне есть OCR, разбор схем, скриншотов, сканов и таблиц-картинок.
  3. Контекстное окно. 128k - рабочий минимум для RAG по регламентам и договорам. Для агентов с историей сессии и логами лучше 200k и выше.
  4. Квантизация. Наличие весов FP8 и INT4 определяет, сколько памяти останется под KV-кэш и с какой скоростью пойдёт генерация.
  5. Лицензия и юрисдикция. Право коммерческого использования, ограничения на отрасли, страна вендора, доступность весов без телеметрии.
  6. Поддержка фреймворков. Готовые рецепты под vLLM или TensorRT-LLM экономят дни отладки tensor parallelism.
  7. Обновляемость. Частота релизов и болезненность перехода между версиями: смена чат-шаблона ломает агентные пайплайны.
  8. Совместимость с инфраструктурой. Формат tool-calling, structured output, поведение на длинных сессиях.

Первые четыре пункта отсекают кандидатов быстро, остальные определяют, сколько времени уйдёт на внедрение. Расширенный чек-лист оценки новинок без шума вокруг релизов разобран отдельно: как не потеряться в потоке запусков AI-моделей.

Основные западные open-модели 120B+ с поддержкой зрения

Полноценных западных open-вариантов с vision в этом размере на сентябрь 2026 года два: Inkling Small и Command A+. Ещё две модели из исходного списка закрывают текстовые задачи и лишены анализа изображений.

Thinking Machines Inkling Small: компромисс между качеством и требованиями

Модель проходит по ключевым требованиям: класс 120B+, поддержка зрения, открытые веса. По совокупности критериев она лидирует среди западных кандидатов, и это делает её дефолтным выбором, когда нужно закрыть и текст, и картинки одним эндпоинтом. Слабое место одно, зато заметное: около 16 пунктов AA до GLM 5.3 Flash.

На практике это означает следующее. Задачи с чёткой спецификацией (извлечение полей из сканов, классификация, разметка, суммаризация по шаблону) закрываются хорошо. Задачи, где нужна длинная цепочка рассуждений без промежуточной проверки (сложная отладка, многошаговое планирование, математика), требуют внешней валидации: тестов, схемы JSON, второго прохода. Контекстное окно модели в исходном описании не приводилось, поэтому его стоит проверить в карточке перед тем, как планировать RAG на больших корпусах.

Cohere Command A+: сильный кандидат с ограничением по контексту

Command A+ подходит по большинству критериев, включая работу с изображениями, и единственное известное ограничение из исходных данных - контекстное окно 128k. Для корпоративного сегмента это ожидаемо: Cohere исторически ориентируется на RAG и поиск по базе знаний, а не на бесконечные чаты.

Где 128k хватает: чат-бот поддержки, разбор договора на 60-80 страниц, ответы по внутренней базе с предварительным поиском, где в промпт попадают 10-20 релевантных фрагментов. Где не хватает: сквозной анализ годового отчёта целиком, агент с историей из сотен шагов, одновременная работа с несколькими длинными документами в одном запросе. В этих сценариях 128k вынуждает строить многоступенчатый пайплайн с пересказом промежуточных результатов, а каждый пересказ теряет детали.

По памяти модель укладывается в кластер из 4×H100 в FP8, если параметрический класс укладывается в диапазон 120B и есть готовые квантованные веса. Точные требования смотрите в карточке: у разных релизов разное число слоёв и голов внимания, а это напрямую влияет и на вес, и на KV-кэш.

Poolside Laguna S 2.1 и Nvidia Nemotron 3 Super: варианты без зрения

Laguna S 2.1 в разборах на AI-Manual описывалась как MoE-модель около 118 млрд параметров с 8 млрд активных. Архитектура разреженная, поэтому при генерации читается не весь вес модели, а только активная часть, и скорость на одном запросе получается существенно выше, чем у плотной модели того же размера. Подробные замеры качества кода и стоимости инференса на стенде с 192 ГБ VRAM собраны в материале про Minimax 2.7, DeepSeek V4 Flash и Laguna S 2.1.

Nvidia Nemotron 3 Super в исходном списке идёт как ещё один кандидат уровня 120B+ без поддержки зрения, с готовыми квантованными сборками под NVIDIA-стек. Практическая ценность обеих моделей проявляется в текстовых пайплайнах: генерация кода, извлечение данных, маршрутизация запросов, черновая разметка. Если в продукте есть анализ изображений, эти две модели закрывают только текстовую часть, и рядом нужен отдельный vision-компонент.

МодельКлассЗрениеКонтекстГлавное ограничение
Thinking Machines Inkling Small120B+ДаУточнять в карточке моделиОтставание от GLM 5.3 Flash около 16 пунктов AA
Cohere Command A+120B+Да128kМалого окна не хватает для сквозного анализа больших корпусов
Poolside Laguna S 2.1около 118B, MoEНетУточнять в карточке моделиНет анализа изображений
Nvidia Nemotron 3 Super120B+НетУточнять в карточке моделиНет анализа изображений

Сравнение с китайскими SOTA-моделями: насколько велик разрыв

Единственная количественная зацепка из исходных данных: Inkling Small отстаёт от GLM 5.3 Flash примерно на 16 пунктов AA. Это ориентир, а не приговор, и вот почему.

AA-оценка Artificial Analysis сводит в один индекс результаты нескольких наборов задач: знания, рассуждения, код, математику, следование инструкциям. Разница в 16 пунктов на агрегате почти всегда складывается из просадки на части поднаборов, а не из равномерного отставания везде. Чтобы понять, что это значит для вашего продукта, индекс нужно разложить: посмотреть отдельно на рассуждения, на код, на устойчивость к длинному контексту. Модель может отставать на 20 пунктов в математике и почти не отставать в извлечении данных, а продакшен часто состоит именно из второго.

Qwen и DeepSeek в открытых бенчмарках держат верхние строчки, и именно поэтому запрет ощущается так болезненно: он срезает не один вариант, а целое семейство SOTA-решений в категории 120B+. При этом сравнение версий между собой - отдельная методология: разные квантованные сборки, разные версии фреймворков и разные чат-шаблоны дают расхождение в разы больше, чем формальная разница между моделями. Разбор этой ловушки на примере одного семейства собран в статье почему DeepSeek отстал в гонке открытых LLM.

Вывод для защиты проекта перед руководством звучит так: 16 пунктов AA - это цена запрета, и её стоит переводить в бизнес-метрики. Сколько дополнительных итераций агента потребуется на задачу, сколько вырастет доля ручных проверок, сколько запросов уйдёт на повторную генерацию. Если узкое место в бюджете на GPU, а не в качестве, разрыв терпим. Если продукт продаётся на точности, разрыв придётся компенсировать инфраструктурой.

Технические требования и производительность на 4×H100

Расчёт VRAM для моделей 120B+

Базовая формула: память под веса ≈ число параметров × байт на параметр. Для модели на 120 млрд параметров это:

  • FP16/BF16: 120 × 2 = 240 ГБ
  • FP8: 120 × 1 = 120 ГБ
  • INT4: 120 × 0,5 = около 60 ГБ

К этому добавляются KV-кэш, активации и оверхед фреймворка: на практике плюс 20-30% к весам. Итого 4×H100 дают 320 ГБ, и расклад получается таким: 120B в FP8 занимает 120 ГБ весов, оставляя около 180 ГБ на KV-кэш и служебные буферы, то есть модель укладывается с комфортом. Тот же класс в FP16 съедает 240 ГБ, оставляя под кэш около 80 ГБ, и это уже тесно: длинные сессии придётся ограничивать или гонять в INT4. Модели от 200B параметров на 4×H100 реалистично запускать только в INT4.

Отдельная строка расходов - KV-кэш при длинном контексте. Прикидка для конфигурации на 80 слоёв, 8 KV-голов и head_dim 128 в FP8: 2 × 80 × 8 × 128 × 1 байт ≈ 163 840 байт на токен, то есть около 0,16 МБ. На 128 000 токенов одной сессии это примерно 20 ГБ. Пять параллельных сессий с полным окном - уже около 100 ГБ, что при FP16-весах не влезет. Отсюда практический вывод: контекст 128k и высокая параллельность требуют FP8 или INT4 для весов.

Если модель 120B нужна только под часть задач, дешевле развести роли: тяжёлые вызовы на большой модели, маршрутизацию, пересказы и предобработку отдать компактным моделям, которым хватает 8-16 ГБ VRAM. Сравнение таких вариантов и их требования к памяти собраны в разборе 9B-моделей для 8 ГБ VRAM и 16 ГБ ОЗУ.

Скорость инференса и пропускная способность

При генерации одного токена модель читает из памяти как минимум весь объём активных весов. Значит, потолок скорости задаёт пропускная способность HBM: у H100 SXM это порядка 3,35 ТБ/с. Дальше арифметика простая: объём активных весов делим на пропускную способность.

  • Плотная модель 120B в FP8: 120 ГБ на токен, потолок около 27-28 токенов/с на один поток.
  • Плотная модель 120B в INT4: 60 ГБ на токен, потолок около 55 токенов/с.
  • MoE около 120B с 8 млрд активных в FP8: около 8 ГБ на токен, теоретический потолок в сотни токенов/с, реально ниже из-за маршрутизации, обмена между GPU и длины промпта.

Это оценки по пропускной способности памяти, а не результаты замеров. Реальная скорость ниже потолка и зависит от числа карт в tensor parallelism, скорости NVLink между ними, версии vLLM или TensorRT-LLM и длины контекста. Два фактора стоит держать в голове: при росте батча суммарная пропускная способность растёт, а задержка одного запроса тоже растёт; при контексте 128k время обработки промпта (prefill) становится сопоставимым со временем генерации ответа, и пользователь это чувствует. Для интерактивных сценариев разумно ограничивать окно и подгружать контекст через поиск, а не подавать документы целиком.

Практические сценарии: что реально можно делать на этих моделях

Разложим типовые задачи по кандидатам:

  • Анализ изображений и сканов. Только Inkling Small и Command A+ из этого списка, потому что у Laguna S 2.1 и Nemotron 3 Super нет зрения.
  • RAG по документам. Command A+ работает при условии, что в промпт попадают релевантные фрагменты, а не документ целиком. Для корпусов, где нужен сквозной анализ, 128k становится узким местом, и пайплайн строится из двух ступеней: отбор фрагментов и генерация ответа по ним.
  • Генерация и ревью кода. Здесь выигрывают модели без зрения: архитектура Laguna S 2.1 с малым числом активных параметров даёт высокую скорость, что важно для агентов, которые делают десятки прогонов на задачу.
  • Чат-боты и поддержка. Любой из четырёх кандидатов, выбор упирается в лицензию, стоимость и требуемый контекст.
  • Агенты. И Inkling Small, и Command A+ справятся, если вокруг модели есть инфраструктура: инструменты, проверка результатов, лимиты на шаги.
  • Fine-tuning. Проверяйте лицензию до обучения: не все открытые веса разрешают дообучение и коммерческое использование производных моделей.

Методология выбора: почему «интеллект» модели - не единственный критерий

Когда выбор ограничен четырьмя моделями, разница между ними часто меньше, чем разница между хорошо и плохо настроенной инфраструктурой вокруг них. Это подтверждает контролируемый эксперимент Anthropic: одна и та же модель Opus 4.5 с одинаковым промптом «build a 2D retro game editor» без обвязки выдала сломанный результат за 20 минут и около $9, а с обвязкой из планировщика, генератора и оценщика дала рабочее решение за 6 часов и около $200. OpenAI описывала похожий сдвиг для Codex: в хорошо подготовленном репозитории надёжность менялась качественно, а не на проценты.

Из этой методологии (harness engineering) выводятся пять подсистем, которые стоит закрыть до того, как винить модель:

  1. Инструкции. Файл вроде AGENTS.md держат короткой картой проекта, а не энциклопедией: тысяча строк справочника вытесняет саму задачу из контекста и устаревает быстрее, чем обновляется.
  2. Состояние. Что агент помнит между шагами и где это хранится.
  3. Верификация. Тесты, схемы, проверки формата. Результат считается готовым только при зелёном статусе, а доказательство (имя теста, дата, фрагмент лога) записывается.
  4. Скоуп. Границы задачи, чтобы агент не расширял её сам.
  5. Жизненный цикл сессии. Фиксированная последовательность шагов с циклом проверки до зелёного состояния.

Практический смысл для выбора модели: если 16 пунктов AA компенсируются тестами и ограничением скоупа, модель с меньшим IQ покажет в продакшене результат не хуже. Если обвязки нет, разницу в 16 пунктов вы увидите сразу и в самом неприятном виде: не в качестве отдельного ответа, а в доле задач, которые агент бросает на середине.

Что использовать в продакшене: рекомендации и ограничения

Рабочая развилка выглядит так.

  • Нужны и текст, и изображения, качество критично: Thinking Machines Inkling Small. Плата - отставание от GLM 5.3 Flash примерно на 16 пунктов AA, которую придётся компенсировать проверками и повторами.
  • Нужны изображения и предсказуемая работа с базой знаний: Cohere Command A+. Плата - контекст 128k, то есть двухступенчатый RAG и ограничение параллельных длинных сессий.
  • Изображения не нужны, важны скорость и стоимость на тексте и коде: Poolside Laguna S 2.1 или Nvidia Nemotron 3 Super. Плата - отдельный компонент под vision, если он когда-нибудь понадобится.

Идеальной западной open-модели 120B+, которая закрывает все требования сразу, на сентябрь 2026 года нет. Запрет китайских моделей не отменяет задачу, а меняет её форму: вы получаете меньший выбор и компенсируете это инфраструктурой. Поэтому порядок действий практичный: прогнать два-три кандидата на своих данных и своих промптах, замерить долю успешных задач, задержку на реалистичной длине контекста и стоимость тысячи запросов на своём железе. Решение принимать по этим цифрам, а не по позиции модели в сводном рейтинге.

Подписаться на канал