Кластер из четырёх NVIDIA H100 даёт 320 ГБ памяти HBM3: по 80 ГБ на карту. Этого хватает, чтобы держать модель класса 120B в FP8 с запасом под KV-кэш, и не хватает, чтобы перебирать варианты наугад. Если руководство запрещает китайские open-модели, привычный шорткат ломается: GLM, Qwen и DeepSeek занимают верх открытых рейтингов, а в категории 120B+ с поддержкой зрения западных альтернатив единицы.
Короткий ответ по набору кандидатов такой. Thinking Machines Inkling Small закрывает большую часть требований, включая работу с изображениями, но отстаёт от GLM 5.3 Flash примерно на 16 пунктов по оценке Artificial Analysis (AA). Cohere Command A+ проходит по большинству критериев, но упирается в контекстное окно 128k. Poolside Laguna S 2.1 и Nvidia Nemotron 3 Super годятся для текстовых задач, однако поддержки зрения у них нет. Получается четыре имени, и каждое требует компромисса.
Дальше: чек-лист критериев, арифметика VRAM и скорости под 4×H100, разбор практических сценариев и методология, в которой AA-оценка модели - только одна переменная из нескольких.
Цифры по Inkling Small, Command A+, Laguna S 2.1, Nemotron 3 Super и разнице в 16 пунктов AA взяты из исходной постановки задачи и независимо не подтверждены. Перед развёртыванием сверяйте их с актуальными карточками моделей и свежими замерами: открытые релизы обновляются каждые несколько недель.
Почему выбор западных open-моделей 120B+ - это отдельная задача
Открытые веса перестали означать «слабее закрытых». Верх открытого сегмента в 2026 году держат китайские лаборатории: GLM, Qwen и DeepSeek. В категории 120B+ с поддержкой зрения разрыв виднее, чем в текстовой, потому что западные команды в этом размере чаще выпускают модели без vision либо ограничивают окно контекста.
Запрет на китайские модели выбивает из шортлиста самые сильные варианты по соотношению качества и стоимости инференса на своём железе. Решение приходится собирать из того, что осталось. Практические следствия:
- Кандидатов мало, поэтому каждая модель оценивается сразу по нескольким осям: качество, vision, контекст, память, лицензия.
- Выбор превращается в компромисс: сильная модель без vision проваливается на мультимодальных задачах, а модель с vision и коротким контекстом упирается в RAG.
- Аргументацию для руководства строят на пунктах AA-оценки и на замерах на своих данных, а не на общих словах про «лучшую модель».
Точка отсчёта в исходной задаче - GLM 5.3 Flash. Inkling Small отстаёт от неё примерно на 16 пунктов AA. Индекс Artificial Analysis агрегирует несколько бенчмарков сразу, поэтому 16 пунктов означают заметную разницу в сложных рассуждениях и следовании инструкциям, но не приговор. На узкой задаче с хорошо подготовленным контекстом и проверяемым результатом разрыв часто сжимается до нескольких процентов по доле успешных прогонов.
Критерии выбора: что важно для локального продакшена на 4×H100
Чек-лист, по которому стоит прогонять каждого кандидата:
- Класс параметров. 120B и выше. Младшие модели дешевле по памяти, но на сложных промптах требуют больше итераций и внешней инфраструктуры.
- Поддержка зрения. Нужна, если в пайплайне есть OCR, разбор схем, скриншотов, сканов и таблиц-картинок.
- Контекстное окно. 128k - рабочий минимум для RAG по регламентам и договорам. Для агентов с историей сессии и логами лучше 200k и выше.
- Квантизация. Наличие весов FP8 и INT4 определяет, сколько памяти останется под KV-кэш и с какой скоростью пойдёт генерация.
- Лицензия и юрисдикция. Право коммерческого использования, ограничения на отрасли, страна вендора, доступность весов без телеметрии.
- Поддержка фреймворков. Готовые рецепты под vLLM или TensorRT-LLM экономят дни отладки tensor parallelism.
- Обновляемость. Частота релизов и болезненность перехода между версиями: смена чат-шаблона ломает агентные пайплайны.
- Совместимость с инфраструктурой. Формат tool-calling, structured output, поведение на длинных сессиях.
Первые четыре пункта отсекают кандидатов быстро, остальные определяют, сколько времени уйдёт на внедрение. Расширенный чек-лист оценки новинок без шума вокруг релизов разобран отдельно: как не потеряться в потоке запусков AI-моделей.
Основные западные open-модели 120B+ с поддержкой зрения
Полноценных западных open-вариантов с vision в этом размере на сентябрь 2026 года два: Inkling Small и Command A+. Ещё две модели из исходного списка закрывают текстовые задачи и лишены анализа изображений.
Thinking Machines Inkling Small: компромисс между качеством и требованиями
Модель проходит по ключевым требованиям: класс 120B+, поддержка зрения, открытые веса. По совокупности критериев она лидирует среди западных кандидатов, и это делает её дефолтным выбором, когда нужно закрыть и текст, и картинки одним эндпоинтом. Слабое место одно, зато заметное: около 16 пунктов AA до GLM 5.3 Flash.
На практике это означает следующее. Задачи с чёткой спецификацией (извлечение полей из сканов, классификация, разметка, суммаризация по шаблону) закрываются хорошо. Задачи, где нужна длинная цепочка рассуждений без промежуточной проверки (сложная отладка, многошаговое планирование, математика), требуют внешней валидации: тестов, схемы JSON, второго прохода. Контекстное окно модели в исходном описании не приводилось, поэтому его стоит проверить в карточке перед тем, как планировать RAG на больших корпусах.
Cohere Command A+: сильный кандидат с ограничением по контексту
Command A+ подходит по большинству критериев, включая работу с изображениями, и единственное известное ограничение из исходных данных - контекстное окно 128k. Для корпоративного сегмента это ожидаемо: Cohere исторически ориентируется на RAG и поиск по базе знаний, а не на бесконечные чаты.
Где 128k хватает: чат-бот поддержки, разбор договора на 60-80 страниц, ответы по внутренней базе с предварительным поиском, где в промпт попадают 10-20 релевантных фрагментов. Где не хватает: сквозной анализ годового отчёта целиком, агент с историей из сотен шагов, одновременная работа с несколькими длинными документами в одном запросе. В этих сценариях 128k вынуждает строить многоступенчатый пайплайн с пересказом промежуточных результатов, а каждый пересказ теряет детали.
По памяти модель укладывается в кластер из 4×H100 в FP8, если параметрический класс укладывается в диапазон 120B и есть готовые квантованные веса. Точные требования смотрите в карточке: у разных релизов разное число слоёв и голов внимания, а это напрямую влияет и на вес, и на KV-кэш.
Poolside Laguna S 2.1 и Nvidia Nemotron 3 Super: варианты без зрения
Laguna S 2.1 в разборах на AI-Manual описывалась как MoE-модель около 118 млрд параметров с 8 млрд активных. Архитектура разреженная, поэтому при генерации читается не весь вес модели, а только активная часть, и скорость на одном запросе получается существенно выше, чем у плотной модели того же размера. Подробные замеры качества кода и стоимости инференса на стенде с 192 ГБ VRAM собраны в материале про Minimax 2.7, DeepSeek V4 Flash и Laguna S 2.1.
Nvidia Nemotron 3 Super в исходном списке идёт как ещё один кандидат уровня 120B+ без поддержки зрения, с готовыми квантованными сборками под NVIDIA-стек. Практическая ценность обеих моделей проявляется в текстовых пайплайнах: генерация кода, извлечение данных, маршрутизация запросов, черновая разметка. Если в продукте есть анализ изображений, эти две модели закрывают только текстовую часть, и рядом нужен отдельный vision-компонент.
| Модель | Класс | Зрение | Контекст | Главное ограничение |
|---|---|---|---|---|
| Thinking Machines Inkling Small | 120B+ | Да | Уточнять в карточке модели | Отставание от GLM 5.3 Flash около 16 пунктов AA |
| Cohere Command A+ | 120B+ | Да | 128k | Малого окна не хватает для сквозного анализа больших корпусов |
| Poolside Laguna S 2.1 | около 118B, MoE | Нет | Уточнять в карточке модели | Нет анализа изображений |
| Nvidia Nemotron 3 Super | 120B+ | Нет | Уточнять в карточке модели | Нет анализа изображений |
Сравнение с китайскими SOTA-моделями: насколько велик разрыв
Единственная количественная зацепка из исходных данных: Inkling Small отстаёт от GLM 5.3 Flash примерно на 16 пунктов AA. Это ориентир, а не приговор, и вот почему.
AA-оценка Artificial Analysis сводит в один индекс результаты нескольких наборов задач: знания, рассуждения, код, математику, следование инструкциям. Разница в 16 пунктов на агрегате почти всегда складывается из просадки на части поднаборов, а не из равномерного отставания везде. Чтобы понять, что это значит для вашего продукта, индекс нужно разложить: посмотреть отдельно на рассуждения, на код, на устойчивость к длинному контексту. Модель может отставать на 20 пунктов в математике и почти не отставать в извлечении данных, а продакшен часто состоит именно из второго.
Qwen и DeepSeek в открытых бенчмарках держат верхние строчки, и именно поэтому запрет ощущается так болезненно: он срезает не один вариант, а целое семейство SOTA-решений в категории 120B+. При этом сравнение версий между собой - отдельная методология: разные квантованные сборки, разные версии фреймворков и разные чат-шаблоны дают расхождение в разы больше, чем формальная разница между моделями. Разбор этой ловушки на примере одного семейства собран в статье почему DeepSeek отстал в гонке открытых LLM.
Вывод для защиты проекта перед руководством звучит так: 16 пунктов AA - это цена запрета, и её стоит переводить в бизнес-метрики. Сколько дополнительных итераций агента потребуется на задачу, сколько вырастет доля ручных проверок, сколько запросов уйдёт на повторную генерацию. Если узкое место в бюджете на GPU, а не в качестве, разрыв терпим. Если продукт продаётся на точности, разрыв придётся компенсировать инфраструктурой.
Технические требования и производительность на 4×H100
Расчёт VRAM для моделей 120B+
Базовая формула: память под веса ≈ число параметров × байт на параметр. Для модели на 120 млрд параметров это:
- FP16/BF16: 120 × 2 = 240 ГБ
- FP8: 120 × 1 = 120 ГБ
- INT4: 120 × 0,5 = около 60 ГБ
К этому добавляются KV-кэш, активации и оверхед фреймворка: на практике плюс 20-30% к весам. Итого 4×H100 дают 320 ГБ, и расклад получается таким: 120B в FP8 занимает 120 ГБ весов, оставляя около 180 ГБ на KV-кэш и служебные буферы, то есть модель укладывается с комфортом. Тот же класс в FP16 съедает 240 ГБ, оставляя под кэш около 80 ГБ, и это уже тесно: длинные сессии придётся ограничивать или гонять в INT4. Модели от 200B параметров на 4×H100 реалистично запускать только в INT4.
Отдельная строка расходов - KV-кэш при длинном контексте. Прикидка для конфигурации на 80 слоёв, 8 KV-голов и head_dim 128 в FP8: 2 × 80 × 8 × 128 × 1 байт ≈ 163 840 байт на токен, то есть около 0,16 МБ. На 128 000 токенов одной сессии это примерно 20 ГБ. Пять параллельных сессий с полным окном - уже около 100 ГБ, что при FP16-весах не влезет. Отсюда практический вывод: контекст 128k и высокая параллельность требуют FP8 или INT4 для весов.
Если модель 120B нужна только под часть задач, дешевле развести роли: тяжёлые вызовы на большой модели, маршрутизацию, пересказы и предобработку отдать компактным моделям, которым хватает 8-16 ГБ VRAM. Сравнение таких вариантов и их требования к памяти собраны в разборе 9B-моделей для 8 ГБ VRAM и 16 ГБ ОЗУ.
Скорость инференса и пропускная способность
При генерации одного токена модель читает из памяти как минимум весь объём активных весов. Значит, потолок скорости задаёт пропускная способность HBM: у H100 SXM это порядка 3,35 ТБ/с. Дальше арифметика простая: объём активных весов делим на пропускную способность.
- Плотная модель 120B в FP8: 120 ГБ на токен, потолок около 27-28 токенов/с на один поток.
- Плотная модель 120B в INT4: 60 ГБ на токен, потолок около 55 токенов/с.
- MoE около 120B с 8 млрд активных в FP8: около 8 ГБ на токен, теоретический потолок в сотни токенов/с, реально ниже из-за маршрутизации, обмена между GPU и длины промпта.
Это оценки по пропускной способности памяти, а не результаты замеров. Реальная скорость ниже потолка и зависит от числа карт в tensor parallelism, скорости NVLink между ними, версии vLLM или TensorRT-LLM и длины контекста. Два фактора стоит держать в голове: при росте батча суммарная пропускная способность растёт, а задержка одного запроса тоже растёт; при контексте 128k время обработки промпта (prefill) становится сопоставимым со временем генерации ответа, и пользователь это чувствует. Для интерактивных сценариев разумно ограничивать окно и подгружать контекст через поиск, а не подавать документы целиком.
Практические сценарии: что реально можно делать на этих моделях
Разложим типовые задачи по кандидатам:
- Анализ изображений и сканов. Только Inkling Small и Command A+ из этого списка, потому что у Laguna S 2.1 и Nemotron 3 Super нет зрения.
- RAG по документам. Command A+ работает при условии, что в промпт попадают релевантные фрагменты, а не документ целиком. Для корпусов, где нужен сквозной анализ, 128k становится узким местом, и пайплайн строится из двух ступеней: отбор фрагментов и генерация ответа по ним.
- Генерация и ревью кода. Здесь выигрывают модели без зрения: архитектура Laguna S 2.1 с малым числом активных параметров даёт высокую скорость, что важно для агентов, которые делают десятки прогонов на задачу.
- Чат-боты и поддержка. Любой из четырёх кандидатов, выбор упирается в лицензию, стоимость и требуемый контекст.
- Агенты. И Inkling Small, и Command A+ справятся, если вокруг модели есть инфраструктура: инструменты, проверка результатов, лимиты на шаги.
- Fine-tuning. Проверяйте лицензию до обучения: не все открытые веса разрешают дообучение и коммерческое использование производных моделей.
Методология выбора: почему «интеллект» модели - не единственный критерий
Когда выбор ограничен четырьмя моделями, разница между ними часто меньше, чем разница между хорошо и плохо настроенной инфраструктурой вокруг них. Это подтверждает контролируемый эксперимент Anthropic: одна и та же модель Opus 4.5 с одинаковым промптом «build a 2D retro game editor» без обвязки выдала сломанный результат за 20 минут и около $9, а с обвязкой из планировщика, генератора и оценщика дала рабочее решение за 6 часов и около $200. OpenAI описывала похожий сдвиг для Codex: в хорошо подготовленном репозитории надёжность менялась качественно, а не на проценты.
Из этой методологии (harness engineering) выводятся пять подсистем, которые стоит закрыть до того, как винить модель:
- Инструкции. Файл вроде AGENTS.md держат короткой картой проекта, а не энциклопедией: тысяча строк справочника вытесняет саму задачу из контекста и устаревает быстрее, чем обновляется.
- Состояние. Что агент помнит между шагами и где это хранится.
- Верификация. Тесты, схемы, проверки формата. Результат считается готовым только при зелёном статусе, а доказательство (имя теста, дата, фрагмент лога) записывается.
- Скоуп. Границы задачи, чтобы агент не расширял её сам.
- Жизненный цикл сессии. Фиксированная последовательность шагов с циклом проверки до зелёного состояния.
Практический смысл для выбора модели: если 16 пунктов AA компенсируются тестами и ограничением скоупа, модель с меньшим IQ покажет в продакшене результат не хуже. Если обвязки нет, разницу в 16 пунктов вы увидите сразу и в самом неприятном виде: не в качестве отдельного ответа, а в доле задач, которые агент бросает на середине.
Что использовать в продакшене: рекомендации и ограничения
Рабочая развилка выглядит так.
- Нужны и текст, и изображения, качество критично: Thinking Machines Inkling Small. Плата - отставание от GLM 5.3 Flash примерно на 16 пунктов AA, которую придётся компенсировать проверками и повторами.
- Нужны изображения и предсказуемая работа с базой знаний: Cohere Command A+. Плата - контекст 128k, то есть двухступенчатый RAG и ограничение параллельных длинных сессий.
- Изображения не нужны, важны скорость и стоимость на тексте и коде: Poolside Laguna S 2.1 или Nvidia Nemotron 3 Super. Плата - отдельный компонент под vision, если он когда-нибудь понадобится.
Идеальной западной open-модели 120B+, которая закрывает все требования сразу, на сентябрь 2026 года нет. Запрет китайских моделей не отменяет задачу, а меняет её форму: вы получаете меньший выбор и компенсируете это инфраструктурой. Поэтому порядок действий практичный: прогнать два-три кандидата на своих данных и своих промптах, замерить долю успешных задач, задержку на реалистичной длине контекста и стоимость тысячи запросов на своём железе. Решение принимать по этим цифрам, а не по позиции модели в сводном рейтинге.