Перейти к содержанию
Публикация AiManual

Gemini 4 Argon: 1 млн токенов на выходе, цены API и бенчмарки новой модели Google

Google анонсировала Gemini 4 Argon: лимит генерации вырос до 1 млн токенов, известны цены API и результаты тестов. Разбираем, что подтверждено официально, а как

Коротко

Что будет в материале

  1. 01

    Что Google официально сообщила о Gemini 4 Argon

  2. 02

    Как Gemini 4 Argon соотносится с предыдущими версиями линейки Gemini

  3. 03

    Бенчмарки Gemini 4 Argon: где модель сильна, а где уступает

  4. 04

    Практические сценарии: что можно делать с Gemini 4 Argon

Что Google официально сообщила о Gemini 4 Argon

Google анонсировала Gemini 4 Argon — новую флагманскую модель, которую разработала команда DeepMind. Об анонсе сообщил главный ИИ-архитектор компании Корай Кавукчуоглу. На момент публикации есть официальное описание, цены API и внутренние примеры применения, но самой модели у широкой публики нет: доступ открывают поэтапно.

Главное подтверждённое изменение касается длины ответа. Лимит генерации вырос с 64 000 до 1 млн токенов за один ответ. Речь именно о выводе, а не о том, сколько данных можно подать на вход: размер контекстного окна Google в анонсе не раскрыла. Практический смысл в том, что модель способна выдать длинный фрагмент кода, объёмный отчёт или юридический документ за один проход, без разбивки на десятки коротких запросов.

Второй слой анонса — позиционирование. Google называет целевыми сценариями разработку ПО, финансовые исследования, юридическую работу, киберзащиту и длительные агентные процессы. Доступ открывают ступенями: сначала отдельные партнёры по кибербезопасности через программу Fairwind, затем платные клиенты API и подписчики Google AI Ultra. Дату широкого запуска компания не назвала.

Часть сведений об Argon может быть неполной. Официальный блог даёт цифры и цены, но почти не раскрывает технические детали, а результаты тестов пока не подтверждены независимыми измерениями. Ниже разбор отделяет подтверждённое от предположений.

Ключевые подтверждённые характеристики

  • Разработчик: DeepMind, анонс от Google.
  • Лимит генерации: 1 млн токенов за один ответ, было 64 000.
  • Целевые сценарии: разработка ПО, финансы, юриспруденция, киберзащита, длительные агентные рабочие процессы.
  • Порядок доступа: партнёры по кибербезопасности через Fairwind, далее платные клиенты API и подписчики Google AI Ultra.
  • Цены API на старте: $2 за 1 млн входных токенов, $10 за 1 млн выходных.
  • Цены после вводного периода: $4 за 1 млн входных, $20 за 1 млн выходных.
  • Кэш: чтение входных токенов из кэша дешевле обычного ввода на 95%.

Все эти цифры — официальные данные Google. Компания заявляет также, что модель самостоятельно находит, проверяет и исправляет уязвимости, а ещё анализирует графики и длинные видео. Сравнение с облачными конкурентами в ценовом плане выглядит агрессивно: стартовая цена сопоставима с тарифами Claude Sonnet и примерно в пять раз ниже, чем у Astra/Fable.

Что пока остаётся неизвестным

Google не раскрыла архитектуру модели, число параметров, размер контекстного окна и детали по мультимодальности. Про анализ графиков и длинных видео сказано одной строкой, без указания ограничений по длине, формату и качеству входных данных.

Отдельный пробел — независимая проверка. Модель не в открытом доступе, поэтому сторонние лаборатории не могут прогнать свои тесты. Нет и заявлений об открытых весах, а значит, говорить о локальном запуске пока не приходится.

Как Gemini 4 Argon соотносится с предыдущими версиями линейки Gemini

Полного сравнения с Gemini 3 и более ранними версиями Google не публиковала. Единственная прямая ремарка об архитектуре: по словам представителя Google, Argon крупнее прежних флагманов линейки Pro. Остальное приходится выводить из заявленных цифр и собственных тестов компании.

Линейка Google к осени 2026 года выглядит неоднородно: Flash-модели выходят регулярно, а флагманские Pro-версии задерживаются. Разбор причин задержки Gemini показывает, что компания подолгу не выводит тяжёлые модели на рынок. Argon в этом смысле шаг в сторону: флагман представили, но дали к нему ограниченный доступ. Как развивалась линейка и почему Pro-версии отставали от Flash, подробно разобрано в материале о том, почему Google откладывает флагмана.

Рост лимита генерации: что это меняет на практике

1 млн токенов вывода против прежних 64 000. Для обычного чата разница почти незаметна: пользователь редко читает ответы на сотни тысяч токенов. Для агентных сценариев разница принципиальная. Агент, который переносит код, пишет отчёт или ведёт многошаговое исследование, должен выдавать длинный результат, не упираясь в лимит посреди работы. Обрыв генерации ломает цепочку и требует повторного запуска с частичным контекстом, а это лишние токены и потеря состояния задачи.

Google приводит пример из внутренней практики: агенты Argon переносят код компании с C/C++ на Rust. Объём работ — от десятков тысяч строк в базовых библиотеках re2 и libgav1 до более чем 800 тысяч строк в ядре Zircon операционной системы Fuchsia. Инженеры Google уже используют модель в работе, включая перенос больших проектов на другие языки программирования.

Бенчмарки Gemini 4 Argon: где модель сильна, а где уступает

Все опубликованные результаты — собственные тесты Google, независимых измерений нет. В сравнительной таблице компании из 19 бенчмарков Argon лидирует единолично 13 раз и один раз делит первое место с GPT-6 Astra. По отдельным тестам картина такая.

БенчмаркGemini 4 ArgonGPT-6 AstraClaude Opus 5.5
DeepSWE v1.177,9%74,1%74,2%
AutomationBench51,3%41,4%42,5%
Vals Finance Agent v265,4%53,5%58,6%
Vals Index68,9%63,1%67,0%
CWE-bench v168%68%67%
FrontierSWE v255%65,5%62,3%
Terminal-Bench 4.057,4%58,2%66,4%

Где Argon обходит конкурентов

В DeepSWE v1.1, тесте на длительные задачи по разработке ПО, Argon набрала 77,9% против 74,1% у GPT-6 Astra и 74,2% у Claude Opus 5.5. В AutomationBench, где проверяют выполнение рабочих процессов от начала до конца, результат Argon — 51,3%, у Astra 41,4%, у Opus 42,5%. В Vals Finance Agent v2, тесте на многошаговые финансовые исследования, Argon получила 65,4%, Astra — 53,5%, Opus — 58,6%.

В Vals Index, который измеряет экономический эффект в финансах, программировании, праве и налогах, Argon набрала 68,9% против 67,0% у Claude Opus 5.5, 65,8% у Claude Fable 5.1 и 63,1% у GPT-6 Astra. Контекст гонки флагманов и связанных с ней сделок собран в отдельном разборе событий вокруг Claude Fable 5. В CWE-bench v1, тесте по кибербезопасности, Argon набрала 68% и сравнялась с Astra при 67% у Opus. Разрыв небольшой, поэтому корректнее говорить о паритете, чем о лидерстве.

Где Argon уступает

В FrontierSWE v2 у Argon 55%, тогда как у GPT-6 Astra 65,5%, а у Claude Opus 5.5 62,3%. В Terminal-Bench 4.0 расклад такой: 57,4% у Argon, 58,2% у Astra и лидирующие 66,4% у Opus. То есть в части тестов именно на программирование модель проигрывает обоим конкурентам, местами с заметным отрывом.

Объяснение может быть простым: Google настраивала Argon под длинные агентные цепочки и корпоративные задачи, а не под классический кодинг с короткими итерациями. Проверить эту гипотезу без независимых прогонов нельзя, поэтому относиться к ней стоит как к версии.

Почему независимые тесты пока недоступны

Модель не находится в открытом доступе. Пока её не выпустили публично, независимые оценочные организации, например Artificial Analysis, не могут прогнать собственные тесты и опубликовать цифры. Все результаты выше — внутренние измерения Google. Вендоры обычно выбирают выгодные для себя конфигурации тестов, так что к таким числам разумно относиться как к заявлению компании, а не как к подтверждённому рейтингу.

Практические сценарии: что можно делать с Gemini 4 Argon

Разработка ПО и перенос кода

Основной сценарий, который Google показывает на своих примерах, — работа с большими кодовыми базами. Агенты Argon переносят код с C/C++ на Rust: от десятков тысяч строк в re2 и libgav1 до более чем 800 тысяч строк в ядре Zircon ОС Fuchsia. В случае с видеодекодером libgav1 агенты заменили около 32 тысяч строк SIMD-кода, получив безопасный по памяти декодер. По данным Google, он работает почти в 3 раза быстрее прежней версии на Rust (в другом описании фигурирует цифра 2,7 раза) и близок по производительности к оптимизированной версии на C++.

Отсюда следует практический вывод: Argon метят в задачи, где нужно долго и автономно править чужой код, а не отвечать на вопросы про синтаксис. Это внутренние примеры Google, а не независимые кейсы, и повторяемость результата на других кодовых базах никто снаружи не проверял.

Финансы, юриспруденция и киберзащита

В финансовых исследованиях Google опирается на Vals Finance Agent v2, где Argon набрала 65,4%. Для юридической работы ключевым становится лимит генерации: договоры, заключения и длинные выдержки из практики модель может выдавать целым документом, без склейки из кусков. Конкретные юридические кейсы Google не раскрывает, поэтому судить о качестве такой работы по одному числу бенчмарка нельзя.

Кибербезопасность — самое заметное направление в анонсе. В CWE-bench v1 у Argon 68%, и партнёры по киберзащите получают модель без ограничений на киберзадачи. По данным Google, Argon самостоятельно находит, проверяет и исправляет уязвимости. Именно на этом направлении и строится первый этап доступа.

Агентные процессы и автоматизация

Лимит 1 млн токенов на выходе критичен для длительных агентных цепочек: модель выдаёт большой промежуточный или финальный результат одним ответом, не теряя состояние задачи. В AutomationBench, который проверяет выполнение процессов от начала до конца, Argon показала 51,3% против 41,4% у Astra и 42,5% у Opus.

Google описывает и корпоративные сценарии: команда агентов проанализировала телеметрию профилирования в дата-центрах и применила улучшения памяти, что, по оценкам компании, освободит более 300 ТиБ, а общая экономия оценивается от 500 ТиБ до 1 ПиБ. Ещё один пример — работа исследователей квантовых вычислений: в одном из случаев модель за считанные минуты превзошла опубликованный базовый результат на 40% при подборе ресурсов подпрограмм. Как устроены агентные обвязки в экосистеме Google, видно на примере Managed Agents в Gemini API, где доступны хуки окружения и контроль бюджета по токенам.

Независимых тестов агентных сценариев тоже нет, а внутренние примеры Google нельзя воспроизвести снаружи: ни промптов, ни полных замеров компания не публикует.

Доступ и цены: когда и как можно будет попробовать Gemini 4 Argon

Этапы доступа: Fairwind, API и Google AI Ultra

Первый этап — отдельные партнёры по кибербезопасности через программу Fairwind. На этом шаге модель выдают выборочно, и она ориентирована на задачи защиты, а не на массовое использование. Второй этап — платные клиенты API и подписчики Google AI Ultra. Дату этого этапа Google не назвала, а бесплатного доступа не анонсировано вовсе.

Перед широким запуском компания дорабатывает защиту от вредоносных запросов и скрытых инструкций в сторонних материалах. Отдельная система следит за рассуждениями и действиями Argon и останавливает её, если она выходит за пределы задачи пользователя. Партнёры по киберзащите и внутренние команды Google получают модель без ограничений на киберзадачи.

Сколько будет стоить API и как сэкономить на кэше

На старте 1 млн входных токенов стоит $2, выходных — $10. После вводного периода цены вырастут до $4 и $20 соответственно. Чтение входных токенов из кэша дешевле обычного ввода на 95%, и это главный рычаг экономии.

Кэш выгоден там, где один и тот же объёмный контекст отправляют многократно: агентные цепочки с неизменным системным промптом, повторные запросы по одной кодовой базе, многошаговые исследования с общей базой документов. При разовых запросах экономии почти не будет.

Оплата зарубежных API из России упирается в карты: локальные не проходят в биллинге Google. Один из обходных путей — виртуальная банковская карта зарубежного банка, которую выпускают дистанционно и пополняют в рублях через СБП, а управление идёт через мессенджер.

Ограничения и открытые вопросы

Что пока неизвестно

  • Дата широкого запуска не названа.
  • Независимых тестов нет: все цифры — внутренние замеры Google.
  • Нет информации об открытых весах, значит, локальный запуск на своём GPU пока не рассматривается. Требования к VRAM, если веса когда-нибудь откроют, тоже неизвестны, а по косвенному признаку (модель крупнее прежних флагманов Pro) они будут высокими.
  • Не раскрыты архитектура, размер контекстного окна, поддержка языков и детали мультимодальности.
  • В части тестов на программирование Argon уступает GPT-6 Astra и Claude Opus 5.5.

Часть информации может быть неполной и требует уточнения из первоисточника — официального блога Google. Если в других пересказах появятся цифры, которых нет в анонсе, их стоит проверять по первоисточнику, а не по вторичным публикациям.

Стоит ли ждать Gemini 4 Argon

Если у вас длинные агентные цепочки, генерация больших объёмов кода или финансовые и юридические исследования с объёмными документами, модель выглядит перспективной: лимит вывода в 1 млн токенов прямо закрывает слабое место прежних версий. Цена на старте тоже выглядит конкурентоспособной, а кэш входных токенов снижает стоимость повторяющихся запросов.

Держать в голове стоит три вещи. Публичного доступа нет, и дата его появления неизвестна. Все бенчмарки поставлены самим вендором. В задачах классического кодинга Argon проигрывает конкурентам по собственным же тестам Google. Поэтому разумный план — не ждать вслепую, а собрать рабочий пайплайн на доступных сегодня моделях и следить за официальным блогом Google и независимыми замерами Artificial Analysis: там появятся цифры, не зависящие от вендора.

Источники

Подписаться на канал