Что Google официально сообщила о Gemini 4 Argon
Google анонсировала Gemini 4 Argon — новую флагманскую модель, которую разработала команда DeepMind. Об анонсе сообщил главный ИИ-архитектор компании Корай Кавукчуоглу. На момент публикации есть официальное описание, цены API и внутренние примеры применения, но самой модели у широкой публики нет: доступ открывают поэтапно.
Главное подтверждённое изменение касается длины ответа. Лимит генерации вырос с 64 000 до 1 млн токенов за один ответ. Речь именно о выводе, а не о том, сколько данных можно подать на вход: размер контекстного окна Google в анонсе не раскрыла. Практический смысл в том, что модель способна выдать длинный фрагмент кода, объёмный отчёт или юридический документ за один проход, без разбивки на десятки коротких запросов.
Второй слой анонса — позиционирование. Google называет целевыми сценариями разработку ПО, финансовые исследования, юридическую работу, киберзащиту и длительные агентные процессы. Доступ открывают ступенями: сначала отдельные партнёры по кибербезопасности через программу Fairwind, затем платные клиенты API и подписчики Google AI Ultra. Дату широкого запуска компания не назвала.
Часть сведений об Argon может быть неполной. Официальный блог даёт цифры и цены, но почти не раскрывает технические детали, а результаты тестов пока не подтверждены независимыми измерениями. Ниже разбор отделяет подтверждённое от предположений.
Ключевые подтверждённые характеристики
- Разработчик: DeepMind, анонс от Google.
- Лимит генерации: 1 млн токенов за один ответ, было 64 000.
- Целевые сценарии: разработка ПО, финансы, юриспруденция, киберзащита, длительные агентные рабочие процессы.
- Порядок доступа: партнёры по кибербезопасности через Fairwind, далее платные клиенты API и подписчики Google AI Ultra.
- Цены API на старте: $2 за 1 млн входных токенов, $10 за 1 млн выходных.
- Цены после вводного периода: $4 за 1 млн входных, $20 за 1 млн выходных.
- Кэш: чтение входных токенов из кэша дешевле обычного ввода на 95%.
Все эти цифры — официальные данные Google. Компания заявляет также, что модель самостоятельно находит, проверяет и исправляет уязвимости, а ещё анализирует графики и длинные видео. Сравнение с облачными конкурентами в ценовом плане выглядит агрессивно: стартовая цена сопоставима с тарифами Claude Sonnet и примерно в пять раз ниже, чем у Astra/Fable.
Что пока остаётся неизвестным
Google не раскрыла архитектуру модели, число параметров, размер контекстного окна и детали по мультимодальности. Про анализ графиков и длинных видео сказано одной строкой, без указания ограничений по длине, формату и качеству входных данных.
Отдельный пробел — независимая проверка. Модель не в открытом доступе, поэтому сторонние лаборатории не могут прогнать свои тесты. Нет и заявлений об открытых весах, а значит, говорить о локальном запуске пока не приходится.
Как Gemini 4 Argon соотносится с предыдущими версиями линейки Gemini
Полного сравнения с Gemini 3 и более ранними версиями Google не публиковала. Единственная прямая ремарка об архитектуре: по словам представителя Google, Argon крупнее прежних флагманов линейки Pro. Остальное приходится выводить из заявленных цифр и собственных тестов компании.
Линейка Google к осени 2026 года выглядит неоднородно: Flash-модели выходят регулярно, а флагманские Pro-версии задерживаются. Разбор причин задержки Gemini показывает, что компания подолгу не выводит тяжёлые модели на рынок. Argon в этом смысле шаг в сторону: флагман представили, но дали к нему ограниченный доступ. Как развивалась линейка и почему Pro-версии отставали от Flash, подробно разобрано в материале о том, почему Google откладывает флагмана.
Рост лимита генерации: что это меняет на практике
1 млн токенов вывода против прежних 64 000. Для обычного чата разница почти незаметна: пользователь редко читает ответы на сотни тысяч токенов. Для агентных сценариев разница принципиальная. Агент, который переносит код, пишет отчёт или ведёт многошаговое исследование, должен выдавать длинный результат, не упираясь в лимит посреди работы. Обрыв генерации ломает цепочку и требует повторного запуска с частичным контекстом, а это лишние токены и потеря состояния задачи.
Google приводит пример из внутренней практики: агенты Argon переносят код компании с C/C++ на Rust. Объём работ — от десятков тысяч строк в базовых библиотеках re2 и libgav1 до более чем 800 тысяч строк в ядре Zircon операционной системы Fuchsia. Инженеры Google уже используют модель в работе, включая перенос больших проектов на другие языки программирования.
Бенчмарки Gemini 4 Argon: где модель сильна, а где уступает
Все опубликованные результаты — собственные тесты Google, независимых измерений нет. В сравнительной таблице компании из 19 бенчмарков Argon лидирует единолично 13 раз и один раз делит первое место с GPT-6 Astra. По отдельным тестам картина такая.
| Бенчмарк | Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 |
|---|---|---|---|
| DeepSWE v1.1 | 77,9% | 74,1% | 74,2% |
| AutomationBench | 51,3% | 41,4% | 42,5% |
| Vals Finance Agent v2 | 65,4% | 53,5% | 58,6% |
| Vals Index | 68,9% | 63,1% | 67,0% |
| CWE-bench v1 | 68% | 68% | 67% |
| FrontierSWE v2 | 55% | 65,5% | 62,3% |
| Terminal-Bench 4.0 | 57,4% | 58,2% | 66,4% |
Где Argon обходит конкурентов
В DeepSWE v1.1, тесте на длительные задачи по разработке ПО, Argon набрала 77,9% против 74,1% у GPT-6 Astra и 74,2% у Claude Opus 5.5. В AutomationBench, где проверяют выполнение рабочих процессов от начала до конца, результат Argon — 51,3%, у Astra 41,4%, у Opus 42,5%. В Vals Finance Agent v2, тесте на многошаговые финансовые исследования, Argon получила 65,4%, Astra — 53,5%, Opus — 58,6%.
В Vals Index, который измеряет экономический эффект в финансах, программировании, праве и налогах, Argon набрала 68,9% против 67,0% у Claude Opus 5.5, 65,8% у Claude Fable 5.1 и 63,1% у GPT-6 Astra. Контекст гонки флагманов и связанных с ней сделок собран в отдельном разборе событий вокруг Claude Fable 5. В CWE-bench v1, тесте по кибербезопасности, Argon набрала 68% и сравнялась с Astra при 67% у Opus. Разрыв небольшой, поэтому корректнее говорить о паритете, чем о лидерстве.
Где Argon уступает
В FrontierSWE v2 у Argon 55%, тогда как у GPT-6 Astra 65,5%, а у Claude Opus 5.5 62,3%. В Terminal-Bench 4.0 расклад такой: 57,4% у Argon, 58,2% у Astra и лидирующие 66,4% у Opus. То есть в части тестов именно на программирование модель проигрывает обоим конкурентам, местами с заметным отрывом.
Объяснение может быть простым: Google настраивала Argon под длинные агентные цепочки и корпоративные задачи, а не под классический кодинг с короткими итерациями. Проверить эту гипотезу без независимых прогонов нельзя, поэтому относиться к ней стоит как к версии.
Почему независимые тесты пока недоступны
Модель не находится в открытом доступе. Пока её не выпустили публично, независимые оценочные организации, например Artificial Analysis, не могут прогнать собственные тесты и опубликовать цифры. Все результаты выше — внутренние измерения Google. Вендоры обычно выбирают выгодные для себя конфигурации тестов, так что к таким числам разумно относиться как к заявлению компании, а не как к подтверждённому рейтингу.
Практические сценарии: что можно делать с Gemini 4 Argon
Разработка ПО и перенос кода
Основной сценарий, который Google показывает на своих примерах, — работа с большими кодовыми базами. Агенты Argon переносят код с C/C++ на Rust: от десятков тысяч строк в re2 и libgav1 до более чем 800 тысяч строк в ядре Zircon ОС Fuchsia. В случае с видеодекодером libgav1 агенты заменили около 32 тысяч строк SIMD-кода, получив безопасный по памяти декодер. По данным Google, он работает почти в 3 раза быстрее прежней версии на Rust (в другом описании фигурирует цифра 2,7 раза) и близок по производительности к оптимизированной версии на C++.
Отсюда следует практический вывод: Argon метят в задачи, где нужно долго и автономно править чужой код, а не отвечать на вопросы про синтаксис. Это внутренние примеры Google, а не независимые кейсы, и повторяемость результата на других кодовых базах никто снаружи не проверял.
Финансы, юриспруденция и киберзащита
В финансовых исследованиях Google опирается на Vals Finance Agent v2, где Argon набрала 65,4%. Для юридической работы ключевым становится лимит генерации: договоры, заключения и длинные выдержки из практики модель может выдавать целым документом, без склейки из кусков. Конкретные юридические кейсы Google не раскрывает, поэтому судить о качестве такой работы по одному числу бенчмарка нельзя.
Кибербезопасность — самое заметное направление в анонсе. В CWE-bench v1 у Argon 68%, и партнёры по киберзащите получают модель без ограничений на киберзадачи. По данным Google, Argon самостоятельно находит, проверяет и исправляет уязвимости. Именно на этом направлении и строится первый этап доступа.
Агентные процессы и автоматизация
Лимит 1 млн токенов на выходе критичен для длительных агентных цепочек: модель выдаёт большой промежуточный или финальный результат одним ответом, не теряя состояние задачи. В AutomationBench, который проверяет выполнение процессов от начала до конца, Argon показала 51,3% против 41,4% у Astra и 42,5% у Opus.
Google описывает и корпоративные сценарии: команда агентов проанализировала телеметрию профилирования в дата-центрах и применила улучшения памяти, что, по оценкам компании, освободит более 300 ТиБ, а общая экономия оценивается от 500 ТиБ до 1 ПиБ. Ещё один пример — работа исследователей квантовых вычислений: в одном из случаев модель за считанные минуты превзошла опубликованный базовый результат на 40% при подборе ресурсов подпрограмм. Как устроены агентные обвязки в экосистеме Google, видно на примере Managed Agents в Gemini API, где доступны хуки окружения и контроль бюджета по токенам.
Независимых тестов агентных сценариев тоже нет, а внутренние примеры Google нельзя воспроизвести снаружи: ни промптов, ни полных замеров компания не публикует.
Доступ и цены: когда и как можно будет попробовать Gemini 4 Argon
Этапы доступа: Fairwind, API и Google AI Ultra
Первый этап — отдельные партнёры по кибербезопасности через программу Fairwind. На этом шаге модель выдают выборочно, и она ориентирована на задачи защиты, а не на массовое использование. Второй этап — платные клиенты API и подписчики Google AI Ultra. Дату этого этапа Google не назвала, а бесплатного доступа не анонсировано вовсе.
Перед широким запуском компания дорабатывает защиту от вредоносных запросов и скрытых инструкций в сторонних материалах. Отдельная система следит за рассуждениями и действиями Argon и останавливает её, если она выходит за пределы задачи пользователя. Партнёры по киберзащите и внутренние команды Google получают модель без ограничений на киберзадачи.
Сколько будет стоить API и как сэкономить на кэше
На старте 1 млн входных токенов стоит $2, выходных — $10. После вводного периода цены вырастут до $4 и $20 соответственно. Чтение входных токенов из кэша дешевле обычного ввода на 95%, и это главный рычаг экономии.
Кэш выгоден там, где один и тот же объёмный контекст отправляют многократно: агентные цепочки с неизменным системным промптом, повторные запросы по одной кодовой базе, многошаговые исследования с общей базой документов. При разовых запросах экономии почти не будет.
Оплата зарубежных API из России упирается в карты: локальные не проходят в биллинге Google. Один из обходных путей — виртуальная банковская карта зарубежного банка, которую выпускают дистанционно и пополняют в рублях через СБП, а управление идёт через мессенджер.
Ограничения и открытые вопросы
Что пока неизвестно
- Дата широкого запуска не названа.
- Независимых тестов нет: все цифры — внутренние замеры Google.
- Нет информации об открытых весах, значит, локальный запуск на своём GPU пока не рассматривается. Требования к VRAM, если веса когда-нибудь откроют, тоже неизвестны, а по косвенному признаку (модель крупнее прежних флагманов Pro) они будут высокими.
- Не раскрыты архитектура, размер контекстного окна, поддержка языков и детали мультимодальности.
- В части тестов на программирование Argon уступает GPT-6 Astra и Claude Opus 5.5.
Часть информации может быть неполной и требует уточнения из первоисточника — официального блога Google. Если в других пересказах появятся цифры, которых нет в анонсе, их стоит проверять по первоисточнику, а не по вторичным публикациям.
Стоит ли ждать Gemini 4 Argon
Если у вас длинные агентные цепочки, генерация больших объёмов кода или финансовые и юридические исследования с объёмными документами, модель выглядит перспективной: лимит вывода в 1 млн токенов прямо закрывает слабое место прежних версий. Цена на старте тоже выглядит конкурентоспособной, а кэш входных токенов снижает стоимость повторяющихся запросов.
Держать в голове стоит три вещи. Публичного доступа нет, и дата его появления неизвестна. Все бенчмарки поставлены самим вендором. В задачах классического кодинга Argon проигрывает конкурентам по собственным же тестам Google. Поэтому разумный план — не ждать вслепую, а собрать рабочий пайплайн на доступных сегодня моделях и следить за официальным блогом Google и независимыми замерами Artificial Analysis: там появятся цифры, не зависящие от вендора.