Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Gemini 3.5 Pro не вышел: почему Google откладывает флагмана и что это значит для рынка AI

Google DeepMind анонсировала Gemini 3.6 Flash, 3.5 Flash-Lite и Flash Cyber, но флагманский Gemini 3.5 Pro так и не появился. Разбираем причины задержки, сравни

Коротко

Что будет в материале

  1. 01

    Анонс, которого не ждали: Flash вместо Pro

  2. 02

    Что представили: разбор Gemini 3.6 Flash, 3.5 Flash-Lite и Flash Cyber

  3. 03

    Почему задерживается Gemini 3.5 Pro: внутренние проблемы и стратегия Google

  4. 04

    Google против OpenAI и Anthropic: позиция на фоне агрессивных релизов

22 июля 2026 года Google DeepMind анонсировала три новые модели: Gemini 3.6 Flash, 3.5 Flash-Lite и Flash Cyber. Флагманский Gemini 3.5 Pro, обещанный ещё в начале года, в релиз не попал. Разработчики, ожидавшие модель для сложного кодинга и рейтинга, остались с линейкой Flash, оптимизированной под скорость и стоимость, а не под максимальную производительность. Это не случайность, а стратегический сдвиг, который фиксирует новую реальность: Google временно выходит из гонки сверхбольших моделей и концентрируется на эффективности инференса и специализации.

Задержка Pro происходит на фоне агрессивных релизов конкурентов. OpenAI выпустила GPT-5.5 и GPT-5.6, Anthropic - Claude Opus 4.8 и Claude Sonnet 5. Отсутствие топовой модели ставит Google в уязвимую позицию в сегменте, где требуются максимальные способности к рассуждению. При этом компания давит ценой токенов и интеграцией с Google Cloud, сохраняя преимущество в сценариях массового production-использования. Разберём, что именно анонсировали, почему Pro задерживается и какие альтернативы доступны разработчикам прямо сейчас.

Анонс, которого не ждали: Flash вместо Pro

Google DeepMind представила три модели, закрывающие разные ценовые и функциональные ниши. Gemini 3.6 Flash - основная рабочая лошадка с улучшенной производительностью. Gemini 3.5 Flash-Lite - сверхдешёвая модель для простых задач. Flash Cyber - специализированное решение для кибербезопасности. Pro-версии в этом списке нет. Сообщество ожидало её с ноября 2025 года, когда вышел Gemini 3 Pro. С тех пор Google несколько раз намекала на скорый релиз, но сроки сдвигались. Текущий анонс подтверждает: в ближайшие месяцы флагмана не будет.

Ситуация напоминает историю с задержкой оригинального Gemini, когда внутренние тесты не достигали целевых показателей. Сейчас паттерн повторяется, но с новым акцентом: Google перераспределяет ресурсы в пользу Flash-линейки. Это осознанный выбор, а не провал разработки. Компания видит больший ROI в снижении стоимости инференса, чем в гонке параметров.

Что представили: разбор Gemini 3.6 Flash, 3.5 Flash-Lite и Flash Cyber

Gemini 3.6 Flash: флагман эффективности

Gemini 3.6 Flash получает контекстное окно до 1 млн токенов, сниженную на 40% latency по сравнению с 3.5 Flash и поддержку кэширования запросов. Модель показывает прирост в бенчмарках MMLU (+3,2 п.п.) и HumanEval (+5,1 п.п.). Этого достаточно для большинства production-задач: генерации кода, суммаризации, RAG-пайплайнов. Но для сложного многошагового рейтинга, где Claude Opus 4.8 и GPT-5.5 держат лидерство, Flash не дотягивает.

Стоимость: $0,15 за 1 млн входных токенов, $0,60 за 1 млн выходных. С кэшированием цена падает до $0,0375. Это конкурентно против GPT-5.5 ($0,50/$2,00) и Claude Sonnet 5 ($0,30/$1,50). Если задача не требует предельной глубины рассуждений, Gemini 3.6 Flash - экономичный выбор. Модель доступна через API Google Cloud и Vertex AI, интеграция с BigQuery и Cloud Storage сохраняется.

Gemini 3.5 Flash-Lite: минимальная цена за токен

Flash-Lite - ответ Google на запрос рынка по демократизации AI. Стоимость: $0,02 за 1 млн входных токенов, $0,08 за выходные. Это рекордно низкая цена среди моделей сопоставимого качества. Контекстное окно - 128 тыс. токенов. Модель заточена под классификацию, извлечение структурированных данных, модерацию контента, простые диалоговые системы. Reasoning-способности ограничены: на задачах MATH модель набирает 62,1%, против 88,3% у GPT-5.5.

Flash-Lite вписывается в стратегию Google по захвату low-end сегмента. Компания строит инфраструктуру, где простые запросы обслуживаются дешёвыми моделями, а сложные - специализированными или внешними. Разработчикам, которые гоняют миллионы токенов в сутки на рутинных операциях, эта модель снижает счета в 5-7 раз относительно Flash.

Flash Cyber: специализация на безопасности

Flash Cyber - первая доменно-специфичная модель в линейке Gemini. Она дообучена на корпусе данных по кибербезопасности: отчёты об инцидентах, сигнатуры угроз, логи SIEM-систем, техники MITRE ATT&CK. Модель генерирует правила детектирования для Suricata и YARA, анализирует фишинговые письма, предлагает шаги по изоляции инцидента. В тестах на датасете CyberSecEval 2.0 она обходит GPT-5.5 на 12% по точности классификации угроз и на 18% по полноте генерируемых правил.

Этот релиз подтверждает тренд: Gartner прогнозирует, что к 2027 году более 50% корпоративного генеративного AI будет доменно-специфичным. Google делает ставку на вертикальные решения, где общие LLM проигрывают в точности. Flash Cyber - первый шаг. Вероятны аналогичные модели для медицины, юриспруденции и финансов.

Почему задерживается Gemini 3.5 Pro: внутренние проблемы и стратегия Google

Технические барьеры: почему сложно сделать Pro

Сверхбольшие модели требуют экспоненциально больше ресурсов на обучение и инференс. Gemini 3 Pro (ноябрь 2025) уже сталкивался с проблемами стабильности: при длинных контекстах модель теряла связность, а в задачах с жёсткими ограничениями формата выдавала недетерминированные результаты. Масштабирование до 3.5 Pro усугубляет эти проблемы. Инженерам Google нужно обеспечить предсказуемость на уровне, сравнимом с Claude Opus 4.8, который держит планку по instruction following.

Инфраструктурные ограничения тоже играют роль. Проблемы с интеграцией Ironwood и дефицит вычислительных мощностей под масштабный инференс заставляют Google приоритезировать Flash-линейку, которая потребляет меньше ресурсов. Железо для Pro-уровня есть, но его недостаточно для массового обслуживания.

Стратегический сдвиг: ставка на эффективность, а не на размер

Google пересматривает стратегию. Вместо гонки за максимальным качеством на любых задачах компания фокусируется на снижении стоимости инференса и специализации. Flash-линейка закрывает 80% сценариев использования по цене в 3-10 раз ниже конкурентов. Flash Cyber открывает нишу доменно-специфичных моделей. Это прагматичный ответ на рыночную реальность: enterprise-клиентам нужны не просто мощные, а экономически оправданные решения.

Google полностью выбыл из топ-15 рейтинга AI-моделей 2026. Это следствие выбора в пользу эффективности. Компания не пытается догнать OpenAI и Anthropic в сегменте сверхбольших моделей, а строит альтернативную ценностную цепочку: дешёвый инференс, интеграция с облаком, специализированные решения. Проигрыш в рейтингах не означает проигрыша в бизнесе.

Google против OpenAI и Anthropic: позиция на фоне агрессивных релизов

Сравнение производительности: где Flash уступает конкурентам

На задачах сложного кодинга и математического рейтинга Gemini 3.6 Flash проигрывает флагманам конкурентов. Сравнение бенчмарков:

Модель MMLU HumanEval MATH GPQA Diamond
GPT-5.5 92,8% 95,1% 88,3% 76,4%
Claude Opus 4.8 91,5% 93,7% 86,9% 78,2%
Claude Sonnet 5 89,2% 91,3% 82,1% 72,8%
Gemini 3.6 Flash 87,4% 88,9% 79,5% 68,1%

Разрыв в GPQA Diamond (тест на сложные научные рассуждения) составляет 8-10 п.п. Для проектов, где критична глубина анализа, Flash не заменяет Pro. Разработчикам, которые строят агентные системы с многошаговым планированием, стоит смотреть на Claude Opus 4.8 или GPT-5.5.

Ценовая война: Google давит стоимостью токенов

Там, где Flash проигрывает в качестве, он выигрывает в экономике. Сравнение цен на 1 млн токенов (вход/выход):

Модель Вход (input) Выход (output) С кэшированием
GPT-5.5 $0,50 $2,00 $0,25
Claude Opus 4.8 $1,00 $5,00 $0,10
Claude Sonnet 5 $0,30 $1,50 $0,075
Gemini 3.6 Flash $0,15 $0,60 $0,0375

Gemini 3.6 Flash в 3-8 раз дешевле конкурентов на выходных токенах. При нагрузке в 100 млн токенов в сутки разница в счёте составляет десятки тысяч долларов в месяц. Для production-систем с высоким RPS это решающий фактор. Google также даёт скидки за резервирование мощностей через Vertex AI, что дополнительно снижает TCO.

Сильные стороны Google: интеграция с Google Cloud, мультимодальность из коробки, рекордно низкие цены. Слабые: отсутствие топовой модели для сложного reasoning, отставание в бенчмарках, потеря позиций в рейтингах. Ситуация напоминает провал Bard 1.0, когда избыточные фильтры безопасности и медленные итерации стоили Google рыночной доли.

Что делать разработчикам прямо сейчас: практические рекомендации

Если вам нужна топовая производительность: альтернативы Pro

Для сложного кодинга, математического рейтинга и агентных систем с многошаговым планированием текущие лидеры: Claude Opus 4.8 и GPT-5.5. Opus 4.8 показывает лучший instruction following и стабильность на длинных цепочках вызовов. GPT-5.5 выигрывает в скорости генерации и экосистеме инструментов (function calling, structured outputs). Пример выбора: если вы строите агента для рефакторинга кодовой базы, берите Opus 4.8. Если делаете real-time систему с жёсткими требованиями по latency - GPT-5.5.

Open-source альтернативы тоже наступают. Kimi-K3 с 2,8 трлн параметров сократила отставание от закрытых лидеров до 1,5 месяцев. Для проектов, где нужен контроль над моделью и нет зависимости от API, это рабочий вариант. Но учтите требования к инфраструктуре: инференс Kimi-K3 требует кластер из 8+ H100.

Если бюджет ограничен: максимальная отдача от Flash

Gemini 3.6 Flash покрывает 80% сценариев при кратно меньшей стоимости. Чтобы выжать максимум:

  • Используйте кэширование запросов. Повторяющиеся системные промпты и контексты кэшируются, цена падает в 4 раза.
  • Настройте пакетную обработку (batch inference) со скидкой 50% за асинхронное выполнение.
  • Разгрузите простые задачи на Flash-Lite. Классификация, извлечение сущностей, модерация - всё, что не требует reasoning, должно идти через Lite.
  • Для задач кибербезопасности используйте Flash Cyber. На доменных данных она точнее общих моделей и дешевле.

Предостережение: избегайте жёсткой привязки к конкретной версии модели. Пример с gpt-realtime (snapshot 2025-08-28), который объявлен устаревшим, показывает, что миграция на новые версии может сломать production-системы, завязанные на детерминированное поведение. Проектируйте пайплайны с возможностью замены модели без переписывания логики.

Прогноз: когда ждать Gemini 3.5 Pro и стоит ли ждать

Анализ дорожной карты Google и исторических паттернов релизов не даёт оснований ждать Pro в ближайшие 3-6 месяцев. Компания не анонсировала сроки, а текущий фокус на Flash-линейке и специализированных моделях указывает на сдвиг приоритетов минимум до конца 2026 года. Открытые модели уровня GPT-5.6 могут появиться раньше, чем Google выпустит Pro.

Рекомендация: не закладывайтесь на скорый релиз Gemini 3.5 Pro в критических проектах. Выбирайте из доступных альтернатив сейчас. Если Google выпустит Pro позже, миграция с Flash будет простой - API и формат ответов совместимы. Но ждать и откладывать запуск продукта ради гипотетической модели - рискованная стратегия в текущем темпе рынка. Конкуренты не ждут, и ваши пользователи тоже.

Подписаться на канал