Google DeepMind выпустила три модели семейства Gemini, закрывающие разные сегменты рынка AI: экономичный Gemini 3.6 Flash, сверхбыстрый 3.5 Flash-Lite и специализированный 3.5 Flash Cyber для кибербезопасности. Релиз подтверждает стратегию компании: ставка на скорость, снижение стоимости инференса и нишевые решения вместо одного флагмана. Разработчики получили инструменты для оптимизации затрат и задержек в агентных сценариях, а безопасники - модель, заточенную под поиск уязвимостей.
Ключевые цифры: 3.6 Flash снижает потребление выходных токенов на 17%, 3.5 Flash-Lite выдаёт до 350 токенов в секунду при цене от $0.3 за миллион входных токенов, а 3.5 Flash Cyber доступна только в пилотной программе CodeMender для правительств и партнёров. Разбираем каждую модель с практическими сценариями, сравнительной таблицей и рекомендациями по внедрению.
Что нового в семействе Gemini: три модели под разные задачи
Google расширяет линейку Flash, делая её основной для массового применения. Gemini 3.6 Flash - прямое обновление предыдущей версии: модель стала эффективнее, дешевле в эксплуатации и точнее в кодовых задачах. Gemini 3.5 Flash-Lite - ответ на запрос рынка по максимальной скорости и минимальной цене. Gemini 3.5 Flash Cyber - нишевый продукт, сигнализирующий о тренде на специализированные AI-инструменты в безопасности.
Все три модели уже доступны через Google AI Studio и Vertex AI, кроме Flash Cyber - она остаётся в закрытом контуре пилотной программы CodeMender. Такой подход позволяет Google конкурировать с OpenAI и Anthropic не в сегменте тяжёлых Pro-моделей, а в нише практического применения, где критичны стоимость и latency. Подробнее о задержке флагманской Gemini 3.5 Pro и позиционировании Google на фоне конкурентов - в аналитике причин переноса релиза.
Gemini 3.6 Flash: умнее и дешевле предшественника
Gemini 3.6 Flash - эволюционное обновление. Модель не получила радикального скачка в качестве, но стала заметно экономичнее. Потребление выходных токенов снижено на 17%, что напрямую влияет на счета за API. В независимых тестах модель сохранила 50 баллов в сводном индексе качества, но сократила время выполнения задач вдвое - с 2,7 до 1,3 минуты. Детальный разбор бенчмарков и практические примеры кода - в обзоре Gemini 3.6 Flash.
Экономика инференса: как 17% экономии выходных токенов снижают счета
Снижение потребления выходных токенов на 17% - это прямая экономия для всех, кто платит за API. Возьмём типовой сценарий: агент поддержки генерирует 10 миллионов выходных токенов в месяц. При цене $0.53 за миллион выходных токенов (актуально для Gemini 3.5 Flash) месячный счёт составит $5.30 только за выход. С 17-процентной экономией сумма снижается до $4.40 - разница в $0.90 с каждого миллиона. Для высоконагруженных систем с сотнями миллионов токенов экономия исчисляется сотнями долларов ежемесячно.
Входные токены остались без изменений - $0.15 за миллион. Это стандартная практика Google: оптимизация направлена на самую затратную часть инференса, генерацию ответа. Для сценариев с длинными промптами и короткими ответами выгода минимальна. Для чат-ботов, агентов с многошаговыми рассуждениями и генерации кода - ощутима.
Кодовые и мультимодальные задачи: что стало лучше
Google заявляет об улучшении качества в кодовых задачах и мультимодальных сценариях. Конкретные цифры по бенчмаркам HumanEval или MMLU компания не раскрыла, но внутренние тесты показывают прирост в задачах на отладку, генерацию функций и работу с изображениями. Модель точнее следует инструкциям при рефакторинге кода и реже допускает синтаксические ошибки.
Мультимодальные улучшения касаются распознавания текста на изображениях и структурного анализа диаграмм. В тестах на извлечение данных из сканов документов 3.6 Flash показывает меньше галлюцинаций, чем предшественник. Практический вывод: если вы используете Gemini для анализа скриншотов интерфейсов, счетов или технических схем - миграция даст заметный прирост точности без увеличения стоимости.
Gemini 3.5 Flash-Lite: рекордная скорость и минимальная цена
Gemini 3.5 Flash-Lite - самая быстрая модель в линейке Google. Она выдаёт до 350 токенов в секунду при цене от $0.3 за миллион входных токенов. Это позиционирует её как инструмент для массовых операций: классификация, извлечение данных, простые агенты, препроцессинг перед тяжёлыми моделями. Модель превосходит 3.1 Flash-Lite и даже 3 Flash в агентных и программных задачах, что делает её кандидатом на замену более дорогих версий в сценариях, где не требуется глубокое рассуждение.
Flash-Lite против 3.1 Flash-Lite и 3 Flash: битва в агентных сценариях
Прямое сравнение трёх моделей по ключевым параметрам:
| Параметр | 3.5 Flash-Lite | 3.1 Flash-Lite | 3 Flash |
|---|---|---|---|
| Скорость (токенов/с) | до 350 | ~200 | ~150 |
| Цена за 1M входных токенов | $0.30 | $0.50 | $0.15 |
| Цена за 1M выходных токенов | $1.00 | $1.50 | $0.53 |
| Качество в function calling | выше 3.1 Flash-Lite и 3 Flash | базовый уровень | средний уровень |
| Агентные задачи (tool use) | превосходит обе модели | ограниченная поддержка | хорошая поддержка |
Ключевой инсайт: 3.5 Flash-Lite обходит 3 Flash в агентных сценариях, несмотря на более высокую цену выходных токенов. Это объясняется оптимизацией архитектуры под function calling и tool use - модель точнее выбирает нужный инструмент и формирует корректные вызовы API. Для цепочек вызовов, где каждый шаг требует быстрого принятия решения, Flash-Lite даёт выигрыш в latency и надёжности.
Для каких задач подходит Flash-Lite: практические кейсы
Flash-Lite не предназначена для сложных рассуждений, генерации объёмного кода или анализа многозначных контекстов. Её сильные стороны:
- Высоконагруженные чат-боты: стриминг ответов с минимальной задержкой, обработка тысяч одновременных сессий.
- Классификация текстов: определение интента, тональности, тематики с высокой скоростью и низкой стоимостью.
- Извлечение данных: парсинг структурированной информации из писем, документов, логов.
- Препроцессинг: фильтрация и нормализация запросов перед отправкой в более тяжёлую модель.
- Простые агенты: маршрутизация запросов, вызов API, заполнение форм.
Ограничения: модель не справляется с задачами, требующими многошагового рассуждения, сравнения нескольких документов или генерации сложного кода. В этих сценариях лучше использовать 3.6 Flash или дождаться выхода Pro-версии. Причины задержки флагмана и технические сложности интеграции с Ironwood разбираем в материале о внутренних проблемах Google.
Gemini 3.5 Flash Cyber: безопасность на уровне модели
Gemini 3.5 Flash Cyber - специализированная версия 3.5 Flash, нацеленная на автоматизированный поиск, верификацию и исправление уязвимостей. Модель доступна только в рамках пилотной программы CodeMender для правительственных организаций и избранных партнёров. Широкой публике она недоступна.
На бенчмарке CyberGym модель в составе агента CodeMender показала результаты, сопоставимые с крупными аналогами. На внутреннем тесте Big Sleep она превзошла базовую 3.5 Flash и Claude Opus 4.6. За 2 часа работы модель нашла RCE-уязвимости и ошибку памяти в production-сервисе Google Cloud, сгенерировав 100% надёжный эксплойт, обходящий ASLR и W^X.
Это нишевый продукт, но важный сигнал: Google движется в сторону специализированных AI-инструментов для безопасности. Тема перекликается с проблематикой безопасного использования AI-агентов для кода, которую мы разбирали в контексте блокировки Fable и тестов Kimi k3 - читайте в сравнительном обзоре защитных механизмов.
Сравнительная таблица: какую модель выбрать для своего проекта
| Модель | Скорость (токенов/с) | Цена входа (за 1M) | Цена выхода (за 1M) | Сильные стороны | Доступность | Идеальные сценарии |
|---|---|---|---|---|---|---|
| Gemini 3.6 Flash | ~150 | $0.15 | $0.44 (с учётом экономии 17%) | качество кода, мультимодальность, экономичность | открытая | генерация кода, анализ изображений, сложные агенты |
| Gemini 3.5 Flash-Lite | до 350 | $0.30 | $1.00 | скорость, цена входа, agentic-задачи | открытая | чат-боты, классификация, извлечение данных, препроцессинг |
| Gemini 3.5 Flash Cyber | не раскрыта | не раскрыта | не раскрыта | поиск уязвимостей, генерация эксплойтов | закрытая (CodeMender) | аудит кода, пентест, верификация исправлений |
| Gemini 3.5 Flash (предыдущая) | ~150 | $0.15 | $0.53 | сбалансированность | открытая | универсальные задачи, референс для сравнения |
Выбор модели зависит от приоритетов: стоимость против скорости против качества. Flash-Lite выигрывает там, где важна минимальная задержка и не требуется глубокое рассуждение. 3.6 Flash - компромиссный вариант для задач, где качество ответа критично, но бюджет ограничен. Flash Cyber - инструмент для узкого круга специалистов по безопасности.
AI-агенты на новых Gemini: что изменилось в экосистеме
Релиз трёх моделей одновременно - это не просто обновление версий. Google формирует экосистему, где разработчик комбинирует модели под разные шаги агентного пайплайна. Flash-Lite берёт на себя быстрые операции: принять запрос, классифицировать интент, вызвать нужный API. 3.6 Flash подключается для сложных шагов: генерация кода, анализ ошибок, работа с изображениями.
Улучшения в function calling и tool use делают обе модели пригодными для многошаговых цепочек. Flash-Lite точнее выбирает инструменты и формирует вызовы, 3.6 Flash - качественнее обрабатывает результаты. Снижение стоимости выходных токенов в 3.6 Flash уменьшает цену каждого шага агента, а рост скорости Flash-Lite сокращает общую latency пайплайна.
Пример архитектуры: агент технической поддержки использует Flash-Lite для первичного анализа запроса и поиска по базе знаний, затем передаёт сложные тикеты в 3.6 Flash для генерации решения с примерами кода. Счёт за API снижается на 20-30% по сравнению с использованием одной универсальной модели, а время ответа сокращается вдвое. Аналогичный подход с конфигурируемым рассуждением и tool calling мы разбирали на примере Grok 4.3 - сравнение с GPT-5.6 Sol и Kimi K3 в техническом обзоре.
Практические рекомендации: с чего начать тестирование
Не мигрируйте вслепую. Начните с замеров на своих данных и сценариях:
- Flash-Lite для простых задач: возьмите текущий сценарий классификации или извлечения данных, запустите на Flash-Lite, замерьте latency и точность. Если качество сопоставимо с текущей моделью - переходите ради скорости и снижения стоимости входных токенов.
- 3.6 Flash для кодовых сценариев: протестируйте на генерации и отладке кода. Сравните количество синтаксических ошибок и точность следования инструкциям с предыдущей версией. Экономия на выходных токенах станет бонусом, если качество устроит.
- Совместимость промптов: новые модели могут иначе интерпретировать инструкции. Проверьте, не требуют ли текущие промпты доработки - особенно для Flash-Lite, которая оптимизирована под быстрые ответы и может игнорировать избыточные указания.
- Гибридные пайплайны: попробуйте разбить агентный сценарий на шаги и назначить разные модели для разных этапов. Замерьте общую стоимость и latency, сравните с монолитным подходом.
Обе модели доступны через Google AI Studio для быстрого прототипирования и Vertex AI для production-развёртывания. Начинайте с AI Studio - это бесплатно и не требует настройки инфраструктуры. При переносе в production учитывайте, что поведение моделей может незначительно отличаться от тестового окружения из-за различий в конфигурации инференса.