Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Обзор новых Gemini: 3.6 Flash, 3.5 Flash-Lite и 3.5 Flash Cyber — эффективность, скорость и безопасность для AI-агентов

Google выпустил Gemini 3.6 Flash с экономией 17% выходных токенов, 3.5 Flash-Lite со скоростью до 350 токенов/с и ценой от $0.3/млн, а также закрытую 3.5 Flash

Коротко

Что будет в материале

  1. 01

    Что нового в семействе Gemini: три модели под разные задачи

  2. 02

    Gemini 3.6 Flash: умнее и дешевле предшественника

  3. 03

    Gemini 3.5 Flash-Lite: рекордная скорость и минимальная цена

  4. 04

    Gemini 3.5 Flash Cyber: безопасность на уровне модели

Google DeepMind выпустила три модели семейства Gemini, закрывающие разные сегменты рынка AI: экономичный Gemini 3.6 Flash, сверхбыстрый 3.5 Flash-Lite и специализированный 3.5 Flash Cyber для кибербезопасности. Релиз подтверждает стратегию компании: ставка на скорость, снижение стоимости инференса и нишевые решения вместо одного флагмана. Разработчики получили инструменты для оптимизации затрат и задержек в агентных сценариях, а безопасники - модель, заточенную под поиск уязвимостей.

Ключевые цифры: 3.6 Flash снижает потребление выходных токенов на 17%, 3.5 Flash-Lite выдаёт до 350 токенов в секунду при цене от $0.3 за миллион входных токенов, а 3.5 Flash Cyber доступна только в пилотной программе CodeMender для правительств и партнёров. Разбираем каждую модель с практическими сценариями, сравнительной таблицей и рекомендациями по внедрению.

Что нового в семействе Gemini: три модели под разные задачи

Google расширяет линейку Flash, делая её основной для массового применения. Gemini 3.6 Flash - прямое обновление предыдущей версии: модель стала эффективнее, дешевле в эксплуатации и точнее в кодовых задачах. Gemini 3.5 Flash-Lite - ответ на запрос рынка по максимальной скорости и минимальной цене. Gemini 3.5 Flash Cyber - нишевый продукт, сигнализирующий о тренде на специализированные AI-инструменты в безопасности.

Все три модели уже доступны через Google AI Studio и Vertex AI, кроме Flash Cyber - она остаётся в закрытом контуре пилотной программы CodeMender. Такой подход позволяет Google конкурировать с OpenAI и Anthropic не в сегменте тяжёлых Pro-моделей, а в нише практического применения, где критичны стоимость и latency. Подробнее о задержке флагманской Gemini 3.5 Pro и позиционировании Google на фоне конкурентов - в аналитике причин переноса релиза.

Gemini 3.6 Flash: умнее и дешевле предшественника

Gemini 3.6 Flash - эволюционное обновление. Модель не получила радикального скачка в качестве, но стала заметно экономичнее. Потребление выходных токенов снижено на 17%, что напрямую влияет на счета за API. В независимых тестах модель сохранила 50 баллов в сводном индексе качества, но сократила время выполнения задач вдвое - с 2,7 до 1,3 минуты. Детальный разбор бенчмарков и практические примеры кода - в обзоре Gemini 3.6 Flash.

Экономика инференса: как 17% экономии выходных токенов снижают счета

Снижение потребления выходных токенов на 17% - это прямая экономия для всех, кто платит за API. Возьмём типовой сценарий: агент поддержки генерирует 10 миллионов выходных токенов в месяц. При цене $0.53 за миллион выходных токенов (актуально для Gemini 3.5 Flash) месячный счёт составит $5.30 только за выход. С 17-процентной экономией сумма снижается до $4.40 - разница в $0.90 с каждого миллиона. Для высоконагруженных систем с сотнями миллионов токенов экономия исчисляется сотнями долларов ежемесячно.

Входные токены остались без изменений - $0.15 за миллион. Это стандартная практика Google: оптимизация направлена на самую затратную часть инференса, генерацию ответа. Для сценариев с длинными промптами и короткими ответами выгода минимальна. Для чат-ботов, агентов с многошаговыми рассуждениями и генерации кода - ощутима.

Кодовые и мультимодальные задачи: что стало лучше

Google заявляет об улучшении качества в кодовых задачах и мультимодальных сценариях. Конкретные цифры по бенчмаркам HumanEval или MMLU компания не раскрыла, но внутренние тесты показывают прирост в задачах на отладку, генерацию функций и работу с изображениями. Модель точнее следует инструкциям при рефакторинге кода и реже допускает синтаксические ошибки.

Мультимодальные улучшения касаются распознавания текста на изображениях и структурного анализа диаграмм. В тестах на извлечение данных из сканов документов 3.6 Flash показывает меньше галлюцинаций, чем предшественник. Практический вывод: если вы используете Gemini для анализа скриншотов интерфейсов, счетов или технических схем - миграция даст заметный прирост точности без увеличения стоимости.

Gemini 3.5 Flash-Lite: рекордная скорость и минимальная цена

Gemini 3.5 Flash-Lite - самая быстрая модель в линейке Google. Она выдаёт до 350 токенов в секунду при цене от $0.3 за миллион входных токенов. Это позиционирует её как инструмент для массовых операций: классификация, извлечение данных, простые агенты, препроцессинг перед тяжёлыми моделями. Модель превосходит 3.1 Flash-Lite и даже 3 Flash в агентных и программных задачах, что делает её кандидатом на замену более дорогих версий в сценариях, где не требуется глубокое рассуждение.

Flash-Lite против 3.1 Flash-Lite и 3 Flash: битва в агентных сценариях

Прямое сравнение трёх моделей по ключевым параметрам:

Параметр3.5 Flash-Lite3.1 Flash-Lite3 Flash
Скорость (токенов/с)до 350~200~150
Цена за 1M входных токенов$0.30$0.50$0.15
Цена за 1M выходных токенов$1.00$1.50$0.53
Качество в function callingвыше 3.1 Flash-Lite и 3 Flashбазовый уровеньсредний уровень
Агентные задачи (tool use)превосходит обе моделиограниченная поддержкахорошая поддержка

Ключевой инсайт: 3.5 Flash-Lite обходит 3 Flash в агентных сценариях, несмотря на более высокую цену выходных токенов. Это объясняется оптимизацией архитектуры под function calling и tool use - модель точнее выбирает нужный инструмент и формирует корректные вызовы API. Для цепочек вызовов, где каждый шаг требует быстрого принятия решения, Flash-Lite даёт выигрыш в latency и надёжности.

Для каких задач подходит Flash-Lite: практические кейсы

Flash-Lite не предназначена для сложных рассуждений, генерации объёмного кода или анализа многозначных контекстов. Её сильные стороны:

  • Высоконагруженные чат-боты: стриминг ответов с минимальной задержкой, обработка тысяч одновременных сессий.
  • Классификация текстов: определение интента, тональности, тематики с высокой скоростью и низкой стоимостью.
  • Извлечение данных: парсинг структурированной информации из писем, документов, логов.
  • Препроцессинг: фильтрация и нормализация запросов перед отправкой в более тяжёлую модель.
  • Простые агенты: маршрутизация запросов, вызов API, заполнение форм.

Ограничения: модель не справляется с задачами, требующими многошагового рассуждения, сравнения нескольких документов или генерации сложного кода. В этих сценариях лучше использовать 3.6 Flash или дождаться выхода Pro-версии. Причины задержки флагмана и технические сложности интеграции с Ironwood разбираем в материале о внутренних проблемах Google.

Gemini 3.5 Flash Cyber: безопасность на уровне модели

Gemini 3.5 Flash Cyber - специализированная версия 3.5 Flash, нацеленная на автоматизированный поиск, верификацию и исправление уязвимостей. Модель доступна только в рамках пилотной программы CodeMender для правительственных организаций и избранных партнёров. Широкой публике она недоступна.

На бенчмарке CyberGym модель в составе агента CodeMender показала результаты, сопоставимые с крупными аналогами. На внутреннем тесте Big Sleep она превзошла базовую 3.5 Flash и Claude Opus 4.6. За 2 часа работы модель нашла RCE-уязвимости и ошибку памяти в production-сервисе Google Cloud, сгенерировав 100% надёжный эксплойт, обходящий ASLR и W^X.

Это нишевый продукт, но важный сигнал: Google движется в сторону специализированных AI-инструментов для безопасности. Тема перекликается с проблематикой безопасного использования AI-агентов для кода, которую мы разбирали в контексте блокировки Fable и тестов Kimi k3 - читайте в сравнительном обзоре защитных механизмов.

Сравнительная таблица: какую модель выбрать для своего проекта

МодельСкорость (токенов/с)Цена входа (за 1M)Цена выхода (за 1M)Сильные стороныДоступностьИдеальные сценарии
Gemini 3.6 Flash~150$0.15$0.44 (с учётом экономии 17%)качество кода, мультимодальность, экономичностьоткрытаягенерация кода, анализ изображений, сложные агенты
Gemini 3.5 Flash-Liteдо 350$0.30$1.00скорость, цена входа, agentic-задачиоткрытаячат-боты, классификация, извлечение данных, препроцессинг
Gemini 3.5 Flash Cyberне раскрытане раскрытане раскрытапоиск уязвимостей, генерация эксплойтовзакрытая (CodeMender)аудит кода, пентест, верификация исправлений
Gemini 3.5 Flash (предыдущая)~150$0.15$0.53сбалансированностьоткрытаяуниверсальные задачи, референс для сравнения

Выбор модели зависит от приоритетов: стоимость против скорости против качества. Flash-Lite выигрывает там, где важна минимальная задержка и не требуется глубокое рассуждение. 3.6 Flash - компромиссный вариант для задач, где качество ответа критично, но бюджет ограничен. Flash Cyber - инструмент для узкого круга специалистов по безопасности.

AI-агенты на новых Gemini: что изменилось в экосистеме

Релиз трёх моделей одновременно - это не просто обновление версий. Google формирует экосистему, где разработчик комбинирует модели под разные шаги агентного пайплайна. Flash-Lite берёт на себя быстрые операции: принять запрос, классифицировать интент, вызвать нужный API. 3.6 Flash подключается для сложных шагов: генерация кода, анализ ошибок, работа с изображениями.

Улучшения в function calling и tool use делают обе модели пригодными для многошаговых цепочек. Flash-Lite точнее выбирает инструменты и формирует вызовы, 3.6 Flash - качественнее обрабатывает результаты. Снижение стоимости выходных токенов в 3.6 Flash уменьшает цену каждого шага агента, а рост скорости Flash-Lite сокращает общую latency пайплайна.

Пример архитектуры: агент технической поддержки использует Flash-Lite для первичного анализа запроса и поиска по базе знаний, затем передаёт сложные тикеты в 3.6 Flash для генерации решения с примерами кода. Счёт за API снижается на 20-30% по сравнению с использованием одной универсальной модели, а время ответа сокращается вдвое. Аналогичный подход с конфигурируемым рассуждением и tool calling мы разбирали на примере Grok 4.3 - сравнение с GPT-5.6 Sol и Kimi K3 в техническом обзоре.

Практические рекомендации: с чего начать тестирование

Не мигрируйте вслепую. Начните с замеров на своих данных и сценариях:

  1. Flash-Lite для простых задач: возьмите текущий сценарий классификации или извлечения данных, запустите на Flash-Lite, замерьте latency и точность. Если качество сопоставимо с текущей моделью - переходите ради скорости и снижения стоимости входных токенов.
  2. 3.6 Flash для кодовых сценариев: протестируйте на генерации и отладке кода. Сравните количество синтаксических ошибок и точность следования инструкциям с предыдущей версией. Экономия на выходных токенах станет бонусом, если качество устроит.
  3. Совместимость промптов: новые модели могут иначе интерпретировать инструкции. Проверьте, не требуют ли текущие промпты доработки - особенно для Flash-Lite, которая оптимизирована под быстрые ответы и может игнорировать избыточные указания.
  4. Гибридные пайплайны: попробуйте разбить агентный сценарий на шаги и назначить разные модели для разных этапов. Замерьте общую стоимость и latency, сравните с монолитным подходом.

Обе модели доступны через Google AI Studio для быстрого прототипирования и Vertex AI для production-развёртывания. Начинайте с AI Studio - это бесплатно и не требует настройки инфраструктуры. При переносе в production учитывайте, что поведение моделей может незначительно отличаться от тестового окружения из-за различий в конфигурации инференса.

Подписаться на канал