Что нового в Managed Agents: ключевые обновления
Google DeepMind обновила Managed Agents в Gemini API. Это сервис для создания и управления AI-агентами, который теперь по умолчанию работает на модели Gemini 3.6 Flash. Апдейт закрывает несколько критичных для продакшена потребностей: кастомизацию окружения, контроль расходов и автоматизацию по расписанию.
Пять ключевых изменений:
- Gemini 3.6 Flash как модель по умолчанию. Сбалансированная производительность для рассуждений, программирования и вызова инструментов. Модель превосходит Gemini 3.1 Pro на всех кодинговых и агентских бенчмарках, опубликованных Google, стоит до 58% дешевле на выходных токенах и работает примерно вдвое быстрее.
- Environment hooks. Пользовательские скрипты внутри изолированной песочницы агента. Блокировка, линтинг или аудит вызовов инструментов до и после исполнения.
- HTTP-хуки. Внешняя валидация результатов агента через HTTP-запросы к вашим серверам. Интеграция с корпоративными политиками и compliance-системами.
- Бюджетный контроль через max_total_tokens. Жёсткий лимит токенов с возможностью возобновления прерванной задачи с точки остановки.
- Планировщик задач по cron. Автоматизация регулярных операций: ежедневные отчёты, мониторинг, периодическая аналитика.
Managed Agents теперь доступны на бесплатном тарифе. Разработчики могут экспериментировать без привязки к платному аккаунту, что снижает порог входа для тестирования агентных пайплайнов.
Gemini 3.6 Flash: производительность, бенчмарки и сравнение с 3.1 Pro
Gemini 3.6 Flash - это не просто облегчённая версия флагмана. В агентских сценариях она обходит предыдущую Pro-модель по всем ключевым метрикам, сохраняя отставание только в одном специфическом тесте. Разберём детали.
Кодинг и агентские бенчмарки: где Flash лидирует
Google опубликовала результаты, согласно которым Gemini 3.6 Flash превосходит Gemini 3.1 Pro на каждом кодинговом и агентском бенчмарке. Это касается задач генерации кода, отладки, вызова функций и многошаговых агентных сценариев. Для разработчиков, строящих агентов на Gemini API, переход на Flash даёт прирост качества без компромиссов по скорости.
Ранее мы подробно разбирали линейку новых моделей Gemini, где Flash показала снижение потребления выходных токенов на 17%. В агентных системах это напрямую влияет на итоговую стоимость задачи.
Рассуждения и знания: когда Pro еще актуален
Единственный бенчмарк, где Gemini 3.1 Pro сохраняет преимущество - GPQA Diamond, тест на PhD-уровневые рассуждения. Pro набирает 94.3% против 92.8% у Flash. Разрыв в полтора процентных пункта значим для сценариев, требующих предельной точности в сложных логических выводах: научные исследования, формальная верификация, многоуровневый анализ.
Для большинства прикладных задач эта разница несущественна. Если агент генерирует код, вызывает API и обрабатывает данные, Flash справляется лучше и быстрее. Pro остаётся нишевым инструментом для максимальной глубины рассуждений.
Скорость, стоимость и токен-эффективность
Экономика Flash выглядит так: цена выходных токенов снижена до 58% относительно Pro, скорость инференса выросла примерно вдвое. В агентных пайплайнах, где один вызов порождает цепочку обращений к инструментам, суммарная экономия достигает 65-71% - этот эффект мы детально разбирали в материале про экономию токенов как новую метрику эффективности.
Снижение latency на 50% означает, что агент быстрее реагирует на запросы пользователя. Для интерактивных сценариев это критично: никто не хочет ждать ответа по 10 секунд, когда можно получить его за 5.
Environment hooks и HTTP-хуки: кастомизация и контроль агентов
Главное архитектурное нововведение - хуки. Они позволяют вклиниться в процесс выполнения агента и проверить, заблокировать или модифицировать его действия. Это шаг от чёрного ящика к управляемому пайплайну.
Environment hooks: скрипты внутри песочницы
Environment hooks исполняются в изолированной среде агента. Вы пишете скрипт, который срабатывает до или после вызова инструмента. Сценарии применения:
- Pre-execution валидация. Перед вызовом API проверить параметры на соответствие схеме. Некорректный запрос блокируется до отправки.
- Линтинг кода. Агент сгенерировал код - хук прогоняет его через линтер и возвращает ошибки обратно агенту на исправление.
- Аудит действий. Post-execution хук записывает все вызовы инструментов с параметрами и результатами в лог для последующего анализа.
Точные детали реализации - поддерживаемые языки, доступные API внутри песочницы - Google пока не раскрыла. Это стоит учитывать при планировании миграции: функциональность может быть ограничена в первых версиях.
HTTP-хуки: внешняя валидация и интеграции
HTTP-хуки отправляют результат вызова инструмента на ваш сервер для проверки. Сервер возвращает разрешение или запрет. Это открывает сценарии, недоступные при локальной валидации:
- Compliance-проверки. Перед отправкой email или публикацией сообщения агент запрашивает одобрение у корпоративной системы.
- Интеграция с базами политик. Хук сверяет действие агента с актуальными правилами безопасности, хранящимися централизованно.
- Многоэтапные пайплайны. Результат одного агента валидируется внешним сервисом, после чего запускается следующий этап обработки.
Комбинация environment hooks и HTTP-хуков даёт двухуровневый контроль: быстрая локальная проверка в песочнице и централизованная валидация на внешнем сервере.
Бюджетный контроль и планировщик: управление затратами и автоматизация
Два обновления адресованы тем, кто запускает агентов в продакшен и считает деньги.
max_total_tokens: жёсткий лимит с умным возобновлением
Параметр max_total_tokens устанавливает потолок расхода токенов на задачу. При достижении лимита агент останавливается, но не теряет прогресс. Задачу можно возобновить с точки остановки - это принципиально отличается от простого обрыва по таймауту, где всё состояние теряется.
Практический сценарий: вы ставите лимит в 10 000 токенов на обработку документа. Агент успевает проанализировать 80% и останавливается. Вы оцениваете промежуточный результат и решаете, стоит ли документ дальнейших затрат. Если да - возобновляете задачу, и агент продолжает с того же места, а не начинает заново.
Точные лимиты и поведение при возобновлении требуют уточнения в документации. Google пока не опубликовала полную спецификацию.
Планировщик по cron: регулярные задачи без ручного запуска
Встроенный cron-планировщик позволяет настроить периодический запуск агента. Примеры:
- Ежедневный отчёт по метрикам в 9:00.
- Мониторинг состояния системы каждые 15 минут.
- Еженедельная аналитика по логам за прошедшую неделю.
Формат cron-выражений и ограничения по частоте запуска пока не детализированы. Предположительно, минимальный интервал будет ограничен для предотвращения злоупотреблений на бесплатном тарифе.
Бесплатный тариф: как начать экспериментировать без затрат
Managed Agents теперь доступны без платного аккаунта. Это снимает финансовый барьер для первого знакомства с агентным фреймворком Google.
Ограничения бесплатного тарифа не раскрыты, но можно предположить стандартную для Google практику: квоты на количество запросов в минуту и в день, лимит на суммарный объём токенов, отсутствие некоторых премиум-функций. Для старта достаточно получить API-ключ в Google AI Studio и запустить простого агента с одним инструментом.
Рекомендуем начать с базового сценария: агент с доступом к поиску или калькулятору, чтобы оценить latency и поведение хуков. Затем переходить к более сложным пайплайнам с несколькими инструментами и бюджетным контролем.
Когда мигрировать с Gemini 3.1 Pro на 3.6 Flash: практические рекомендации
Решение о миграции сводится к трём факторам: тип задач, бюджет и требования к точности рассуждений.
Переходите на Flash, если:
- Агент решает кодинговые задачи, вызывает API, обрабатывает данные. Flash быстрее, дешевле и качественнее на этих сценариях.
- Критична стоимость операции. До 58% экономии на выходных токенах и двукратный прирост скорости дают совокупное снижение затрат до 71% в агентных пайплайнах.
- Вы используете Managed Agents с новыми хуками. Flash - модель по умолчанию, и новые функции тестировались именно с ней.
Оставайтесь на Pro, если:
- Задача требует PhD-уровневых рассуждений. Разрыв в 1.5% на GPQA Diamond может быть критичен для научных или формально-логических сценариев.
- Вы уже оптимизировали пайплайн под Pro и не готовы к регрессионному тестированию. Переход на новую модель требует валидации на ваших данных.
Для большинства агентных сценариев Flash - лучший выбор прямо сейчас. Pro сохраняет нишу в сложных рассуждениях, но проигрывает по совокупности характеристик для прикладных задач. Подробный разбор компромиссов между скоростью и качеством мы давали в обзоре Gemini 3.6 Flash.
Если вы ждали Gemini 3.5 Pro и не понимаете, почему Google откладывает флагмана - рекомендуем разбор причин задержки и стратегии Google на фоне релизов OpenAI и Anthropic.