Что такое Gemini 3.8 Live и Extended Thinking
Google открыла разработчикам две голосовые модели: Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Обе построены на Gemini 3 Pro, принимают на вход аудио, текст, изображения и видео, а на выходе выдают речь или текст. Разница в режиме работы: Live держит быстрый разговор с визуальным контекстом, Extended Thinking рассуждает и обращается к внешним инструментам параллельно с тем, как говорит.
Выбор между ними решает одна характеристика задачи. Если ответ нужен за доли секунды и укладывается в одну реплику, берут Live. Если между вопросом и ответом есть несколько шагов с проверкой данных, берут Extended Thinking: он не заставляет пользователя ждать в тишине, а проговаривает процесс вслух.
С 15 сентября 2026 года обе модели доступны через Gemini API и Google AI Studio. Корпоративным заказчикам их предлагают в закрытом предварительном тестировании. Любое аудио, сгенерированное моделями, помечается водяным знаком SynthID.
Ключевые отличия Live и Extended Thinking
| Параметр | Gemini 3.8 Live | Gemini 3.8 Live Extended Thinking |
|---|---|---|
| Задача | Быстрые диалоги, простые агенты, визуальные подсказки | Многошаговые задачи с рассуждением и вызовами инструментов |
| Задержка | Минимальная | Выше: часть времени уходит на фоновое рассуждение |
| Рассуждение | Короткое, в пределах реплики | Идёт в фоне одновременно с речью |
| Вызовы инструментов | Асинхронно, без прерывания диалога | Асинхронно, продолжаются и после сигнала завершения реплики |
| Языки | 97 языков с переключением во время разговора | Отдельно в анонсе не выделены |
Пример для Live: голосовой ассистент в приложении доставки. Пользователь наводит камеру на полку, спрашивает, есть ли этот продукт в наличии, и получает ответ, пока держит телефон в руке. Пример для Extended Thinking: бронирование билетов. Агент уточняет даты, проверяет рейсы, сравнивает цену, оформляет оплату и вслух комментирует, на каком шаге находится.
Технические характеристики и возможности
Контекстное окно обеих моделей: 131 072 входных токена. Максимальный объём вывода: 65 536 токенов. Для голосового агента это большой запас: в один сеанс помещается длинная история диалога, стенограмма звонка, изображения и видеофрагменты, которые пользователь показывает по ходу разговора.
Модальности на входе и выходе одинаковые у обеих версий. Вход: аудио, текст, изображения и видео. Выход: речь или текст, поэтому один и тот же агент отвечает голосом в приложении и текстом в чате поддержки.
Поддержка 97 языков и переключение на лету
Gemini 3.8 Live поддерживает 97 языков и переключается между ними прямо во время разговора. Смена языка не сбрасывает контекст: пользователь начинает по-русски, уточняет термин по-английски, и модель продолжает диалог с того места, где он остановился. Для поддержки это убирает отдельный шаг с выбором языка в интерфейсе, для глобальных продуктов снимает необходимость маршрутизировать запрос в отдельную модель под каждый язык.
Визуальный ввод и асинхронные вызовы инструментов
Модель обрабатывает изображения и видео почти в реальном времени и одновременно вызывает внешние API. Пока пользователь говорит, запрос к базе данных или внутреннему сервису уходит в фон, а диалог продолжается. Паузы в стиле «сейчас посмотрю» сокращаются, потому что ответ инструмента приходит к моменту, когда он нужен в разговоре.
Аудио на выходе помечается водяным знаком SynthID. Метка встраивается в сам сигнал, поэтому её нельзя снять простым копированием файла. Для внутренних сценариев это не мешает, для публикации синтезированной речи означает, что происхождение аудио можно проверить.
Как работает параллельное мышление в Extended Thinking
Extended Thinking выполняет фоновое рассуждение и вызовы инструментов одновременно с передачей голосового ответа. Пока модель говорит, она проверяет данные, ждёт ответа API и уточняет план действий. Прогресс озвучивается: сигналы вроде «Let me check that» заполняют паузу и объясняют пользователю, чем занят агент.
Для потока данных это важное изменение. Сигнал завершения реплики больше не означает, что обработка закончилась. После него сервер может отправить дополнительные аудиоданные или новые запросы к инструментам.
Что меняется для разработчиков
Соединение нельзя закрывать по первому сигналу конца реплики. Логика сессии должна учитывать три вещи: держать канал открытым, принимать дополнительные аудиочанки и события инструментов, завершать сессию только по явному признаку окончания обработки.
Практический пример. Агент бронирует отель. Пользователь закончил фразу и замолчал, а модель ещё сверяет даты и наличие номеров, затем озвучивает результат. Если код закроет стрим сразу после тишины, пользователь не услышит ответ, хотя на стороне модели задача уже выполнена. По этой же причине стоит логировать не только реплики, но и фоновые вызовы: часть действий происходит вне слышимой части диалога.
Бенчмарки и позиционирование на рынке
Единственная цифра, которую Google приводит в анонсе со ссылкой на внешнюю оценку: 82,6 балла и первое место в Speech-to-Speech Quality Index от Artificial Analysis. Это метрика качества речи в диалоге, а не универсальный рейтинг модели для любых задач.
В описании релиза упоминаются также 68,6% на τ-Voice и второе место Gemini 3.8 Live в Speech Agent Arena. Подтверждений этим цифрам в доступных материалах нет, поэтому при выборе стека опираться на них не стоит. Проверять голосовые модели надёжнее по собственному набору сценариев: длина реплики, доля перебиваний, поведение при смене языка, задержка ответа на вызов инструмента. Подробный разбор такого подхода есть в материале как не потеряться в потоке запусков AI-моделей.
Как получить доступ и начать работу
С 15 сентября 2026 года обе модели открыты для разработчиков через Gemini API и Google AI Studio. Корпоративным заказчикам доступ дают в закрытом предварительном тестировании, публичного списка тарифов и лимитов на старте нет.
В анонсе упоминается использование моделей в приложениях Gemini, Google Workspace и Search, но детали интеграции и сроки не раскрыты.
Доступ через Gemini API и Google AI Studio
Оба канала закрывают разные задачи. AI Studio подходит для быстрой проверки: собрать диалог, подсунуть изображение, посмотреть задержку и качество озвучки. Gemini API нужен для продакшена: потоковый ввод и вывод звука, вызовы инструментов, обработка событий вне реплик. Для Extended Thinking код сессии придётся писать с учётом того, что обработка продолжается после сигнала завершения реплики.
Историю релизов Google тоже стоит держать в голове: часть анонсов выходит с задержками и в закрытых режимах. Причины задержки флагманской модели и практические выводы для тех, кто планирует ставить её в продакшен, разобраны в статье отсрочка релиза Gemini. Для голосовых моделей вывод простой: тестировать через API можно уже сейчас, а переносить на них критичные процессы стоит после того, как станут известны лимиты и цены.
Практические сценарии применения
- Голосовой ассистент с камерой. Live: пользователь показывает объект или документ и получает разбор прямо в разговоре. Полезно для техподдержки на месте, приёмки товара, обучения сотрудников.
- Поддержка на нескольких языках. Live: один агент ведёт диалог со сменой языка без перезапуска сессии.
- Многошаговое бронирование и заказы. Extended Thinking: проверка доступности, согласование условий, оформление и озвучивание прогресса по шагам.
- Автоматизация с внешними API. Extended Thinking: агент параллельно обращается к CRM, биллингу и базе знаний, не оставляя пользователя в тишине.
- Операторские сценарии с длинным контекстом. Обе модели: в окно на 131 072 токена помещается история обращений и приложенные изображения.
Параллельные вызовы инструментов и визуальный ввод встраивают голосовых агентов в общий тренд на универсальные модели: один интерфейс закрывает мультимодальный вход, длинный контекст и агентные действия. Как этот сдвиг выглядит на уровне рынка, разобрано в статье эволюция спектра возможностей нейросетей.
Ограничения и на что обратить внимание
- Доступ. Для корпоративных заказчиков модели идут в закрытом предварительном тестировании. Публичных цен и лимитов нет, планировать бюджет вслепую не получится.
- Неподтверждённые цифры. Результат 68,6% на τ-Voice и второе место в Speech Agent Arena из анонса не подтверждены доступными данными. Это контекст релиза, а не ориентир для выбора стека.
- Асинхронность. Extended Thinking требует переписать логику сессии: конец реплики не означает конец обработки, нужна обработка событий вне диалога.
- Водяной знак. Аудио помечается SynthID. Для внутренних задач это нейтрально, для публикации синтезированной речи проверьте, укладывается ли метка в ваши требования.
- Бенчмарки от вендора. 82,6 балла в Speech-to-Speech Quality Index показывают качество речи в диалоге. Скорость, стоимость, устойчивость к перебиваниям и поведение на ваших данных эта метрика не покрывает.
Практичный порядок действий: собрать в AI Studio два-три своих сценария, один быстрый диалог на Live и один многошаговый на Extended Thinking, замерить задержку и качество ответов на своих данных. Решение о смене стека принимать после этих замеров, а не по цифрам из анонса.