Перейти к содержанию
Публикация AiManual

Gemini 3.8 Live with Live Avatar: визуальный аватар для диалоговых AI-агентов

Google добавила к Gemini 3.8 Live визуального аватара: near real-time видеогенерация, синхронизация губ и переключение между 97 языками прямо во время разговора

Коротко

Что будет в материале

  1. 01

    Что такое Gemini 3.8 Live with Live Avatar

  2. 02

    Сценарии использования для бизнеса

  3. 03

    Мультиязычность и качество видео

  4. 04

    Кастомизация аватаров и брендинг

Что такое Gemini 3.8 Live with Live Avatar

Live Avatar - визуальное расширение для диалоговой модели Gemini 3.8 Live. Google представила его 24 сентября 2026 года: к голосовому агенту добавляется near real-time видеогенерация, и разговор превращается в сцену, где персонаж на экране слушает, видит собеседника и отвечает вслух. Анонс подписан Gemini Audio Team, среди авторов Shuo-yiin Chang (Research Scientist) и CJ Zheng (Software Engineer).

Отличие от привычных видео-аватаров в том, что здесь нет предзаписанного или заранее отрендеренного ролика. Губы двигаются в такт фразам, брови поднимаются, персонаж улыбается, хмурится, отводит взгляд, а реплики сменяют друг друга без разрыва. Русскоязычный разбор анонса описывает то же поведение: анимированный персонаж отвечает в реальном времени.

Работает всё поверх Gemini 3.8 Live. Эта модель уже принимает визуальный ввод, переключается между языками и вызывает инструменты в фоне; её характеристики и бенчмарки разобраны в материале про Gemini 3.8 Live и 3.8 Live Extended Thinking.

Ключевые возможности Live Avatar

  • Near real-time видеогенерация: изображение аватара собирается во время диалога.
  • Точная синхронизация губ с произносимыми фразами.
  • Естественная мимика: поднятые брови, улыбка, нахмуренные брови, отведённый взгляд.
  • Плавная смена реплик без пауз между вопросом пользователя и ответом агента.
  • Одновременная обработка визуального и аудиовхода.
  • Асинхронный вызов инструментов: данные подтягиваются в фоне, пока разговор продолжается.
  • Нативная мультиязычная синхронизация речи с переключением между 97 языками.
  • Библиотека готовых аватаров и кастомные аватары по референсному изображению.
  • Доступ через Gemini Enterprise; кастомные аватары только по enterprise allowlisting.

Как это работает: техническая сторона

Модель принимает визуальный и аудиовход одновременно и генерирует видео почти в реальном времени. Синхронизация губ и мимики опирается на нативную мультиязычную синхронизацию речи: аватар подстраивает артикуляцию под тот язык, на котором говорит прямо сейчас, а не проигрывает одну и ту же анимацию для всех языков.

Асинхронный вызов инструментов меняет поведение агента: он запускает вызов и получает данные в фоне, продолжая активный диалог. Пользователь не слышит тишину, пока система ходит во внешнюю базу.

Архитектуру Google не раскрывает. В анонсе нет данных о размере модели, требованиях к GPU, задержке в миллисекундах и о том, где идёт рендеринг видео. Подтверждено только поведение, описанное в самом сообщении компании. Понимание видео у Gemini развивается отдельным направлением: о разнице между покадровым анализом и агентной навигацией мы писали в разборе agentic video understanding в Gemini.

Сценарии использования для бизнеса

Google приводит три сценария: обслуживание клиентов, интерактивные walkthrough и сложные задачи с фоновыми вызовами инструментов вроде регистрации гостя в отеле. Все они рассчитаны на корпоративные внедрения через Gemini Enterprise, а не на одиночных пользователей.

Обслуживание клиентов и поддержка

Агент отвечает голосом, показывает эмоции и меняет язык по ходу разговора. Практический эффект даёт связка с фоновыми вызовами: проверка брони, статуса заказа или остатка на складе идёт параллельно с разговором, и клиенту не нужно ждать с пустым экраном.

Второй слой - подача. Про то, как характер ассистента влияет на удержание и вовлечённость, есть отдельный разбор: персонализация AI-ассистентов. Живое лицо с мимикой усиливает тот же эффект, только в видеоформате.

Интерактивные walkthrough и обучение

Аватар ведёт пользователя по продукту голосом и жестами, объясняет шаги и отвечает на уточняющие вопросы в том же сеансе. Для SaaS-платформ это заменяет часть работы онбординг-менеджеров, для обучающих курсов - записанные видеоинструкции, которые устаревают после каждого обновления интерфейса. Демонстрация становится диалогом: пользователь спрашивает, почему кнопка неактивна, и получает ответ по ходу показа.

Мультиязычность и качество видео

Live Avatar переключается между 97 языками прямо в середине разговора. Поддержку 97 языков Google подтверждает и для интеллектуальных моделей Gemini. Речь идёт не о переводе текста: синхронизация губ и выражения лица адаптируются под новый язык, а качество видео не проседает и визуальные артефакты не появляются.

Для международных команд это меняет схему поддержки. Один агент ведёт разговор на нескольких языках в одной сессии, без раздельных ботов, дублирующих аватаров и ручной передачи диалога между операторами разных смен. Ограничение тоже есть: список из 97 языков и качество синхронизации по каждому из них Google в анонсе не приводит, поэтому региональные варианты придётся проверять на своих сценариях.

Кастомизация аватаров и брендинг

Есть библиотека готовых аватаров: разные персонажи с собственной внешностью, голосом и манерой держаться. Если готовые не подходят, компания собирает своего: из качественного референсного изображения генерируется полностью анимированный аватар, который сохраняет сходство, стиль бренда или идентичность персонажа.

Условие одно, но жёсткое: создание кастомных аватаров сейчас доступно только через enterprise allowlisting. Маршрут такой: организация обращается к Google, проходит согласование и только потом получает доступ к генерации персонажа по референсу. Google причину ограничения не раскрывает, но требование означает, что каждое кастомное лицо проходит через проверку вендора. Для малого бизнеса и одиночных разработчиков это фактически закрытая дверь, для крупных компаний - способ не выпускать в генерацию чужие лица и бренды без разрешения.

Доступность и ограничения

На момент анонса Gemini 3.8 Live with Live Avatar доступен в Gemini Enterprise. Публичного API, бесплатного доступа и отдельной страницы с ценами Google не объявляла: в сообщении нет ни сроков расширения доступа, ни условий тарифов. Кастомные аватары остаются за allowlisting, библиотека готовых работает внутри того же корпоративного контура.

Отдельный вопрос - маркировка контента. В описании функции упоминается невидимый водяной знак SynthID для сгенерированного аудио и видео, но в опубликованных материалах анонса подтверждения по Live Avatar нет. Считать маркировку гарантированной нельзя до отдельного заявления Google. Если для вашего сценария важна прослеживаемость происхождения видео, это стоит уточнить у вендора до пилота, а не после запуска в продакшене.

Что ещё остаётся неизвестным: задержка и требования к каналу связи, нагрузка на инфраструктуру заказчика, поддержка мобильных клиентов, запись сессий и хранение сгенерированного видео. Без этих данных оценивать стоимость внедрения рано, а обкатывать сценарии разумно на ограниченной группе пользователей.

Технические детали: асинхронный вызов инструментов

Асинхронный вызов инструментов отличает Live Avatar от синхронных агентов. Агент запускает вызов инструмента и получает данные в фоне, продолжая активный диалог, поэтому разговор не распадается на «вопрос - пауза - ответ».

Google показывает это на примере регистрации гостя в отеле: аватар уточняет детали, параллельно проверяет данные и продолжает беседу без остановки на ожидание ответа системы. Для сценариев с внешними API разница принципиальная. Чем длиннее цепочка вызовов (проверка брони, оплата, верификация документа), тем заметнее выигрыш от фонового выполнения по сравнению с последовательной схемой.

Ограничение в том, что деталей реализации Google не приводит. Неизвестно, сколько вызовов можно держать в фоне одновременно, что происходит с диалогом при таймауте инструмента и как обрабатываются ошибки внешних сервисов. Это придётся выяснять на этапе интеграции, и планировать бюджет времени на отладку стоит заранее.

Сравнение с конкурентами и позиционирование

Рынок видео-аватаров сложился раньше и решает другую задачу: производство ролика по сценарию, с монтажом и пакетной генерацией. Gemini заходит со стороны диалога, где аватар встроен в саму модель. Сопоставлять решения стоит по признакам, которые подтверждены в анонсе:

  • Синхронизация с речью в реальном времени вместо пакетной генерации по готовому тексту.
  • Асинхронный вызов инструментов внутри разговора, что для визуальных агентов встречается редко.
  • 97 языков с адаптацией артикуляции и мимики под текущий язык.
  • Доступ только через Gemini Enterprise, кастомные лица - по allowlisting.

Сравнение аватаров Google Vids, HeyGen и Synthesia по задачам и ограничениям разобрано отдельно: Google Vids как AI-видеоредактор. Короткий вывод для выбора: для маркетингового ролика по сценарию нужны платформы видеопроизводства, для агента, который говорит с клиентом и одновременно ходит во внутренние системы, ближе Live Avatar, но пока только в enterprise-контуре.

Перспективы и влияние на индустрию

Google последовательно двигает визуальное присутствие в корпоративный сегмент: сначала голосовые модели, затем синтез речи, понимание видео, аватары в Vids и теперь Live Avatar в Gemini Enterprise. Логика читается: агент должен не только отвечать текстом, но и выглядеть как сотрудник, которому можно задать вопрос в лицо.

Ожидаемые направления развития - расширение библиотеки аватаров и списка языков, снижение задержки, появление публичных условий доступа. Это именно ожидания: в официальном сообщении нет ни roadmap, ни сроков. Опираться пока стоит на три подтверждённых факта: near real-time видеогенерация, переключение между 97 языками и фоновый вызов инструментов.

Практический шаг для команды: если у вас есть сценарий с живым диалогом и внешними системами (поддержка, ресепшен, онбординг, демонстрация продукта), запрашивайте доступ через Gemini Enterprise и проверяйте задержку и качество синхронизации на своих языках. Если задача - поток видео по сценарию, это другой класс инструментов, и подбирать его нужно по процессу производства, а не по качеству диалога.

Подписаться на канал