Перейти к содержанию
Публикация AiManual

Gemini 3.8 Flash TTS и Flash-Lite TTS: генерация и репликация голоса по текстовому промпту

Google выпустила Gemini 3.8 Flash TTS и Flash-Lite TTS: первая создаёт новые голоса по текстовому описанию и управляет каждой репликой, вторая рассчитана на мас

Коротко

Что будет в материале

  1. 01

    Что такое Gemini 3.8 Flash TTS и Flash-Lite TTS

  2. 02

    Генерация голоса с нуля по текстовому промпту

  3. 03

    Пошаговая режиссура реплик: темп, эмоции, невербальные звуки

  4. 04

    Репликация голоса по 30-секундному образцу: как это работает и что с безопасностью

Google 23 сентября 2026 года представила две модели синтеза речи в семействе Gemini Audio: Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Первая создаёт голоса с нуля по текстовому описанию и позволяет режиссировать каждую реплику, вторая рассчитана на массовую озвучку с меньшими затратами. Обе модели компания называет самыми выразительными из своих генераторов аудио на текущий момент (анонс Google DeepMind).

Разница между ними укладывается в одну фразу: Flash TTS нужна там, где голос придумывают под персонажа и сцену, Flash-Lite TTS - там, где важен объём. Обе работают по промптам на естественном языке, умеют создавать новые голоса и реплицировать существующие, а Flash TTS настраивает роль, акцент и характеристики голоса более чем на 100 языках и диалектах.

Дальше разберём, что нового в этих моделях, как собирать промпт под нужный голос, как управлять отдельными репликами и где проходят границы: что подтверждено в анонсе, а что пока остаётся деталью из пересказов.

Что такое Gemini 3.8 Flash TTS и Flash-Lite TTS

Обе модели дополняют семейство Gemini Audio, куда уже входят 3.5 Live Translate, 3.5 Transcribe, 3.8 Live и 3.8 Live Extended Thinking. Модели линейки Live отвечают за разговор в реальном времени, и у нас есть отдельный разбор Gemini 3.8 Live и Live Extended Thinking с их характеристиками и доступом. Новые TTS-модели закрывают другую задачу: превращают текст и описание голоса в готовую озвучку.

Позиционирование в анонсе выглядит так. Flash TTS - инструмент творческой режиссуры и дизайна персонажей: новые голоса с нуля, построчное управление игрой. Flash-Lite TTS - инструмент масштаба: массовый дубляж, поток аудиоконтента и выразительные голосовые агенты с тонкой настройкой тона, темпа и нюансов.

Ключевые отличия от предыдущих моделей Gemini Audio

Предыдущие модели семейства работали с аудио как с потоком в диалоге: распознавали речь, переводили её, поддерживали разговор. Новые модели относятся к речи как к контенту: на входе текст и описание голоса, на выходе файл озвучки, который можно перемонтировать, переозвучить и разложить по персонажам.

Сравнимых цифр по качеству, задержке и стоимости между старыми и новыми моделями в анонсе нет. Утверждать, что новая линейка обходит 3.8 Live по естественности речи, не на чем: единственная оценка в тексте - что это самые выразительные модели генерации аудио от Google на момент выпуска (первоисточник).

ПараметрGemini 3.8 Flash TTSGemini 3.8 Flash-Lite TTS
НазначениеТворческая режиссура и дизайн персонажейБольшие объёмы при меньшей стоимости
Создание голосаНовые голоса с нуля по текстовому промптуОзвучка и голосовые агенты с контролем тона, темпа и выразительных нюансов
Управление репликойАктёрские указания, темп, диалектные сдвиги, backchannelingТон, темп, выразительные нюансы
Типичные задачиИгры, аудиокниги, подкасты, интерактивные медиаМассовый дубляж, поток аудиоконтента, голосовые агенты
ПлатформыGoogle AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook, Google VidsGoogle AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook, Google Vids

Генерация голоса с нуля по текстовому промпту

Flash TTS собирает голос по описанию, а не подставляет готовый пресет. В промпте задают роль, акцент и характеристики голоса, а модель подбирает тембр, манеру и подачу. Самый наглядный пример из анонса - генерация голоса диджея с высокой энергией из текстового описания.

Практическая схема промпта состоит из четырёх блоков: кто говорит (роль и характер), как говорит (темп, энергия, тембр), с каким акцентом и на каком языке, в какой ситуации (сцена, жанр, адресат). Чем конкретнее описание, тем меньше свободы остаётся модели.

Как формулировать промпт для генерации голоса

Примеры формулировок для разных задач:

Роль: циничный детектив, 50 лет. Низкий голос с хрипотцой, говорит не спеша, с паузами, будто взвешивает каждое слово. В интонации лёгкая ирония.
Роль: ведущая молодёжного подкаста. Энергичная подача, быстрый темп, улыбка в голосе.
Роль: виртуальный ассистент службы поддержки. Ровный нейтральный тон, чёткая дикция, без резких перепадов громкости.

Это примеры структуры, а не подтверждённый синтаксис: точных шаблонов промптов анонс не приводит. Комбинировать параметры можно и нужно: акцент с темпом, характер с эмоциональным фоном, роль с ситуацией. Одна и та же ремарка в разных сценариях даст разный результат, поэтому финальный голос удобнее отбирать на коротких фрагментах.

Поддержка языков и диалектов

Анонс заявляет более 100 языков и диалектов, а диалектные сдвиги управляются на уровне отдельной реплики: персонаж может перейти на другой вариант произношения внутри сцены. Google параллельно расширяет языковое покрытие своих продуктов, и общий контекст этих работ мы разбирали в материале про 300+ языков и TranslateGemma.

Конкретного списка региональных вариантов в анонсе нет. Мексиканский испанский или квебекский французский в описаниях темы упоминаются как примеры, но подтверждения в опубликованном тексте они не получили, а заявлять поддержку всех существующих диалектов оснований нет.

Пошаговая режиссура реплик: темп, эмоции, невербальные звуки

Flash TTS позволяет управлять каждой строкой отдельно: актёрские указания, темп, диалектные сдвиги, невербальные звуки. Для практики это значит, что один текст можно развести по разным состояниям персонажа в пределах одной сцены, не перегенерируя её целиком.

Пример сценария с разными ремарками на каждую строку:

Строка 1: «Я всё знал с самого начала». Подача: спокойно, ровно, без нажима.
Строка 2: «Ты правда думал, что я поверю?» Подача: с сарказмом, чуть быстрее.
Строка 3: «Ладно. Рассказывай». Подача: тихо, устало, с паузой перед последним словом.

Управление темпом и паузами

Темп задаётся описанием: «говорит медленно и вдумчиво», «частит от волнения», «чеканит слова». Паузы ставятся через описание состояния и разбиение текста на строки. Точной конструкции вида «пауза 2 секунды» в анонсе нет, поэтому рассчитывать на управление длительностью с точностью до десятых долей секунды не стоит. Если пауза критична для монтажа, надёжнее нарезать реплики отдельно и расставить тишину на этапе сведения.

Эмоции и актёрские указания

Актёрские указания работают как ремарки в сценарии: «шёпотом», «с сарказмом», «сдерживаемая ярость». Их можно совмещать с темпом и громкостью: «говорит тихо и раздельно, будто через силу». В диалоге это даёт контраст между репликами, который и создаёт ощущение живой сцены, а не чтения вслух.

Невербальные звуки и backchanneling

Backchanneling - короткие звуки реакции: «ага», «угу», «ммм». В анонсе они перечислены прямо, рядом со смехом и другими невербальными элементами. Пара таких вставок меняет восприятие диалога: слушатель слышит ответную реакцию, а не два чередующихся монолога. Ограничение в том, что анонс не описывает полный список поддерживаемых звуков, поэтому конкретный набор придётся проверять на месте.

Репликация голоса по 30-секундному образцу: как это работает и что с безопасностью

Анонс подтверждает: существующие голоса можно реплицировать простыми промптами на естественном языке. Требования к образцу в тексте не раскрыты. Цифра в 30 секунд встречается в описаниях темы, но подтверждения в анонсе не получила, как и детали процедуры: сколько дублей нужно, как обрабатывается шум, что происходит при несовпадении языка образца и текста.

Как получить согласие на использование голоса

Требование проверять согласие владельца голоса в анонсе отдельно не сформулировано: там говорится о встроенных инструментах безопасности, включая водяные знаки. Это не снимает юридическую часть. Права на голос живого человека регулируются законодательством и договором, поэтому письменное разрешение носителя голоса и фиксация объёма использования остаются вашей задачей, а не функцией модели.

Водяные знаки SynthID и C2PA-метаданные

В анонсе сказано, что сгенерированное аудио защищено встроенными инструментами безопасности, включая водяные знаки. Названия SynthID и метаданных C2PA в этом тексте не упоминаются, подтверждения по ним нет. Практический вывод: пометка ставится на этапе генерации, но рассчитывать на то, что её невозможно убрать, не стоит. Перекодирование, нарезка и повторное сведение аудио способны испортить или уничтожить след, поэтому проверка происхождения файла редко бывает единственным аргументом.

Региональные ограничения на репликацию голоса

Анонс не делит доступ по странам и не описывает отдельные правила клонирования для разных регионов. Если вы запускаете проект в конкретной стране, проверяйте условия использования Gemini API и местное законодательство о синтетическом голосе: этот пункт лежит вне технической документации модели.

Flash TTS или Flash-Lite TTS: что выбрать для вашей задачи

Выбор сводится к одной развилке: нужен уникальный голос и построчная режиссура или нужен объём. Цен в анонсе нет, поэтому стоимость считайте по фактическим тарифам API, а не по обещаниям.

Сценарии для Flash TTS

  • Игровые персонажи с собственным тембром и характером, включая голоса, которых нет в готовых библиотеках.
  • Аудиокниги с несколькими героями: у каждого свой голос и своя манера.
  • Подкасты и интерактивные медиа с богатой актёрской подачей и невербальными реакциями.
  • Сцены, где нужна построчная режиссура: смена настроения внутри одного диалога, диалектные сдвиги, разные темпы.

Сценарии для Flash-Lite TTS

  • Массовый дубляж: одинаковые требования к голосу на большом объёме материала.
  • Поток аудиоконтента: новостные сводки, короткие ролики, обучающие модули.
  • Голосовые агенты с тонким контролем тона и темпа, где важна не уникальность голоса, а предсказуемость и стоимость.

Где и как получить доступ к Gemini 3.8 Flash TTS

Анонс перечисляет пять поверхностей: Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook и Google Vids. Разбивки по моделям в тексте нет: указано, что новые модели улучшают пользовательский опыт в Gemini Notebook и Google Vids.

Google AI Studio и Gemini API для разработчиков

AI Studio даёт песочницу: там удобно подбирать формулировки промпта и слушать результат до того, как вы встроите модель в продукт. Gemini API нужен для интеграции в приложение: генерация озвучки по запросу, пакетная обработка текстов, сборка голосовых агентов. Примеров кода в анонсе нет, поэтому стартовые сниппеты смотрите в документации Gemini API и AI Studio.

Google Vids и Gemini Notebook для пользователей

В описаниях темы Flash-Lite TTS называют доступной в Google Vids для озвучки видео. В анонсе формулировка шире: Gemini Notebook и Google Vids упомянуты как продукты, где новые модели улучшают пользовательский опыт, без разделения по моделям. Для нетехнического пользователя это означает, что начать можно внутри готового продукта, без работы с API.

Gemini Enterprise: корпоративный доступ

В анонсе Gemini Enterprise указан среди платформ, где доступны новые модели. В описаниях темы корпоративный доступ называли ожидаемым «скоро», но опубликованный текст говорит о доступности, а не о планах. Сроки и условия для организаций уточняйте у Google: анонс их не приводит.

Практические сценарии и ограничения

Аудиокниги и подкасты

Основной выигрыш здесь в разделении ролей. Flash TTS позволяет выдать каждому персонажу свой голос, а рассказчику - отдельную подачу: ровный темп для описаний, актёрские указания для диалогов. Авторскую озвучку можно реплицировать, если у вас есть права на голос. Как выбирать движок под такие задачи, мы разбирали в материале про TTS для аудиокниг с поддержкой эмоций и интонаций.

Голосовые агенты и дубляж

Flash-Lite TTS рассчитана на голосовых агентов и большой объём озвучки. Поддержка более 100 языков и диалектов упрощает локализацию: один и тот же сценарий можно прогонять на разных языках, а диалектные сдвиги задавать построчно. Для дубляжа с репликацией голоса актёра нужны права на его голос, и это ограничение не техническое, а юридическое.

Ограничения и что важно учитывать

  • Список региональных вариантов и правил клонирования по странам анонс не раскрывает.
  • Длина генерируемого фрагмента не указана: для длинных текстов планируйте нарезку на реплики и сведение отдельно.
  • Точный набор поддерживаемых невербальных звуков не описан.
  • Водяные знаки есть, но гарантий их сохранности после перекодирования нет.
  • Воспроизводимость голоса при повторных генерациях в анонсе не описана: если делаете сериал или аудиокнигу, проверьте на коротких дублях, что голос звучит одинаково от запуска к запуску.
  • Если облачный доступ не подходит по условиям или бюджету, посмотрите локальные варианты: например, разбор TTS Studio с чанкингом и клонированием голосов.

Библиотека голосов: от 30 до бесконечности

Анонс формулирует масштабирование прямо: от 30 оригинальных голосов к бесконечной библиотеке. Механика в том, что базовый набор служит отправной точкой, а дальше голоса создают с нуля или реплицируют под конкретную задачу. Цифра в 2000+ готовых голосов, которая встречается в описаниях темы, в опубликованном анонсе не упоминается (анонс Google DeepMind). Доступность конкретных голосов по странам тоже не описана.

Практический смысл бесконечной библиотеки простой: поиск подходящего пресета перестаёт быть узким местом. Если нужного голоса нет, его описывают текстом или собирают по образцу, а не подстраивают сценарий под то, что есть в каталоге. Проверить это стоит на своей задаче: возьмите сцену на 5-10 реплик, задайте голос промптом и сравните результат с ближайшим готовым пресетом. Такой тест занимает несколько минут и сразу показывает, окупается ли построчная режиссура на вашем материале.

Подписаться на канал