Google 23 сентября 2026 года представила две модели синтеза речи в семействе Gemini Audio: Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Первая создаёт голоса с нуля по текстовому описанию и позволяет режиссировать каждую реплику, вторая рассчитана на массовую озвучку с меньшими затратами. Обе модели компания называет самыми выразительными из своих генераторов аудио на текущий момент (анонс Google DeepMind).
Разница между ними укладывается в одну фразу: Flash TTS нужна там, где голос придумывают под персонажа и сцену, Flash-Lite TTS - там, где важен объём. Обе работают по промптам на естественном языке, умеют создавать новые голоса и реплицировать существующие, а Flash TTS настраивает роль, акцент и характеристики голоса более чем на 100 языках и диалектах.
Дальше разберём, что нового в этих моделях, как собирать промпт под нужный голос, как управлять отдельными репликами и где проходят границы: что подтверждено в анонсе, а что пока остаётся деталью из пересказов.
Что такое Gemini 3.8 Flash TTS и Flash-Lite TTS
Обе модели дополняют семейство Gemini Audio, куда уже входят 3.5 Live Translate, 3.5 Transcribe, 3.8 Live и 3.8 Live Extended Thinking. Модели линейки Live отвечают за разговор в реальном времени, и у нас есть отдельный разбор Gemini 3.8 Live и Live Extended Thinking с их характеристиками и доступом. Новые TTS-модели закрывают другую задачу: превращают текст и описание голоса в готовую озвучку.
Позиционирование в анонсе выглядит так. Flash TTS - инструмент творческой режиссуры и дизайна персонажей: новые голоса с нуля, построчное управление игрой. Flash-Lite TTS - инструмент масштаба: массовый дубляж, поток аудиоконтента и выразительные голосовые агенты с тонкой настройкой тона, темпа и нюансов.
Ключевые отличия от предыдущих моделей Gemini Audio
Предыдущие модели семейства работали с аудио как с потоком в диалоге: распознавали речь, переводили её, поддерживали разговор. Новые модели относятся к речи как к контенту: на входе текст и описание голоса, на выходе файл озвучки, который можно перемонтировать, переозвучить и разложить по персонажам.
Сравнимых цифр по качеству, задержке и стоимости между старыми и новыми моделями в анонсе нет. Утверждать, что новая линейка обходит 3.8 Live по естественности речи, не на чем: единственная оценка в тексте - что это самые выразительные модели генерации аудио от Google на момент выпуска (первоисточник).
| Параметр | Gemini 3.8 Flash TTS | Gemini 3.8 Flash-Lite TTS |
|---|---|---|
| Назначение | Творческая режиссура и дизайн персонажей | Большие объёмы при меньшей стоимости |
| Создание голоса | Новые голоса с нуля по текстовому промпту | Озвучка и голосовые агенты с контролем тона, темпа и выразительных нюансов |
| Управление репликой | Актёрские указания, темп, диалектные сдвиги, backchanneling | Тон, темп, выразительные нюансы |
| Типичные задачи | Игры, аудиокниги, подкасты, интерактивные медиа | Массовый дубляж, поток аудиоконтента, голосовые агенты |
| Платформы | Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook, Google Vids | Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook, Google Vids |
Генерация голоса с нуля по текстовому промпту
Flash TTS собирает голос по описанию, а не подставляет готовый пресет. В промпте задают роль, акцент и характеристики голоса, а модель подбирает тембр, манеру и подачу. Самый наглядный пример из анонса - генерация голоса диджея с высокой энергией из текстового описания.
Практическая схема промпта состоит из четырёх блоков: кто говорит (роль и характер), как говорит (темп, энергия, тембр), с каким акцентом и на каком языке, в какой ситуации (сцена, жанр, адресат). Чем конкретнее описание, тем меньше свободы остаётся модели.
Как формулировать промпт для генерации голоса
Примеры формулировок для разных задач:
Роль: циничный детектив, 50 лет. Низкий голос с хрипотцой, говорит не спеша, с паузами, будто взвешивает каждое слово. В интонации лёгкая ирония.
Роль: ведущая молодёжного подкаста. Энергичная подача, быстрый темп, улыбка в голосе.
Роль: виртуальный ассистент службы поддержки. Ровный нейтральный тон, чёткая дикция, без резких перепадов громкости.
Это примеры структуры, а не подтверждённый синтаксис: точных шаблонов промптов анонс не приводит. Комбинировать параметры можно и нужно: акцент с темпом, характер с эмоциональным фоном, роль с ситуацией. Одна и та же ремарка в разных сценариях даст разный результат, поэтому финальный голос удобнее отбирать на коротких фрагментах.
Поддержка языков и диалектов
Анонс заявляет более 100 языков и диалектов, а диалектные сдвиги управляются на уровне отдельной реплики: персонаж может перейти на другой вариант произношения внутри сцены. Google параллельно расширяет языковое покрытие своих продуктов, и общий контекст этих работ мы разбирали в материале про 300+ языков и TranslateGemma.
Конкретного списка региональных вариантов в анонсе нет. Мексиканский испанский или квебекский французский в описаниях темы упоминаются как примеры, но подтверждения в опубликованном тексте они не получили, а заявлять поддержку всех существующих диалектов оснований нет.
Пошаговая режиссура реплик: темп, эмоции, невербальные звуки
Flash TTS позволяет управлять каждой строкой отдельно: актёрские указания, темп, диалектные сдвиги, невербальные звуки. Для практики это значит, что один текст можно развести по разным состояниям персонажа в пределах одной сцены, не перегенерируя её целиком.
Пример сценария с разными ремарками на каждую строку:
Строка 1: «Я всё знал с самого начала». Подача: спокойно, ровно, без нажима.
Строка 2: «Ты правда думал, что я поверю?» Подача: с сарказмом, чуть быстрее.
Строка 3: «Ладно. Рассказывай». Подача: тихо, устало, с паузой перед последним словом.
Управление темпом и паузами
Темп задаётся описанием: «говорит медленно и вдумчиво», «частит от волнения», «чеканит слова». Паузы ставятся через описание состояния и разбиение текста на строки. Точной конструкции вида «пауза 2 секунды» в анонсе нет, поэтому рассчитывать на управление длительностью с точностью до десятых долей секунды не стоит. Если пауза критична для монтажа, надёжнее нарезать реплики отдельно и расставить тишину на этапе сведения.
Эмоции и актёрские указания
Актёрские указания работают как ремарки в сценарии: «шёпотом», «с сарказмом», «сдерживаемая ярость». Их можно совмещать с темпом и громкостью: «говорит тихо и раздельно, будто через силу». В диалоге это даёт контраст между репликами, который и создаёт ощущение живой сцены, а не чтения вслух.
Невербальные звуки и backchanneling
Backchanneling - короткие звуки реакции: «ага», «угу», «ммм». В анонсе они перечислены прямо, рядом со смехом и другими невербальными элементами. Пара таких вставок меняет восприятие диалога: слушатель слышит ответную реакцию, а не два чередующихся монолога. Ограничение в том, что анонс не описывает полный список поддерживаемых звуков, поэтому конкретный набор придётся проверять на месте.
Репликация голоса по 30-секундному образцу: как это работает и что с безопасностью
Анонс подтверждает: существующие голоса можно реплицировать простыми промптами на естественном языке. Требования к образцу в тексте не раскрыты. Цифра в 30 секунд встречается в описаниях темы, но подтверждения в анонсе не получила, как и детали процедуры: сколько дублей нужно, как обрабатывается шум, что происходит при несовпадении языка образца и текста.
Как получить согласие на использование голоса
Требование проверять согласие владельца голоса в анонсе отдельно не сформулировано: там говорится о встроенных инструментах безопасности, включая водяные знаки. Это не снимает юридическую часть. Права на голос живого человека регулируются законодательством и договором, поэтому письменное разрешение носителя голоса и фиксация объёма использования остаются вашей задачей, а не функцией модели.
Водяные знаки SynthID и C2PA-метаданные
В анонсе сказано, что сгенерированное аудио защищено встроенными инструментами безопасности, включая водяные знаки. Названия SynthID и метаданных C2PA в этом тексте не упоминаются, подтверждения по ним нет. Практический вывод: пометка ставится на этапе генерации, но рассчитывать на то, что её невозможно убрать, не стоит. Перекодирование, нарезка и повторное сведение аудио способны испортить или уничтожить след, поэтому проверка происхождения файла редко бывает единственным аргументом.
Региональные ограничения на репликацию голоса
Анонс не делит доступ по странам и не описывает отдельные правила клонирования для разных регионов. Если вы запускаете проект в конкретной стране, проверяйте условия использования Gemini API и местное законодательство о синтетическом голосе: этот пункт лежит вне технической документации модели.
Flash TTS или Flash-Lite TTS: что выбрать для вашей задачи
Выбор сводится к одной развилке: нужен уникальный голос и построчная режиссура или нужен объём. Цен в анонсе нет, поэтому стоимость считайте по фактическим тарифам API, а не по обещаниям.
Сценарии для Flash TTS
- Игровые персонажи с собственным тембром и характером, включая голоса, которых нет в готовых библиотеках.
- Аудиокниги с несколькими героями: у каждого свой голос и своя манера.
- Подкасты и интерактивные медиа с богатой актёрской подачей и невербальными реакциями.
- Сцены, где нужна построчная режиссура: смена настроения внутри одного диалога, диалектные сдвиги, разные темпы.
Сценарии для Flash-Lite TTS
- Массовый дубляж: одинаковые требования к голосу на большом объёме материала.
- Поток аудиоконтента: новостные сводки, короткие ролики, обучающие модули.
- Голосовые агенты с тонким контролем тона и темпа, где важна не уникальность голоса, а предсказуемость и стоимость.
Где и как получить доступ к Gemini 3.8 Flash TTS
Анонс перечисляет пять поверхностей: Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook и Google Vids. Разбивки по моделям в тексте нет: указано, что новые модели улучшают пользовательский опыт в Gemini Notebook и Google Vids.
Google AI Studio и Gemini API для разработчиков
AI Studio даёт песочницу: там удобно подбирать формулировки промпта и слушать результат до того, как вы встроите модель в продукт. Gemini API нужен для интеграции в приложение: генерация озвучки по запросу, пакетная обработка текстов, сборка голосовых агентов. Примеров кода в анонсе нет, поэтому стартовые сниппеты смотрите в документации Gemini API и AI Studio.
Google Vids и Gemini Notebook для пользователей
В описаниях темы Flash-Lite TTS называют доступной в Google Vids для озвучки видео. В анонсе формулировка шире: Gemini Notebook и Google Vids упомянуты как продукты, где новые модели улучшают пользовательский опыт, без разделения по моделям. Для нетехнического пользователя это означает, что начать можно внутри готового продукта, без работы с API.
Gemini Enterprise: корпоративный доступ
В анонсе Gemini Enterprise указан среди платформ, где доступны новые модели. В описаниях темы корпоративный доступ называли ожидаемым «скоро», но опубликованный текст говорит о доступности, а не о планах. Сроки и условия для организаций уточняйте у Google: анонс их не приводит.
Практические сценарии и ограничения
Аудиокниги и подкасты
Основной выигрыш здесь в разделении ролей. Flash TTS позволяет выдать каждому персонажу свой голос, а рассказчику - отдельную подачу: ровный темп для описаний, актёрские указания для диалогов. Авторскую озвучку можно реплицировать, если у вас есть права на голос. Как выбирать движок под такие задачи, мы разбирали в материале про TTS для аудиокниг с поддержкой эмоций и интонаций.
Голосовые агенты и дубляж
Flash-Lite TTS рассчитана на голосовых агентов и большой объём озвучки. Поддержка более 100 языков и диалектов упрощает локализацию: один и тот же сценарий можно прогонять на разных языках, а диалектные сдвиги задавать построчно. Для дубляжа с репликацией голоса актёра нужны права на его голос, и это ограничение не техническое, а юридическое.
Ограничения и что важно учитывать
- Список региональных вариантов и правил клонирования по странам анонс не раскрывает.
- Длина генерируемого фрагмента не указана: для длинных текстов планируйте нарезку на реплики и сведение отдельно.
- Точный набор поддерживаемых невербальных звуков не описан.
- Водяные знаки есть, но гарантий их сохранности после перекодирования нет.
- Воспроизводимость голоса при повторных генерациях в анонсе не описана: если делаете сериал или аудиокнигу, проверьте на коротких дублях, что голос звучит одинаково от запуска к запуску.
- Если облачный доступ не подходит по условиям или бюджету, посмотрите локальные варианты: например, разбор TTS Studio с чанкингом и клонированием голосов.
Библиотека голосов: от 30 до бесконечности
Анонс формулирует масштабирование прямо: от 30 оригинальных голосов к бесконечной библиотеке. Механика в том, что базовый набор служит отправной точкой, а дальше голоса создают с нуля или реплицируют под конкретную задачу. Цифра в 2000+ готовых голосов, которая встречается в описаниях темы, в опубликованном анонсе не упоминается (анонс Google DeepMind). Доступность конкретных голосов по странам тоже не описана.
Практический смысл бесконечной библиотеки простой: поиск подходящего пресета перестаёт быть узким местом. Если нужного голоса нет, его описывают текстом или собирают по образцу, а не подстраивают сценарий под то, что есть в каталоге. Проверить это стоит на своей задаче: возьмите сцену на 5-10 реплик, задайте голос промптом и сравните результат с ближайшим готовым пресетом. Такой тест занимает несколько минут и сразу показывает, окупается ли построчная режиссура на вашем материале.