Google заявляет о поддержке более 300 языков в своих AI-продуктах, и, по оценке компании, это покрывает около 86% населения планеты. Google Translate прошёл путь с нескольких стартовых языков до 250+. Практический смысл простой: перевод, распознавание речи и голосовой ввод всё чаще доступны на родном языке пользователя, а не только на английском и десятке крупных европейских.
Цифры 300+ и 250+ не взаимозаменяемы. 300+ языков описывают совокупный охват всей линейки продуктов и моделей Google, а 250+ относятся конкретно к Google Translate. Разброс внутри экосистемы большой: голосовая модель Gemini 3.8 Live работает с 97 языками, Gemini 3.5 Live Translate с 70 языками и 2000+ языковыми парами, офлайн-модели TranslateGemma с 55 языками, проект Sign Language-to-Text с 50+ жестовыми языками, а голосовой ассистент AVA на базе Gemini добрался до кнопочных телефонов. Отдельно держится Universal Speech Model, обученный на 12 млн часов аудио, и инициатива 1,000 Languages Initiative, которая поддерживает языки с малым объёмом обучающих данных через cross-lingual transfer learning и партнёрства WAXAL, Project Vaani и Amplify Initiative.
За цифрами стоит смена подхода. Раньше конвейер перевода был текстовым: текст на входе, текст на выходе. Сейчас модели обрабатывают аудио напрямую и учитывают интонацию, эмоции и смешение языков внутри одной фразы.
Что стоит за цифрой 300+ языков у Google
300+ языков описывают всю языковую линейку, а не один сервис. Читать эту цифру как «одна модель знает 300 языков» неверно: перевод, распознавание речи, синтез и распознавание жестов закрывают разные наборы языков разного размера.
Охват 86% населения планеты считается по числу людей, говорящих хотя бы на одном языке из поддерживаемого набора. Оставшиеся 14% приходятся на носителей языков, для которых пока не хватает данных, чаще всего это малые и бесписьменные языки.
Google Translate: от нескольких языков до 250+
Google Translate начинался с нескольких языков и вырос до 250+. Механика роста изменилась: часть языков добавляли за счёт собственных данных и разметки, часть за счёт переноса знаний с крупных языков на малые. Для пользователя это означает больше доступных языковых пар и лучшее качество на редких языках, особенно в направлениях «редкий язык - английский».
Направления «редкий - редкий» остаются слабым местом. Если язык B почти не пересекается с языком C в обучающих данных, перевод идёт через язык-посредник и качество проседает. Проверить конкретную пару до того, как полагаться на неё в работе, полезнее, чем верить в общий счётчик языков.
Почему 300+ языков охватывают несколько продуктов
Языковые возможности Google распределены по продуктам, и у каждого свой набор языков:
| Продукт | Языки | Где работает |
|---|---|---|
| Google Translate | 250+ | облако, текст и речь |
| Gemini 3.5 Live Translate | 70 языков, 2000+ пар | облако, аудио в реальном времени |
| Gemini 3.8 Live | 97 | облако, голос и текст |
| TranslateGemma | 55 | на устройстве, без интернета |
| Sign Language-to-Text | 50+ жестовых языков | распознавание визуального языка |
Такой разброс объясняется компромиссами. Облачные модели выигрывают в охвате языков, локальные в автономности и приватности, а модели для жестов решают отдельную задачу распознавания визуального языка.
Gemini Live Translate и голосовые модели: перевод аудио с интонацией и смешением языков
Переход к работе с аудио меняет то, что вообще считается переводом. Модель слышит паузы, интонацию и эмоции, распознаёт смену языка посреди фразы и не разваливается на этом переходе. Для синхронного перевода в звонке это критично: текстовая модель просто не увидит половину сигнала.
Gemini 3.5 Live Translate: 70 языков и 2000+ языковых пар
Gemini 3.5 Live Translate заявлена с поддержкой 70 языков и 2000+ языковых пар. Языковая пара - это направление перевода: «русский - английский» и «английский - русский» считаются отдельно. Арифметика простая: 70 языков дают максимум 70 x 69 = 4830 направлений, значит 2000+ пар покрывают не все теоретические комбинации, а выбранный набор.
Сценарии, где это применяется: живой разговор двух людей без общего языка, синхронные субтитры для стрима, расшифровка и перевод звонков, разбор встреч с участниками из разных стран.
Gemini 3.8 Live и Extended Thinking: что внутри и кому доступно
Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking - две отдельные голосовые модели, обе построены на Gemini 3 Pro. Путать их с Gemini 3.5 Live Translate не стоит: 3.5 Live Translate отвечает за перевод, 3.8 Live за голосовой диалог и агентные задачи. Разбор Gemini 3.8 Live и Extended Thinking с характеристиками и бенчмарками уже есть на сайте.
Разница между версиями: Gemini 3.8 Live рассчитана на низкую задержку и быстрый диалог, Extended Thinking умеет рассуждать по шагам и вызывать внешние инструменты параллельно с разговором, не обрывая речь. Обе модели поддерживают 97 языков и переключаются между ними прямо во время беседы.
- Вход: аудио, текст, изображения, видео.
- Выход: речь или текст.
- Контекстное окно: 131 072 входных токена.
- Максимальный объём вывода: 65 536 токенов.
- Оценка Artificial Analysis: Extended Thinking получила 82,6 балла и первое место в Speech-to-Speech Quality Index.
С 15 сентября 2026 года обе модели доступны разработчикам через Gemini API и Google AI Studio. Корпоративным заказчикам их предлагают в закрытом предварительном тестировании, то есть свободного доступа для бизнеса пока нет.
SynthID и маркировка аудио: зачем это нужно
Аудио, которое генерируют модели Gemini 3.8 Live, помечается водяным знаком SynthID. Метка нужна, чтобы отличить синтезированную речь от настоящей: это важно для журналистики, юридических записей, идентификации голоса и любых ситуаций, где подделанная запись голоса может причинить вред.
Языки с малым объёмом данных: cross-lingual transfer learning и Universal Speech Model
Сложность редких языков не в архитектуре, а в данных. Для английского легко набрать десятки тысяч часов записи, а для языка с несколькими сотнями тысяч носителей может не найтись и сотни часов размеченного аудио. Отсюда два инструмента Google: перенос знаний между языками и большая многоязычная модель.
Как cross-lingual transfer learning помогает редким языкам
Cross-lingual transfer learning работает так: модель обучают на языках с большим количеством данных, а затем применяют к языку с малым объёмом, рассчитывая, что часть закономерностей перенесётся. Механика похожа на человека, который учил испанский и поэтому быстрее схватывает португальский: структура языка другая, а часть фонетики и лексики узнаваема.
Перенос работает не бесплатно. Чем дальше редкий язык от крупных по грамматике или письменности, тем слабее эффект. Для языков без письменности и с тональной фонетикой результат обычно хуже, чем для близкородственных европейских языков.
Universal Speech Model: 12 млн часов аудио
Universal Speech Model обучен на 12 млн часов аудио. Такой объём позволяет выучить общие акустические закономерности речи, которые затем применяются к языкам с малым объёмом данных. Universal Speech Model - один из инструментов инициативы 1,000 Languages Initiative, цель которой собрать поддержку языков, пока не охваченных обычными сервисами.
WAXAL, Project Vaani и Amplify Initiative: зачем нужны локальные партнёрства
Данные для редких языков не лежат в открытых архивах, их собирают на месте. Этим занимаются локальные партнёрства WAXAL, Project Vaani и Amplify Initiative: местные команды записывают речь носителей, размечают диалекты и передают данные в обучение.
Здесь и упирается вся цепочка. Без таких данных ни cross-lingual transfer learning, ни Universal Speech Model не дадут приемлемого качества: переносить нечего, если язык не представлен в обучающем наборе.
TranslateGemma и AVA: офлайн-перевод и голосовой ассистент без интернета
Облачный перевод удобен, пока есть сеть. Офлайн-сценарии, то есть поездки без роуминга, удалённые регионы и устройства без стабильного подключения, требуют моделей, которые работают локально.
TranslateGemma: 55 языков без интернета
TranslateGemma - семейство лёгких открытых моделей, которые поддерживают 55 языков и работают на устройстве без интернета. Открытая лицензия означает, что модели можно скачать, запустить локально и использовать в своих проектах. Перевод выполняется на самом устройстве, данные не уходят в облако, и это заметный плюс для рабочих документов и переписок.
Ограничения конкретные. 55 языков против 250+ у Google Translate: набор уже, и наличие нужной пары стоит проверять заранее. Качество локальной модели обычно уступает облачной того же поколения, особенно на длинных текстах и редких языках. Требования к ресурсам зависят от размера конкретной модели, и на слабом устройстве придётся идти на компромисс по скорости или точности.
Если задача шире, чем готовый сервис, локальную схему собирают из нескольких моделей. Пример такого подхода - каскадная архитектура Parlor v2 как альтернатива GPT-Live, где распознавание, рассуждение и синтез речи разделены по этапам и работают на локальном железе.
AVA на базе Gemini: голосовой ассистент для кнопочных телефонов
Голосовой ассистент AVA на базе Gemini доступен даже на кнопочных телефонах. Практическая ценность в том, что голосовой интерфейс не требует сенсорного экрана и мощного железа: спросить, перевести фразу или уточнить информацию можно там, где смартфон недоступен или неудобен. Это расширяет аудиторию AI-функций за пределы владельцев флагманских устройств.
Доступность и жестовые языки: Sign Language-to-Text для 50+ языков
Sign Language-to-Text охватывает 50+ жестовых языков. Проект переводит жесты в текст и относится к направлению доступности: жестовые языки полноценны, у них своя грамматика, и для них нужны отдельные данные и модели.
Как Sign Language-to-Text вписывается в языковую экосистему Google
Жестовые языки показывают, что языковые AI-технологии выходят за пределы звучащей речи. Модель здесь работает с видеопотоком, а не с аудио, и учитывает движение рук, мимику и положение корпуса. Связь с остальной экосистемой в общей инфраструктуре: те же подходы к сбору данных, разметке и обучению, что и для редких звучащих языков.
Что это даёт на практике: сценарии, ограничения и как начать
Кому и для чего: разработчикам, пользователям, бизнесу
- Разработчики: Gemini API и Google AI Studio дают доступ к голосовым моделям Gemini 3.8 Live с 15 сентября 2026 года.
- Пользователи: Google Translate для повседневного перевода, TranslateGemma для офлайн-задач, AVA для голосового доступа без смартфона.
- Бизнес: корпоративный доступ к Gemini 3.8 Live идёт через закрытое предварительное тестирование, планировать запуск стоит с запасом по срокам.
Голосовой интерфейс постепенно становится основным способом взаимодействия с AI, и перевод в реальном времени - одна из первых задач, где это заметно. Разбор Voice Mode как предвестника смены парадигмы объясняет, почему ставка делается на голос, а не на очередную колонку.
Ограничения, о которых стоит знать
- 300+ языков - совокупный охват продуктов, а не возможности одной модели.
- Google Translate: 250+ языков, Gemini 3.5 Live Translate: 70 языков, Gemini 3.8 Live: 97 языков, TranslateGemma: 55 языков.
- Офлайн-модели требуют ресурсов устройства и уступают облачным по числу языков.
- Качество на редких языках зависит от объёма и качества собранных данных, а не от архитектуры.
- Корпоративный доступ к Gemini 3.8 Live ограничен закрытым предварительным тестированием.
Чек-лист перед выбором инструмента: определить сценарий (онлайн или офлайн), подобрать продукт под него, проверить поддержку нужного языка и направления перевода, оценить ресурсы устройства для локальной модели и только потом строить на этом рабочий процесс.
Что дальше: 1,000 Languages Initiative и перспективы языковых AI
Три направления развития языковых AI у Google
- Облачные голосовые модели: Gemini 3.5 Live Translate, Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking.
- Офлайн-модели на устройстве: TranslateGemma, голосовой ассистент AVA.
- Доступность и сбор данных: Sign Language-to-Text, WAXAL, Project Vaani, Amplify Initiative, 1,000 Languages Initiative.
Все три направления двигаются к одной цели: расширить языковой охват так, чтобы AI работал на родном языке пользователя и не требовал перехода на английский. Что остаётся нерешённым: охват редких языков по-прежнему упирается в объём собранных данных, офлайн-модели заметно уступают облачным по числу языков, а сроки доступности флагманских моделей у Google сдвигаются. Разбор причин задержки релиза флагманской модели Gemini показывает, что планировать запуск только по анонсам рискованно, полезно держать альтернативы и проверять фактическую доступность.
Практический вывод: следите за обновлениями Gemini API и Google AI Studio, тестируйте TranslateGemma в офлайн-сценариях и проверяйте AVA как вариант голосового доступа на простых устройствах. Языковой охват растёт быстро, и разница между анонсом и работающим инструментом обычно измеряется месяцами.