Перейти к содержанию
Публикация AiManual

Google расширяет языковые возможности AI: 300+ языков, TranslateGemma и офлайн-перевод

Google заявляет о поддержке более 300 языков в своих AI-продуктах, что покрывает 86% населения планеты, а Google Translate вырос до 250+ языков. Разбираем, как

Коротко

Что будет в материале

  1. 01

    Что стоит за цифрой 300+ языков у Google

  2. 02

    Gemini Live Translate и голосовые модели: перевод аудио с интонацией и смешением языков

  3. 03

    Языки с малым объёмом данных: cross-lingual transfer learning и Universal Speech Model

  4. 04

    TranslateGemma и AVA: офлайн-перевод и голосовой ассистент без интернета

Google заявляет о поддержке более 300 языков в своих AI-продуктах, и, по оценке компании, это покрывает около 86% населения планеты. Google Translate прошёл путь с нескольких стартовых языков до 250+. Практический смысл простой: перевод, распознавание речи и голосовой ввод всё чаще доступны на родном языке пользователя, а не только на английском и десятке крупных европейских.

Цифры 300+ и 250+ не взаимозаменяемы. 300+ языков описывают совокупный охват всей линейки продуктов и моделей Google, а 250+ относятся конкретно к Google Translate. Разброс внутри экосистемы большой: голосовая модель Gemini 3.8 Live работает с 97 языками, Gemini 3.5 Live Translate с 70 языками и 2000+ языковыми парами, офлайн-модели TranslateGemma с 55 языками, проект Sign Language-to-Text с 50+ жестовыми языками, а голосовой ассистент AVA на базе Gemini добрался до кнопочных телефонов. Отдельно держится Universal Speech Model, обученный на 12 млн часов аудио, и инициатива 1,000 Languages Initiative, которая поддерживает языки с малым объёмом обучающих данных через cross-lingual transfer learning и партнёрства WAXAL, Project Vaani и Amplify Initiative.

За цифрами стоит смена подхода. Раньше конвейер перевода был текстовым: текст на входе, текст на выходе. Сейчас модели обрабатывают аудио напрямую и учитывают интонацию, эмоции и смешение языков внутри одной фразы.

Что стоит за цифрой 300+ языков у Google

300+ языков описывают всю языковую линейку, а не один сервис. Читать эту цифру как «одна модель знает 300 языков» неверно: перевод, распознавание речи, синтез и распознавание жестов закрывают разные наборы языков разного размера.

Охват 86% населения планеты считается по числу людей, говорящих хотя бы на одном языке из поддерживаемого набора. Оставшиеся 14% приходятся на носителей языков, для которых пока не хватает данных, чаще всего это малые и бесписьменные языки.

Google Translate: от нескольких языков до 250+

Google Translate начинался с нескольких языков и вырос до 250+. Механика роста изменилась: часть языков добавляли за счёт собственных данных и разметки, часть за счёт переноса знаний с крупных языков на малые. Для пользователя это означает больше доступных языковых пар и лучшее качество на редких языках, особенно в направлениях «редкий язык - английский».

Направления «редкий - редкий» остаются слабым местом. Если язык B почти не пересекается с языком C в обучающих данных, перевод идёт через язык-посредник и качество проседает. Проверить конкретную пару до того, как полагаться на неё в работе, полезнее, чем верить в общий счётчик языков.

Почему 300+ языков охватывают несколько продуктов

Языковые возможности Google распределены по продуктам, и у каждого свой набор языков:

ПродуктЯзыкиГде работает
Google Translate250+облако, текст и речь
Gemini 3.5 Live Translate70 языков, 2000+ пароблако, аудио в реальном времени
Gemini 3.8 Live97облако, голос и текст
TranslateGemma55на устройстве, без интернета
Sign Language-to-Text50+ жестовых языковраспознавание визуального языка

Такой разброс объясняется компромиссами. Облачные модели выигрывают в охвате языков, локальные в автономности и приватности, а модели для жестов решают отдельную задачу распознавания визуального языка.

Gemini Live Translate и голосовые модели: перевод аудио с интонацией и смешением языков

Переход к работе с аудио меняет то, что вообще считается переводом. Модель слышит паузы, интонацию и эмоции, распознаёт смену языка посреди фразы и не разваливается на этом переходе. Для синхронного перевода в звонке это критично: текстовая модель просто не увидит половину сигнала.

Gemini 3.5 Live Translate: 70 языков и 2000+ языковых пар

Gemini 3.5 Live Translate заявлена с поддержкой 70 языков и 2000+ языковых пар. Языковая пара - это направление перевода: «русский - английский» и «английский - русский» считаются отдельно. Арифметика простая: 70 языков дают максимум 70 x 69 = 4830 направлений, значит 2000+ пар покрывают не все теоретические комбинации, а выбранный набор.

Сценарии, где это применяется: живой разговор двух людей без общего языка, синхронные субтитры для стрима, расшифровка и перевод звонков, разбор встреч с участниками из разных стран.

Gemini 3.8 Live и Extended Thinking: что внутри и кому доступно

Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking - две отдельные голосовые модели, обе построены на Gemini 3 Pro. Путать их с Gemini 3.5 Live Translate не стоит: 3.5 Live Translate отвечает за перевод, 3.8 Live за голосовой диалог и агентные задачи. Разбор Gemini 3.8 Live и Extended Thinking с характеристиками и бенчмарками уже есть на сайте.

Разница между версиями: Gemini 3.8 Live рассчитана на низкую задержку и быстрый диалог, Extended Thinking умеет рассуждать по шагам и вызывать внешние инструменты параллельно с разговором, не обрывая речь. Обе модели поддерживают 97 языков и переключаются между ними прямо во время беседы.

  • Вход: аудио, текст, изображения, видео.
  • Выход: речь или текст.
  • Контекстное окно: 131 072 входных токена.
  • Максимальный объём вывода: 65 536 токенов.
  • Оценка Artificial Analysis: Extended Thinking получила 82,6 балла и первое место в Speech-to-Speech Quality Index.

С 15 сентября 2026 года обе модели доступны разработчикам через Gemini API и Google AI Studio. Корпоративным заказчикам их предлагают в закрытом предварительном тестировании, то есть свободного доступа для бизнеса пока нет.

SynthID и маркировка аудио: зачем это нужно

Аудио, которое генерируют модели Gemini 3.8 Live, помечается водяным знаком SynthID. Метка нужна, чтобы отличить синтезированную речь от настоящей: это важно для журналистики, юридических записей, идентификации голоса и любых ситуаций, где подделанная запись голоса может причинить вред.

Языки с малым объёмом данных: cross-lingual transfer learning и Universal Speech Model

Сложность редких языков не в архитектуре, а в данных. Для английского легко набрать десятки тысяч часов записи, а для языка с несколькими сотнями тысяч носителей может не найтись и сотни часов размеченного аудио. Отсюда два инструмента Google: перенос знаний между языками и большая многоязычная модель.

Как cross-lingual transfer learning помогает редким языкам

Cross-lingual transfer learning работает так: модель обучают на языках с большим количеством данных, а затем применяют к языку с малым объёмом, рассчитывая, что часть закономерностей перенесётся. Механика похожа на человека, который учил испанский и поэтому быстрее схватывает португальский: структура языка другая, а часть фонетики и лексики узнаваема.

Перенос работает не бесплатно. Чем дальше редкий язык от крупных по грамматике или письменности, тем слабее эффект. Для языков без письменности и с тональной фонетикой результат обычно хуже, чем для близкородственных европейских языков.

Universal Speech Model: 12 млн часов аудио

Universal Speech Model обучен на 12 млн часов аудио. Такой объём позволяет выучить общие акустические закономерности речи, которые затем применяются к языкам с малым объёмом данных. Universal Speech Model - один из инструментов инициативы 1,000 Languages Initiative, цель которой собрать поддержку языков, пока не охваченных обычными сервисами.

WAXAL, Project Vaani и Amplify Initiative: зачем нужны локальные партнёрства

Данные для редких языков не лежат в открытых архивах, их собирают на месте. Этим занимаются локальные партнёрства WAXAL, Project Vaani и Amplify Initiative: местные команды записывают речь носителей, размечают диалекты и передают данные в обучение.

Здесь и упирается вся цепочка. Без таких данных ни cross-lingual transfer learning, ни Universal Speech Model не дадут приемлемого качества: переносить нечего, если язык не представлен в обучающем наборе.

TranslateGemma и AVA: офлайн-перевод и голосовой ассистент без интернета

Облачный перевод удобен, пока есть сеть. Офлайн-сценарии, то есть поездки без роуминга, удалённые регионы и устройства без стабильного подключения, требуют моделей, которые работают локально.

TranslateGemma: 55 языков без интернета

TranslateGemma - семейство лёгких открытых моделей, которые поддерживают 55 языков и работают на устройстве без интернета. Открытая лицензия означает, что модели можно скачать, запустить локально и использовать в своих проектах. Перевод выполняется на самом устройстве, данные не уходят в облако, и это заметный плюс для рабочих документов и переписок.

Ограничения конкретные. 55 языков против 250+ у Google Translate: набор уже, и наличие нужной пары стоит проверять заранее. Качество локальной модели обычно уступает облачной того же поколения, особенно на длинных текстах и редких языках. Требования к ресурсам зависят от размера конкретной модели, и на слабом устройстве придётся идти на компромисс по скорости или точности.

Если задача шире, чем готовый сервис, локальную схему собирают из нескольких моделей. Пример такого подхода - каскадная архитектура Parlor v2 как альтернатива GPT-Live, где распознавание, рассуждение и синтез речи разделены по этапам и работают на локальном железе.

AVA на базе Gemini: голосовой ассистент для кнопочных телефонов

Голосовой ассистент AVA на базе Gemini доступен даже на кнопочных телефонах. Практическая ценность в том, что голосовой интерфейс не требует сенсорного экрана и мощного железа: спросить, перевести фразу или уточнить информацию можно там, где смартфон недоступен или неудобен. Это расширяет аудиторию AI-функций за пределы владельцев флагманских устройств.

Доступность и жестовые языки: Sign Language-to-Text для 50+ языков

Sign Language-to-Text охватывает 50+ жестовых языков. Проект переводит жесты в текст и относится к направлению доступности: жестовые языки полноценны, у них своя грамматика, и для них нужны отдельные данные и модели.

Как Sign Language-to-Text вписывается в языковую экосистему Google

Жестовые языки показывают, что языковые AI-технологии выходят за пределы звучащей речи. Модель здесь работает с видеопотоком, а не с аудио, и учитывает движение рук, мимику и положение корпуса. Связь с остальной экосистемой в общей инфраструктуре: те же подходы к сбору данных, разметке и обучению, что и для редких звучащих языков.

Что это даёт на практике: сценарии, ограничения и как начать

Кому и для чего: разработчикам, пользователям, бизнесу

  • Разработчики: Gemini API и Google AI Studio дают доступ к голосовым моделям Gemini 3.8 Live с 15 сентября 2026 года.
  • Пользователи: Google Translate для повседневного перевода, TranslateGemma для офлайн-задач, AVA для голосового доступа без смартфона.
  • Бизнес: корпоративный доступ к Gemini 3.8 Live идёт через закрытое предварительное тестирование, планировать запуск стоит с запасом по срокам.

Голосовой интерфейс постепенно становится основным способом взаимодействия с AI, и перевод в реальном времени - одна из первых задач, где это заметно. Разбор Voice Mode как предвестника смены парадигмы объясняет, почему ставка делается на голос, а не на очередную колонку.

Ограничения, о которых стоит знать

  • 300+ языков - совокупный охват продуктов, а не возможности одной модели.
  • Google Translate: 250+ языков, Gemini 3.5 Live Translate: 70 языков, Gemini 3.8 Live: 97 языков, TranslateGemma: 55 языков.
  • Офлайн-модели требуют ресурсов устройства и уступают облачным по числу языков.
  • Качество на редких языках зависит от объёма и качества собранных данных, а не от архитектуры.
  • Корпоративный доступ к Gemini 3.8 Live ограничен закрытым предварительным тестированием.

Чек-лист перед выбором инструмента: определить сценарий (онлайн или офлайн), подобрать продукт под него, проверить поддержку нужного языка и направления перевода, оценить ресурсы устройства для локальной модели и только потом строить на этом рабочий процесс.

Что дальше: 1,000 Languages Initiative и перспективы языковых AI

Три направления развития языковых AI у Google

  1. Облачные голосовые модели: Gemini 3.5 Live Translate, Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking.
  2. Офлайн-модели на устройстве: TranslateGemma, голосовой ассистент AVA.
  3. Доступность и сбор данных: Sign Language-to-Text, WAXAL, Project Vaani, Amplify Initiative, 1,000 Languages Initiative.

Все три направления двигаются к одной цели: расширить языковой охват так, чтобы AI работал на родном языке пользователя и не требовал перехода на английский. Что остаётся нерешённым: охват редких языков по-прежнему упирается в объём собранных данных, офлайн-модели заметно уступают облачным по числу языков, а сроки доступности флагманских моделей у Google сдвигаются. Разбор причин задержки релиза флагманской модели Gemini показывает, что планировать запуск только по анонсам рискованно, полезно держать альтернативы и проверять фактическую доступность.

Практический вывод: следите за обновлениями Gemini API и Google AI Studio, тестируйте TranslateGemma в офлайн-сценариях и проверяйте AVA как вариант голосового доступа на простых устройствах. Языковой охват растёт быстро, и разница между анонсом и работающим инструментом обычно измеряется месяцами.

Подписаться на канал