Index-Translate - семейство открытых моделей перевода от команды BiliBili Index LLM. Текстовая модель поддерживает 150 языков и выходит в вариантах 2B, 9B и 35B-A3B (preview). Код и выпущенные веса опубликованы под лицензией Apache-2.0, рядом с релизом доступны демо, репозиторий на GitHub и страница моделей.
Главная особенность в управляемости. Можно задать терминологию, стиль изложения и формат вывода, а при локализации модель сохраняет JSON и плейсхолдеры, то есть ключи, переменные и разметку. Для отдельных задач предусмотрены специализированные модели: Index-NativeLong для целых документов, Index-Homura для дубляжа с бюджетом слогов, Index-Echo для многоязычных субтитров и перевода речи в речь.
Границы стоит обозначить сразу. Покрытие в 150 языков относится только к текстовым моделям, Index-Echo работает с меньшим набором языковых пар, а старший вариант 35B-A3B помечен как preview. Деталей о качестве перевода в описании релиза нет, только перечень возможностей и демонстрационное видео.
Что такое Index-Translate и почему это интересно
Кто стоит за релизом: команда BiliBili Index LLM
Модели выпустила команда BiliBili Index LLM. Открытый релиз означает, что код и веса лежат под Apache-2.0, а эта лицензия разрешает коммерческое использование и не запрещает дообучение. Отсюда три практических следствия.
Перевод не уходит на чужие серверы, что важно для документов под NDA и внутренних баз знаний. Нет оплаты за токены и лимитов на объём, поэтому пакетную обработку тысяч строк можно планировать без сюрпризов в счёте. И есть возможность дообучить модель на своей терминологии, если базового качества не хватит.
Полное описание релиза с перечнем возможностей и демонстрацией собрано в анонсе Index-Translate в r/LocalLLaMA.
Чем Index-Translate отличается от обычного переводчика
Обычный переводчик принимает текст и возвращает текст. Здесь в запрос добавляются правила: словарь терминов, тон изложения, формат ответа. Это меняет не качество отдельной фразы, а предсказуемость всего потока строк.
Разница видна на объёме. Когда в файле локализации тысячи ключей, один сломанный плейсхолдер превращается в сломанный интерфейс или падение приложения. Модель, которая держит структуру файла, экономит часы на вычитке диффов и не требует промежуточного парсера.
Варианты моделей: 2B, 9B и 35B-A3B (preview)
Требований к VRAM и замеров скорости в описании релиза нет, поэтому ориентируйтесь на порядок величин, а конкретику смотрите в репозитории и на странице моделей.
- 2B - самый лёгкий вариант. Разумная точка старта для скромного железа, пакетной обработки коротких строк и сценариев, где важна скорость.
- 9B - средний вариант. Типичный компромисс между качеством и ресурсами, чаще всего его берут для повседневного перевода и интеграций.
- 35B-A3B (preview) - старший вариант со статусом preview. Для сложных сценариев и экспериментов, требует заметно больше железа.
Как выбрать между 2B, 9B и 35B-A3B
Начинайте с 9B, если есть GPU с запасом памяти: это рабочий размер для большинства задач перевода. Берите 2B, когда ресурсы ограничены или нужно обрабатывать большие объёмы дёшево. Переходите на 35B-A3B, если качества 9B не хватает на сложных языковых парах и вы готовы мириться с preview-статусом.
Статус preview значит, что вариант ещё могут менять: веса, поведение, детали архитектуры. Для продакшена это риск, поэтому держите запасной вариант и не переводите на preview весь поток сразу.
И ещё одно уточнение: 150 языков - это про текст. Речь и видео работают по другим правилам, об этом ниже.
Управление переводом: терминология, стиль и формат вывода
Контроль делится на три уровня. Терминология задаёт словарь, стиль изложения задаёт тон, формат вывода отвечает за структуру файла.
Сохранение JSON и плейсхолдеров при локализации
Локализация ломается на мелочах. Ключ user_name должен остаться ключом, а {count} внутри строки - переменной, а не переведённым словом. Index-Translate сохраняет JSON и плейсхолдеры при переводе, и это главный аргумент для команд, которые гоняют строки интерфейса через модель.
Проверять всё равно придётся. Прогоните на своих файлах десяток строк с нестандартными плейсхолдерами ({{name}}, %s, $1) и посмотрите, что вернётся. Пайплайны перевода вообще склонны к сюрпризам: модели иногда уходят в посторонние задачи вместо перевода, механика такого сбоя и рабочие способы защиты разобраны в материале почему нейросети для перевода начинают решать задачи вместо перевода.
Единообразие терминов и стиль изложения
Второй уровень - правила языка. Названия продуктов можно зафиксировать, чтобы один и тот же термин не переводился пятью способами на соседних экранах. Тон тоже задаётся явно: для продукта, который общается с пользователем по-дружески, подойдёт неформальный стиль изложения.
Для крупных проектов это снимает самый дорогой этап - ручную унификацию. Глоссарий и правило тона закрывают первый проход, а человек подключается уже к готовому тексту.
Специализированные модели: NativeLong, Homura и Echo
Три модели закрывают то, что плохо ложится на обычный текстовый перевод: длинные документы, дубляж и видео.
Index-NativeLong: перевод целых документов с учётом контекста
Index-NativeLong переводит целые документы и использует их контекст, чтобы держать единообразие имён и терминологии между фрагментами. Это лечит классическую проблему чанкового перевода: когда документ режут на куски, термин в первой главе и в седьмой переводится по-разному.
Сценарии очевидные: техническая документация, книги, длинные инструкции, юридические тексты. Ограничений по длине документа в описании релиза нет, поэтому реальный потолок придётся искать самому на своих файлах. Как такой процесс выглядит на книгах, со словарями терминов, JSON-выводом и ручной вычиткой, разобрано в материале про локальный пайплайн перевода книг через LLM.
Index-Homura: бюджет слогов для дубляжа
Index-Homura решает задачу тайминга. Модель позволяет задать бюджет слогов для переведённых строк, и перевод подгоняется под длину реплики в сценарии дубляжа. Для языков с разной плотностью слогов это критично: фраза на одном языке и её перевод на другой редко совпадают по длине.
Гарантий идеального попадания в артикуляцию здесь нет. Бюджет слогов ограничивает длину строки, а финальную подгонку под видео всё равно делают на монтаже.
Index-Echo: субтитры и перевод речи в речь с сохранением голоса
Index-Echo работает с видео: генерирует многоязычные субтитры и переводит речь в речь, используя голос исходного диктора как референс. На выходе получается озвучка, тембр которой ориентирован на оригинального говорящего.
Ограничение тут же: Echo поддерживает меньший набор языковых пар, чем текстовые модели. 150 языков к нему не относятся. В демонстрационном видео показан дубляж с английского на японский, а затем английский клип с субтитрами на шести языках, детали подтверждены в описании релиза Index-Translate. Качество синтеза по этому описанию не оценить: данных о том, как звучит результат, в релизе нет.
Ограничения и на что смотреть перед внедрением
150 языков - только для текста
Цифра 150 в заголовке релиза относится к текстовым моделям. Субтитры, дубляж и перевод речи живут по другим правилам, и набор языковых пар там уже. Если задача - мультиязычное видео, планируйте по покрытию Echo, а не по общему числу языков.
Preview-статус 35B-A3B и возможные ошибки в языковых парах
Два момента требуют осторожности. Старший вариант 35B-A3B идёт со статусом preview: поведение и веса могут измениться. И команда отдельно просит присылать примеры, где модель ошибается с языковой парой. Такая просьба - прямой сигнал, что ошибки в отдельных парах возможны и о них знают.
Что делать практически: собрать свой набор тестов на 30-50 строк для каждой нужной языковой пары, прогнать через доступные размеры и посмотреть, где ломается. Методика такой оценки без лишнего шума вокруг релизов разобрана в чек-листе как оценивать новые AI-модели до смены рабочего стека.
Сведения о демонстрации тоже ограничены. По описанию видео можно судить о том, что сценарии дубляжа и субтитров работают, а не о качестве перевода.
Как попробовать и запустить: демо, GitHub и страница моделей
Что доступно уже сейчас
Три точки входа: демо для быстрой проверки на своих фразах, репозиторий на GitHub с кодом и весами, страница моделей для выбора размера. Ссылки собраны в анонсе релиза. Лицензия Apache-2.0 распространяется на код и выпущенные веса.
Что учесть при локальном запуске
Требований к VRAM и форматов весов в описании нет, поэтому цифры смотрите в репозитории. Общее правило работает и здесь: 2B и 9B реалистичны для домашней машины, 35B-A3B тяжелее и вдобавок в статусе preview.
Проверьте, поддерживает ли ваша обвязка нужный формат весов. Если планируете не локальный запуск, а API, уточняйте доступность и условия отдельно: открытые веса не означают, что кто-то уже поднял хостинг.
Кому подходит Index-Translate и что с альтернативами
Практические сценарии использования
- Локализация интерфейсов и сайтов - базовый вариант Index-Translate: сохранение JSON и плейсхолдеров, глоссарий, единый тон.
- Документация и книги - Index-NativeLong: контекст всего документа держит терминологию.
- Дубляж - Index-Homura: бюджет слогов под тайминг реплик.
- Субтитры и озвучка видео - Index-Echo: многоязычные субтитры и перевод речи с голосом исходного диктора как референсом.
Когда Index-Translate не нужен
Для перевода пары абзацев быстрее открыть привычный сервис. Если нужен дубляж на редкую языковую пару, сначала проверьте, поддерживает ли её Echo. Если требуется стабильный продакшен без сюрпризов, preview-вариант 35B-A3B лучше не ставить в основную ветку.
Расклад по альтернативам такой: облачные переводчики выигрывают в удобстве и не требуют железа, открытые модели - в контроле и приватности. Крупные игроки тоже двигают языковое покрытие: Google заявляет о 300+ языках в своих продуктах и офлайн-моделях TranslateGemma, подробности в разборе Google расширяет языковые возможности AI: 300+ языков и офлайн-перевод. Сравнивать Index-Translate с ними по бенчмаркам пока не на чем: замеров в релизе нет.