Введение: зачем нужна аудио-native LLM
Типичный пайплайн обработки голоса выглядит как цепочка: автоматическое распознавание речи (ASR) превращает аудио в текст, а затем текстовая LLM этот текст анализирует. Схема работает, но вносит фундаментальные ограничения. Транскрибация отсекает просодику, темп, интонации и фоновые звуки — информацию, которая часто критична для понимания контекста. Ошибка на этапе ASR становится неустранимой: если система неверно распознала слово, текстовая модель уже не сможет его исправить. Добавьте задержку на распознавание, и вы получите каскадную архитектуру, которая проигрывает по скорости и точности.
Ключевые выводы:
- GigaChat Audio 10B от ai-sage обрабатывает аудио напрямую, без промежуточной транскрипции.
- Архитектура объединяет Conformer-энкодер, модальный адаптер и Mixture-of-Experts декодер на базе GigaChat 3.1 Lightning.
- Флагманская возможность — временная локализация событий с таймстемпами, обученная на датасете TimeGround-1M.
- Модель сохраняет полную функциональность текстовой LLM и поддерживает сценарии «речь-в-речь».
GigaChat Audio 10B решает проблему радикально: аудио подается напрямую в LLM. Модель использует Conformer-энкодер для извлечения признаков из речи и модальный адаптер для проекции этих признаков в пространство текстовых эмбеддингов. Декодер на базе GigaChat 3.1 Lightning с архитектурой Mixture-of-Experts обрабатывает аудио-эмбеддинги как ещё один вид токенов, сохраняя полное текстовое качество базовой модели. Ключевая особенность — временная локализация событий: модель находит, описывает и привязывает к таймстемпам конкретные моменты в длинных аудиозаписях. Эта способность обучена на специализированном датасете TimeGround-1M.
Статья детально разбирает архитектуру GigaChat Audio 10B, механизм временной локализации, поддерживаемые задачи и практические ограничения. Материал ориентирован на ML-инженеров, архитекторов решений и разработчиков, которые оценивают применимость аудио-native моделей в своих системах.
Архитектура GigaChat Audio 10B: от аудио к ответу без транскрипции
GigaChat Audio 10B состоит из трёх ключевых компонентов: Conformer-энкодер извлекает признаки из сырого аудио, модальный адаптер проецирует их в размерность текстовых эмбеддингов, а Mixture-of-Experts декодер обрабатывает смешанную последовательность аудио- и текстовых токенов. Такая архитектура позволяет модели понимать речь напрямую, не теряя информацию при преобразовании в текст.
Conformer-энкодер: извлечение признаков из речи
Conformer объединяет свёрточные слои и механизм self-attention в одном блоке. Свёртки эффективно моделируют локальные паттерны в спектрограмме — форманты, переходы между фонемами, кратковременные звуковые события. Self-attention захватывает глобальные зависимости: ритм фразы, интонационный контур, долгосрочные связи между сегментами речи. Комбинация даёт более богатое представление аудио, чем каждый механизм по отдельности.
На вход Conformer получает последовательность спектральных признаков (например, log-mel filterbanks), извлечённых из аудиофрагментов длительностью 25 мс с шагом 10 мс. На выходе — последовательность эмбеддингов той же длины, где каждый вектор кодирует информацию о соответствующем временном окне. Эти эмбеддинги содержат и акустические, и лингвистические признаки, но находятся в собственном пространстве представлений, не совместимом с текстовыми токенами LLM.
Модальный адаптер: мост между аудио и текстом
Проблема несовместимости пространств решается модальным адаптером — обучаемым проекционным слоем, который отображает выход Conformer в ту же размерность, которую используют текстовые эмбеддинги декодера. Технически это может быть линейный слой или небольшая MLP. Адаптер обучается совместно с энкодером при замороженном декодере или в режиме дообучения с низким learning rate.
После проекции аудио-эмбеддинги выглядят для декодера как последовательность «токенов» — точно так же, как текстовые токены после эмбеддинг-слоя. Это ключевой архитектурный приём: декодеру не нужно знать, что часть входных данных пришла из аудио. Он применяет один и тот же механизм внимания ко всей последовательности, независимо от модальности источника.
Mixture-of-Experts декодер: обработка аудио и текста
Декодер GigaChat Audio 10B — это текстовая LLM GigaChat 3.1 Lightning с архитектурой Mixture-of-Experts (MoE). В MoE каждый токен обрабатывается не всеми параметрами модели, а только подмножеством экспертов, выбранных маршрутизатором. Для 10-миллиардной модели это означает, что на инференсе активируется лишь часть весов, что снижает вычислительные затраты без потери качества.
Аудио-эмбеддинги подаются как префикс перед текстовой инструкцией. Декодер обрабатывает их через те же MoE-слои, что и текст. Маршрутизатор обучается направлять аудио-токены к экспертам, которые специализируются на соответствующих паттернах. Поскольку базовая модель GigaChat 3.1 Lightning обучена на большом корпусе текстов, она сохраняет сильные языковые способности, одновременно приобретая понимание речи через аудио-префикс.
Сравнение с каскадными системами показывает три преимущества прямого ввода аудио:
- Нет потерь при транскрибации: модель слышит оригинальный сигнал.
- Ниже задержка: исключён этап ASR.
- Учёт невербальных аспектов: эмоциональная окраска, неуверенность, сарказм — всё, что теряется при преобразовании в текст.
Временная локализация событий: как модель находит события с таймстемпами
Стандартная аудио-LLM отвечает на вопрос «что произошло?». GigaChat Audio 10B добавляет измерение времени и отвечает «что произошло и когда именно». Временная локализация — это способность модели определять границы события в аудиопотоке: начало, конец, а для повторяющихся событий — все интервалы. Модель выводит таймстемпы в формате [MM:SS] или [HH:MM:SS] непосредственно в тексте ответа.
Реализована эта способность через обучение на данных, где ответы содержат временные метки. Декодер учится генерировать таймстемпы как часть текстового вывода — аналогично тому, как текстовая LLM генерирует числа или код. Никаких дополнительных архитектурных компонентов для этого не требуется: модель предсказывает временные метки теми же механизмами, что и обычные токены.
Датасет TimeGround-1M: основа для обучения временной локализации
TimeGround-1M — специализированный датасет, созданный для обучения временной локализации в аудио. Он содержит миллион примеров длинных аудиозаписей с временными аннотациями событий. Каждый пример включает аудиофайл, текстовое описание события и точные таймстемпы начала и окончания. Разнообразие сценариев покрывает бытовые звуки (звонок телефона, лай собаки), речевые события (смена говорящего, ключевые заявления) и акустические паттерны (аплодисменты, тишина, шум).
Аннотации использовались для обучения модели предсказывать временные границы в ответах. Например, на вопрос «Когда зазвонил телефон?» модель училась выдавать ответ с таймстемпами: «Телефон зазвонил с 00:12:05 по 00:12:15». Формат обучения предполагает, что модель получает аудио и текстовый запрос, а целевой ответ содержит временные метки, которые декодер должен воспроизвести.
Примеры временной локализации: от саммари до поиска событий
Практическое применение временной локализации покрывает несколько сценариев:
- Саммари встречи с временными метками: «00:03:15 - 00:05:40: Обсуждение бюджета Q3, решено увеличить на 15%».
- Поиск конкретного звукового события: запрос «когда залаяла собака?» возвращает все интервалы с лаем.
- Вопросно-ответная система с привязкой ко времени: «Что сказал спикер о сроках запуска?» — «Спикер сообщил о переносе запуска на октябрь [00:22:10 - 00:22:45]».
Формат вывода с таймстемпами позволяет строить интерактивные интерфейсы: пользователь видит ответ и может сразу перейти к соответствующему фрагменту записи. Для разработчиков голосовых ассистентов и инструментов анализа совещаний это открывает возможность создавать навигацию по аудио без ручной разметки.
Другие возможности: не только локализация
Временная локализация — флагманская фича, но GigaChat Audio 10B решает и стандартные для аудио-LLM задачи. Модель отвечает на вопросы по аудио без временных меток: «Какая тема обсуждалась на встрече?» — «Обсуждался запуск нового продукта и распределение ресурсов». Классифицирует аудио: определяет эмоциональную окраску речи, тип звукового события, количество говорящих. Поддерживает использование инструментов: по голосовой команде вызывает внешние API — например, «запиши встречу в календарь на завтра, 10:00».
Модель сохраняет функциональность текстовой LLM. GigaChat Audio 10B выполняет текстовые задачи без аудио-входа: генерация кода, саммаризация документов, перевод. Это полноценная текстовая модель, которая дополнительно обучена понимать речь. Для разработчиков это означает, что один инстанс модели может обслуживать и текстовые, и голосовые интерфейсы.
Практические сценарии включают интеграцию с голосовыми AI-агентами. Модель способна работать в архитектурах «речь-в-речь», где аудио-вход обрабатывается напрямую, без каскада STT-LLM-TTS. Это снижает задержку и устраняет точку отказа на этапе распознавания. Для систем, где важна наблюдаемость, такой подход упрощает трассировку: весь аудио-контекст доступен в одном трейсе, без разделения на ASR и LLM-этапы.
Сравнение с каскадными системами (ASR + LLM)
| Критерий | GigaChat Audio 10B | Каскад ASR + LLM |
|---|---|---|
| Потери при транскрибации | Отсутствуют | Неустранимые ошибки ASR |
| Задержка | Ниже за счёт исключения ASR | Выше из-за двух этапов |
| Невербальные аспекты | Улавливает | Теряются |
| Временная локализация | Встроена | Требует отдельного решения |
| Требования к GPU | 24+ GB VRAM | Зависит от LLM и ASR |
Ограничения и практические соображения
GigaChat Audio 10B оптимизирована под русский и английский языки. Качество на других языках не заявлено и требует отдельного тестирования. Максимальная длина обрабатываемого аудио определяется контекстным окном декодера и архитектурой Conformer-энкодера — точные цифры производитель не раскрывает, но для задач временной локализации на длинных записях этот параметр критичен. Рекомендуется проверять на целевых данных до внедрения.
Требования к GPU для инференса соответствуют классу 10B MoE-модели. Активация только части экспертов снижает вычислительную нагрузку, но для продакшен-нагрузок потребуется как минимум одна современная GPU с 24+ GB видеопамяти. Точные бенчмарки производительности пока не опубликованы — оценку latency и throughput стоит проводить на собственных данных.
Временная локализация может давать неточные границы событий. Модель предсказывает таймстемпы как текст, и ошибка в несколько секунд возможна, особенно на границах акустически похожих событий. Для критичных приложений стоит предусмотреть постобработку или порог уверенности. Модель не является silver bullet: на специфических доменных данных (медицинские термины, узкопрофессиональный жаргон) качество может снижаться. Тестирование на целевых сценариях обязательно.
FAQ: частые вопросы о GigaChat Audio 10B
Какие GPU нужны для инференса?
Для продакшен-нагрузок рекомендуется как минимум одна современная GPU с 24+ GB видеопамяти. MoE-архитектура снижает вычислительную нагрузку, но точные требования зависят от длины аудио и ожидаемой пропускной способности.
Какие языки поддерживаются?
Модель оптимизирована под русский и английский. Качество на других языках не заявлено и требует отдельного тестирования.
Чем GigaChat Audio 10B отличается от каскада ASR + LLM?
Прямой ввод аудио исключает потери при транскрибации, снижает задержку и позволяет модели улавливать невербальные аспекты речи. Временная локализация встроена в модель, а не добавляется отдельным компонентом.
Насколько точна временная локализация?
Модель предсказывает таймстемпы как текст, поэтому возможна ошибка в несколько секунд, особенно на границах акустически похожих событий. Для критичных приложений рекомендуется постобработка или порог уверенности.
Заключение: место GigaChat Audio 10B в ландшафте аудио-LLM
GigaChat Audio 10B занимает нишу аудио-native LLM с сильным текстовым бэкендом и уникальной способностью к временной локализации. Прямой ввод аудио через Conformer-энкодер и модальный адаптер устраняет потери каскадных систем. База GigaChat 3.1 Lightning обеспечивает качество текстовых задач на уровне современной LLM. Временная локализация, обученная на TimeGround-1M, добавляет измерение, которого нет у большинства аналогов.
Модель наиболее полезна в сценариях анализа длинных записей: расшифровка совещаний с навигацией по таймстемпам, мониторинг аудиопотоков на специфические события, голосовые ассистенты с точной временной привязкой ответов. Разработчикам, которые строят офлайн-системы обработки речи, стоит рассмотреть GigaChat Audio 10B как альтернативу связке ASR + текстовая LLM — особенно если важны невербальные аспекты и низкая задержка.
Для практического внедрения модель требует тестирования на целевых данных, оценки требований к GPU и анализа точности временной локализации в конкретном домене. При соблюдении этих условий GigaChat Audio 10B открывает новые возможности для приложений, где важна временная структура аудио.