Перейти к содержанию
Публикация AiManual

GigaChat Audio 10B: аудио-native LLM с временной локализацией — архитектура и примеры

GigaChat Audio 10B обрабатывает аудио напрямую через Conformer-энкодер и Mixture-of-Experts декодер, без транскрипции. Разбираем архитектуру, временную локализа

Коротко

Что будет в материале

  1. 01

    Введение: зачем нужна аудио-native LLM

  2. 02

    Архитектура GigaChat Audio 10B: от аудио к ответу без транскрипции

  3. 03

    Временная локализация событий: как модель находит события с таймстемпами

  4. 04

    Другие возможности: не только локализация

Введение: зачем нужна аудио-native LLM

Типичный пайплайн обработки голоса выглядит как цепочка: автоматическое распознавание речи (ASR) превращает аудио в текст, а затем текстовая LLM этот текст анализирует. Схема работает, но вносит фундаментальные ограничения. Транскрибация отсекает просодику, темп, интонации и фоновые звуки — информацию, которая часто критична для понимания контекста. Ошибка на этапе ASR становится неустранимой: если система неверно распознала слово, текстовая модель уже не сможет его исправить. Добавьте задержку на распознавание, и вы получите каскадную архитектуру, которая проигрывает по скорости и точности.

Ключевые выводы:

  • GigaChat Audio 10B от ai-sage обрабатывает аудио напрямую, без промежуточной транскрипции.
  • Архитектура объединяет Conformer-энкодер, модальный адаптер и Mixture-of-Experts декодер на базе GigaChat 3.1 Lightning.
  • Флагманская возможность — временная локализация событий с таймстемпами, обученная на датасете TimeGround-1M.
  • Модель сохраняет полную функциональность текстовой LLM и поддерживает сценарии «речь-в-речь».

GigaChat Audio 10B решает проблему радикально: аудио подается напрямую в LLM. Модель использует Conformer-энкодер для извлечения признаков из речи и модальный адаптер для проекции этих признаков в пространство текстовых эмбеддингов. Декодер на базе GigaChat 3.1 Lightning с архитектурой Mixture-of-Experts обрабатывает аудио-эмбеддинги как ещё один вид токенов, сохраняя полное текстовое качество базовой модели. Ключевая особенность — временная локализация событий: модель находит, описывает и привязывает к таймстемпам конкретные моменты в длинных аудиозаписях. Эта способность обучена на специализированном датасете TimeGround-1M.

Статья детально разбирает архитектуру GigaChat Audio 10B, механизм временной локализации, поддерживаемые задачи и практические ограничения. Материал ориентирован на ML-инженеров, архитекторов решений и разработчиков, которые оценивают применимость аудио-native моделей в своих системах.

Архитектура GigaChat Audio 10B: от аудио к ответу без транскрипции

GigaChat Audio 10B состоит из трёх ключевых компонентов: Conformer-энкодер извлекает признаки из сырого аудио, модальный адаптер проецирует их в размерность текстовых эмбеддингов, а Mixture-of-Experts декодер обрабатывает смешанную последовательность аудио- и текстовых токенов. Такая архитектура позволяет модели понимать речь напрямую, не теряя информацию при преобразовании в текст.

Conformer-энкодер: извлечение признаков из речи

Conformer объединяет свёрточные слои и механизм self-attention в одном блоке. Свёртки эффективно моделируют локальные паттерны в спектрограмме — форманты, переходы между фонемами, кратковременные звуковые события. Self-attention захватывает глобальные зависимости: ритм фразы, интонационный контур, долгосрочные связи между сегментами речи. Комбинация даёт более богатое представление аудио, чем каждый механизм по отдельности.

На вход Conformer получает последовательность спектральных признаков (например, log-mel filterbanks), извлечённых из аудиофрагментов длительностью 25 мс с шагом 10 мс. На выходе — последовательность эмбеддингов той же длины, где каждый вектор кодирует информацию о соответствующем временном окне. Эти эмбеддинги содержат и акустические, и лингвистические признаки, но находятся в собственном пространстве представлений, не совместимом с текстовыми токенами LLM.

Модальный адаптер: мост между аудио и текстом

Проблема несовместимости пространств решается модальным адаптером — обучаемым проекционным слоем, который отображает выход Conformer в ту же размерность, которую используют текстовые эмбеддинги декодера. Технически это может быть линейный слой или небольшая MLP. Адаптер обучается совместно с энкодером при замороженном декодере или в режиме дообучения с низким learning rate.

После проекции аудио-эмбеддинги выглядят для декодера как последовательность «токенов» — точно так же, как текстовые токены после эмбеддинг-слоя. Это ключевой архитектурный приём: декодеру не нужно знать, что часть входных данных пришла из аудио. Он применяет один и тот же механизм внимания ко всей последовательности, независимо от модальности источника.

Mixture-of-Experts декодер: обработка аудио и текста

Декодер GigaChat Audio 10B — это текстовая LLM GigaChat 3.1 Lightning с архитектурой Mixture-of-Experts (MoE). В MoE каждый токен обрабатывается не всеми параметрами модели, а только подмножеством экспертов, выбранных маршрутизатором. Для 10-миллиардной модели это означает, что на инференсе активируется лишь часть весов, что снижает вычислительные затраты без потери качества.

Аудио-эмбеддинги подаются как префикс перед текстовой инструкцией. Декодер обрабатывает их через те же MoE-слои, что и текст. Маршрутизатор обучается направлять аудио-токены к экспертам, которые специализируются на соответствующих паттернах. Поскольку базовая модель GigaChat 3.1 Lightning обучена на большом корпусе текстов, она сохраняет сильные языковые способности, одновременно приобретая понимание речи через аудио-префикс.

Сравнение с каскадными системами показывает три преимущества прямого ввода аудио:

  • Нет потерь при транскрибации: модель слышит оригинальный сигнал.
  • Ниже задержка: исключён этап ASR.
  • Учёт невербальных аспектов: эмоциональная окраска, неуверенность, сарказм — всё, что теряется при преобразовании в текст.

Временная локализация событий: как модель находит события с таймстемпами

Стандартная аудио-LLM отвечает на вопрос «что произошло?». GigaChat Audio 10B добавляет измерение времени и отвечает «что произошло и когда именно». Временная локализация — это способность модели определять границы события в аудиопотоке: начало, конец, а для повторяющихся событий — все интервалы. Модель выводит таймстемпы в формате [MM:SS] или [HH:MM:SS] непосредственно в тексте ответа.

Реализована эта способность через обучение на данных, где ответы содержат временные метки. Декодер учится генерировать таймстемпы как часть текстового вывода — аналогично тому, как текстовая LLM генерирует числа или код. Никаких дополнительных архитектурных компонентов для этого не требуется: модель предсказывает временные метки теми же механизмами, что и обычные токены.

Датасет TimeGround-1M: основа для обучения временной локализации

TimeGround-1M — специализированный датасет, созданный для обучения временной локализации в аудио. Он содержит миллион примеров длинных аудиозаписей с временными аннотациями событий. Каждый пример включает аудиофайл, текстовое описание события и точные таймстемпы начала и окончания. Разнообразие сценариев покрывает бытовые звуки (звонок телефона, лай собаки), речевые события (смена говорящего, ключевые заявления) и акустические паттерны (аплодисменты, тишина, шум).

Аннотации использовались для обучения модели предсказывать временные границы в ответах. Например, на вопрос «Когда зазвонил телефон?» модель училась выдавать ответ с таймстемпами: «Телефон зазвонил с 00:12:05 по 00:12:15». Формат обучения предполагает, что модель получает аудио и текстовый запрос, а целевой ответ содержит временные метки, которые декодер должен воспроизвести.

Примеры временной локализации: от саммари до поиска событий

Практическое применение временной локализации покрывает несколько сценариев:

  • Саммари встречи с временными метками: «00:03:15 - 00:05:40: Обсуждение бюджета Q3, решено увеличить на 15%».
  • Поиск конкретного звукового события: запрос «когда залаяла собака?» возвращает все интервалы с лаем.
  • Вопросно-ответная система с привязкой ко времени: «Что сказал спикер о сроках запуска?» — «Спикер сообщил о переносе запуска на октябрь [00:22:10 - 00:22:45]».

Формат вывода с таймстемпами позволяет строить интерактивные интерфейсы: пользователь видит ответ и может сразу перейти к соответствующему фрагменту записи. Для разработчиков голосовых ассистентов и инструментов анализа совещаний это открывает возможность создавать навигацию по аудио без ручной разметки.

Другие возможности: не только локализация

Временная локализация — флагманская фича, но GigaChat Audio 10B решает и стандартные для аудио-LLM задачи. Модель отвечает на вопросы по аудио без временных меток: «Какая тема обсуждалась на встрече?» — «Обсуждался запуск нового продукта и распределение ресурсов». Классифицирует аудио: определяет эмоциональную окраску речи, тип звукового события, количество говорящих. Поддерживает использование инструментов: по голосовой команде вызывает внешние API — например, «запиши встречу в календарь на завтра, 10:00».

Модель сохраняет функциональность текстовой LLM. GigaChat Audio 10B выполняет текстовые задачи без аудио-входа: генерация кода, саммаризация документов, перевод. Это полноценная текстовая модель, которая дополнительно обучена понимать речь. Для разработчиков это означает, что один инстанс модели может обслуживать и текстовые, и голосовые интерфейсы.

Практические сценарии включают интеграцию с голосовыми AI-агентами. Модель способна работать в архитектурах «речь-в-речь», где аудио-вход обрабатывается напрямую, без каскада STT-LLM-TTS. Это снижает задержку и устраняет точку отказа на этапе распознавания. Для систем, где важна наблюдаемость, такой подход упрощает трассировку: весь аудио-контекст доступен в одном трейсе, без разделения на ASR и LLM-этапы.

Сравнение с каскадными системами (ASR + LLM)

КритерийGigaChat Audio 10BКаскад ASR + LLM
Потери при транскрибацииОтсутствуютНеустранимые ошибки ASR
ЗадержкаНиже за счёт исключения ASRВыше из-за двух этапов
Невербальные аспектыУлавливаетТеряются
Временная локализацияВстроенаТребует отдельного решения
Требования к GPU24+ GB VRAMЗависит от LLM и ASR

Ограничения и практические соображения

GigaChat Audio 10B оптимизирована под русский и английский языки. Качество на других языках не заявлено и требует отдельного тестирования. Максимальная длина обрабатываемого аудио определяется контекстным окном декодера и архитектурой Conformer-энкодера — точные цифры производитель не раскрывает, но для задач временной локализации на длинных записях этот параметр критичен. Рекомендуется проверять на целевых данных до внедрения.

Требования к GPU для инференса соответствуют классу 10B MoE-модели. Активация только части экспертов снижает вычислительную нагрузку, но для продакшен-нагрузок потребуется как минимум одна современная GPU с 24+ GB видеопамяти. Точные бенчмарки производительности пока не опубликованы — оценку latency и throughput стоит проводить на собственных данных.

Временная локализация может давать неточные границы событий. Модель предсказывает таймстемпы как текст, и ошибка в несколько секунд возможна, особенно на границах акустически похожих событий. Для критичных приложений стоит предусмотреть постобработку или порог уверенности. Модель не является silver bullet: на специфических доменных данных (медицинские термины, узкопрофессиональный жаргон) качество может снижаться. Тестирование на целевых сценариях обязательно.

FAQ: частые вопросы о GigaChat Audio 10B

Какие GPU нужны для инференса?

Для продакшен-нагрузок рекомендуется как минимум одна современная GPU с 24+ GB видеопамяти. MoE-архитектура снижает вычислительную нагрузку, но точные требования зависят от длины аудио и ожидаемой пропускной способности.

Какие языки поддерживаются?

Модель оптимизирована под русский и английский. Качество на других языках не заявлено и требует отдельного тестирования.

Чем GigaChat Audio 10B отличается от каскада ASR + LLM?

Прямой ввод аудио исключает потери при транскрибации, снижает задержку и позволяет модели улавливать невербальные аспекты речи. Временная локализация встроена в модель, а не добавляется отдельным компонентом.

Насколько точна временная локализация?

Модель предсказывает таймстемпы как текст, поэтому возможна ошибка в несколько секунд, особенно на границах акустически похожих событий. Для критичных приложений рекомендуется постобработка или порог уверенности.

Заключение: место GigaChat Audio 10B в ландшафте аудио-LLM

GigaChat Audio 10B занимает нишу аудио-native LLM с сильным текстовым бэкендом и уникальной способностью к временной локализации. Прямой ввод аудио через Conformer-энкодер и модальный адаптер устраняет потери каскадных систем. База GigaChat 3.1 Lightning обеспечивает качество текстовых задач на уровне современной LLM. Временная локализация, обученная на TimeGround-1M, добавляет измерение, которого нет у большинства аналогов.

Модель наиболее полезна в сценариях анализа длинных записей: расшифровка совещаний с навигацией по таймстемпам, мониторинг аудиопотоков на специфические события, голосовые ассистенты с точной временной привязкой ответов. Разработчикам, которые строят офлайн-системы обработки речи, стоит рассмотреть GigaChat Audio 10B как альтернативу связке ASR + текстовая LLM — особенно если важны невербальные аспекты и низкая задержка.

Для практического внедрения модель требует тестирования на целевых данных, оценки требований к GPU и анализа точности временной локализации в конкретном домене. При соблюдении этих условий GigaChat Audio 10B открывает новые возможности для приложений, где важна временная структура аудио.

Подписаться на канал