Что произошло: краткая суть эксперимента
Участник сообщества LocalLLaMA под ником /u/jjusko20 завершил instruct-дообучение базовой модели Yandex AliceAI-80B-A3B на синтетическом дистиллированном датасете. Работа заняла около 48 часов, о завершении автор сообщил в апдейте от 1 октября 2026 года (пост в r/LocalLLaMA).
Сразу важное уточнение: это инициатива сообщества, а не официальный релиз Yandex. Сам автор описывает результат как поведенческий и логический файнтюн, который сохраняет исходные данные обучения Yandex. Модель не переобучается с нуля, базовые веса остаются её основой.
Практический интерес для тех, кто запускает модели локально, лежит в сроках. В ближайшие дни автор обещает выложить несколько GGUF-квантов и патч для llama.cpp, чтобы модель можно было запускать на своей машине. Отдельно планируется опубликовать текущий чекпоинт, чтобы сообщество протестировало промежуточный результат.
- Модель: Yandex AliceAI-80B-A3B, база, построенная по схеме MoE.
- Что сделано: instruct-дообучение на синтетическом дистиллированном датасете.
- Сколько заняло: около 48 часов.
- Железо: три V100 по 32 ГБ, под них автор написал отдельное ядро.
- Что дальше: GGUF-кванты, патч для llama.cpp, публичный чекпоинт.
Технические детали: что обучалось, а что осталось замороженным
Yandex AliceAI-80B-A3B построена по схеме MoE (mixture of experts). В таких моделях часть слоёв заменена набором экспертных подсетей, и для каждого токена роутер выбирает, какие эксперты его обработают. Схема снижает вычисления на токен, потому что активна лишь часть параметров, но требует аккуратной работы с памятью и маршрутизацией.
Помимо отдельных экспертов в подобных архитектурах есть shared expert. Он работает всегда, независимо от выбора роутера, и берёт на себя общие для всех запросов паттерны.
В этом эксперименте обучались два компонента: attention и shared expert. Attention определяет, на какие части контекста модель опирается при генерации следующего токена. Базовые эксперты остались замороженными, их веса не обновлялись.
Почему заморозили базовые эксперты
Логика простая. Эксперты хранят специализированные знания, накопленные при обучении базовой версии, и автор хочет их сохранить. Обучение attention и shared expert меняет то, как модель выбирает стратегию ответа и как распределяет информацию между экспертами, но не переписывает содержимое экспертных подсетей.
Вторая причина приземлённее: меньше обучаемых параметров означает меньше памяти под градиенты и состояния оптимизатора. Задачу удаётся уложить в скромное по нынешним меркам железо. Автор как раз работал на трёх V100 по 32 ГБ, и объём обучаемых весов здесь критичен.
Подход с частичной заморозкой часто используют, когда нужно изменить поведение модели, не растеряв исходные знания. Гарантией от деградации на узких задачах он не служит: итог зависит от данных, числа эпох и скорости обучения. В этом конкретном случае публичных замеров качества пока нет.
Кривая loss: почему выглядит странно и что это значит
Автор прямо пишет, что кривая loss выглядит необычно, но анализ показывает: средний loss по эпохам стабильно снижался. Причины скачков он связывает с размером словаря и разным числом токенов в эпохах (источник). Это его объяснение по итогам собственного разбора, а не установленный факт.
Почему мгновенные значения шумят, понятно и без деталей обучения. Loss считается по батчу, а батчи различаются длиной и содержанием: на одном шаге это короткие реплики, на другом длинные технические тексты. Большой словарь добавляет свой вклад, так как вероятность распределяется между большим числом токенов, и абсолютные значения метрики выглядят выше, чем у моделей с компактным словарём. Если эпохи содержат разное число токенов, их средние значения тоже считаются по разным знаменателям.
Отсюда практический вывод для чтения таких графиков: смотреть на динамику среднего loss по эпохам полезнее, чем на пики внутри эпохи. И отдельно: снижение loss не равно улучшению модели на реальных задачах. Это метрика на обучающих данных, а не результат оценки.
Когда можно будет запустить локально: GGUF и патч для llama.cpp
Всё описанное ниже относится к планам, а не к готовым файлам. Автор заявил, что в течение следующих нескольких дней выпустит несколько GGUF-квантов модели вместе с патчем для llama.cpp для локального запуска. Текущую версию он собирается опубликовать как публичный чекпоинт, чтобы люди могли её покрутить. Свой подход он сравнил с тем, как публиковала промежуточные версии DeepSeek.
Что такое GGUF-кванты и зачем они нужны
GGUF - формат упаковки весов для llama.cpp и совместимых с ним инструментов. Веса хранятся с пониженной точностью, поэтому файл занимает меньше места и требует меньше VRAM при запуске. Плата за это известна: чем агрессивнее квантование, тем заметнее расхождение в ответах по сравнению с полной точностью.
Для модели с обозначением 80B-A3B локальный запуск без квантования на потребительском железе нереален, так что появление готовых квантов - главное практическое событие для этой истории. Конкретные размеры и типы квантов автор пока не объявил, как и требования к VRAM.
Патч для llama.cpp: что это даст
Патч нужен для поддержки архитектуры AliceAI-80B-A3B в llama.cpp. Без него стандартная сборка модель просто не загрузит: движок должен знать, как читать такую конфигурацию слоёв и экспертов. Патч ещё не выпущен, детали реализации автор не раскрывал.
Насколько такая специализированная сборка ускоряет инференс, вопрос отдельный. Мы разбирали, что реально можно вырезать из llama.cpp ради одной модели и где выигрыш упирается в память и квантование. Для MoE-архитектур отдельная тема - производительность ядер и раскладка экспертов, и там прирост зависит от конфигурации заметно сильнее, чем от самого факта патча. Практические замеры ускорения MoE-инференса в llama.cpp на RTX 4080 мы собирали в отдельном разборе: часть патчей даёт прирост, часть приводит к регрессиям.
Оборудование и кастомное ядро для V100
Обучение шло на трёх V100 по 32 ГБ. Чтобы это заработало, автору пришлось написать отдельное ядро для тренировки на этих GPU: по его словам, на это ушло изрядное количество времени. Готовые решения под V100 часто не рассчитаны, потому что карты относятся к архитектуре Volta и уступают по поддерживаемым форматам вычислений современным Hopper и Blackwell.
Три V100 по 32 ГБ - это 96 ГБ видеопамяти суммарно, распределённых по трём устройствам. Дообучать модель такого масштаба на таком объёме можно только при агрессивной экономии: замороженные базовые эксперты, ограниченный набор обучаемых модулей, ручная оптимизация ядер. Для сравнения, когда речь идёт о MoE-моделях на новых ускорителях, узким местом становится не только память, но и то, включён ли expert parallel и какой режим attention используется. Мы описывали такой случай в разборе запуска DeepSeek-V4-Flash на одном B300, где отказ MoE-ядра без expert parallel обрушил скорость.
SFTMill и другие открытые инструменты
Автор уже открыл движок дистилляции SFTMill. Именно с его помощью готовился синтетический дистиллированный датасет, то есть набор данных, который использовался для instruct-дообучения. Прямую ссылку на репозиторий он приводит в самом посте, здесь мы её не дублируем.
Помимо SFTMill автор готов делиться другими патчами, включая то самое кастомное ядро для обучения на V100. Для сообщества это самостоятельная ценность: даже если итоговое качество модели окажется скромным, инструменты для тренировки на не самой новой архитектуре могут пригодиться другим.
Планы на будущее: reinforcement learning и расширенный SFT
Первым этапом автор не ограничится. Он заявил, что продолжит тренировку с reinforcement learning и расширенным SFT-набором. Это указывает на итеративный подход: сначала поведенческая адаптация на синтетике, затем дообучение на более широких данных и отдельная работа по качеству ответов через RL.
Сроки следующего этапа не названы, как и объём расширенного набора данных. Текущий чекпоинт стоит воспринимать как промежуточный результат, а не как финальную версию. Если план с RL реализуется, следующая итерация будет интереснее для практического применения, но подтверждений пока нет.
Ограничения и неопределённости: что важно учитывать
Автор сам говорит, что не уверен, насколько удачным получится первоначальный файнтюн. Это честная оценка, и к ней стоит отнестись серьёзно: речь идёт о незавершённом эксперименте.
| Утверждение | Статус |
|---|---|
| Instruct-дообучение завершено, около 48 часов | Подтверждено автором |
| Обучались attention и shared expert, базовые эксперты заморожены | Подтверждено автором |
| Средний loss по эпохам снижался | По анализу автора |
| Причины скачков кривой loss | Предположение автора |
| GGUF-кванты и патч для llama.cpp | Планируются, не выпущены |
| Публичный чекпоинт | Планируется, не выпущен |
| Качество модели, бенчмарки, требования к VRAM | Данных нет |
Ещё несколько моментов, которые легко упустить. Первый: модель обучалась на синтетическом дистиллированном датасете, а значит, качество результата ограничено качеством данных и модели-учителя. Дистилляция переносит и ошибки источника. Второй: полного переобучения здесь нет, базовые данные Yandex остаются внутри, поэтому поведение модели вне зоны правки может напоминать исходную версию. Третий: производная модель распространяется на условиях лицензии базовой версии, и это стоит проверить до любого рабочего использования.
Что делать прямо сейчас: следить за апдейтами в r/LocalLLaMA, где появятся и кванты, и патч (тред автора). Скачивать и разворачивать пока нечего, релиза нет. Если вы планируете применять модель в рабочем процессе, дождитесь бенчмарков и отзывов первых тестировщиков, а также убедитесь, что лицензия базовой версии допускает такой сценарий.