Компактные языковые модели с числом параметров менее миллиона перестают быть просто академическими игрушками. Silia v2 - это нейросетевая архитектура на 0,5M параметров, обученная на 1 миллиарде токенов из датасета Fineweb-edu за три эпохи. Автор проекта исправил ключевые недостатки первой версии и добился снижения вычислительных затрат в 2–2,5 раза за счёт гибридного механизма внимания. Модель проверили на HellaSwag, PIQA и LAMBADA, сравнив с Quark-v2, Spark-v4 и SupraMini-v6. Эта статья даёт детальный разбор архитектурных решений, процесса обучения и результатов бенчмарков, чтобы вы могли оценить применимость Silia v2 в своих проектах.
Тренд на сверхкомпактные модели усиливается. Когда Nanbeige 4.2-3B с Looped Transformer обходит девятимиллиардные модели в агентных задачах, а Laguna S 2.1 на 118B параметров конкурирует с флагманами при меньшей стоимости инференса, становится ясно: эффективность архитектуры часто важнее грубой силы параметров. Silia v2 исследует нижнюю границу этого спектра - модель, которая помещается в кэш процессора и работает без GPU.
Что такое Silia v2 и зачем нужны сверхкомпактные модели
Модели с числом параметров менее одного миллиона решают три практические задачи. Первая - инференс на микроконтроллерах и устройствах без GPU, где каждый килобайт памяти на счету. Вторая - быстрое прототипирование идей в условиях ограниченного бюджета на вычисления. Третья - образовательные проекты, где важна прозрачность архитектуры и возможность полного цикла обучения за часы, а не недели.
Silia v2 занимает нишу экстремально компактной модели с конкурентными показателями на стандартных бенчмарках. Параметров всего 0,5 миллиона - это примерно в 250 раз меньше, чем у GPT-2 Small. Обучение провели на 1 миллиарде токенов из датасета Fineweb-edu, отфильтрованного образовательного подмножества Common Crawl. Три эпохи обучения позволили модели усвоить базовые языковые закономерности без переобучения. Ключевое улучшение второй версии - гибридный механизм внимания, который сократил вычислительные затраты в 2–2,5 раза по сравнению с предшественницей.
Архитектурные инновации: как гибридное внимание сокращает вычисления
Автор Silia v2 собрал механизм внимания из трёх компонентов, каждый из которых решает конкретную проблему эффективности. Комбинация DeepSeek MLA без decoupled RoPE, Qwen HydraHead и Apple Attention Free Transformer дала синергетический эффект - суммарное снижение FLOPS на инференсе в 2–2,5 раза. Разберём каждый компонент отдельно.
DeepSeek MLA без decoupled RoPE: экономим на кэше
Multi-Head Latent Attention - это метод сжатия ключей и значений в низкоразмерное латентное пространство. Классическое многоголовое внимание хранит полные матрицы ключей и значений для каждой головы, что при масштабировании модели быстро раздувает KV-кэш. MLA проецирует входной вектор в компактное представление, из которого ключи и значения восстанавливаются через обучаемые матрицы малой размерности.
Decoupled RoPE в оригинальной реализации DeepSeek добавляет позиционную информацию отдельным потоком, не вмешиваясь в латентное сжатие. Для модели на 0,5M параметров этот дополнительный вычислительный блок оказался избыточным. Отказ от decoupled RoPE сэкономил параметры и операции, а позиционная информация кодируется через сам механизм латентного внимания. Результат - меньший объём KV-кэша и меньшее число операций на токен.
Qwen HydraHead: разделение труда между головами
HydraHead отказывается от принципа одинаковой размерности всех голов внимания. Разные головы получают разную размерность и специализацию: одни фокусируются на локальном контексте в пределах нескольких токенов, другие захватывают глобальные зависимости по всей последовательности. Локальные головы делаются узкими и быстрыми, глобальные - более широкими, но их меньше.
Эта асимметрия устраняет избыточность, характерную для классического многоголового внимания, где все головы вынуждены обрабатывать полный контекст с одинаковой размерностью. Для модели на 0,5M параметров HydraHead даёт возможность распределить скудный бюджет параметров туда, где они принесут максимум пользы - в глобальные зависимости, оставив локальным связям минимум ресурсов.
Apple Attention Free Transformer: внимание без матричного умножения
Attention Free Transformer заменяет главный источник вычислительной сложности трансформера - матричное произведение QK^T - на поэлементные операции. Вместо вычисления матрицы внимания размером n×n, где n - длина последовательности, AFT использует поэлементное перемножение запросов и скользящее среднее по ключам и значениям. Сложность падает с O(n²) до O(n) по длине последовательности.
Для коротких последовательностей выигрыш не так заметен, но Silia v2 проектируется с прицелом на обработку контекстов переменной длины. AFT гарантирует, что удвоение длины входа не приведёт к четырёхкратному росту вычислений. В сочетании с MLA и HydraHead этот компонент завершает картину: каждый аспект внимания оптимизирован под минимальный бюджет параметров и операций.
Обучение на Fineweb-edu: данные и процесс
Fineweb-edu - это подмножество датасета Fineweb, отфильтрованное по критерию образовательной ценности. Из общего корпуса Common Crawl отобраны тексты с высокой плотностью фактов, объяснений и структурированной информации - энциклопедические статьи, учебные материалы, техническая документация. Для модели на 0,5M параметров качество данных критически важнее их количества: каждый токен должен нести максимум полезного сигнала.
Объём обучающей выборки составил 1 миллиард токенов. Три эпохи означают, что модель увидела каждый пример трижды - достаточно для усвоения закономерностей, но без риска запоминания шума. Для сравнения: модели масштаба GPT-2 Small обучаются на десятках миллиардов токенов, а флагманские модели вроде тех, что сравниваются в обзоре Solar Open 2 против DeepSeek V4 Flash, проходят через триллионы токенов. Полмиллиона параметров просто не способны впитать больше информации, поэтому 1B токенов - разумный потолок.
Автор честно признал, что не указал FLOPS обучения. Причина - незнание корректного формата отчёта, а не попытка скрыть данные. Эта метрика важна для воспроизводимости: зная точное число операций с плавающей точкой, другие исследователи могут оценить, сколько времени займёт обучение на их оборудовании. Косвенно затраты можно прикинуть через время обучения на известном железе, но автор не привёл и этих цифр. Подробнее об ограничениях поговорим в отдельном разделе.
Бенчмарки: Silia v2 против Quark-v2, Spark-v4 и SupraMini-v6
Модель протестировали на трёх стандартных бенчмарках, покрывающих разные аспекты языковых способностей: commonsense reasoning, физическую интуицию и понимание широкого контекста. Конкурентами выбраны модели сопоставимого масштаба - Quark-v2, Spark-v4 и SupraMini-v6, каждая из которых представляет альтернативный подход к архитектуре компактных языковых моделей.
HellaSwag: здравый смысл под микроскопом
HellaSwag проверяет способность модели выбирать наиболее правдоподобное продолжение для бытовой ситуации. Задачи строятся через adversarial filtering - из множества кандидатов отбираются те, которые поверхностно похожи на правильный ответ, но содержат логическую ошибку. Модель должна уловить тонкие несоответствия.
Silia v2 показала accuracy на уровне, сопоставимом с Quark-v2, и обошла Spark-v4. Это примечательно, потому что Quark-v2 использует классический трансформер с большим числом параметров на голову внимания. Гибридный механизм Silia v2 компенсировал меньшую размерность за счёт специализации голов HydraHead - глобальные головы захватили контекст, необходимый для разрешения неоднозначностей HellaSwag.
PIQA: физическая интуиция
PIQA оценивает понимание физических взаимодействий: как смешать ингредиенты, как починить устройство, как расположить предметы в пространстве. Это сложная задача для моделей, не имеющих сенсорного опыта, - ответ требует рассуждений о причинно-следственных связях в материальном мире.
Здесь Silia v2 уступила SupraMini-v6, но превзошла Spark-v4. SupraMini-v6, судя по косвенным данным, обучалась на более разнообразном корпусе, включающем инструкции и описания процессов. Silia v2, тренированная только на Fineweb-edu, получила меньше примеров физических рассуждений. Архитектурные оптимизации не компенсировали пробел в данных.
LAMBADA: предсказание последнего слова
LAMBADA тестирует способность предсказать последнее слово в абзаце, опираясь на широкий контекст. В отличие от стандартной языковой модели, где контекст ограничен несколькими предложениями, здесь требуется проследить связи через весь отрывок. Это стресс-тест для механизма внимания - модель должна удерживать релевантную информацию на длинной дистанции.
Silia v2 показала конкурентоспособный результат, сравнимый с Quark-v2 и лучше Spark-v4. Комбинация глобальных голов HydraHead и линейной сложности AFT по длине последовательности сработала: модель эффективно агрегировала контекст без квадратичного взрыва вычислений. Для модели на 0,5M параметров это сильный результат, подтверждающий жизнеспособность гибридного подхода.
Честный взгляд на ограничения: почему нет FLOPS и что это значит
Отсутствие метрики FLOPS обучения - досадный, но не фатальный пробел. Автор прямо заявил, что не указал её из-за незнания формата отчёта, а не из желания скрыть невыгодные цифры. Такая честность заслуживает уважения, но создаёт практические сложности.
Без FLOPS невозможно точно сравнить вычислительную эффективность обучения Silia v2 с конкурентами. Модель может показывать хорошие бенчмарки просто потому, что на неё потратили больше вычислений, а не потому, что архитектура принципиально лучше. Косвенно затраты можно оценить, если автор опубликует время обучения на конкретном оборудовании - например, «N часов на одном GPU A100» или «M часов на CPU с N ядрами». Пока этих данных нет, воспроизводимость остаётся под вопросом.
Другое ограничение - объём знаний. Модель на 0,5M параметров физически не способна запомнить много фактов. На LAMBADA она справляется за счёт языковых закономерностей, но на фактологических вопросах вроде «столица Бурунди» неизбежно провалится. Это плата за компактность, и автор её не скрывает. Silia v2 - инструмент для задач, где важна форма ответа, а не энциклопедическая точность.
Практические выводы: когда стоит присмотреться к Silia v2
Silia v2 демонстрирует, что полмиллиона параметров - это достаточно для осмысленного языкового поведения. Гибридный механизм внимания из трёх компонентов даёт реальный выигрыш в скорости инференса, а обучение на качественном образовательном датасете позволяет извлечь максимум из скромного бюджета параметров.
Сценарии применения: инференс на микроконтроллерах и edge-устройствах без GPU, быстрые прототипы NLP-функций в условиях жёстких ограничений по памяти, образовательные проекты для изучения архитектур трансформеров. Модель можно полностью обучить за несколько часов на потребительском железе, что открывает возможности для экспериментов с данными и гиперпараметрами. Если вас интересуют более мощные, но всё ещё эффективные архитектуры, посмотрите разбор Nanbeige 4.2-3B с Looped Transformer или сравнение Solar Open 2 с DeepSeek V4 Flash - там параметров больше, но и возможности шире.
Ограничения нужно держать в голове: малый объём фактических знаний, отсутствие мультиязычности за пределами английского, неподтверждённая воспроизводимость из-за отсутствия FLOPS. Silia v2 не заменит GPT-4o или DeepSeek-V3 в продуктовых сценариях, но она и не проектировалась для этого. Её ценность - в доказательстве того, что архитектурные инновации работают даже на экстремально малом масштабе. Для разработчиков, исследующих нижнюю границу жизнеспособных языковых моделей, Silia v2 - обязательный к изучению проект.