Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

DWARF-55M-Base: почти полностью разрежённое внимание с O(1) декодированием

DWARF-55M-Base заменяет полное внимание на динамический разрежённый сбор запросов (DSQG) почти во всех слоях, снижая затраты на декодирование до O(1). Разбираем

Коротко

Что будет в материале

  1. 01

    Почему полное внимание - узкое место, и как DWARF решает эту проблему

  2. 02

    Dynamic Sparse Query-Gather (DSQG): как работает механизм разрежённого внимания

  3. 03

    Эффективность на практике: O(1) пропускная способность KV-кэша

  4. 04

    Обучение и результаты: 10B токенов, контекст 2048 и потенциал расширения

Почему полное внимание - узкое место, и как DWARF решает эту проблему

Стандартный механизм внимания в трансформерах масштабируется квадратично: каждый токен вычисляет связи со всеми предшествующими токенами. На длине последовательности n это даёт O(n²) операций и O(n) памяти под KV-кэш. Инференс на контекстах в десятки и сотни тысяч токенов упирается в объём вычислений и пропускную способность памяти.

DWARF-55M-Base атакует эту проблему радикально. Модель заменяет полное внимание на динамический разрежённый сбор по запросам (Dynamic Sparse Query-Gather, DSQG) во всех слоях, кроме одного. Каждый токен консультируется не со всей историей, а с малой мультимасштабной выборкой прошлого - фиксированным набором близких и дальних смещений. Результат: пропускная способность KV-кэша и объём работы внимания на токен становятся почти O(1) относительно длины контекста. Обучение на 10 миллиардах токенов датасета Dolma3 Mix 150B даёт стабильное извлечение информации вплоть до 2048 токенов с потенциалом расширения до трёхкратной длины.

Это не очередная вариация sliding window или блочного внимания - это архитектура, где разрежение заложено на уровне механизма, а не наложено поверх dense-вычислений. Для разработчиков, упирающихся в память при работе с длинными документами, такой подход означает радикальное снижение требований к железу без потери способности модели удерживать дальние зависимости. Похожие идеи мы разбирали в архитектуре Reformer, где LSH-хэширование снижало сложность до O(n log n), но DWARF идёт дальше - к константным затратам на токен.

Dynamic Sparse Query-Gather (DSQG): как работает механизм разрежённого внимания

DSQG отказывается от вычисления матрицы внимания размером n×n. Вместо этого для каждого токена-запроса механизм собирает информацию только из заранее определённых позиций прошлого. Эти позиции заданы фиксированным набором смещений - одни указывают на ближайших соседей, другие перескакивают на десятки и сотни токенов назад. Выборка мультимасштабная: локальные смещения ловят синтаксис и непосредственный контекст, глобальные - дальние смысловые связи.

Количество собираемых токенов не зависит от длины последовательности. Обрабатываете вы 512 токенов или 2048 - каждый запрос тянет одно и то же число ключей и значений. Отсюда и O(1): объём вычислений на токен фиксирован, размер KV-кэша на токен фиксирован. Нет экспоненциального роста, нет необходимости агрессивно квантизировать кэш для выживания в памяти.

Ближние и дальние смещения: мультимасштабный сбор контекста

Секрет сохранения качества при жёстком разрежении - в геометрии смещений. Ближние позиции (например, 1, 2, 4, 8 токенов назад) дают модели плотный локальный контекст, аналогичный небольшому окну внимания. Дальние смещения (64, 128, 256, 512 токенов) работают как разрежённая выборка из истории, позволяя восстанавливать дальние зависимости. Такой паттерн напоминает dilated convolutions из обработки сигналов: экспоненциально растущий шаг даёт логарифмическое покрытие истории при фиксированном числе точек.

Для задач извлечения информации это критично. Модель должна одновременно держать локальную связность текста и помнить факт, упомянутый тысячу токенов назад. Мультимасштабная выборка DSQG даёт оба свойства без квадратичного штрафа.

Почему один слой полного внимания всё ещё нужен

Полный отказ от dense-внимания во всех слоях - слишком агрессивная оптимизация. Один слой с классическим softmax-вниманием сохраняется как якорь для глобальной агрегации. Он собирает информацию со всей истории и перераспределяет её в представления, которые затем обрабатываются разрежёнными слоями.

Этот компромисс знаком по гибридным архитектурам вроде моделей с Mixture of Experts, где чередование dense и sparse блоков даёт баланс качества и эффективности. В DWARF единственный dense-слой выступает страховкой: он гарантирует, что ни один участок контекста не выпадет полностью, даже если фиксированные смещения DSQG его пропустят.

Эффективность на практике: O(1) пропускная способность KV-кэша

Сравним цифры. В стандартном трансформере с полным вниманием каждый новый токен требует вычисления внимания ко всем n предшествующим токенам - это O(n) операций на токен. KV-кэш растёт линейно: для 2048 токенов при размерности 64 и 12 головах это около 6 млн float16-значений, для 100 тысяч токенов - уже под 300 млн.

DWARF с DSQG фиксирует число собираемых токенов. Если каждый запрос тянет, скажем, 32 ключа и значения, то прирост вычислений и памяти на новый токен - константа. На длине 2048 токенов разница с полным вниманием уже заметна, на 100 тысячах - кратная. KV-кэш модели перестаёт быть узким местом, а инференс не деградирует с ростом контекста. Проблемы потери контекста, которые мы детально разбирали для Qwen 3.6 на длинных диалогах, здесь решаются архитектурно: модель не забывает инструкции, потому что физически способна дотянуться до любой точки истории за фиксированное число операций.

Обучение и результаты: 10B токенов, контекст 2048 и потенциал расширения

DWARF-55M-Base - модель на 55 миллионов параметров, обученная на 10 миллиардах токенов из датасета Dolma3 Mix 150B. Это скромный по современным меркам бюджет: для сравнения, 20B Looping Model, которую мы разбирали ранее, использовала 3.5 триллиона токенов. Однако цель DWARF - не рекорды перплексии, а демонстрация жизнеспособности почти полностью разрежённого внимания.

Результат: модель стабильно извлекает информацию на обученной длине контекста 2048 токенов. Авторы предполагают, что архитектура масштабируется до 3× от обученной длины - порядка 6144 токенов - без катастрофической потери качества. Это свойство вытекает из природы DSQG: фиксированные смещения не привязаны к абсолютным позициям, модель учится использовать относительные паттерны доступа к истории.

Границы применимости и неопределённости

Расширение контекста до 6144 токенов заявлено как предположительное и требует независимой проверки. Детали реализации DSQG - конкретные наборы смещений, способ их динамического выбора, взаимодействие с позиционным кодированием - в доступном описании не раскрыты. Нет сравнительных экспериментов с другими методами разрежённого внимания: неизвестно, как DWARF показывает себя против BigBird, Longformer или Routing Transformer на стандартных бенчмарках длинного контекста.

Модель на 55M параметров - это исследовательский прототип. Прямой перенос выводов на продакшен-модели масштаба 7B и выше требует экспериментов. Архитектурные решения могут не перенестись линейно при масштабировании.

DWARF в экосистеме разрежённого внимания: сравнение и перспективы

Ландшафт разрежённого внимания разнообразен. BigBird комбинирует случайное, локальное и глобальное внимание, снижая сложность до O(n). Longformer использует скользящее окно плюс глобальные токены для задач вроде вопросно-ответных систем. Routing Transformer применяет кластеризацию для группировки токенов со схожим контекстом.

DWARF выделяется радикальностью: разрежены все слои кроме одного. Это не гибрид, где dense-блоки чередуются с sparse, а почти полностью разрежённый стек. Второе отличие - достижение O(1) на токен именно на этапе декодирования, а не только на этапе кодирования. Для авторегрессионной генерации, где каждый новый токен требует обращения к истории, это даёт максимальный выигрыш.

Потенциальные сценарии: инференс на edge-устройствах с жёстким лимитом памяти, обработка потоковых данных с неограниченно растущим контекстом, суммаризация длинных документов без скользящего окна. В комбинации с техниками квантизации KV-кэша, которые мы видели в оптимизациях инференса DeepSeek-V4-Flash, DWARF-подобные архитектуры могут стать стандартом для моделей, ориентированных на сверхдлинные контексты.

Как начать использовать DWARF-55M-Base уже сегодня

На момент публикации информация о доступности весов модели и кода DSQG ограничена. Если вы хотите воспроизвести архитектуру или протестировать модель, отслеживайте репозитории авторов и страницу проекта на Hugging Face - исследовательские модели такого типа обычно публикуются под открытой лицензией.

Для экспериментов с разрежённым вниманием в собственных проектах обратите внимание на готовые реализации sparse attention в библиотеках transformers и xformers. Они поддерживают скользящие окна, блочное внимание и кастомные маски - можно собрать прототип, близкий по духу к DSQG, задав фиксированный паттерн смещений через attention mask. При тестировании обязательно проверяйте стабильность извлечения информации на длинах, превышающих обученный контекст - это узкое место любых sparse-архитектур.

Подписаться на канал