Перейти к содержанию
Публикация AiManual

SupraElegans-500K: Рекуррентная модель без Transformer — архитектура, тесты и перспективы

Разбираем архитектуру SupraElegans-500K — рекуррентной модели на 500K параметров без Transformer и KV-кэша. Бенчмарки HellaSwag 26.5%, ARC 21-22%, WinoGrande 52

Коротко

Что будет в материале

  1. 01

    Что такое SupraElegans-500K и почему это важно

  2. 02

    Архитектура: как работает разреженный знаковый рекуррентный граф

  3. 03

    Производительность: бенчмарки и сравнение с Transformer-аналогами

  4. 04

    Ограничения и нерешённые проблемы

SupraElegans-500K - экспериментальная языковая модель от SupraLabs, которая полностью отказывается от архитектуры Transformer, механизма attention и KV-кэша. Вместо этого используется разреженный знаковый рекуррентный граф, вдохновлённый нервной системой C. elegans. Это proof-of-concept: всего 500 тысяч параметров, базовая способность к генерации текста и значительное отставание от Transformer-аналогов по бенчмаркам. Модель не претендует на замену GPT, но открывает направление для исследований альтернативных архитектур.

Ключевая инновация - обработка контекста через мембранный потенциал нейронов. Потенциал персистентно обновляется на каждом токене, сохраняя состояние без внешней памяти. На практике это означает O(1) затрат памяти на инференсе вместо O(n) у Transformer. Результаты скромные: HellaSwag 26.5%, ARC-Easy 21%, ARC-Challenge 22%, WinoGrande 52%. Но для 500K параметров и отсутствия предобучения на масштабных корпусах это ожидаемый уровень.

Разработка продолжает тренд на поиск не-Transformer архитектур, таких как RWKV с линейной ататенцией на базе RNN или Mamba. SupraElegans-500K интересна радикальным подходом: отказ от attention полный, а не частичный. Это исследовательский прототип, и его ценность - в демонстрации альтернативного пути.

Что такое SupraElegans-500K и почему это важно

SupraElegans-500K - модель с архитектурой на основе разреженного знакового рекуррентного графа. Граф имитирует нейронные связи C. elegans: возбуждающие и тормозные синапсы, популяции нейронов, динамика мембранного потенциала. Ни attention, ни KV-кэш не используются. Контекст кодируется напрямую в состоянии сети.

Почему это важно. Transformer доминирует в языковых моделях, но его квадратичная сложность по длине контекста - фундаментальное ограничение. KV-кэш растёт линейно с длиной последовательности, потребляя гигабайты памяти на длинных контекстах. Рекуррентные архитектуры обещают решение: фиксированный объём состояния, O(1) на токен при инференсе, отсутствие кэша. SupraElegans-500K - попытка реализовать это на биологически мотивированном графе.

Модель создана SupraLabs, известной по компактным моделям вроде Supra2-100M с базовой и Instruct версиями. SupraElegans-500K - шаг в сторону от мейнстрима, эксперимент с иной парадигмой вычислений. Результаты подтверждают: архитектура работает, но до практической применимости далеко.

Архитектура: как работает разреженный знаковый рекуррентный граф

Архитектура SupraElegans-500K строится вокруг трёх компонентов: нейронные популяции, разреженный граф связей и динамика мембранного потенциала. Входной токен преобразуется в начальное возбуждение сенсорной популяции, сигнал распространяется через интернейроны к моторной популяции, выход которой декодируется в следующий токен. Состояние сети сохраняется между шагами - это и есть память модели.

Граф разреженный: каждый нейрон соединён лишь с небольшой долей других нейронов. Связи знаковые - возбуждающие (положительный вес) и тормозные (отрицательный вес). Структура графа фиксирована или обучается - детали SupraLabs не раскрывает. Разреженность снижает вычислительные затраты и объём параметров: 500K при такой архитектуре - это тысячи нейронов, а не миллионы весов полносвязных слоёв.

Нейронные популяции и динамика мембранного потенциала

Популяции разделены по функции, аналогично C. elegans. Сенсорные нейроны получают входной сигнал - эмбеддинг токена. Интернейроны обрабатывают информацию, смешивая текущий вход с состоянием сети. Моторные нейроны формируют выход. Каждая популяция - группа нейронов с общими свойствами, но индивидуальными связями.

Динамика мембранного потенциала описывается формулой обновления:

V_i(t) = V_i(t-1) * decay + sum_j(W_ij * spike_j(t-1)) + I_i(t)

где V_i - потенциал нейрона i, decay - коэффициент затухания (меньше 1), W_ij - вес связи от нейрона j, spike_j - бинарный спайк (1 если потенциал превысил порог, иначе 0), I_i - внешний вход. После обновления потенциала нейроны с V_i > threshold генерируют спайк и сбрасывают потенциал. Эта динамика идёт несколько шагов на каждый входной токен, позволяя сигналу распространиться по графу.

Память модели - это распределённое состояние потенциалов всех нейронов. Оно сохраняется между токенами, обновляется новым входом и затухает со временем. Никакого отдельного кэша ключей и значений. Для сравнения: Transformer хранит явные представления всех предыдущих токенов в KV-кэше, что даёт прямой доступ к истории, но требует O(n) памяти. Рекуррентный граф сжимает историю в вектор состояния фиксированного размера - это компромисс между точностью и эффективностью.

Обучение с помощью BPTT: особенности и ограничения

Обучение рекуррентного графа выполняется методом Backpropagation Through Time. Граф «разворачивается» во времени на заданную глубину, градиенты текут от выхода к предыдущим состояниям. Для SupraElegans-500K применяется truncated BPTT: граф разворачивается на фиксированное число шагов, дальние зависимости обрезаются. Это снижает вычислительные затраты и борется с затуханием градиентов.

Затухающие и взрывающиеся градиенты - классическая проблема рекуррентных сетей. В глубокой развёртке градиенты экспоненциально убывают или растут, делая обучение нестабильным. Truncated BPTT ограничивает глубину, но ценой потери дальних зависимостей. Регуляризация и gradient clipping помогают, но не решают проблему полностью. Ограниченный токен-бюджет SupraElegans-500K - прямое следствие: модель эффективно обучается только на коротких последовательностях.

Сравнение с Transformer показательно. Transformer обучается через self-attention с прямым доступом к любому токену - градиенты не затухают по длине последовательности. Рекуррентный граф вынужден проводить сигнал через множество шагов, накапливая ошибки. Это фундаментальное ограничение, которое SupraElegans-500K наследует от своего класса архитектур.

Производительность: бенчмарки и сравнение с Transformer-аналогами

Результаты SupraElegans-500K на стандартных бенчмарках:

БенчмаркSupraElegans-500KGPT-2 Small (124M)DistilGPT2 (82M)
HellaSwag26.5%31.4%27.8%
ARC-Easy21.0%43.8%38.2%
ARC-Challenge22.0%25.9%22.4%
WinoGrande52.0%51.6%50.8%

HellaSwag 26.5% - модель угадывает продолжение сценария чуть лучше случайного выбора из четырёх вариантов (25%). ARC-Easy 21% - хуже случайного для задач с выбором из нескольких ответов. ARC-Challenge 22% - на уровне DistilGPT2, но GPT-2 Small обходит на 3.9 пункта. WinoGrande 52% - единственный бенчмарк, где SupraElegans-500K на уровне Transformer-моделей, но это близко к random baseline (50%).

Отставание закономерно. GPT-2 Small имеет в 248 раз больше параметров и обучен на 40GB текста. SupraElegans-500K - 500K параметров и ограниченный токен-бюджет. Прямое сравнение некорректно: это разные весовые категории. Корректнее сопоставлять с моделями схожего размера, например Silia v2 (0.5M параметров), которая на 1B токенов показала лучшие результаты благодаря гибридным механизмам внимания - детали архитектуры разбирали в обзоре Silia v2.

Базовая генерация текста присутствует: модель выдаёт грамматически связные предложения на простые промпты. Но качество быстро деградирует с ростом длины: повторы, потеря темы, фактические ошибки. Для практических задач модель неприменима. Это ожидаемо для 500K параметров без масштабного предобучения.

Ограничения и нерешённые проблемы

Ключевые ограничения SupraElegans-500K:

  • Малый размер. 500K параметров - это на два-три порядка меньше минимальных практически полезных языковых моделей. Модель не способна запомнить факты, выучить сложные паттерны языка или рассуждать.
  • Низкое качество на сложных задачах. Результаты ARC-Easy 21% означают, что модель не справляется с простыми вопросами на понимание. HellaSwag 26.5% - генерация продолжений на уровне случайного угадывания.
  • Ограниченная длина контекста. Truncated BPTT и затухание потенциала ограничивают эффективную память модели несколькими десятками токенов. Длинные зависимости теряются.
  • Нестабильность обучения. Рекуррентные архитектуры чувствительны к гиперпараметрам, склонны к затуханию градиентов. Обучение требует тщательной настройки и регуляризации.
  • Отсутствие публичного кода и весов. На момент публикации SupraLabs не открыла репозиторий. Воспроизвести результаты или использовать модель в своих проектах нельзя.

Модель - исследовательский прототип. Она доказывает работоспособность концепции, но не является готовым продуктом. Для продакшен-задач, где нужна надёжная генерация текста, ответы на вопросы или работа с длинными документами, SupraElegans-500K не подходит. Это инструмент для исследователей, изучающих альтернативные архитектуры.

Потенциал направления: зачем нужны не-Transformer архитектуры

Transformer решил проблему обучения на длинных последовательностях, но создал проблему инференса. KV-кэш растёт линейно с длиной контекста: для 1M токенов при размерности 4096 и float16 кэш занимает 16GB на слой. Многослойные модели требуют сотни гигабайт памяти только под кэш. Это ограничивает применение на устройствах с ограниченными ресурсами и повышает стоимость API.

Рекуррентные архитектуры решают эту проблему радикально: состояние фиксированного размера, O(1) памяти на токен, отсутствие кэша. Инференс становится предсказуемым по памяти и потенциально быстрее на длинных последовательностях. RWKV продемонстрировала, что линейная ататенция на базе RNN может конкурировать с Transformer по качеству при лучшей эффективности. Mamba и S4 показали, что state-space модели с селективным сканированием достигают качества Transformer на задачах с длинными зависимостями.

SupraElegans-500K идёт дальше: полный отказ от attention, биологически мотивированный граф, спайковая динамика. Это радикальный подход с потенциалом для нейроморфных вычислений. Спайковые сети энергоэффективны на специализированном железе (Loihi, TrueNorth), а разреженные графы допускают эффективную аппаратную реализацию. Пока это теоретические преимущества, но направление активно исследуется.

Стоит отметить и другие попытки сжатия моделей для эффективного инференса. Например, Nota AI сжала 250B модель до 32B методом REAP, сохраняя архитектуру Transformer, но радикально сокращая число параметров. Это ортогональный подход: не менять архитектуру, а прореживать веса. SupraElegans-500K предлагает альтернативу - менять саму архитектуру вычислений.

Выводы: стоит ли следить за SupraElegans и аналогичными проектами

SupraElegans-500K - интересный концепт, но не конкурент Transformer. Для практических задач модель не подходит: качество низкое, длина контекста ограничена, код закрыт. Для исследователей и энтузиастов альтернативных архитектур - достойный внимания пример. Модель демонстрирует, что рекуррентный граф без attention способен генерировать связный текст, пусть и с низким качеством.

Следить за направлением стоит. Рекуррентные модели и state-space архитектуры решают реальную проблему - память инференса Transformer. Если SupraLabs масштабирует подход до 100M+ параметров и покажет конкурентоспособные бенчмарки, это будет значимым событием. Пока же SupraElegans-500K остаётся proof-of-concept: архитектура работает, потенциал есть, но до практической пользы далеко.

Практическая рекомендация: если вы ищете модель для продакшена - выбирайте проверенные Transformer-архитектуры или их эффективные варианты вроде RWKV. Если исследуете альтернативные подходы - изучайте код (когда он появится), экспериментируйте с малыми рекуррентными моделями, следите за публикациями SupraLabs. Направление многообещающее, но требует времени на созревание.

Подписаться на канал