Что такое Spotlight от Percepta и какую проблему он решает
Spotlight это архитектура больших языковых моделей от компании Percepta. Она заменяет механизм внимания (attention) на записываемую память и разделяет модель на два модуля: интеллектуальный, который выполняет вычисления, и память, которая хранит знания, процедуры и рабочее состояние.
Главное обещание авторов: память может расти бесконечно, а стоимость доступа к ней при этом не увеличивается. По заявлению Percepta, это первая архитектура, которой удалось выйти из компромисса между объёмом памяти и расходами на обращение к ней. Речь идёт о заявлении компании о собственной разработке: независимых подтверждений, сторонних тестов и рецензий на момент публикации нет.
Проблема, из которой всё выросло, знакома каждому, кто работал с длинным контекстом. Механизм внимания сопоставляет каждый токен со всеми предыдущими, поэтому вычислительные затраты растут квадратично относительно длины последовательности. Объём памяти модели при этом фактически ограничен контекстным окном: всё, что вышло за его пределы, модель не помнит. Spotlight предлагает другой принцип. Вычисления отделяются от хранения, и растущая база знаний перестаёт упираться в размер окна.
Архитектура Spotlight: интеллектуальный модуль и память
Spotlight делит модель на две части, и это разделение принципиально для всей конструкции. Интеллектуальный модуль считает. Память хранит знания, процедуры и рабочее состояние. Схема напоминает связку процессора и накопителя: вычислительное ядро остаётся компактным, а данные лежат отдельно и могут расширяться.
Интеллектуальный модуль: вычислительное ядро
Интеллектуальный модуль отвечает за вычисления. Его размер фиксирован и не меняется при росте памяти. Веса модели тоже остаются прежними: добавили гигабайты новых знаний в память, а сам модуль, который этими знаниями пользуется, не потолстел. В блоге Percepta это сформулировано прямо: «The intelligence module stays the same size, and the weights don't change as memory grows».
Практический смысл в том, что вычислительная сложность не растёт вместе с базой знаний. Расширение возможностей модели раньше означало обучение новой, более крупной версии. Здесь меняется только содержимое памяти.
Память: знания, процедуры и рабочее состояние
Память хранит три типа содержимого: знания (факты), процедуры (навыки) и рабочее состояние. Она доступна для записи, и модель сама по токенам решает, что загрузить и когда перезаписать. Отличие от статичных весов очевидно: обычная модель после обучения не меняется, а память Spotlight обновляется прямо в процессе работы.
Авторы приводят такой довод: если память способна хранить навыки наравне с фактами, модель осваивает новые возможности без переобучения. Она записывает новую процедуру и дальше пользуется ей. Потолок возможностей тогда задаёт содержимое памяти, а не размер вычислительного модуля.
Как работает индексирование ячеек памяти и почему память растёт без роста затрат
Вся механика опирается на индексацию отдельных ячеек. Каждый токен читает из неограниченной памяти и записывает в неё, но затрагивает лишь небольшое число ячеек за раз. Модель учится индексировать ячейки, то есть определять, куда именно обратиться, и от этого зависит, сколько памяти она реально трогает на каждом шаге.
Ключевое свойство: число затрагиваемых ячеек не зависит от общего объёма памяти. Память выросла в десять раз или в сто, количество ячеек, к которым обращается один токен, остаётся тем же. Именно это позволяет авторам говорить о росте памяти без роста стоимости доступа.
Произвольная разреженность: чем отличается от фиксированной
Spotlight называют произвольно разреженным. Формулировка из блога: «Spotlight is arbitrarily sparse, touching the same number of cells regardless of how the memory grows. The fraction of memory it uses can shrink as far as we want». Доля используемой памяти может уменьшаться сколь угодно сильно, а число затрагиваемых ячеек не растёт. Источник этой формулировки: публикация об архитектуре Spotlight.
Другие разреженные архитектуры так не умеют. Они фиксируют долю используемой ёмкости на каждом шаге. Spotlight снимает это ограничение, и в этом его главное техническое отличие от предшественников.
Оговорка важная: как именно устроено обучение индексации ячеек, авторы не раскрывают. В блоге нет описания алгоритма, поэтому судить о том, насколько схема устойчива и как ведёт себя на масштабе, по доступным материалам нельзя.
Spotlight против attention и mixture-of-experts: ключевые отличия
Почему attention ограничивает рост памяти
Attention вычисляет веса для пар токенов. Чем длиннее последовательность, тем больше пар, и затраты растут квадратично. Хранение истории тоже упирается в контекстное окно и KV-кэш, который занимает VRAM. Как это устроено и почему влияет на выбор модели для локального запуска, подробно разобрано в материале про архитектуру LLM, контекстное окно и KV-cache.
Spotlight заменяет attention на записываемую память, а не дополняет его. Вместо попарного сопоставления токенов модель обращается к конкретным ячейкам памяти.
MoE: фиксированная разреженность и её пределы
Mixture-of-experts устроен иначе. Модель всегда активирует одинаковое число экспертов из фиксированного набора. Доля активных параметров зафиксирована: если выбрано два эксперта из восьми, эта пропорция не меняется при росте общего числа экспертов. Что реально ускоряет MoE-инференс на потребительской карте, показывает эксперимент по ускорению MoE-инференса в llama.cpp.
| Подход | Что делает | Стоимость доступа при росте памяти | Доля активной ёмкости |
|---|---|---|---|
| Attention | Сопоставляет все пары токенов | Растёт квадратично с длиной контекста | Используется весь доступный контекст |
| Mixture-of-experts | Активирует фиксированное число экспертов | Зависит от числа активируемых экспертов | Фиксирована |
| Spotlight | Обращается к отдельным ячейкам памяти | Не растёт (по заявлению авторов) | Может уменьшаться сколь угодно сильно |
Из таблицы видно, где проходит граница. В MoE доля активных параметров фиксирована. В Spotlight число затрагиваемых ячеек не зависит от объёма памяти, а используемая доля может уменьшаться сколь угодно сильно. Утверждать, что Spotlight лучше, оснований нет: сравнивать пока нечего, бенчмарков и воспроизводимых тестов не публиковалось.
Практические сценарии: где Spotlight может пригодиться
Всё ниже это гипотетические сценарии, построенные на заявлениях Percepta, а не на результатах тестов.
Агенты с долговременной памятью
Агенты могли бы записывать новые навыки и факты в память и использовать их без переобучения. Пример: агент осваивает новый API, сохраняет процедуру его вызова в память и дальше применяет её, не требуя дообучения модели. Такой подход затрагивает задачи, для которых сегодня применяют RAG или fine-tuning. RAG подмешивает релевантные фрагменты в контекст, а Spotlight по замыслу авторов хранит знание внутри модели и достаёт нужное напрямую.
Локальные LLM и оборудование
Если память растёт без роста вычислительной сложности, меняется картина требований к железу. Сегодня база знаний локальной модели ограничена размером весов и объёмом VRAM, который они занимают. Архитектура с вынесенной памятью теоретически позволяет наращивать знания без покупки новой карты. Конкретных данных о требованиях к оборудованию, о совместимости с движками вроде llama.cpp или vLLM у Percepta нет. Строить планы на апгрейд под Spotlight рано.
Ограничения и открытые вопросы
Отсутствие независимых подтверждений
Все сведения об архитектуре взяты из описания Percepta и обсуждения в сообществе. Сторонних исследований, рецензий или независимых тестов нет. Утверждения про первую архитектуру с бесконечно растущей памятью и отсутствие роста стоимости доступа остаются заявлениями авторов, а не подтверждёнными фактами. Само по себе это не значит, что архитектура не работает, но требует осторожности в выводах. Точка отсчёта по этим утверждениям: публикация и обсуждение Spotlight.
Нерешённые технические вопросы
- Как именно обучается индексация ячеек памяти?
- Как обеспечивается согласованность записей, если модель перезаписывает ячейки по ходу генерации?
- Где физически хранится память на практике: в VRAM, в RAM или на диске?
- Какие накладные расходы даёт запись в память на каждом токене?
- Что происходит с качеством, если одна и та же ячейка перезаписывается многократно?
Ответов на эти вопросы в материалах нет. Эмпирических результатов, бенчмарков и сравнений с другими архитектурами тоже. Без воспроизводимых тестов оценить реальную эффективность невозможно.
Что это значит для будущего LLM
Если заявления Percepta подтвердятся, меняется логика масштабирования. Сегодня рост возможностей модели требует роста числа параметров и объёма вычислений при обучении. Архитектура, где знания и навыки живут в отдельной памяти, а веса остаются неизменными, предлагает другой путь: наращивать память, не переобучая модель. Для агентов это означало бы накопление опыта без дообучения, для локальных систем - снижение зависимости от объёма VRAM.
Даже рабочая архитектура попадает в готовые модели не мгновенно. От архитектурного прорыва до релиза LLM проходят годы, потому что менять архитектуру уже обучаемой модели нельзя без перезапуска предобучения. Если Spotlight окажется жизнеспособным, его эффект стоит ждать в следующих поколениях моделей, а не в ближайших релизах.
Сейчас Spotlight это концепция с описанием принципов и без публичных тестов. Следить стоит за двумя вещами: появятся ли воспроизводимые бенчмарки и раскроет ли Percepta детали индексации ячеек. До этого архитектуру правильно держать в категории перспективной идеи, а не готового решения, на которое можно переводить продакшен.