Что такое mini-AGI и почему о нём заговорили
mini-AGI - экспериментальный трансформер, который один разработчик обучает на ноутбуке. В проекте соединены несколько идей: зацикленная архитектура с динамической рекуррентной глубиной до 24 циклов на каждый токен, постоянное самообучение на новом материале, Mixture of Experts с 8 активными и 32 маршрутизируемыми экспертами в VRAM плюс умное кэширование ещё 96, динамическое создание новых экспертов с эволюционным отбором и хранение весов на SSD с подкачкой по требованию. Токенизатор отсутствует: модель читает сырые байты напрямую. Анонс с полным перечнем особенностей опубликован в сабреддите r/LocalLLaMA.
Готовой модели на 22 сентября 2026 года нет. Автор обещает выложить веса примерно через две недели, когда прогресс обучения дойдёт до уровня около GPT-2, и сразу оговаривает: оценка приблизительная, тренд держался с 15-кратным ростом, но в какой-то момент может измениться. Независимых тестов, замеров и опубликованного кода на момент анонса не существует, поэтому всё описанное ниже - заявленная архитектура, а не проверенный результат.
Разбираться в проекте стоит по одной причине: он показывает, как энтузиасты пытаются обойти два главных ограничения локального запуска - нехватку VRAM и стоимость полного переобучения. Переиспользование одних и тех же весов в цикле снижает требования к объёму параметров, рост структуры под данные заменяет фиксированную архитектуру, а подкачка с диска освобождает быструю память.
Кто стоит за проектом и на каком этапе разработка
Имя автора в анонсе не раскрыто, известна только платформа: обучение идёт на ноутбуке. Это важная деталь для оценки заявлений, потому что архитектура с рекуррентной глубиной, четырьмя десятками экспертов в VRAM и подкачкой с SSD обычно ассоциируется с серверным железом, а не с портативной машиной.
Стадия проекта ранняя. Прогресс обучения автор сравнивает с уровнем GPT-2, при котором обещает открыть веса. Публичных чекпоинтов, бенчмарков вроде HellaSwag или ARC и репозитория с кодом пока нет.
Доверять анонсу до появления весов не стоит по простой причине: проверить нечего. Сроки автор честно называет грубой оценкой траектории, и это единственная часть заявления, которую он сам ограничивает.
Чем mini-AGI отличается от обычного трансформера
- Зацикливание с динамической рекуррентной глубиной до 24 циклов на каждый токен.
- Mixture of Experts с эволюционным ростом: 8 активных и 32 маршрутизируемых эксперта в VRAM, кэш ещё на 96, создание новых экспертов и отсечение неиспользуемых.
- Постоянное самообучение на новом материале вместо замороженных весов.
- Хранение весов на SSD с подкачкой по требованию.
- Отказ от токенизатора: вход - сырые байты.
По отдельности каждый приём известен: зацикленные трансформеры, MoE, byte-level модели и непрерывное обучение исследуют давно. Интерес вызывает попытка собрать всё это в одной модели, которая помещается на ноутбук.
Зацикленный трансформер: как работает рекуррентная глубина до 24 циклов
В обычном трансформере токен проходит через фиксированный набор слоёв ровно один раз. В зацикленном варианте выход блока снова подаётся на его вход, и число таких проходов переменно: в mini-AGI заявлено до 24 циклов на каждый токен.
Чем это отличается от обычной глубины сети
Разница в весах. Сеть с 24 слоями хранит 24 разных набора параметров. Зацикленная модель применяет один набор до 24 раз. Если блок весит N параметров, то 24 цикла не превращаются в 24N: те же N переиспользуются.
Практический итог такой схемы: памяти под параметры нужно меньше, а вычислений на каждый токен больше. Для ноутбука это разумный обмен, посколькуVRAM обычно упирается в объём, а не в скорость.
Как именно выбирается число циклов для конкретного токена, есть ли механизм ранней остановки и как это сказывается на времени генерации, в анонсе не указано.
Зачем модели «думать» дольше над отдельными токенами
Токены различаются по сложности. Обычное слово в предложении предсказать проще, чем результат арифметической операции, редкое имя или фрагмент кода. Фиксированная глубина тратит одинаковый бюджет вычислений на всё подряд.
Динамическая рекуррентная глубина позволяет распределять вычисления неравномерно: простые токены проходят меньше циклов, сложные - больше. Идея сближает такие модели с системами, которые тратят дополнительные вычисления на этапе рассуждения, а не на этапе роста числа параметров.
Ждать подтверждённого прироста качества от этого механизма в mini-AGI пока нельзя: замеров нет, а подробности выбора глубины автор не публиковал.
Mixture of Experts и эволюционный рост: как модель увеличивает число параметров
MoE заменяет один большой блок набором специализированных. Маршрутизатор решает, каких экспертов включить для конкретного токена. В mini-AGI заявлена схема: 8 активных экспертов, 32 маршрутизируемых, все они находятся в VRAM, плюс умное кэширование ещё 96 экспертов.
Сколько экспертов и как они помещаются в VRAM
Ключ к пониманию в том, что одновременно нужны не все эксперты. Активными в каждый момент оказываются 8, маршрутизируемые 32 доступны для выбора, остальные 96 лежат в кэше и подгружаются, когда маршрутизатор к ним обратится. Такой подход экономит быструю память за счёт обращений к более медленному носителю.
Конкретная механика кэширования, объёмы занимаемой памяти и требования к железу в анонсе не раскрыты. Сравнивать эти цифры с другими MoE-моделями без таких данных нельзя.
Тренировать MoE-модели на одной потребительской карте уже пробуют другие авторы: в разборе tiny MoE на 3.7B параметров с нуля на одной RTX 4090 показано, что итог определяют память, данные и проверка качества, а не только архитектура.
Как эволюционный отбор отсекает неиспользуемых экспертов
Схема описана так: модель генерирует новых экспертов и увеличивает число параметров, когда это нужно, затем проверяет свежих экспертов и отсекает те, что не работают. По логике это ближе к биологической эволюции, чем к обычному обучению: в модели остаются структуры, доказавшие полезность.
Аналогия простая. Команда нанимает специалистов под появляющиеся задачи и расстаётся с теми, чей вклад не подтверждается. Замысел в том, чтобы архитектура росла вместе с данными, а не оставалась фиксированной с первого дня.
Критерии отсечения, метрика полезности эксперта и то, куда деваются отброшенные веса, автор не раскрыл. Эффективность механизма независимо не подтверждена.
Обучение на лету и борьба с катастрофическим забыванием
mini-AGI описывают как модель с самоподконтрольным обучением, которая постоянно доучивается на новом материале. Это отличает её от классических чекпоинтов: знания не замораживаются в момент публикации весов.
Почему катастрофическое забывание - главная проблема непрерывного обучения
При обычном дообучении веса сдвигаются под новую задачу. Если данных о старой задаче в батче нет, сеть переписывает представления под свежий сигнал и теряет прежние навыки. Чем дольше идёт непрерывное обучение, тем выше риск: модель, натасканная на сегодняшние новости, может разучиться базовой арифметике.
Проблема известна как катастрофическое забывание. Она объясняет, почему большинство команд предпочитают переобучать модель целиком или добавлять адаптеры вместо постоянной подстройки всех весов.
Раздельные скорости обучения: медленный ствол и быстрые эксперты
В mini-AGI применяют разделение: «медленный» ствол обновляется с низкой скоростью обучения, а «быстрые» эксперты меняются гораздо активнее. Общие представления остаются стабильными, новая информация оседает в экспертах.
Приём не нов, но в сочетании с эволюционным ростом и отсечением экспертов он выглядит целостно: ствол хранит базу, эксперты принимают свежие данные, а неиспользуемые специализации уходят.
Конкретные значения скоростей обучения, расписание их изменения и то, как разделение проверяли на практике, в анонсе не указаны. Утверждать, что проблема забывания решена, оснований нет.
Хранение весов на SSD и подкачка по требованию: как это умещается на ноутбуке
Веса модели хранятся на SSD и подкачиваются по требованию. Вместе с кэшированием экспертов это снижает требования к VRAM: в быстрой памяти держат только то, что нужно сейчас.
Что это даёт и какие создаёт ограничения
Плюс очевиден: модель с большим числом экспертов может запускаться там, где целиком в память она не влезает. Минус тоже на месте: подкачка стоит времени. Если нужный блок ещё не в VRAM, его сначала нужно прочитать с диска, и это медленнее обращения к памяти. Скорость генерации становится менее предсказуемой и зависит от того, попадает ли следующий токен в уже загруженные эксперты.
Оценить реальную производительность до выхода весов невозможно. Тип SSD, объём занятого дискового пространства, минимальные требования к системе и замеры токенов в секунду в анонсе не приводятся.
Отсутствие токенизатора: модель читает сырые байты
Обычно текст разбивают на токены, то есть части слов, и модель работает с их числовыми идентификаторами. В mini-AGI токенизатора нет: вход - последовательность сырых байтов.
Плюсы и минусы байтового подхода
Плюсы: исчезает проблема неизвестных токенов, одинаково обрабатываются редкие слова, эмодзи, программный код и языки, для которых токенизатор обучен плохо. На этапе разбиения ничего не теряется.
Минус в длине. Байтов на текст приходится больше, чем токенов. Слово «привет» в UTF-8 занимает 12 байт, тогда как токенизатор средней модели разбил бы его на один-два токена. Последовательность растёт, а вместе с ней и вычислительная нагрузка, что особенно чувствительно для зацикленной архитектуры с 24 циклами.
Байтовые модели существуют давно, так что новизна здесь не в самой идее, а в сочетании с остальной частью архитектуры. Как mini-AGI справляется с удлинением последовательностей, автор не объяснил.
Когда выйдут веса и насколько реалистичны сроки
Обещание простое: веса появятся примерно через две недели, когда прогресс обучения дойдёт до уровня около GPT-2. Здесь же автор делает оговорку: тренд держался с 15-кратным ростом, но может измениться, поэтому названный срок - грубая оценка траектории, а не дата релиза. Об этом сказано в самой публикации анонса.
Что значит «уровень GPT-2» и почему это не фронтир
GPT-2 вышла в 2019 году и содержала около 1,5 млрд параметров. Для своего времени это был заметный шаг вперёд, сегодня её способности скромные: связное продолжение текста, простые ответы, слабая арифметика и логика.
Уровень GPT-2 в анонсе mini-AGI - это планка, при которой модель начинает связно генерировать текст, а не заявка на конкуренцию с современными LLM. Рассчитывать на агентные сценарии или надёжную работу с кодом не стоит.
Что делать, пока весов нет
Вариантов три. Первый: следить за веткой проекта и ждать публикации весов, помня про оговорку о сроках. Второй: разобраться в составляющих, чтобы позже оценить архитектуру по существу, - зацикленные трансформеры, MoE, byte-level подходы и непрерывное обучение описаны в открытых публикациях. Третий: взять уже доступные локальные модели под свои задачи, если рабочий инструмент нужен сейчас.
Проверять качество всё равно придётся самому: без бенчмарков единственный способ оценить модель - прогнать на ней свои задачи после релиза.
Практическая ценность и ограничения mini-AGI: кому это интересно
mini-AGI - исследовательский эксперимент, а не инструмент для продакшена. Полезен он тем, что показывает рабочую комбинацию приёмов для экономии памяти и непрерывного дообучения, а такие приёмы рано или поздно перетекают в прикладные модели.
Кому стоит следить за проектом
- Разработчикам, которые изучают архитектуры моделей и хотят увидеть, как ведёт себя зацикливание в сочетании с MoE.
- Владельцам домашних серверов и мощных ПК: подкачка весов с SSD и кэширование экспертов напрямую касаются экономии VRAM.
- Тем, кто тренирует небольшие модели на одной карте: схема роста и отсечения экспертов пригодится в собственных экспериментах.
- Читателям, которым интересно, куда движется локальный AI, а не только какие модели скачать сегодня.
Смежные архитектурные эксперименты описаны детальнее, чем mini-AGI: в разборе AttnRes с заменой residual stream на attention-based routing в Gemma 4 31B видно, сколько вопросов приходится решать, когда меняешь базовый блок трансформера, и какие ограничения это создаёт.
Главные риски и что остаётся за кадром
Главный риск - отсутствие проверки. Все характеристики взяты из анонса автора, а независимых замеров, весов и кода нет. Источник всех приведённых цифр - публикация в r/LocalLLaMA, других подтверждений у этих заявлений не существует.
Второй момент - нераскрытые детали: скорости обучения ствола и экспертов, механика подкачки весов, объёмы кэша, критерии отсечения экспертов и способ выбора числа циклов на токен. Без них оценить работоспособность архитектуры нельзя.
Третий риск практический. У экспериментов с постоянно обучающимися моделями стоимость растёт не только по железу: как показано в разборе технического долга в эпоху AI, выигрывают не самые быстрые генераторы, а системы с понятной архитектурой и проверяемым качеством. mini-AGI пока не даёт ни того, ни другого.
Что делать дальше: дождаться весов, прогнать на своих задачах и сравнить результат с текущей локальной моделью. Заметная разница будет означать, что за направлением стоит следить внимательно. Если разницы не окажется, идеи с переиспользованием весов и подкачкой с диска всё равно останутся в копилке приёмов для экономии памяти.