Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Пределы сжатия интеллекта: возможен ли ИИ уровня Claude Fable в 20B параметров?

Разбираем физический минимум параметров для сложных рассуждений. Эффективность MoE, дистилляции и квантования. Прогноз на 2035 год и практические рекомендации п

Коротко

Что будет в материале

  1. 01

    Введение: почему 20B - это вызов

  2. 02

    Теоретический минимум: откуда берутся ограничения

  3. 03

    Архитектурные рычаги: как выжать максимум из 20B

  4. 04

    Бенчмарки реальности: что могут 30B–100B сегодня

Введение: почему 20B - это вызов

Прямой ответ: уместить интеллект уровня Claude Fable 5 в 20 миллиардов параметров к 2035 году теоретически возможно, но маловероятно. Текущие данные указывают, что для сложных рассуждений, агентных сценариев и длинной кодогенерации потребуется модель размером не менее 30-100B параметров даже с учётом архитектурных улучшений.

Модели класса 7B-13B уже упираются в потолок качества на задачах multi-hop reasoning и агентного поведения. Компромиссный диапазон 30B-100B позволяет запускать инференс на 1-4 GPU и получать качество, сопоставимое с проприетарными API. Llama 3.1-70B набирает 86.0 MMLU и 81.7 HumanEval, Mistral Large - 89.2 MMLU. Это ориентиры, от которых мы отталкиваемся.

Разрыв между 20B и целевым уровнем интеллекта colossal. Claude Opus 5 превосходит Opus 4.8 на всех 14 бенчмарках Anthropic, с наибольшим отрывом в агентном кодинге и решении новых задач. На ARC-AGI-3 Opus 4.8 набирает 1.5%, Opus 5 - 30.2%. Скачок такого размера указывает на появление новой способности, а не на инкрементальное улучшение. Сжать этот уровень интеллекта до 20B - задача на порядок сложнее, чем кажется.

В этой статье мы разберём физические ограничения, архитектурные рычаги сжатия и дадим прогноз до 2035 года. Без спекуляций, с опорой на цифры и бенчмарки.

Теоретический минимум: откуда берутся ограничения

Интеллект модели - это способность представлять и обрабатывать сложные паттерны. Каждый параметр хранит ограниченный объём информации. Когда мы требуем от модели multi-hop reasoning, агентного поведения и генерации кода на сотни строк, мы просим её удерживать и манипулировать огромным количеством признаков одновременно. Малые модели просто не имеют достаточной «ширины» представления.

Информационная ёмкость весов и разреженность признаков

Плотные модели неэффективны по своей природе. Большинство параметров в любой момент времени неактивны или кодируют избыточную информацию. Исследования в области monosemanticity показывают: один параметр в плотной модели может кодировать доли бита полезной информации. Грубая оценка: для хранения N независимых концептов требуется модель с количеством параметров, на порядок превышающим N.

Модели 7B-13B упираются в потолок качества на сложных задачах именно по этой причине. Им не хватает ёмкости для одновременного представления всех релевантных признаков. Результат - галлюцинации, потеря контекста, неспособность удержать цепочку рассуждений длиннее 3-4 шагов.

Уроки Scaling Monosemanticity для малых моделей

Статья Scaling Monosemanticity показала: с ростом модели количество интерпретируемых моносемантических признаков растёт быстрее, чем количество параметров. Крупные модели учатся более эффективному использованию каждого параметра за счёт разреженного кодирования. Парадокс в том, что для достижения этой эффективности сначала нужно иметь избыток параметров.

Для 20B модели это означает двойной удар. Малое количество параметров ограничивает общее число признаков. Отсутствие избыточности мешает формированию разреженных, эффективных представлений. Результат - модель, которая «знает» меньше и использует то, что знает, менее эффективно.

Архитектурные рычаги: как выжать максимум из 20B

Три основных подхода позволяют частично обойти ограничения размера: Mixture of Experts, дистилляция и квантование. Каждый решает свою часть проблемы, но ни один не отменяет фундаментальных ограничений.

Mixture of Experts: интеллект за счёт условных вычислений

MoE-архитектура разделяет модель на множество экспертов, активируя лишь часть из них для каждого токена. Это позволяет иметь большое общее число параметров при малых вычислительных затратах. Хорошо квантизованная MoE-модель на 120B параметров может быть в пять раз дешевле плотной модели на 27B при пересчёте на миллион токенов.

Ключевая метрика стоимости - объём данных, считываемых из памяти на каждый токен, а не общее количество параметров. MoE радикально снижает эту метрику, загружая только активных экспертов. Практический пример: Laguna S 2.1 (118B MoE) при квантизации IQ4_XS показала стоимость $0.002 за 1M токенов, что в 5 раз дешевле плотной Qwen3.6-27B ($0.010 за 1M токенов).

Потенциальная модель Qwen 3.x-35B-a3B с 35B общих и 3B активных параметров может стать поворотным моментом. Если она покажет качество, близкое к плотным 30B+ моделям, это докажет, что MoE способен радикально сжать эффективный размер модели.

Дистилляция и квантование: сжатие без потери смысла

Дистилляция переносит знания большой модели-учителя в меньшую модель-ученика. Это не магия - ученик учится имитировать выходные распределения учителя, а не воспроизводить все промежуточные вычисления. Результат: модель может показывать высокое качество на задачах, близких к обучающему распределению, но деградирует на задачах, требующих оригинального рассуждения.

Квантование снижает точность весов с FP16 до INT8 или даже INT4. IQ4_XS и подобные схемы позволяют уменьшить размер модели в 3-4 раза с минимальной потерей качества. Для MoE-моделей эффект ещё сильнее, так как квантуются все эксперты, а не только активные.

Подробный разбор ограничений малых моделей и влияния VRAM на качество инференса мы делали в статье о пределах возможностей моделей до 48GB VRAM.

Бенчмарки реальности: что могут 30B–100B сегодня

Чтобы оценить, насколько 20B далеки от целевого уровня, посмотрим на текущих лидеров.

Claude Opus 5 как верхняя планка качества

Opus 5 лидирует на всех 14 бенчмарках Anthropic. Наибольший отрыв - в агентном кодинге, computer use и решении новых задач. На ARC-AGI-3 скачок с 1.5% до 30.2% указывает на качественный сдвиг: модель не просто улучшилась, а приобрела новую способность к абстрактному рассуждению.

В задачах due diligence партнёр Anthropic сообщил о 17% улучшении при использовании Opus 5 по сравнению с Opus 4.8. Это не инкрементальный прирост, а шаг на следующую ступень интеллекта. Сжать этот уровень до 20B - значит уместить способности модели, которая, вероятно, имеет сотни миллиардов параметров, в размер, меньший на порядок.

Открытые модели: Llama 3.1, Mistral Large и другие

Текущий ландшафт открытых моделей даёт чёткие ориентиры:

МодельMMLUHumanEvalПримерные требования к VRAM
Llama 3.1-70B86.081.735-40 GB (INT4)
Mistral Large89.240+ GB (INT4)
Qwen 3.x-35B-a3B (ожидания)~80+~75+16-20 GB (INT4)

Диапазон 30B-100B - текущий компромисс, позволяющий запускать инференс на 1-4 GPU и получать качество, сопоставимое с проприетарными API. Модели меньше 30B пока не демонстрируют стабильного качества в агентных сценариях и сложном кодинге.

Исключения подтверждают правило. Nanbeige 4.2-3B с архитектурой Looped Transformer обходит Qwen3.5-9B и Gemma4-12B в агентных тестах SWE-Bench при всего 3B параметрах. Но это узкая специализация, а не общий интеллект уровня Fable.

Прогноз до 2035: успеет ли индустрия сжать интеллект до 20B

Девять лет - достаточный срок для нескольких архитектурных прорывов. Но фундаментальные ограничения никуда не денутся.

Факторы, работающие на сжатие

Улучшенные MoE-архитектуры с динамической маршрутизацией продолжат снижать количество активных параметров на токен. Уже сейчас модели с 2B активных параметров, такие как LFM2 и Mellum 2, заполняют разрыв между 1B и 3B+ и оптимальны для устаревших GPU - подробный обзор мы делали в статье о MoE-моделях с 2B активных параметров.

Динамическое квантование, подбирающее точность под каждый слой и тип операции, даст ещё 20-30% сжатия без потери качества. Синтетические данные и co-training с инструментами позволят модели учиться более эффективным представлениям. Kimi K3 уже используется в кибербезопасности для задач суждения, включая оценку достижимости, влияния и приоритизацию - это пример узкой, но глубокой компетенции, достижимой в меньшем размере.

Почему 20B может остаться недостижимым

Агентные сценарии требуют от модели одновременного удержания состояния среды, истории действий, плана и контекста задачи. Это экспоненциально сложнее, чем генерация текста. Длинный контекст (128K+ токенов) сам по себе требует значительной ёмкости для хранения и обработки.

Закон масштабирования Чинчиллы никто не отменял: для оптимального обучения модель должна видеть количество токенов, пропорциональное числу параметров. Меньше параметров - меньше данных для обучения - меньше знаний. Можно повысить качество данных, но нельзя обучить модель на порядок эффективнее без архитектурного прорыва, сопоставимого с изобретением трансформера.

Прогноз: к 2035 году модели уровня Claude Fable 5 (2026 года) вероятно сожмутся до 40-60B параметров. Уровень Fable образца 2035 года останется за пределами 20B. Прогресс в эффективности будет съедён ростом требований к интеллекту.

Практические рекомендации: к чему готовиться уже сейчас

Ожидание компактной модели с интеллектом Fable - плохая стратегия. Разумный подход: использовать текущие модели правильного размера под конкретные задачи.

Выбор модели под задачу: компромисс размера, контекста и латентности

Матрица решений по состоянию на середину 2026 года:

  • Чат и базовая генерация текста: 7B-13B плотные модели, 1 GPU с 16GB VRAM.
  • Кодогенерация и рефакторинг: 30B-35B MoE или плотные, 24-32GB VRAM.
  • Агентные сценарии и сложный multi-hop reasoning: 70B+, 2-4 GPU или API.
  • Локальный инференс с максимальным качеством: 70B-120B MoE с квантованием, Mac Studio M3 Ultra или эквивалент с 64GB+ унифицированной памяти.

Для тех, кто ищет оптимальный стек AI-разработки в 2026 году, мы подготовили полный анализ с цифрами, таблицами и расчётом окупаемости.

Инструменты для эффективного инференса

vLLM с поддержкой PagedAttention и continuous batching снижает требования к VRAM на 20-30% по сравнению с наивным инференсом. Квантование через llama.cpp с IQ4_XS позволяет запускать 70B модели на 40GB VRAM с приемлемым качеством.

Agenta - open-source альтернатива Claude Cowork с поддержкой self-hosted моделей и сменных обвязок. Позволяет развернуть агентный фреймворк на собственной инфраструктуре, не полагаясь на закрытые API. Это практический путь к автономности уже сегодня, без ожидания гипотетической 20B модели 2035 года.

Заключение: ставка на эффективность

20B параметров для уровня Claude Fable к 2035 году - маловероятный сценарий. Фундаментальные ограничения информационной ёмкости весов, требований к контексту и сложности агентных задач создают нижнюю планку, которая сегодня находится в диапазоне 30-100B. Архитектурные улучшения сдвинут эту планку вниз, но параллельно вырастут и требования к интеллекту.

Практический вывод: не ждите чуда сжатия. Используйте MoE-модели правильного размера под конкретные задачи, внедряйте квантование и self-hosted инструменты вроде Agenta. Следите за бенчмарками новых моделей на нашем сайте - мы продолжаем тестировать каждую значимую модель и публиковать результаты с цифрами, конфигами и практическими выводами.

Подписаться на канал