Краткие результаты: что показал тест Bonsai-27B
Ternary-Bonsai-27B с 2-битным квантованием набрал 7.9% в Terminal-Bench 2.0. Это тест для агентных задач, где модель должна выполнять последовательные действия в терминале. Для сравнения: Qwen3.5-9B с умеренным квантованием показал 9.2%, а Qwen3.6-35B-A3B - 24.3%. 27-миллиардная модель проиграла 9-миллиардной.
1-битная версия Bonsai-27B оказалась полностью непригодной. Модель сгенерировала более 14 тысяч токенов без единого стоп-токена и вошла в самовалидационные циклы - повторяла одни и те же команды, проверяла собственный вывод и не могла завершить задачу. Экстремальное квантование разрушило способность модели к финишированию.
Прямой вывод: для агентных сценариев 1-2 битное квантование Bonsai-27B не работает. Модель запускается в 8GB VRAM, но практическая польза стремится к нулю.
Зачем тестировать 27B модель на 8GB VRAM?
Рынок потребительских видеокарт застрял на объёмах 8-12GB VRAM. RTX 4060 Ti с 8GB, RTX 3070, RX 6700 XT - это массовый парк, на котором работают разработчики. Большие модели в 20-70 миллиардов параметров требуют 16-48GB VRAM в FP16, что отсекает их от большинства пользователей.
Квантование обещает решить эту проблему. Сжатие весов до 4 бит, 2 бит и даже 1 бита теоретически позволяет уместить 27B модель в 8GB. Prism-ML выпустила семейство Bonsai-27B именно с этим позиционированием - экстремально сжатые версии для ограниченного железа. В нашем сравнительном анализе GGUF-квантизаций Bonsai-27B мы разбирали архитектуру и заявленные характеристики.
Цель этого теста - проверить, сохраняется ли практическая польза при экстремальном сжатии. Запустить модель в 8GB VRAM можно, вопрос в том, способна ли она решать реальные задачи.
Методология: Terminal-Bench 2.0 и условия теста
Terminal-Bench 2.0 - бенчмарк для оценки агентных способностей языковых моделей. Модель получает текстовое описание задачи и должна выполнить её через последовательность команд в эмулированном терминале. Задачи включают навигацию по файловой системе, редактирование файлов, поиск информации, работу с git, запуск скриптов и отладку.
В отличие от бенчмарков генерации текста, Terminal-Bench проверяет способность модели планировать действия, удерживать контекст и корректировать ошибки. Модель не просто генерирует ответ, а взаимодействует со средой. Одна ошибка на раннем шаге каскадно разрушает всю цепочку действий.
Конфигурация теста:
- Видеокарта: 8GB VRAM
- Загрузчик: llama.cpp с поддержкой кастомных квантизаций Prism-ML
- Модели: Ternary-Bonsai-27B (2-bit) и Bonsai-27B (1-bit)
- Бенчмарк: Terminal-Bench 2.0, полный набор задач
- Сравнительные модели: Qwen3.5-9B (Q4_K_M), Qwen3.6-35B-A3B (Q4_K_M)
Выбор Terminal-Bench 2.0 обоснован: агентные задачи - самый жёсткий тест для квантованных моделей. Если модель проваливает их, для простой генерации текста она может быть приемлема, но для автоматизации и агентов - нет.
Ternary-Bonsai-27B (2-bit): 7.9% - провал или ожидаемо?
7.9% в Terminal-Bench 2.0 - это уровень случайного угадывания с небольшим смещением. Модель выполняет элементарные операции: открыть файл, прочитать директорию. Всё, что требует последовательности из трёх и более шагов, вызывает ошибку. Модель теряет контекст, повторяет уже выполненные команды или генерирует синтаксически неверные инструкции.
Причина - деградация весов при 2-битном квантовании. 27 миллиардов параметров, сжатых до двух бит на вес, теряют способность различать тонкие паттерны. Модель «помнит» общую структуру языка, но не способна удерживать логические цепочки длиннее двух-трёх шагов. Для сравнения: 4-битное квантование Qwen3.5-9B сохраняет когерентность на десятках шагов.
Сравнение с Qwen3.5-9B: когда размер не главное
Qwen3.5-9B с 4-битным квантованием набрал 9.2% против 7.9% у Ternary-Bonsai-27B. Разрыв в 1.3 процентных пункта при трёхкратной разнице в числе параметров - это приговор экстремальному квантованию для агентных задач.
Механизм прост: 9B модель с 4-битным квантованием имеет эффективный объём информации около 4.5GB весов. 27B модель с 2-битным квантованием - около 6.75GB. Разница в полтора раза, но архитектурные потери от двукратного снижения битности перекрывают выигрыш от числа параметров. 9B модель точнее восстанавливает зависимости между токенами, лучше удерживает контекст и реже срывается в бессвязную генерацию.
Практический ориентир: если бюджет 8GB VRAM, модель с умеренным квантованием (4-bit) и меньшим числом параметров предпочтительнее большой модели с экстремальным сжатием. Наше сравнение GGUF и DS4 Flash при 2-битном квантовании подтверждает этот вывод на других архитектурах.
Ориентир: Qwen3.6-35B-A3B и 24.3%
Qwen3.6-35B-A3B использует архитектуру Mixture of Experts: 35 миллиардов полных параметров, но только 3 миллиарда активны на каждом токене. С 4-битным квантованием модель занимает около 18GB в FP16-эквиваленте, но эффективно использует лишь малую часть весов для каждого предсказания. Результат 24.3% в Terminal-Bench 2.0 - это верхняя планка для моделей, доступных на потребительском железе.
Разрыв между 24.3% и 7.9% - это разрыв между моделью, способной решать многошаговые задачи, и моделью, которая с трудом выполняет элементарные операции. MoE-архитектура с умеренным квантованием сохраняет когерентность, потому что активные эксперты работают с полной точностью, а сжатие применяется к неактивным весам. Bonsai-27B сжимает все веса одинаково, разрушая и активные, и неактивные пути.
Похожий паттерн мы наблюдали в тестировании Qwen3.5 122B против Qwen3 Next 80B на CPU: модель с большим числом параметров, но низким квантованием давала качественно лучшие ответы за счёт MoE-архитектуры. Bonsai-27B лишён этого преимущества - экстремальное сжатие нивелирует любые архитектурные выигрыши.
Bonsai-27B (1-bit): бесконечная генерация и самовалидационные циклы
1-битная версия Bonsai-27B показала критический баг: модель не способна завершить генерацию. В тесте она выдала более 14 тысяч токенов без единого стоп-токена. Генерация прервалась только по лимиту, заданному в конфигурации инференса.
Поведение модели в логах: она входила в самовалидационные циклы. Генерировала команду, затем проверяла её вывод, затем перепроверяла проверку, затем начинала новый цикл валидации. Типичный паттерн:
ls -la /home/user
Результат: file1.txt file2.txt
Проверим, что file1.txt существует: ls -la /home/user/file1.txt
Результат: file1.txt
Убедимся, что это правильный файл: cat /home/user/file1.txt
Результат: содержимое файла
Валидируем содержимое: ...
Этот цикл повторялся бесконечно. Модель утратила способность оценивать достаточность информации для перехода к следующему шагу. При 1-битном квантовании каждый вес принимает значение -1 или +1. Градиент между «достаточно информации» и «нужно проверить ещё» исчезает - модель всегда склоняется к дополнительной проверке, потому что не может количественно оценить уверенность.
Вывод однозначный: 1-битная версия Bonsai-27B непригодна для любых задач, требующих завершения генерации. Даже для простого продолжения текста модель будет уходить в бесконечные циклы самоповторов.
Практические выводы: когда экстремальное квантование оправдано?
Экстремальное квантование 1-2 бита не работает для агентных задач. Это подтверждено цифрами: 7.9% у 2-битной версии и полная неработоспособность 1-битной. Модели с 4-битным квантованием и меньшим числом параметров стабильно обходят экстремально сжатые аналоги.
Есть гипотетические сценарии, где 2-битное квантование может быть оправдано: простая генерация текста без многошагового планирования, классификация, извлечение сущностей. Но тесты Terminal-Bench этого не подтвердили - даже базовые операции модель выполняла с ошибками.
Техника KVarN для квантизации KV-кэша, описанная в руководстве по запуску Bonsai-Ternary-27B на 120K токенов, частично решает проблему памяти, но не проблему качества. Сжатие KV-кэша до 4 бит с преобразованием Уолша-Адамара сохраняет контекст лучше, чем сжатие весов до 2 бит. Но базовая модель остаётся экстремально квантованной, и выигрыш от оптимизации кэша не компенсирует потерю качества весов.
Альтернативы для 8GB VRAM: на что обратить внимание
Практические варианты для 8GB VRAM с подтверждённой работоспособностью:
- Qwen3.5-9B с 4-битным квантованием (Q4_K_M). Занимает около 5.5GB VRAM, набирает 9.2% в Terminal-Bench 2.0. Достаточно для базовых агентных сценариев: навигация по файлам, простые скрипты, работа с git.
- Qwen3.6-35B-A3B с 4-битным квантованием. Требует 18GB VRAM в полной загрузке, но с offloading на CPU умещается в 8GB VRAM + 32GB RAM. Скорость падает, но качество остаётся на уровне 24.3%. Тесты Strix Halo с Ryzen AI Max+ 395 показывают 14.2 токен/с на этой модели под нагрузкой.
- Модели с архитектурой MoE и умеренным квантованием. Активные эксперты работают с полной точностью, сжатие применяется только к неактивным весам. Это сохраняет когерентность при снижении потребления памяти.
Ключевой принцип: не гонитесь за числом параметров, если бюджет битности ниже 4. Модель с 9B параметров и 4-битным квантованием надёжнее, чем 27B с 2-битным. Экстремальное сжатие разрушает способность к последовательному мышлению - именно то, что нужно агентам.