Перейти к содержанию
Публикация AiManual

Ternary Bonsai 2 27B против Gemma 4 12B и Qwen 3.5 9B: тест сильноквантованной модели на RTX 5090

Ternary Bonsai 2 27B весом 7,2 ГБ сгенерировала 106 396 токенов за 17,5 минуты и обошла Qwen 3.5 9B и Gemma 4 12B на одной RTX 5090. Разбираем цифры, флаги запу

Коротко

Что будет в материале

  1. 01

    Что такое Ternary Bonsai 2 27B и почему вокруг неё шум

  2. 02

    Как проходил тест: железо, рантайм и настройки

  3. 03

    Результаты: цифры, скорость и качество трёх моделей

  4. 04

    Что это значит для владельца RTX 3060 и других GPU

Ternary Bonsai 2 27B - сильно квантованная версия Qwen 3.8 27B от prismml. Вес модели: около 6 ГБ в квантовании Q1 и примерно 8 ГБ в Q2, при заявленном сохранении более 98% качества относительно fp16. Для локального запуска это аномалия: 27B-модель укладывается в 8 ГБ видеопамяти, тогда как та же Qwen 3.8 27B в Q4 занимает 14-16 ГБ.

Пользователь проверил, что из этого работает на практике. Три модели встали на одну RTX 5090 32 ГБ и получили одинаковую задачу: сгенерировать сцену воксельной японской пагоды на three.js в одном HTML-файле. Bonsai 2 27B (PQ2_0, 7,2 ГБ) выдала 106 396 токенов за 17,5 минуты, Qwen 3.5 9B (Q6_K, 7,5 ГБ) - 12 105 токенов за 70 секунд, Gemma 4 12B (Q8_0, 12,7 ГБ) - 9 159 токенов за 95 секунд. Лучший результат и детализацию, по оценке автора, дала Bonsai (отчёт с полными настройками).

Механика сжатия проста по идее и требовательна в реализации. Ternary-квантование сводит веса к трём состояниям: -1, 0 и +1. Обычные GGUF-кванты (Q4_K_M, Q6_K, Q8_0) хранят веса в 4-8 битах, ternary идёт дальше и режет разрядность настолько, что каждое значение занимает доли бита. Вес падает вдвое и больше, но загрузить такой GGUF умеет не каждый рантайм.

Что такое Ternary Bonsai 2 27B и почему вокруг неё шум

Bonsai 2 27B построена на Qwen3.8-27B. Модель рассуждающая: поддерживает кодирование, математику, вызов инструментов и понимание изображений, контекстное окно 262 144 токена (описание модели и API). По умолчанию она работает на высоком уровне усилий для рассуждений, и это напрямую определяет её поведение в тестах.

Шум вокруг модели вызван не архитектурой, а цифрами. Заявленные 98%+ качества при весе 6-8 ГБ означают, что 27B-модель конкурирует по требованиям к памяти с 9B-моделями в квантах среднего размера. На странице модели у одного из российских провайдеров приводится близкая цифра: тройное сжатие уменьшает вес до примерно 8,5 ГБ и сохраняет 98,2% среднего балла базовой модели по 14 тестам на режимы мышления PrismML (карточка провайдера). Обе цифры идут от разработчика.

Чем ternary-квантование отличается от обычных GGUF Q4/Q8

Разница в том, сколько информации остаётся в одном весе. Q8_0 хранит каждое значение в 8 битах, Q6_K - в 6, Q4_K_M - в 4. Ternary переходит к трём значениям, поэтому вес 27B-модели сжимается до 6-8 ГБ. Дальше начинаются компромиссы: чем меньше бит на вес, тем сильнее потери на задачах, где важна точность вычислений и строгая логика кода.

Второе отличие практическое. Обычные GGUF грузит любой свежий llama.cpp. С ternary-GGUF так не работает: в отчёте отдельно указано, что стоковый llama.cpp не загружает GGUF Bonsai, поэтому использовался форк PrismML. Выигрыш в памяти оплачивается привязкой к конкретной сборке рантайма.

Третье: заявленные 98% - утверждение производителя, а не результат независимой проверки. Публичный замер с агрессивным квантованием Bonsai на агентных задачах дал куда более скромные результаты (разбор теста в 8 ГБ VRAM), и это стоит держать в голове, прежде чем ждать от модели уровня fp16.

Кто такой prismml и при чём тут atomic.chat

prismml - разработчик модели и форка llama.cpp. Автор теста прямо указал, что он основатель prismml, и попросил присылать обратную связь. Рамка восприятия меняется: материал стоит читать как тест от разработчика, а не как независимое сравнение. Цифры производительности от этого не портятся, а вот оценка качества требует скепсиса.

atomic.chat упомянут в отчёте как площадка установки. Попробовать модель можно и через OpenAI-совместимые API: страница AllTokens собирает практические параметры интеграции, включая стоимость входа и выхода, рабочий контекст и набор поддерживаемых параметров (карточка модели).

Как проходил тест: железо, рантайм и настройки

Все три модели запускались в одинаковых условиях: одна RTX 5090 32 ГБ, llama-server из форка PrismML llama.cpp, релиз prism-b10683-d8f26ee, сборка CUDA 12.8. Лимит вывода не задавался, на каждую модель пришлось по одному прогону.

Почему понадобился форк PrismML llama.cpp

Стоковый llama.cpp не умеет загружать GGUF Bonsai, поэтому без форка запуск невозможен. Автор теста взял один и тот же бинарник для всех трёх моделей: так разница в результатах объясняется моделью, а не разными сборками рантайма. Если у вас уже настроен стоковый llama.cpp, Bonsai потребует отдельной сборки форка или отдельного бинарника рядом.

Как llama.cpp ведёт себя на фоне альтернативных движков на других моделях, разбирали отдельно: в сравнении с TensorSharp на Gemma 4 и Qwen 3.6 разница на префилле доходит до 27,9% (замеры decode, prefill и TTFT).

Одинаковые флаги и сэмплинг для всех трёх моделей

Флаги запуска:

-ngl 999 -fa on -c 262144 -np 1 --jinja

Сэмплинг: temp 1.0, top-p 0.95, top-k 20, min-p 0. Контекст 262 144 токена выставлялся всем трём моделям одинаково. «Мышление» включено у всех трёх, но с оговоркой: Bonsai работала на reasoning effort xhigh, своём значении по умолчанию, а у Qwen 3.5 9B и Gemma 4 12B такой настройки нет. Это единственное расхождение в условиях, и оно напрямую влияет на объём генерации.

Результаты: цифры, скорость и качество трёх моделей

МодельКвантованиеВесТокенов сгенерированоВремяСкорость
Ternary Bonsai 2 27BPQ2_0 (prism-ml)7,2 ГБ106 396~17,5 мин~101 ток/с
Qwen 3.5 9BQ6_K (unsloth)7,5 ГБ12 105~70 с~168 ток/с
Gemma 4 12BQ8_0 (unsloth)12,7 ГБ9 159~95 с~96 ток/с

По оценке автора теста, Bonsai выглядит существенно лучше и держит хорошую детализацию по всей сцене. Результат Gemma не плохой, но заметно более блёклый. Результат Qwen сломан. Это субъективная оценка одного прогона, а не бенчмарк (источник цифр и оценок).

Скорость читается с поправкой на объём работы. Qwen 3.5 9B выдаёт 168 ток/с против 101 ток/с у Bonsai, но за 70 секунд успевает 12 105 токенов. Bonsai за 17,5 минуты выдаёт текст почти в девять раз больше. Быстрее по токенам в секунду, медленнее по времени до готового результата.

Почему Bonsai сгенерировала в 10 раз больше токенов

Около 90% бюджета токенов Bonsai ушло на «мышление», то есть на внутренние рассуждения перед выдачей кода. Автор теста считает это доказательством автономности модели по сравнению с конкурентами. Причина техническая: reasoning effort xhigh, значение по умолчанию для этой модели, заставляет её тратить токены на планирование, разбор условий и самопроверку.

Практический вывод из этой арифметики: 106 396 токенов на одну HTML-страницу - это не только качество, но и время, а при работе через API ещё и деньги. Если оплата идёт за токены, разница в объёме генерации превращается в разницу в стоимости запроса. У Qwen 3.5 9B и Gemma 4 12B настройки уровня усилий нет, поэтому они отвечают быстрее и менее обдуманно.

Что именно сгенерировали модели: воксельная пагода на three.js

Промпт занимал около 770 слов и требовал сцену воксельной японской пагоды на three.js в одном HTML-файле. Задача проверяет сразу несколько навыков: структуру кода, работу с 3D-библиотекой и визуальную композицию. Что конкретно сломалось у Qwen 3.5 9B, в отчёте не сказано, есть только оценка «сломанный результат».

Почему быстрые модели проваливают такие задачи, объяснимо без домыслов. Чем меньше параметров и чем меньше токенов уходит на планирование, тем выше шанс, что модель соберёт визуально нерабочий HTML. В этом тесте Bonsai выиграла именно за счёт бюджета рассуждений.

Что это значит для владельца RTX 3060 и других GPU

Автор теста отмечает, что модель легко работает на 3060 с приемлемой скоростью токенов и выполняет достойную работу. Это утверждение автора, а не измерение: замеров на 3060 в отчёте нет.

Сколько VRAM нужно для Bonsai 2 27B на самом деле

7,2 ГБ - только вес модели в PQ2_0. К нему добавляется KV-кэш, размер которого растёт с длиной контекста. В тесте контекст составлял 262 144 токена, и всё вместе помещалось в 32 ГБ RTX 5090. Точных цифр расхода KV-кэша для этой модели в отчёте нет, поэтому память считается под свой сценарий.

Для карты на 12 ГБ рабочая схема выглядит так: урезать контекст и держать запас на KV-кэш, иначе часть слоёв уйдёт на CPU и скорость просядет. Как это выглядит на практике при 12 ГБ с урезанным контекстом, разбирали на примере другой модели в квантовании IQ3_XXS: 14-15 токенов в секунду с просадкой до 11,3 на длинном контексте (отчёт по 12 ГБ VRAM).

Сравнение с Qwen 3.5 9B и Gemma 4 12B по требованиям к железу

По весу расклад такой: Bonsai 2 27B в PQ2_0 - 7,2 ГБ, Qwen 3.5 9B в Q6_K - 7,5 ГБ, Gemma 4 12B в Q8_0 - 12,7 ГБ. Первые две сопоставимы по памяти, Gemma тяжелее почти вдвое. При этом Bonsai - 27B-модель: на слабой GPU больше параметров означает меньше токенов в секунду. Qwen 3.5 9B на 3060 обгонит её по скорости, но в этом тесте именно Qwen дала сломанный результат на сложной задаче.

Как запустить Ternary Bonsai 2 27B локально

  1. Скачать GGUF Bonsai. В тесте использовался PQ2_0 весом 7,2 ГБ.
  2. Собрать форк PrismML llama.cpp или взять готовую сборку релиза prism-b10683-d8f26ee с CUDA 12.8.
  3. Запустить llama-server с флагами -ngl 999 -fa on -c 262144 -np 1 --jinja.
  4. Выставить сэмплинг temp 1.0, top-p 0.95, top-k 20, min-p 0.
  5. Включить «мышление» и, если настройка доступна, reasoning effort xhigh.

Пятый пункт на практике не требует действий: xhigh - значение по умолчанию для Bonsai. Предупреждение из отчёта остаётся в силе: стоковый llama.cpp GGUF Bonsai не загрузит. Владельцам карт на 12 ГБ контекст 262 144 токена придётся урезать, иначе модель полезет в оперативную память.

Общие принципы подбора моделей и настройки llama.cpp под конкретные задачи разбирали отдельно (гайд по локальной AI-лаборатории): выбор квантов под классификацию, суммаризацию и function calling, плюс готовый конфиг.

Альтернатива: atomic.chat без локальной установки

Автор теста работал через atomic.chat. Если мощной GPU и желания собирать форк нет, модель доступна по API: RouterAI отдаёт её через OpenAI-совместимый эндпоинт, который принимает историю сообщений и поддерживает потоковый (SSE) и обычный режимы, а оплата идёт по факту за использованные токены (доступ через API).

Параметры API-предложений (цена, контекст, набор поддерживаемых параметров) относятся к облачному запуску и могут отличаться от локального. Перед использованием в продакшене провайдер рекомендует проверить реальные лимиты по токенам, настроить алерты по расходам и провести A/B-тест на своём датасете (рекомендации по интеграции).

Ограничения теста: почему нельзя делать окончательных выводов

Тест - это один прогон на модель, один промпт (~770 слов) и субъективная оценка качества. Повторов не было, эталонных метрик тоже. Чтобы говорить о воспроизводимости, нужны серии прогонов, разные задачи и независимые оценщики.

Конфликт интересов: автор теста - основатель prismml

Автор теста заявил, что он основатель prismml, и попросил присылать обратную связь (исходный отчёт). Цифры производительности от этого не меняются, а оценка «выглядит существенно лучше» сделана заинтересованной стороной. Заявленные более 98% качества относительно fp16 тоже идут от разработчика, а не от стороннего тестирования.

Что стоит проверить самостоятельно

  • Прогнать Bonsai на своих задачах: генерация кода, математика, вызов инструментов, длинные документы.
  • Сравнить с Qwen 3.5 9B и Gemma 4 12B на одинаковых промптах и с одинаковым сэмплингом.
  • Замерить ток/с и потребление VRAM на своей GPU, особенно при длинном контексте.
  • Посчитать стоимость, если работаете через API: сотни тысяч токенов на одну задачу быстро превращаются в заметную сумму.

Ещё одно расхождение, которое стоит держать в голове: режим рассуждений не был полностью равным. Bonsai работала на reasoning effort xhigh, у двух других моделей такой настройки нет. Часть преимущества может объясняться именно этим, а не архитектурой или квантованием.

Итог: кому и зачем нужна Ternary Bonsai 2 27B

Bonsai 2 27B интересна там, где важна глубина результата, а не секунды. Для сложных задач (генерация кода с пространственной логикой, длинные документы, агентные цепочки с вызовом инструментов) и готовности ждать 17 минут модель оправдывает ожидание: 106 396 токенов, из которых около 90% ушло на рассуждения.

Если нужна скорость и простые задачи, разумнее смотреть на 9B и 12B модели. Qwen 3.5 9B выдаёт 168 ток/с при весе 7,5 ГБ и отвечает примерно за минуту, Gemma 4 12B даёт 96 ток/с при весе 12,7 ГБ. В этом тесте быстрые модели проиграли по качеству, но это один прогон и одна задача.

Начинать стоит с малого: скачать PQ2_0, собрать форк PrismML llama.cpp, запустить llama-server с флагами -ngl 999 -fa on -c 262144 -np 1 --jinja и прогнать свою задачу на своём железе. После этого решать, стоит ли модель постоянного места на диске. Без форка она просто не загрузится.

Подписаться на канал