Что такое Bonsai 2 и почему её сравнивают с другими Qwen3.8
Prism-LM выпустила QAT-модели Bonsai 2 на базе Qwen3.8, и в сообществе локальных LLM они получили заметный отклик. В независимой оценке эти модели набрали около 91,5% на композитном наборе бенчмарков и показали баланс между пропускной способностью и качеством (публикация с результатами сравнения).
Ключевая оговорка с первого абзаца: 91,5% - это собственные результаты авторов оценки, а не цифры, заявленные Prism. Авторы сравнения разводят эти два набора данных прямо и отдельно предупреждают, что отчёты разных провайдеров почти никогда не сопоставимы напрямую.
Практический смысл материала узкий и конкретный: появляется ещё одна точка отсчёта при выборе квантованной модели Qwen3.8 для локального запуска. Она не заменяет прогон на своих задачах, но помогает сократить список кандидатов.
QAT-модели: чем они отличаются от обычного квантования
QAT расшифровывается как quantization-aware training, то есть обучение с учётом квантования. Разница с обычным сжатием в том, когда модель узнаёт о низкой разрядности. При пост-тренировочном квантовании готовую fp16-модель сжимают после обучения, и об урезанных весах она узнаёт уже на инференсе. При QAT ограничения квантования встраиваются в сам процесс обучения: веса и активации проходят имитацию квантования на шагах тренировки, и модель подстраивается под них заранее.
На практике это обычно означает, что при той же низкой разрядности QAT-версия теряет меньше качества, чем та же модель, сжатая постфактум. Для локального запуска важен один эффект: чем ниже разрядность, тем меньше веса и тем меньше VRAM нужно. Если качество удаётся удержать на низкой разрядности, вы получаете работающую модель там, где полноразмерный вариант в память просто не влезает.
Обратная сторона: QAT требует доступа к пайплайну обучения и данным, поэтому таких моделей на рынке меньше, чем обычных GGUF-квантовок. Конкретные размеры файлов, разрядности и требования к памяти у сборок Bonsai 2 в переданных данных не раскрываются, так что вариант под свою видеокарту придётся подбирать по странице модели и по собственному замеру.
Место Bonsai 2 в ландшафте Qwen3.8
Bonsai 2 - часть экосистемы Qwen3.8, а не отдельная архитектура, собранная с нуля. Поэтому сравнение с остальными моделями линейки имеет смысл: база одна, различаются способ сжатия, размер и настройки рантайма. Авторы оценки объяснили, что добавили Bonsai 2 именно потому, что эти модели стали заметной частью ландшафта Qwen3.8, и им нужна была общая точка отсчёта для тех, кто выбирает между доступными вариантами.
Авторы сравнения не заявляют, что Bonsai 2 обходит другие модели линейки. Их тезис скромнее: прогон через одну и ту же оценку даёт дополнительную точку отсчёта для понимания компромиссов между качеством, размером модели и пропускной способностью. Логика та же, что и в разборе локального агентного бенчмарка для квантованных вариантов Qwen3.8: без единых условий прогона проценты ничего не значат (какие данные нужны для честного сравнения квантованных моделей).
Независимый бенчмарк Bonsai 2: 91,5% на композитном наборе
Главная цифра: в оценке авторов сравнения модели Bonsai 2 достигли примерно 91,5% на композитном бенчмарке. Слово «композитный» здесь принципиально. Это агрегат по нескольким задачам, сведённый в один процент, а не результат одной узкой метрики. Такой агрегат удобен для быстрого отбора кандидатов, но не отвечает на вопрос, как модель поведёт себя на вашем промпте.
Второй момент: авторы отдельно подчёркивают, что это их результаты, а не отчёт Prism. Формулировка из публикации звучит буквально как «these are our evaluation results, not Prism’s reported benchmark numbers». Для читателя это значит, что цифра прошла независимый прогон, но со своими допущениями, о которых ниже.
Instruct и Thinking: почему их считают отдельно
Instruct - режим прямого ответа: модель выдаёт результат без длинной цепочки рассуждений. Thinking - режим с внутренним reasoning: сначала строится ход решения, потом появляется ответ. Это два разных профиля использования. В первом важны скорость и предсказуемость формата, во втором вы платите токенами и временем за качество на задачах, где нужен многошаговый вывод.
В оценке Bonsai 2 эти режимы измерялись раздельно. Для Thinking использовался средний уровень «размышления» (medium thinking effort) и рекомендованные параметры сэмплирования. Прямое следствие: результат привязан к конкретной настройке. Поднимете уровень рассуждения выше или поменяете сэмплирование - получите другие числа. Для reasoning-моделей это нормальное поведение, а не признак нестабильного бенчмарка.
Что означает 91,5% и чего эта цифра не говорит
91,5% на композитном наборе описывают средний уровень по смеси задач. Из него не следует, что модель одинаково хороша везде: сильные результаты на части тестов могут подтянуть агрегат и скрыть провал на остальных. Для агентных сценариев, генерации кода или длинных цепочек вызовов инструментов агрегат вообще слабый ориентир, там важнее стабильность формата и умение вовремя остановиться.
Второе ограничение: модели запускались через форк и рантайм Prism. Тот же чекпоинт в другом рантайме может дать другой результат, потому что отличается реализация ядер, работа с контекстом и обработка сэмплинга. Оценка честная, но её условия нельзя автоматически переносить на любое окружение.
Третье: сравнивать 91,5% с числами других моделей напрямую нельзя, если те измерялись другой методологией. В переданных данных нет результатов конкурентов из этого же прогона, поэтому вывод вида «Bonsai 2 лучше модели X» из публикации не вытекает.
Как проводилось сравнение квантованных моделей Qwen3.8
Методика опирается на уже существующий набор оценок: Bonsai 2 прогнали по той же методологии, которая применялась к остальным моделям Qwen3.8. Рабочие нагрузки, набор тестов и методология оценки остались едиными, отличалось одно: для запуска моделей Prism использовался их форк и рантайм (описание методики от авторов сравнения).
Смысл конструкции в том, чтобы не сравнивать модель, запущенную в чужих условиях, с моделью в родных. Форк Prism нужен потому, что нестандартные квантованные сборки не всегда корректно поднимаются в универсальных сборках инференс-движка. Побочный эффект: воспроизвести прогон один в один без этого рантайма может не получиться.
Почему цифры разных провайдеров несопоставимы
Авторы сравнения перечисляют причины прямо: разные провайдеры используют разные наборы тестов, рантаймы, настройки рассуждения, параметры сэмплирования и методологии оценки. Расхождение по любому из этих пунктов ломает прямое сравнение процентов.
Как это выглядит на практике. Модель A показывает 90% на наборе из коротких задач с температурой 0. Модель B показывает 85% на наборе с длинными диалогами и температурой 1.0. Формально A «лучше» на пять пунктов, фактически вы не знаете, как они поведут себя на вашем промпте. Честное сравнение получается только при одинаковых задачах, параметрах и рантайме.
Ограничения оценки и воспроизводимость
Оговорки стоит собрать в одном месте: именно они определяют, что можно, а что нельзя вынести из публикации.
- Это собственные результаты авторов оценки, а не числа, заявленные Prism.
- Модели Prism запускались через их форк и рантайм, что влияет на воспроизводимость в других окружениях.
- Для режима Thinking применялись средний уровень рассуждения и рекомендованные параметры сэмплирования; с другими настройками результаты будут иными.
- Набор тестов композитный, то есть агрегированный. Разбивка по отдельным задачам в переданных данных не приводится.
Ничего из этого результат не отменяет, но задаёт рамку: цифра валидна внутри описанной конфигурации и требует проверки за её пределами.
Качество, размер и пропускная способность: где Bonsai 2 выигрывает
Главный практический вывод публикации: модели показали баланс между пропускной способностью и качеством. Слово «баланс» описывает конкретный компромисс, с которым сталкивается каждый, кто запускает LLM локально. Приходится выбирать между тремя переменными: насколько хорош ответ, сколько памяти занимает модель и сколько токенов в секунду она выдаёт.
Квантование сдвигает этот баланс в сторону памяти: меньшая разрядность освобождает VRAM. QAT-подход пытается удержать качество на прежнем уровне. Поэтому результат около 91,5% на композитном наборе при компактном формате и привлекает внимание: если качество действительно удерживается, вы получаете рабочую модель на железе, где полноразмерный вариант не помещается.
Что такое пропускная способность на практике
Пропускная способность (throughput) - это сколько токенов модель генерирует за единицу времени. Метрика влияет на две вещи: интерактивность и стоимость. В чате разница между 20 и 80 токенами в секунду ощущается физически, во втором случае ответ появляется быстрее, чем вы дочитываете предыдущий. В пакетной обработке throughput определяет, сколько задач закроется за ночь и сколько часов аренды GPU на это уйдёт.
При локальном запуске через llama.cpp-подобные рантаймы скорость зависит от связки «модель - разрядность - GPU - длина контекста». Длинный контекст расходует и память, и время, поэтому одна и та же модель на 4k и на 100k токенов контекста ведёт себя по-разному. Конкретных цифр throughput для Bonsai 2 в переданных данных нет, поэтому ограничимся тем, что авторы называют баланс с качеством сильной стороной модели.
Кому подходит баланс Bonsai 2, а кому нет
Если задача - локальный запуск с приемлемым качеством и вменяемой скоростью на ограниченной видеопамяти, Bonsai 2 попадает в список кандидатов. Речь о сценариях, где важны автономность и контроль над данными: обработка документов, ассистент по внутренней базе, локальный агент для рутинных операций.
Если нужен максимум качества на узком домене - юридические тексты, редкие языки, специфичная разметка - агрегированный процент не поможет. Такие случаи закрываются прогоном на собственной выборке. И отдельно про агентные пайплайны с длинными цепочками вызовов инструментов: там критичны дисциплина формата и умение вовремя остановиться, а композитный бенчмарк этого не измеряет.
Как использовать эти данные при выборе квантованной модели Qwen3.8
Смотреть нужно не на агрегированный процент в вакууме, а на три вещи вместе: режим работы, требования к VRAM и пропускную способность на вашем железе. Плюс держать в голове, что оценка проводилась с использованием форка и рантайма Prism: при запуске в другом рантайме поведение может отличаться.
Чек-лист перед выбором квантованной модели
- Определите режим. Instruct - для быстрых ответов и простых задач, Thinking - там, где нужен многошаговый вывод. Помните, что для Thinking в оценке использовался средний уровень рассуждения, а не максимальный.
- Посчитайте доступную VRAM. От неё зависит, какая разрядность вообще влезет и останется ли место под длинный контекст.
- Замерьте пропускную способность на своём железе. Одна и та же модель на разных GPU даёт разную скорость, а длина контекста меняет картину.
- Прогоните свои задачи. Возьмите 20-50 реальных промптов и сравните ответы, а не средний процент по чужому набору.
- Учтите ограничения методологии: чужой рантайм, конкретные параметры сэмплирования, агрегированный набор тестов.
- Проверьте статус базовой модели. Если ориентируетесь на Qwen 3.8 27B, держите в голове, что официального анонса может ещё не быть и часть данных остаётся утечками (что подтверждено про Qwen 3.8 27B, а что остаётся гипотезой).
Где смотреть первоисточник и полное сравнение
Обновлённое сравнение и результаты для Qwen3.8-27B публикует byteshape.com, полный прогон с Bonsai 2 вышел в их публикации о квантованном сравнении Qwen3.8. Там стоит искать детали, которых нет в пересказе: конкретные конфигурации запуска, разбивку по задачам и параметры сэмплирования. Ссылка на публикацию дана выше, в разделе о методике.
Ограничения и риски интерпретации бенчмарков Bonsai 2
Здесь собраны все оговорки, без которых материал превращается в рекламу.
- 91,5% - собственные результаты авторов оценки, а не цифры, заявленные Prism.
- Разные провайдеры используют разные наборы тестов, рантаймы, настройки рассуждения, параметры сэмплирования и методологии оценки, поэтому их числа не всегда напрямую сопоставимы (оговорки авторов сравнения).
- Модели запускались через форк и рантайм Prism, что ограничивает воспроизводимость в других окружениях.
- Для Thinking применялись средний уровень «размышления» и рекомендованные параметры сэмплирования; другие настройки дадут другие результаты.
- Композитный набор - агрегат, он не показывает поведение на конкретной задаче и не измеряет устойчивость агентных цепочек.
Главный риск интерпретации в том, чтобы принять 91,5% за универсальную оценку качества модели. Это число описывает поведение конкретных сборок в конкретном рантайме с конкретными настройками. Другой размер контекста, другой сэмплинг, другой движок - и картина может измениться заметно.
Итог: стоит ли обращать внимание на Bonsai 2
Bonsai 2 - QAT-модели на базе Qwen3.8 от Prism-LM. В независимой оценке они набрали около 91,5% на композитном наборе и показали баланс между пропускной способностью и качеством. Это результаты авторов сравнения, а не отчёт вендора, и методологии у разных провайдеров расходятся.
Практический вывод простой. Если вы выбираете квантованную модель Qwen3.8 для локального запуска и упираетесь в объём видеопамяти, Bonsai 2 стоит добавить в короткий список и проверить на своих задачах в обоих режимах, Instruct и Thinking. Решение по одной агрегированной цифре принимать не стоит: прогоните 20-50 своих промптов, замерьте скорость на своём железе и только потом сравните с альтернативами.