Перейти к содержанию
Публикация AiManual

Тест 15 локальных моделей для агентов и tool-use: почему Bonsai 27B оказалась последней

Автор прогнал 15 локальных моделей через бенчмарк Toolery: 143 сценария, по 3 прогона каждый, 429 прогонов на модель. qwen3.8-27b заняла первое место с 71.8%, о

Коротко

Что будет в материале

  1. 01

    Что показал тест 15 локальных моделей для агентов и tool-use

  2. 02

    Как устроен бенчмарк Toolery и что именно он измеряет

  3. 03

    Результаты теста: qwen3.8-27b впереди, Bonsai 27B в конце

  4. 04

    Почему Bonsai 27B провалилась: 103 из 148 ошибок - превышение бюджета вызовов

Что показал тест 15 локальных моделей для агентов и tool-use

Автор прогнал 15 локальных моделей через бенчмарк Toolery, чтобы выяснить, какие из них реально пригодны для агентных задач и вызова инструментов, а какие хорошо смотрятся только в сводных таблицах. Первое место заняла qwen/qwen3.8-27b с результатом 71.8%. Оригинальная prism-ml/bonsai-27b финишировала последней, на 15-м месте, с 50.5% в общем зачёте и худшим результатом на самых сложных сценариях (22.2%). Сводка результатов и разбор ошибок опубликованы автором теста.

Разбор провалов объясняет картину точнее, чем итоговый процент. У Bonsai 27B было 148 провальных прогонов, и 103 из них классифицированы как превышение бюджета вызовов инструментов. Модель часто выбирала правильный инструмент и получала верный результат, но делала лишний вызов и не останавливалась вовремя.

Условия теста: 143 сценария, три прогона на каждый, то есть 429 прогонов на модель. Четыре уровня сложности: Easy, Medium, Hard, Very Hard. Все модели обслуживались локально через LM Studio, с одинаковым окном контекста 30k токенов и температурой 0.8.

Важная оговорка от автора: тестировалась оригинальная Bonsai 27B, а не новая Bonsai 2 27B. Это один бенчмарк с фиксированными настройками, а не универсальная оценка качества модели.

Как устроен бенчмарк Toolery и что именно он измеряет

Toolery проверяет поведение модели в задачах tool-use и агентных сценариях под ограничениями. Он не измеряет общий интеллект и не доказывает, что модель плоха во всём: тест показывает, справляется ли она с вызовом инструментов при заданных лимитах и бюджетах. 143 сценария разбиты на четыре уровня сложности, каждый прогоняется три раза, что даёт 429 прогонов на модель.

Три прогона при температуре 0.8 дают разброс между запусками. Итоговый балл в такой схеме отражает усреднённую стабильность, а не один удачный прогон.

Уровни сложности: Easy, Medium, Hard и Very Hard

Сценарии разделены на Easy, Medium, Hard и Very Hard. Такой разрез важен, потому что средний балл скрывает провалы на сложных задачах. Bonsai 27B на уровне Very Hard набрала 22.2%, и это худший результат среди всех 15 моделей. Модель может выглядеть приемлемо в среднем за счёт простых сценариев и разваливаться там, где задача требует длинной цепочки вызовов инструментов с контролем лимитов.

Настройки запуска: LM Studio, 30k контекста, температура 0.8

Все модели запускались локально через LM Studio. Контекст для каждой модели - 30k токенов, температура - 0.8, concurrency - 4, timeout scale - 4.0. Одно исключение автор оговаривает отдельно: qwen3.8-flash-next работала через вариант Strata, но температуру всё равно выставили на 0.8.

30k токенов - реалистичное, но не максимальное окно для многих локальных моделей. Температура 0.8 означает, что одинаковые условия запуска не гарантируют идентичных прогонов, поэтому сравнение идёт по агрегатам: среднему баллу, числу провалов и общему времени.

Результаты теста: qwen3.8-27b впереди, Bonsai 27B в конце

Топ-3: минимальный разрыв между лидерами

Первые три места выглядят так:

  • qwen/qwen3.8-27b - 71.8%
  • mellum2-12b-a2.5b-thinking - 71.4%
  • google/gemma-4-26b-a4b - 70.4%

Разрыв между первым и третьим местом меньше 1.5 процентного пункта. При трёх прогонах и температуре 0.8 такой отрыв лежит в пределах естественной вариативности, поэтому выбирать между этими моделями стоит по другим критериям: скорость, требования к VRAM, профиль ошибок и поведение на вашей задаче. Похожий сюжет уже разбирали на менее мощном железе, где при близком результате по задачам модели сильно расходились по скорости и расходу токенов (Qwen3.8 27B IQ3_XXS против Bonsai Ternary PQ2 на 16 ГБ VRAM).

Bonsai 27B: 50.5% и 22.2% на Very Hard

Оригинальная prism-ml/bonsai-27b заняла 15-е место с общим результатом 50.5%. На уровне Very Hard она набрала 22.2% и снова оказалась последней. Провал относится именно к оригинальной Bonsai 27B; новая Bonsai 2 27B в этом прогоне не участвовала.

Из общего балла не следует, что модель непригодна везде. Инженерный вывод скромнее и полезнее: в сценариях с жёстким лимитом на число вызовов инструментов оригинальная Bonsai 27B ведёт себя недостаточно предсказуемо.

Почему Bonsai 27B провалилась: 103 из 148 ошибок - превышение бюджета вызовов

У Bonsai 27B было 148 провальных прогонов. Из них 103 классифицированы как budget_violated, и только 30 - как wrong-tool-choice. Пропорция важнее абсолютных чисел: она показывает, какой именно механизм ломает сценарий. Автор теста приводит эту классификацию ошибок.

Что такое budget_violated и почему это важнее wrong-tool-choice

budget_violated означает превышение лимита вызовов инструментов, заданного в сценарии. wrong-tool-choice - выбор неподходящего инструмента. Соотношение 103 к 30 говорит о характере сбоев: модель обычно понимала задачу, выбирала правильный инструмент и получала верный результат, но делала на один вызов больше и не вовремя останавливалась.

Для агентного пайплайна это критично. Лишний вызов инструмента означает дополнительные задержки, расход токенов и риск побочного эффекта: повторную запись, повторную отправку запроса, лишнюю транзакцию. Модель, которая выбирает инструмент правильно, но не умеет останавливаться, создаёт больше проблем в продакшене, чем модель, которая изредка ошибается с выбором, но держит заданные лимиты.

Скорость как отдельный минус: 6 208 секунд

Bonsai 27B была самой медленной моделью в прогоне: 6 208 секунд общего времени. Следующая по медленности модель заняла около 5 750 секунд, но показала результат примерно на 17 пунктов выше. Медленность в этом случае не окупается качеством: модель тратила больше времени и получала меньше баллов.

Скорость и надёжность: что ещё важно, кроме общего процента

Общий балл - только одна из метрик. Число провалов и время на сценарий показывают, насколько предсказуемо модель поведёт себя в реальном пайплайне, где ошибка стоит денег и времени.

granite-4.2-8b: меньше всего провалов, но не первое место

granite-4.2-8b показала наименьшее общее число провалов - 69. При этом она не входит в топ-3 по итоговому проценту. Число провалов и итоговый балл измеряют разное: можно реже падать на простых сценариях и проигрывать на сложных. Для контраста: у лидера qwen3.8-27b было 84 провальных прогона, у Bonsai 27B - 148. Без полной таблицы по всем 15 моделям далеко идущие выводы из этих чисел делать не стоит.

qwen3.8-flash-next-iq2_xs: скорость около 9 секунд на сценарий

Модель qwen3.8-flash-next-iq2_xs показывала около 9 секунд на сценарий. Для неё использовался вариант Strata, температура осталась 0.8. Позицию в общем рейтинге по этому фрагменту данных определить нельзя, но скорость - отдельное измерение. В интерактивных агентах, где пользователь ждёт ответ, несколько секунд на сценарий могут весить больше, чем пара процентов точности. Подход к оценке агентных моделей через итоговый балл, latency и число запросов на результат разбирали отдельно (Qwen3.8-Flash-Next NVFP4 в локальном агентном бенчмарке).

Ограничения теста: почему 50.5% Bonsai 27B - не приговор

Результаты стоит читать с оговорками, которые автор теста проговаривает прямо. Без них легко сделать вывод шире, чем позволяют данные.

Оригинальная Bonsai 27B и Bonsai 2 27B - это разные модели

prism-ml/bonsai-27b - оригинальная модель, и именно она тестировалась. Bonsai 2 27B - новая версия, в этом прогоне она не участвовала. Результаты 50.5% и 22.2% на Very Hard относятся только к оригинальной версии, переносить их на Bonsai 2 27B нельзя. Независимый прогон Bonsai 2 на базе Qwen3.8 дал около 91,5% на композитном наборе, но там другая методология, другие нагрузки и другой набор тестов, поэтому цифры несопоставимы напрямую (разбор сравнения квантованных моделей Bonsai 2).

Один бенчмарк - не универсальная оценка

Toolery измеряет поведение в tool-use и агентных сценариях под лимитами, а не общий интеллект. Результат зависит от набора сценариев, настроек (LM Studio, 30k контекста, температура 0.8, concurrency 4, timeout scale 4.0) и железа. Для генерации текста, кода или RAG нужны другие тесты. Перед внедрением модель стоит прогнать на своих сценариях: 143 чужих кейса не заменят проверку на вашем пайплайне. Автор теста сам оговаривает эти границы применимости.

Практические выводы: как выбирать локальную модель для агентов после этого теста

Смотреть на один общий процент недостаточно. Полезная рамка выбора включает четыре измерения.

  1. Результат на Very Hard. Именно на сложных сценариях видна разница между моделями. 22.2% у Bonsai 27B против плотной группы лидеров говорит, что длинные цепочки вызовов с контролем лимитов она держит плохо.
  2. Профиль ошибок. Соотношение budget_violated и wrong-tool-choice показывает, умеет ли модель останавливаться. Если в пайплайне жёсткий лимит на вызовы, превышение бюджета особенно опасно.
  3. Скорость. Секунды на сценарий важны для интерактивных агентов; для batch-задач критичнее общее время и надёжность.
  4. Число провалов. Меньше провалов не всегда значит выше балл. granite-4.2-8b с 69 провалами и лидер с 84 провалами показывают, что метрики расходятся.

Для сложных агентных пайплайнов с лимитами на вызовы инструментов проверяйте, умеет ли модель останавливаться, а не только выбирать инструмент. Для интерактивных задач смотрите на скорость, для batch - на надёжность и общее время прогона.

Топ-3 идёт плотной группой: qwen/qwen3.8-27b (71.8%), mellum2-12b-a2.5b-thinking (71.4%), google/gemma-4-26b-a4b (70.4%). Разница между ними меньше 1.5 пункта, поэтому решение стоит принимать по требованиям к железу, скорости и профилю ошибок. Если нужен ориентир по локальному запуску на ограниченной VRAM, полезен разбор теста девяти моделей на одной видеокарте, где видно, как thinking-режим и квантизация меняют время генерации (9 LLM на одном промпте на RTX 3060 12GB).

Подписаться на канал