Что показал тест 15 локальных моделей для агентов и tool-use
Автор прогнал 15 локальных моделей через бенчмарк Toolery, чтобы выяснить, какие из них реально пригодны для агентных задач и вызова инструментов, а какие хорошо смотрятся только в сводных таблицах. Первое место заняла qwen/qwen3.8-27b с результатом 71.8%. Оригинальная prism-ml/bonsai-27b финишировала последней, на 15-м месте, с 50.5% в общем зачёте и худшим результатом на самых сложных сценариях (22.2%). Сводка результатов и разбор ошибок опубликованы автором теста.
Разбор провалов объясняет картину точнее, чем итоговый процент. У Bonsai 27B было 148 провальных прогонов, и 103 из них классифицированы как превышение бюджета вызовов инструментов. Модель часто выбирала правильный инструмент и получала верный результат, но делала лишний вызов и не останавливалась вовремя.
Условия теста: 143 сценария, три прогона на каждый, то есть 429 прогонов на модель. Четыре уровня сложности: Easy, Medium, Hard, Very Hard. Все модели обслуживались локально через LM Studio, с одинаковым окном контекста 30k токенов и температурой 0.8.
Важная оговорка от автора: тестировалась оригинальная Bonsai 27B, а не новая Bonsai 2 27B. Это один бенчмарк с фиксированными настройками, а не универсальная оценка качества модели.
Как устроен бенчмарк Toolery и что именно он измеряет
Toolery проверяет поведение модели в задачах tool-use и агентных сценариях под ограничениями. Он не измеряет общий интеллект и не доказывает, что модель плоха во всём: тест показывает, справляется ли она с вызовом инструментов при заданных лимитах и бюджетах. 143 сценария разбиты на четыре уровня сложности, каждый прогоняется три раза, что даёт 429 прогонов на модель.
Три прогона при температуре 0.8 дают разброс между запусками. Итоговый балл в такой схеме отражает усреднённую стабильность, а не один удачный прогон.
Уровни сложности: Easy, Medium, Hard и Very Hard
Сценарии разделены на Easy, Medium, Hard и Very Hard. Такой разрез важен, потому что средний балл скрывает провалы на сложных задачах. Bonsai 27B на уровне Very Hard набрала 22.2%, и это худший результат среди всех 15 моделей. Модель может выглядеть приемлемо в среднем за счёт простых сценариев и разваливаться там, где задача требует длинной цепочки вызовов инструментов с контролем лимитов.
Настройки запуска: LM Studio, 30k контекста, температура 0.8
Все модели запускались локально через LM Studio. Контекст для каждой модели - 30k токенов, температура - 0.8, concurrency - 4, timeout scale - 4.0. Одно исключение автор оговаривает отдельно: qwen3.8-flash-next работала через вариант Strata, но температуру всё равно выставили на 0.8.
30k токенов - реалистичное, но не максимальное окно для многих локальных моделей. Температура 0.8 означает, что одинаковые условия запуска не гарантируют идентичных прогонов, поэтому сравнение идёт по агрегатам: среднему баллу, числу провалов и общему времени.
Результаты теста: qwen3.8-27b впереди, Bonsai 27B в конце
Топ-3: минимальный разрыв между лидерами
Первые три места выглядят так:
- qwen/qwen3.8-27b - 71.8%
- mellum2-12b-a2.5b-thinking - 71.4%
- google/gemma-4-26b-a4b - 70.4%
Разрыв между первым и третьим местом меньше 1.5 процентного пункта. При трёх прогонах и температуре 0.8 такой отрыв лежит в пределах естественной вариативности, поэтому выбирать между этими моделями стоит по другим критериям: скорость, требования к VRAM, профиль ошибок и поведение на вашей задаче. Похожий сюжет уже разбирали на менее мощном железе, где при близком результате по задачам модели сильно расходились по скорости и расходу токенов (Qwen3.8 27B IQ3_XXS против Bonsai Ternary PQ2 на 16 ГБ VRAM).
Bonsai 27B: 50.5% и 22.2% на Very Hard
Оригинальная prism-ml/bonsai-27b заняла 15-е место с общим результатом 50.5%. На уровне Very Hard она набрала 22.2% и снова оказалась последней. Провал относится именно к оригинальной Bonsai 27B; новая Bonsai 2 27B в этом прогоне не участвовала.
Из общего балла не следует, что модель непригодна везде. Инженерный вывод скромнее и полезнее: в сценариях с жёстким лимитом на число вызовов инструментов оригинальная Bonsai 27B ведёт себя недостаточно предсказуемо.
Почему Bonsai 27B провалилась: 103 из 148 ошибок - превышение бюджета вызовов
У Bonsai 27B было 148 провальных прогонов. Из них 103 классифицированы как budget_violated, и только 30 - как wrong-tool-choice. Пропорция важнее абсолютных чисел: она показывает, какой именно механизм ломает сценарий. Автор теста приводит эту классификацию ошибок.
Что такое budget_violated и почему это важнее wrong-tool-choice
budget_violated означает превышение лимита вызовов инструментов, заданного в сценарии. wrong-tool-choice - выбор неподходящего инструмента. Соотношение 103 к 30 говорит о характере сбоев: модель обычно понимала задачу, выбирала правильный инструмент и получала верный результат, но делала на один вызов больше и не вовремя останавливалась.
Для агентного пайплайна это критично. Лишний вызов инструмента означает дополнительные задержки, расход токенов и риск побочного эффекта: повторную запись, повторную отправку запроса, лишнюю транзакцию. Модель, которая выбирает инструмент правильно, но не умеет останавливаться, создаёт больше проблем в продакшене, чем модель, которая изредка ошибается с выбором, но держит заданные лимиты.
Скорость как отдельный минус: 6 208 секунд
Bonsai 27B была самой медленной моделью в прогоне: 6 208 секунд общего времени. Следующая по медленности модель заняла около 5 750 секунд, но показала результат примерно на 17 пунктов выше. Медленность в этом случае не окупается качеством: модель тратила больше времени и получала меньше баллов.
Скорость и надёжность: что ещё важно, кроме общего процента
Общий балл - только одна из метрик. Число провалов и время на сценарий показывают, насколько предсказуемо модель поведёт себя в реальном пайплайне, где ошибка стоит денег и времени.
granite-4.2-8b: меньше всего провалов, но не первое место
granite-4.2-8b показала наименьшее общее число провалов - 69. При этом она не входит в топ-3 по итоговому проценту. Число провалов и итоговый балл измеряют разное: можно реже падать на простых сценариях и проигрывать на сложных. Для контраста: у лидера qwen3.8-27b было 84 провальных прогона, у Bonsai 27B - 148. Без полной таблицы по всем 15 моделям далеко идущие выводы из этих чисел делать не стоит.
qwen3.8-flash-next-iq2_xs: скорость около 9 секунд на сценарий
Модель qwen3.8-flash-next-iq2_xs показывала около 9 секунд на сценарий. Для неё использовался вариант Strata, температура осталась 0.8. Позицию в общем рейтинге по этому фрагменту данных определить нельзя, но скорость - отдельное измерение. В интерактивных агентах, где пользователь ждёт ответ, несколько секунд на сценарий могут весить больше, чем пара процентов точности. Подход к оценке агентных моделей через итоговый балл, latency и число запросов на результат разбирали отдельно (Qwen3.8-Flash-Next NVFP4 в локальном агентном бенчмарке).
Ограничения теста: почему 50.5% Bonsai 27B - не приговор
Результаты стоит читать с оговорками, которые автор теста проговаривает прямо. Без них легко сделать вывод шире, чем позволяют данные.
Оригинальная Bonsai 27B и Bonsai 2 27B - это разные модели
prism-ml/bonsai-27b - оригинальная модель, и именно она тестировалась. Bonsai 2 27B - новая версия, в этом прогоне она не участвовала. Результаты 50.5% и 22.2% на Very Hard относятся только к оригинальной версии, переносить их на Bonsai 2 27B нельзя. Независимый прогон Bonsai 2 на базе Qwen3.8 дал около 91,5% на композитном наборе, но там другая методология, другие нагрузки и другой набор тестов, поэтому цифры несопоставимы напрямую (разбор сравнения квантованных моделей Bonsai 2).
Один бенчмарк - не универсальная оценка
Toolery измеряет поведение в tool-use и агентных сценариях под лимитами, а не общий интеллект. Результат зависит от набора сценариев, настроек (LM Studio, 30k контекста, температура 0.8, concurrency 4, timeout scale 4.0) и железа. Для генерации текста, кода или RAG нужны другие тесты. Перед внедрением модель стоит прогнать на своих сценариях: 143 чужих кейса не заменят проверку на вашем пайплайне. Автор теста сам оговаривает эти границы применимости.
Практические выводы: как выбирать локальную модель для агентов после этого теста
Смотреть на один общий процент недостаточно. Полезная рамка выбора включает четыре измерения.
- Результат на Very Hard. Именно на сложных сценариях видна разница между моделями. 22.2% у Bonsai 27B против плотной группы лидеров говорит, что длинные цепочки вызовов с контролем лимитов она держит плохо.
- Профиль ошибок. Соотношение budget_violated и wrong-tool-choice показывает, умеет ли модель останавливаться. Если в пайплайне жёсткий лимит на вызовы, превышение бюджета особенно опасно.
- Скорость. Секунды на сценарий важны для интерактивных агентов; для batch-задач критичнее общее время и надёжность.
- Число провалов. Меньше провалов не всегда значит выше балл. granite-4.2-8b с 69 провалами и лидер с 84 провалами показывают, что метрики расходятся.
Для сложных агентных пайплайнов с лимитами на вызовы инструментов проверяйте, умеет ли модель останавливаться, а не только выбирать инструмент. Для интерактивных задач смотрите на скорость, для batch - на надёжность и общее время прогона.
Топ-3 идёт плотной группой: qwen/qwen3.8-27b (71.8%), mellum2-12b-a2.5b-thinking (71.4%), google/gemma-4-26b-a4b (70.4%). Разница между ними меньше 1.5 пункта, поэтому решение стоит принимать по требованиям к железу, скорости и профилю ошибок. Если нужен ориентир по локальному запуску на ограниченной VRAM, полезен разбор теста девяти моделей на одной видеокарте, где видно, как thinking-режим и квантизация меняют время генерации (9 LLM на одном промпте на RTX 3060 12GB).