Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Бенчмарк 35B моделей для кодинга: KAT-Coder vs Qwen vs Ornith — 120 прогонов, прозрачная методология и неожиданный лидер по эффективности

Сравнили KAT-Coder-V2.5-Dev, Qwen3.5-35B, Qwen3.6-35B и Ornith в 120 прогонах на 6 самопроверяемых задачах. KAT-Coder — 0 ошибок вызовов, 29/30 успех и вдвое ме

Коротко

Что будет в материале

  1. 01

    Ключевые результаты: кто лидирует в дисциплине и успешности

  2. 02

    Методология тестирования: 120 прогонов, 6 задач, 5 повторений

  3. 03

    KAT-Coder-V2.5-Dev: ноль ошибок и секрет эффективности

  4. 04

    Qwen3.5-35B и Qwen3.6-35B: прогресс или регресс?

Ключевые результаты: кто лидирует в дисциплине и успешности

KAT-Coder-V2.5-Dev завершил 29 из 30 тестовых прогонов с нулевым количеством некорректных вызовов инструментов. Qwen3.6-35B при том же количестве попыток допустил 195 ошибок. Ornith провалился из-за механических сбоев: утечек формата и перезаписи файлов. Эти цифры получены в идентичных условиях на шести самопроверяемых задачах с пятикратным повторением каждой.

Сводная таблица результатов

Модель Успешные / Всего прогонов Некорректные вызовы (всего) Средние входные токены
KAT-Coder-V2.5-Dev 29 / 30 0 в 2 раза ниже среднего
Qwen3.5-35B данные уточняются существенно ниже 195 базовый уровень
Qwen3.6-35B данные уточняются 195 базовый уровень
Ornith проигрыш базовой модели критические сбои формата нерелевантно из-за ошибок

KAT-Coder показал двукратное преимущество по входным токенам. Это прямая экономия бюджета при работе через API. Qwen3.6, напротив, генерирует 6.5 ошибок на задачу - уровень, исключающий автономное применение.

Почему дисциплина инструментов важнее грубой силы

В agentic-системах каждый некорректный вызов инструмента запускает каскад проблем. Модель теряет контекст, выполняет неверное действие, а стоимость цепочки вызовов растет экспоненциально. 195 ошибок Qwen3.6 означают, что в среднем каждые 1.5 шага агент совершал бессмысленное действие. На дистанции в 1000 задач это тысячи долларов, потраченных на обработку мусорных запросов.

KAT-Coder доказал: можно решать задачи без единого сбоя в инструментальном слое. Ноль ошибок за 30 прогонов - это не случайность, а свойство архитектуры. Модель не требует дополнительных валидаторов или страховочных механизмов на стороне клиента. Она просто работает.

Методология тестирования: 120 прогонов, 6 задач, 5 повторений

Все четыре модели тестировались в идентичном окружении. Шесть самопроверяемых задач покрывают типовые сценарии agentic coding: генерация кода по спецификации, рефакторинг с тестами, multi-file редактирование. Каждая задача прогонялась пять раз для оценки стабильности. Итоговые 120 прогонов дают достаточную выборку для выявления системных паттернов, хотя и не претендуют на полную статистическую значимость.

Что такое самопроверяемые задачи и почему они выбраны

Самопроверяемая задача содержит встроенный механизм валидации: набор unit-тестов, проверку вывода на эталонных данных или сравнение хеш-сумм результатов. Модель получает описание задачи, генерирует код, запускает его и видит результат проверки. Никакого человеческого судейства. Объективность абсолютна: тесты либо проходят, либо нет.

Этот подход исключает субъективную оценку качества кода и фокусируется на единственном критерии - работает ли решение. Для production-сценариев это единственная метрика, которая имеет значение.

Ограничения бенчмарка: что осталось за кадром

Шесть задач - узкая выборка. Она не охватывает долгосрочные агентные сессии с десятками последовательных действий, не тестирует работу с внешними API и не оценивает качество кода в ситуациях, где нет однозначно правильного ответа. Результаты нельзя механически переносить на другие домены - например, на задачи data science или DevOps-сценарии.

Пять повторений на задачу сглаживают случайные выбросы, но не гарантируют воспроизводимость на других наборах задач. Это моментальный снимок, а не исчерпывающее исследование.

KAT-Coder-V2.5-Dev: ноль ошибок и секрет эффективности

Модель от команды Kwaipilot построена по MOE-архитектуре: 35B общих параметров, 3B активных на каждом шаге инференса. RL-тренировка сократила долю ошибок в инструментальных метках с 9.34% до 0.28%, а повторы в одном витке упали до нуля. В нашем бенчмарке эти цифры подтвердились: 0 некорректных вызовов за 30 прогонов.

Детальный разбор архитектуры KAT-Coder и сравнение с Qwen2.5-Coder доступны в отдельной статье.

Как KAT-Coder экономит токены и что это значит для бюджета

KAT-Coder потребляет вдвое меньше входных токенов по сравнению с Qwen3.6. При цене API-провайдера в $0.5 за миллион токенов и нагрузке в 10 000 задач в месяц разница превращается в сотни долларов экономии. Для команды из пяти разработчиков, каждый из которых делает 50 агентных запросов в день, годовая экономия превышает $2 000.

Секрет в дисциплине: модель не переспрашивает, не уточняет очевидное, не генерирует избыточные рассуждения перед вызовом инструмента. Она действует. Это свойство RL-файнтюнинга, который оптимизирует не только правильность, но и лаконичность цепочек действий.

Qwen3.5-35B и Qwen3.6-35B: прогресс или регресс?

Qwen3.6 позиционируется как улучшенная версия 3.5. На практике в agentic-сценариях произошел откат. Там, где 3.5 действовала предсказуемо, 3.6 начала массово генерировать некорректные вызовы инструментов. 195 ошибок за 30 прогонов - это не шум, это системный сбой.

Анализ ошибок Qwen3.6: 195 некорректных вызовов

Типичный паттерн ошибки: модель вызывает инструмент с неверной сигнатурой, передает параметры не того типа или обращается к функции, которой нет в доступном наборе. Агентный фреймворк получает исключение, контекст частично теряется, и следующие шаги строятся на ошибочном предположении. Три-четыре таких сбоя подряд - и задача гарантированно провалена.

Вероятная причина - переоптимизация Qwen3.6 под статические бенчмарки кодинга в ущерб инструментальной дисциплине. Модель научилась писать красивый код, но разучилась корректно взаимодействовать со средой выполнения. Это напоминание: результаты на HumanEval или MBPP не гарантируют пригодности для agentic-систем.

Сравнение агентного поведения разных версий Qwen на реальных задачах мы разбирали в бенчмарке ThinkingCap vs Fable Fusion vs стоковый Qwen3.6-27B. Выводы аналогичны: дообученные версии часто проигрывают базовым в дисциплине.

Ornith: когда дообучение вредит

Ornith - специализированная дообученная версия одной из открытых моделей. Создатели обещали улучшенные результаты в задачах кодинга. Бенчмарк показал обратное: модель проиграла собственной базовой версии из-за механических ошибок, которые делают ее непригодной для практического применения.

Утечки формата и перезапись файлов: как это выглядит на практике

Утечка формата проявляется так: модель получает инструкцию в JSON-схеме, но в ответе смешивает разметку, добавляя лишние символы или экранируя кавычки не по стандарту. Парсер агентного фреймворка не может разобрать ответ, и шаг завершается ошибкой.

Перезапись файлов еще опаснее. Модель корректно генерирует код, но при вызове инструмента записи указывает неверный путь или перезаписывает уже готовый файл пустым содержимым. В многофайловых проектах это приводит к потере работы, проделанной на предыдущих шагах. Две-три таких ошибки - и весь прогресс обнулен.

Результаты тестов DeepSeek V4 Flash и Qwen 3.6 27B, где стабильность на длинных дистанциях оказалась ключевым фактором выбора, разбираются в этом сравнении.

Практические рекомендации: какую модель выбрать для agentic coding

Выбор модели сводится к трем критериям: надежность инструментальных вызовов, стоимость токенов и стабильность на повторных прогонах. KAT-Coder-V2.5-Dev лидирует по всем трем. Qwen3.5-35B остается допустимым вариантом, если бюджет ограничен, а редкие ошибки приемлемы. Qwen3.6 и Ornith в текущем состоянии не рекомендуются для автономных агентных систем.

Главное правило: никогда не внедряйте модель без собственного A/B-тестирования на реальных задачах. Бенчмарки показывают направление, но не гарантируют результат в вашем конкретном контексте.

Чек-лист для оценки модели перед внедрением

  1. Запустите модель на 10 ваших типовых задачах, каждую не менее 5 раз.
  2. Замерьте долю прогонов с хотя бы одним некорректным вызовом инструмента. Порог отбраковки - более 5%.
  3. Сравните среднее потребление входных токенов с базовой моделью. Разница более 30% должна быть обоснована улучшением других метрик.
  4. Проверьте стабильность: совпадают ли результаты на одних и тех же задачах при повторных прогонах.
  5. Сравните дообученную версию с базовой. Если прироста нет или он отрицательный - используйте базу.
  6. Оцените характер ошибок: механические сбои формата опаснее логических ошибок в коде, потому что ломают весь пайплайн.
  7. Проверьте, как модель ведет себя на длинных сессиях из 20+ последовательных шагов.

Выводы и следующие шаги

KAT-Coder-V2.5-Dev установил новую планку дисциплины инструментов для 35B-моделей: ноль ошибок за 30 прогонов при двукратной экономии токенов. Qwen3.6 откатился по сравнению с предшественником, сгенерировав 195 некорректных вызовов. Ornith показал, что некачественный файнтюнинг делает модель опасной для production-сценариев.

Эти результаты дополняют картину, которую мы наблюдаем в BigCodeArena: реальное исполнение кода выявляет проблемы, невидимые на статических бенчмарках. Модели, оптимизированные под тесты, часто проигрывают тем, что обучены взаимодействовать со средой.

Следующий шаг - тестирование на расширенном наборе из 20+ задач с длинными агентными сессиями. Если вы проводите собственные бенчмарки agentic-моделей - публикуйте результаты. Коллективный опыт быстрее выявит реальных лидеров, чем любые официальные рейтинги.

Подписаться на канал