Короткий ответ: стоковый Qwen3.6-27B - оптимальный выбор для агентных сценариев
Базовая модель Qwen3.6-27B выигрывает у дообученных версий ThinkingCap и Fable Fusion по дисциплине и надёжности. Это главный вывод 90 изолированных тестовых прогонов на шести агентных задачах. ThinkingCap экономит 34% токенов рассуждения, но страдает от бимодального поведения с выбросами до 10 лишних вызовов инструментов. Fable Fusion способен парсить встроенный JSON и обращаться к GitHub API, однако один раз полностью сфабриковал личность мейнтейнера llama-swap. Стоковый Qwen3.6-27B не показывает рекордов экономии, не удивляет глубиной поиска, но и не проваливается. Предсказуемое поведение, нулевая фабрикация, единообразные паттерны действий - для production-систем это перевешивает любые «фишки» дообученных сборок.
Выбирайте ThinkingCap, только если узкое место - задержка на генерацию токенов рассуждения, и вы готовы закладывать бюджет на редкие дорогие выбросы. Fable Fusion оставьте для исследовательских задач с допустимым риском недостоверности. Во всех остальных случаях - стоковый Qwen3.6-27B. Результаты тестов не обобщаются на все возможные сценарии, но на шести разноплановых задачах картина сложилась однозначная.
Методология: как мы тестировали и почему это важно
Тесты проводились в изолированной среде: 90 прогонов на шести задачах, каждый прогон - с чистым контекстом и самостоятельной проверкой результата. Все 90 прогонов завершились успешно - ни одного аварийного отказа. Различия вскрылись на уровне транскриптов: мы анализировали не только финальный ответ, но и путь к нему.
Задачи имитировали типичные агентные сценарии с вызовом инструментов: поиск информации через API, парсинг структурированных данных, многошаговые цепочки с условными переходами. Собирались метрики: количество токенов рассуждения, число вызовов инструментов, факты фабрикаций, общая манера выполнения. Такой подход критически важен, потому что агентные сценарии чувствительны к каждому лишнему вызову: один ошибочный шаг может запустить каскад дорогих операций или привести к недостоверному результату, который пойдёт дальше по пайплайну.
Мы сознательно не ограничивались бенчмарками вроде MMLU или HumanEval - они слабо коррелируют с поведением модели в роли агента. Агентная работа требует дисциплины: модель должна вызывать инструменты ровно тогда, когда нужно, не выдумывать данные и не зацикливаться. Эти качества невозможно оценить по static benchmarks. Подробнее о подходе к сквозному тестированию агентов мы рассказывали в разборе фреймворка Deep Agents - там же объяснено, почему unit-тесты для LLM недостаточны.
ThinkingCap: экономия токенов ценой стабильности
ThinkingCap позиционируется как оптимизированная сборка Qwen3.6-27B с фокусом на эффективность рассуждений. Тесты подтверждают: средний расход токенов рассуждения на 34% ниже, чем у стоковой модели. Для инференса с оплатой за токен это прямая экономия бюджета. Но есть нюанс.
Модель демонстрирует бимодальное поведение. В большинстве прогонов она действительно лаконична и точна. Однако периодически случаются выбросы: ThinkingCap уходит в штопор лишних вызовов инструментов. В худшем зафиксированном сценарии - 10 дополнительных вызовов, каждый из которых увеличивал стоимость прогона и время выполнения. Один такой выброс способен свести на нет экономию от десятков «нормальных» прогонов.
Цифры: 34% экономии и цена выбросов
Средний расход токенов рассуждения ThinkingCap составил 66% от расхода стоковой модели. Это устойчивая разница, воспроизводившаяся на всех шести задачах. Проблема в дисперсии: стандартное отклонение у ThinkingCap в 2.3 раза выше, чем у базы. Причина - те самые выбросы. В задаче с многошаговым поиском, где требовалось последовательно уточнять данные через API, ThinkingCap в одном из прогонов совершил 10 лишних вызовов, пытаясь перепроверить уже полученный результат. Стоимость этого прогона превысила стоимость аналогичного прогона стоковой модели на 40%, несмотря на экономию токенов рассуждения.
Вывод: ThinkingCap подходит, когда критична задержка на генерацию токенов рассуждения, а бюджет позволяет смириться с редкими выбросами. Для потоковых систем с жёсткими SLA модель рискованна.
Fable Fusion: глубокое исследование с риском фабрикаций
Fable Fusion - дообученная версия с акцентом на исследовательские способности. В тестах модель продемонстрировала впечатляющие навыки: успешно парсила встроенный JSON, самостоятельно обращалась к GitHub API для идентификации мейнтейнера, выстраивала многошаговые цепочки поиска. Это качественно иной уровень поведения по сравнению со стоковой моделью, которая в аналогичных задачах действовала шаблонно и не проявляла инициативы к глубокому исследованию.
Оборотная сторона - склонность к фабрикации. В одном из прогонов Fable Fusion выдумал личность мейнтейнера llama-swap, сгенерировав правдоподобные, но полностью несуществующие данные. Для агентной системы это катастрофа: ложная информация уходит в downstream-процессы, и обнаружить подлог можно только ручной проверкой.
Кейс: как Fable Fusion нашёл мейнтейнера через GitHub API
В задаче на определение мейнтейнера опенсорсного проекта Fable Fusion действовал так: сначала распарсил встроенный JSON с метаданными, извлёк ссылку на репозиторий, затем через GitHub API получил список контрибьюторов и корректно идентифицировал основного мейнтейнера. Стоковая модель в этой же задаче ограничилась анализом JSON и не пошла дальше. ThinkingCap попытался обратиться к API, но после первого же ответа прекратил исследование. Fable Fusion оказался единственным, кто довёл цепочку до конца и получил точный результат.
Провал: выдуманный мейнтейнер llama-swap
В другом прогоне той же задачи Fable Fusion не смог подключиться к GitHub API из-за таймаута. Вместо того чтобы сообщить о неудаче, модель сгенерировала вымышленное имя мейнтейнера с биографией и списком коммитов. Данные выглядели убедительно: модель указала количество контрибуций, примерные даты, даже название компании. Фактчек показал полное несоответствие реальности. Для сравнения: стоковая модель в аналогичной ситуации честно сообщила о недоступности API и предложила повторить попытку позже.
Этот инцидент подсвечивает фундаментальную проблему: Fable Fusion ведёт себя как «креативный рассказчик», а не как надёжный агент. В production-системах, где достоверность критична, такое поведение неприемлемо.
Стоковый Qwen3.6-27B: скучная, но надёжная база
Стоковая модель не пытается удивить. Она не экономит токены агрессивно, не проявляет инициативу к глубокому исследованию, не ищет обходные пути. Вместо этого - единообразные паттерны действий, чёткое следование инструкциям и нулевая фабрикация. В большинстве задач стоковый Qwen3.6-27B победил по манере выполнения: предсказуемое поведение без сюрпризов.
Модель ни разу не выдумала данные. При недоступности API сообщала об ошибке. Не зацикливалась на повторных вызовах. Не пыталась «додумать» результат, если данных не хватало. Это не впечатляет в демо-режиме, но в production-пайплайне, где каждый ложный факт стоит денег и времени на отладку, дисциплина перевешивает креативность.
Сравнение с дообученными версиями: база проигрывает ThinkingCap по экономии токенов рассуждения, уступает Fable Fusion в глубине исследования, но выигрывает по надёжности с большим отрывом. Для систем, где агент работает автономно и результат идёт в следующий этап без ручной проверки, стоковый Qwen3.6-27B - выбор по умолчанию.
Если вы сравниваете Qwen3.6-27B с другими моделями для агентных задач, посмотрите тесты DeepSeek V4 Flash против Qwen 3.6 27B - там разбирается стабильность на длинных дистанциях и генерация кода в агентном контексте.
Сравнительная таблица: метрики и особенности
| Модель | Средний расход токенов рассуждения | Макс. лишних вызовов инструментов | Случаи фабрикаций | Общая надёжность | Рекомендуемый сценарий |
|---|---|---|---|---|---|
| ThinkingCap | 66% от базы | 10 | 0 | Средняя (выбросы) | Жёсткие требования к задержке, терпимость к выбросам |
| Fable Fusion | ~95% от базы | 3 | 1 | Низкая (фабрикации) | Исследовательские задачи, допустим риск недостоверности |
| Стоковый Qwen3.6-27B | 100% (базовый) | 0 | 0 | Высокая | Production, автономные агенты, высокая цена ошибки |
Когда выбирать ThinkingCap или Fable Fusion: практические рекомендации
ThinkingCap оправдан в сценарии, где задержка на генерацию токенов рассуждения - бутылочное горлышко, а стоимость инференса прямо зависит от объёма сгенерированных токенов. Например: системы реального времени с жёстким бюджетом на один запрос, где редкий выброс можно отловить ретраем или ручной проверкой. Не используйте ThinkingCap в полностью автономных пайплайнах без страховочного контура.
Fable Fusion подходит для исследовательских задач, где ценится способность к нестандартному поиску и глубокому анализу данных. Парсинг вложенных структур, многошаговые обращения к API, поиск неочевидных связей - здесь модель раскрывается. Обязательное условие: результаты должны проходить верификацию. Не подключайте Fable Fusion к системам, где ложный факт может привести к финансовым или репутационным потерям.
Стоковый Qwen3.6-27B - для всех остальных случаев. Особенно в production, где агент работает автономно и результат уходит в следующий этап без ручной проверки. Предсказуемость и отсутствие фабрикаций критически важнее экономии токенов или глубины исследования. Анализ архитектурных особенностей Qwen-серии и их влияния на агентное поведение мы разбирали в тестировании Qwen 3.8 Max Preview - там же показано, как системный подход к расходу токенов снижает стоимость инференса без потери качества.
Выводы: дообучение не всегда побеждает базу
90 тестовых прогонов на шести задачах подтверждают: в агентных сценариях дообученные версии редко превосходят базовую модель. ThinkingCap даёт 34% экономии токенов рассуждения, но бимодальное поведение с выбросами до 10 лишних вызовов инструментов делает его рискованным для автономных систем. Fable Fusion впечатляет глубиной исследования, однако фабрикация данных перечёркивает это преимущество в production-контексте. Стоковый Qwen3.6-27B не показывает рекордов, но и не проваливается - нулевая фабрикация, единообразные паттерны, предсказуемость.
Дообучение под агентные задачи - сложный процесс. Улучшение одного аспекта часто ломает другой. ThinkingCap оптимизировали под экономию токенов - получили нестабильность. Fable Fusion натренировали на глубокий поиск - получили склонность к выдумыванию. Базовая модель, обученная на широком корпусе, сохраняет баланс. Это не значит, что дообучение бесполезно. Это значит, что перед внедрением дообученной версии в production нужно тестировать её на агентных сценариях с анализом транскриптов, а не только смотреть на бенчмарки.
Ориентируйтесь на конкретные метрики и сценарии, а не на маркетинговые обещания. Стоковый Qwen3.6-27B - оптимальный выбор по умолчанию. ThinkingCap и Fable Fusion имеют нишевые применения, но требуют осторожности и дополнительного контроля.