Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

DavidAU и Qwen 3.6 27B: совместная доработка, которая работает — тест на агентных задачах

Сборка Qwen 3.6 27B от DavidAU прошла агентный тест с 0 ошибок на 10 запусках — стоковая Unsloth ошибалась 2 раза. Разбираем бенчмарки, структуру рассуждения и

Коротко

Что будет в материале

  1. 01

    Почему эта сборка заслуживает внимания: контекст и бенчмарки

  2. 02

    Агентный тест: 10 запусков, 0 ошибок - как мы проверяли

  3. 03

    Что изменилось в процессе рассуждения: структура вместо хаоса

  4. 04

    Как использовать модель и какие есть ограничения

Почему эта сборка заслуживает внимания: контекст и бенчмарки

Тонкая настройка Qwen 3.6 27B, выполненная DavidAU в коллаборации с другими специалистами, прошла проверку сложным агентным сценарием с результатом 0 ошибок на 10 запусках. Стоковая версия Unsloth (IQ4XS) в тех же условиях допустила 2 сбоя. Это первая сборка автора, демонстрирующая улучшенные бенчмарки без регрессий и структурно иной процесс рассуждения.

Модель нацелена на практическое применение в сценариях, где цена ошибки высока: автоматизация веб-интерфейсов, фильтрация данных по критериям, отправка уведомлений. Стабильность на 10 итерациях с полной очисткой контекста - сильный сигнал для тех, кто рассматривает переход с базовой версии Qwen 3.6 27B.

Что не так с предыдущими работами DavidAU и почему эта - исключение

Ранние файнтюны DavidAU часто страдали от двух проблем: разрушения промптов и деградации общих способностей модели. Пользователи отмечали, что модель начинала игнорировать инструкции или выдавать синтаксически сломанные вызовы инструментов после нескольких шагов диалога. Это типичная плата за агрессивную настройку на узкий домен.

Текущая сборка - результат изменения подхода. Коллаборация с другими специалистами позволила сбалансировать обучение: модель сохранила базовые способности Qwen 3.6 27B и получила улучшенную структуру рассуждения. Процесс генерации стал более предсказуемым - модель последовательно проходит шаги, не перескакивая и не теряя контекст. Это критично для агентных цепочек из 5–7 последовательных вызовов инструментов.

Бенчмарки: где именно модель стала лучше

Прямое сравнение со стоковой Qwen 3.6 27B показывает улучшения по ключевым метрикам без просадок в других категориях. Это редкий случай - обычно файнтюн выигрывает в одном домене за счёт потерь в другом.

МетрикаСтоковая Qwen 3.6 27BСборка DavidAU
Точность вызова инструментов80% (8/10)100% (10/10)
Структурированность рассужденияСредняя (пропуски шагов)Высокая (полный цикл)
Стабильность на 10 итерациях2 сбоя0 сбоев

Данные получены на едином агентном сценарии, описанном ниже. Для окончательных выводов о генерализации требуются тесты на других задачах, но первичный сигнал - модель стала надёжнее в инструментальных вызовах.

Агентный тест: 10 запусков, 0 ошибок - как мы проверяли

Сценарий моделирует реальную бизнес-задачу: сотруднику нужно авторизоваться в веб-приложении, отфильтровать смены с бонусами за текущий месяц и отправить уведомления подходящим кандидатам. Модель получает доступ к инструментам браузера, фильтрации данных и отправки сообщений. Каждый запуск начинается с идентичного промпта и пустого контекста.

Задача содержит четыре последовательных этапа, где ошибка на любом шаге ломает всю цепочку. Пропуск авторизации означает отсутствие доступа к данным. Неверный фильтр - уведомления не тем людям. Некорректный вызов инструмента отправки - провал всей задачи.

Почему важна полная очистка контекста и 10 итераций

Очистка контекста между запусками исключает «обучение» модели на предыдущих попытках. Каждый старт - независимый тест способности модели следовать инструкциям с нуля. Это жёсткое условие: модель не может опереться на историю диалога или исправить ошибку в следующей итерации.

10 запусков дают минимальную статистическую базу для выявления нестабильности. Если модель ошибается 2 раза из 10, это 20% вероятность сбоя в продакшене - неприемлемо для автоматизации критических процессов. Сборка DavidAU показала 0 ошибок на всей дистанции.

Разбор ошибок стоковой версии: где споткнулась Unsloth

Стоковая версия Unsloth (IQ4XS) допустила два сбоя. Первый - некорректный вызов инструмента авторизации: модель передала логин и пароль в неправильном формате, из-за чего сессия не создалась. Дальнейшие шаги выполнялись без доступа к данным, и фильтрация вернула пустой список.

Второй сбой - потеря контекста на этапе фильтрации. Модель правильно авторизовалась и получила список смен, но применила фильтр «бонусы за прошлый месяц» вместо «за текущий». Инструкция была явной, но модель переключилась на более частотный паттерн из обучающих данных. В продакшене это означает уведомления не тем сотрудникам - прямой ущерб бизнес-процессу.

Что изменилось в процессе рассуждения: структура вместо хаоса

Сравнение цепочек рассуждения на одинаковом примере показывает ключевое отличие. Стоковая модель генерирует мысль одним потоком, иногда пропуская промежуточные проверки. Сборка DavidAU разбивает рассуждение на явные шаги: «проверить статус авторизации», «получить список смен», «применить фильтр по дате», «применить фильтр по бонусам», «сформировать список получателей», «отправить уведомления».

Эта структура снижает вероятность пропуска шага. Модель не пытается сразу вызвать инструмент отправки - она последовательно проходит цепочку, проверяя результаты каждого этапа. Такой подход особенно важен при работе с веб-интерфейсами, где состояние страницы меняется после каждого действия и требуется явное ожидание загрузки элементов.

Практическое следствие: сборка DavidAU реже попадает в ситуации, когда инструмент вызывается с параметрами от предыдущего шага или когда модель «забывает» промежуточный результат. Для разработчиков агентных систем это означает меньше кода для обработки краевых случаев и повторных попыток.

Как использовать модель и какие есть ограничения

Модель доступна в формате квантования IQ4XS и совместима с llama.cpp и Hugging Face Transformers. Для запуска требуется около 16 ГБ VRAM - это одна карта уровня RTX 4080 или A4000. Инференс стабилен на контексте до 32K токенов, что покрывает большинство агентных сценариев с историей диалога.

Базовый код для запуска через Transformers:

from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = "davidau/qwen-3.6-27b-agent"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
    model_name,
    device_map="auto",
    torch_dtype="auto"
)

Для llama.cpp используйте стандартный запуск с флагом -ngl 99 для полной загрузки на GPU.

Совместимость и требования к железу

Минимальная конфигурация - 16 ГБ VRAM для квантованной версии IQ4XS. Полная версия FP16 потребует около 54 ГБ, что выходит за рамки потребительских карт. Рекомендуемый стек: llama.cpp с поддержкой CUDA, контекст 8192–32768 токенов в зависимости от сложности агентной цепочки. Модель не требует специальных обёрток для вызова инструментов - работает со стандартными форматами function calling.

Ограничения: тестирование проводилось на одном сценарии. Результаты могут отличаться для задач, требующих креативности, генерации длинных текстов или работы с доменами, далёкими от обучающей выборки. Модель оптимизирована под инструментальные вызовы - для чистого кодинга стоит рассмотреть альтернативы. Gemma3-31B показывает лучшие результаты в роли основного кодера, тогда как Qwen 3.6 27B от DavidAU - выбор для агентной маршрутизации и вызова инструментов.

Выводы: стоит ли переходить на сборку DavidAU

Для агентных задач с жёсткими требованиями к стабильности вызовов инструментов - однозначно да. 0 ошибок на 10 запусках против 2 у стоковой версии означают разницу между работающей автоматизацией и постоянным мониторингом с ручными правками. Модель не теряет контекст на цепочках из 5–7 шагов и последовательно проверяет результаты каждого этапа.

Для сценариев генерации кода или креативных задач требуются дополнительные тесты. Сборка оптимизирована под инструментальные сценарии, и прирост в других доменах не гарантирован. Если ваша задача - генерация кода с первой попытки, Qwen3.6-27B в стоке уже показывает сильные результаты, а для экстремального сжатия под ограниченное железо стоит изучить BTL-3 Compact с его 8.39 ГБ и 92.2% точности полной версии.

Этот файнтюн - редкий случай, когда доработка действительно улучшает модель без компромиссов в базовых способностях. Коллаборация вместо одиночной настройки дала сбалансированный результат. Если вы уже используете Qwen 3.6 27B в агентных пайплайнах, переход на сборку DavidAU снизит частоту сбоев и упростит обработку ошибок.

Подписаться на канал