Перейти к содержанию
Публикация AiManual

DeepSeek V4 Flash vs Qwen 3.6 27B: Реальные тесты для agentic и coding сценариев

Сравниваем DeepSeek V4 Flash и Qwen 3.6 27B для coding и AI-агентов: качество кода, стабильность цепочек, скорость, стоимость и локальный запуск. Отдельно разби

Коротко

Что будет в материале

  1. 01

    Ключевые выводы: DeepSeek V4 Flash vs Qwen 3.6 27B

  2. 02

    Почему это сравнение важно именно сейчас

  3. 03

    Методология тестирования: как сравнивали модели

  4. 04

    Coding-тесты: генерация, отладка и рефакторинг

Ключевые выводы: DeepSeek V4 Flash vs Qwen 3.6 27B

По приведённым данным конкретного запуска DeepSeek V4 Flash выигрывает по скорости и стоимости инференса: около 185 токенов в секунду на указанном стенде, при цене примерно в 2,5 раза ниже Qwen 3.6 27B. Qwen 3.6 27B в тех же данных выглядит стабильнее: на 10 повторных прогонах сложных агентных цепочек модель не допустила критического сбоя, тогда как DeepSeek V4 Flash потеряла контекст в 2 случаях из 10. Версии моделей, провайдер и дата замера в исходных материалах не указаны, поэтому эти цифры нельзя считать универсальным результатом.

Для генерации кода с нуля обе модели показали сопоставимые результаты на задачах средней сложности: pass@1 = 0.82–0.85. Разрыв проявился на длинных сессиях: после 15 тысяч токенов контекста точность DeepSeek V4 Flash снизилась на 12%, Qwen 3.6 27B — на 4% в описанном запуске. Если нужна высокая скорость для коротких задач и быстрого прототипа, по этим данным предпочтительнее DeepSeek. Если приоритет — устойчивый AI-агент, работающий с длинной цепочкой действий, более осторожный выбор — Qwen 3.6 27B.

Ниже — компактная сводка заявленного сравнения. Для всех числовых результатов нужно учитывать один и тот же стенд и условия, описанные в методологии; размер набора coding-задач, формальный критерий успеха и воспроизводимые логи в исходных данных не приведены.

КритерийDeepSeek V4 FlashQwen 3.6 27B
Тип моделиMixture-of-Experts, в описании — 284B-A13Bdense-модель
Контекст в сравнении32 тысячи токенов по умолчанию; отдельно заявлен прогон на 128 тысячах32 тысячи токенов по умолчанию; отдельно заявлен прогон на 128 тысячах
Скорость185 токенов/сек в заявленном запуске; TTFT не приведён62 токена/сек в заявленном запуске; TTFT не приведён
Стоимость$0.12 за 1M входных и $0.48 за 1M выходных токенов*$0.35 за 1M входных и $1.05 за 1M выходных токенов*
VRAM для локального запускаОт 48 ГБ по данным исходного описания*RTX 4090 с 24 ГБ VRAM и 4-битной квантизацией по данным исходного описания*
Агентные задачи7/10 для сценария с API и файлами; 6/10 для цепочки из 8 шагов10/10 для сценария с API и файлами; 9/10 для цепочки из 8 шагов
Ключевые ограниченияВ отдельных прогонах чаще теряла контекст и вызывала несуществующие инструментыМедленнее и дороже; в одном прогоне перепутала порядок колонок при записи в базу данных
Дата замераНе указанаНе указана

* Важное ограничение: источник цен, версии моделей, провайдер, точная конфигурация запуска и дата измерения для этих значений не указаны. Таблица описывает данные конкретного запуска, а не независимый воспроизводимый бенчмарк.

Почему это сравнение важно именно сейчас

Сравнение DeepSeek V4 Flash и Qwen 3.6 27B важно для практического выбора модели под coding, AI-агентов и локальный запуск. В исходном материале DeepSeek V4 Flash описана как модель архитектуры Mixture-of-Experts (284B-A13B), а Qwen 3.6 27B — как dense-модель с фокусом на агентные сценарии и работу с инструментами. Дата релиза, первичные спецификации и утверждение о производительности уровня GPT-4o в исходных данных не подтверждены ссылками, поэтому их не следует использовать как установленные факты.

Отдельный вопрос — насколько официальные и пользовательские бенчмарки отражают работу на реальных задачах. В материале упоминается Laguna, форк DeepSeek, с результатом 7 успешных выполнений из 10 на одном из прогонов. Однако исходные логи, промпты и независимый источник для этого сравнения не приложены. Возможные причины расхождений — разные версии заданий, sampling, распределение задач и реализация tool use. Называть такие различия накруткой без контрольного исследования нельзя. Поэтому ниже приведены результаты описанного запуска с оговорками, а не заявление о полномасштабном независимом тестировании.

Методология тестирования: как сравнивали модели

В описании запуска указан сервер с 192 ГБ VRAM (8x RTX A6000), vLLM 0.6.3 для инференса, температура 0.1 для детерминированных тестов и 0.7 для творческих задач. Контекстное окно — 32 тысячи токенов, если не указано иное. Каждый тест, согласно описанию, прогонялся 10 раз с полной очисткой контекста между запусками.

При этом в исходных данных не указаны точные версии DeepSeek V4 Flash и Qwen 3.6 27B, провайдер, дата замеров, параметры sampling помимо температуры, исходные промпты и логи. Поэтому pass@k, стоимость, скорость и проценты успешных прогонов следует воспринимать как результаты конкретной конфигурации, а не как гарантированные характеристики моделей.

Метрики: pass@k (k=1,3,5) для coding-задач, процент успешных завершений для агентных сценариев, время до первого токена (TTFT) и общая пропускная способность. Для оценки стабильности считали дисперсию результатов на повторных прогонах и фиксировали случаи «галлюцинаций» — вызовов несуществующих инструментов или синтаксически некорректного кода. Размер набора coding-задач и формальное правило, по которому прогон считался успешным, в описании не раскрыты.

Тестовые сценарии включали генерацию Python/JavaScript/SQL кода по спецификации, рефакторинг легаси-кода с поиском уязвимостей, многошаговые агентные задачи с вызовом API, работой с файловой системой и парсингом веб-страниц. Заявлено, что использовались не синтетические бенчмарки, а задачи, близкие к ежедневной работе разработчика, но публичных промптов и исходных результатов для проверки этого утверждения нет.

Coding-тесты: генерация, отладка и рефакторинг

Генерация нового кода: кто пишет чище и быстрее

На задачах уровня LeetCode Medium в приведённом запуске обе модели показали близкий pass@1: 0.84 для DeepSeek V4 Flash и 0.82 для Qwen 3.6 27B. При неизвестном размере выборки такую разницу корректнее считать ориентиром, а не доказанным преимуществом. Qwen генерировала более многословный код с детальными комментариями — в среднем на 23% длиннее решений DeepSeek в этом наборе. Это может быть плюсом для поддержки кода и минусом для скорости инференса.

На сложных алгоритмических задачах, включая динамическое программирование и графы, в описанном прогоне DeepSeek V4 Flash получила pass@1 = 0.71 против 0.63 у Qwen 3.6 27B. Модель лучше справлялась с оптимизацией по памяти и времени выполнения. В качестве примера приведена задача поиска longest common subsequence для строк длиной 10^5 символов: DeepSeek предложила решение с O(n) по памяти, а Qwen использовала наивную O(n^2) реализацию, падающую на больших входных данных. Это наблюдение относится к конкретной формулировке задачи и не заменяет проверку на собственном наборе.

В веб-разработке, включая React-компоненты и SQL-запросы, Qwen 3.6 27B оказалась точнее в приведённых результатах. Модель лучше учитывала контекст предметной области и генерировала запросы с правильными JOIN'ами и индексами без явных подсказок. DeepSeek V4 Flash допустила синтаксические ошибки в 8% SQL-запросов против 3% у Qwen. Размер выборки и критерий синтаксической ошибки не опубликованы, поэтому процент нельзя переносить на все SQL-задачи.

Отладка и рефакторинг: поиск багов и улучшение легаси

В тесте на поиск уязвимостей в Python-коде из 500 строк Qwen 3.6 27B нашла 11 из 14 внедрённых проблем, включая SQL-инъекции, XSS и race conditions, а DeepSeek V4 Flash — 9 из 14. По описанию запуска Qwen лучше анализировала поток данных и отслеживала источники пользовательского ввода. DeepSeek пропустила две race conditions в асинхронном коде, однако без исходного файла и чек-листа уязвимостей этот результат нельзя независимо воспроизвести.

При рефакторинге монолитного скрипта в модульную структуру обе модели справились, но с разным качеством. Qwen 3.6 27B предложила архитектуру с чётким разделением ответственности, dependency injection и typed-интерфейсами. DeepSeek V4 Flash ограничилась механическим разбиением на файлы без заметного улучшения связности. Результат DeepSeek работал, но не решал проблему поддерживаемости в полном объёме.

Интересный кейс — поиск логической ошибки в рекурсивной функции с мемоизацией. Qwen 3.6 27B не только нашла баг, связанный с некорректным ключом кэширования, но и объяснила, почему он проявляется только на определённых входных данных. DeepSeek V4 Flash предложила переписать функцию итеративно: решение рабочее, но не показывающее понимания причины. Это качественное наблюдение по одному сценарию, а не отдельная количественная метрика.

Agentic-сценарии: автономное выполнение задач

Работа с инструментами: вызов API и управление файлами

Тестовый сценарий: модель получает доступ к терминалу, файловой системе и REST API вымышленного сервиса бронирования. Задача — найти свободные слоты на неделю, забронировать время, создать календарный файл и отправить email с подтверждением. В описании указаны 10 прогонов с полной очисткой контекста. Успешным считалось прохождение всей цепочки, но формальный чек-лист проверки результата в исходных данных не приложен.

Qwen 3.6 27B успешно выполнила задачу в 10 из 10 случаев по приведённым данным. Модель корректно обрабатывала ошибки API, когда сервер возвращал 503 на каждый третий запрос, использовала exponential backoff и не пыталась вызывать несуществующие эндпоинты. Среднее время выполнения составило 47 секунд в этом запуске.

DeepSeek V4 Flash справилась в 7 из 10 случаев. Два провала были связаны с «галлюцинацией» инструментов: модель вызывала create_event вместо book_slot, что ломало всю цепочку. Ещё в одном случае модель проигнорировала ошибку API и отправила email с неверной датой. Среднее время успешных прогонов составило 31 секунду. Это быстрее, но менее надёжно в рамках описанного сценария.

Многошаговые инструкции: удержание контекста и цели

Сценарий состоял из 8 последовательных шагов: прочитать CSV-файл с транзакциями, отфильтровать данные по дате, агрегировать по категориям, построить график, написать текстовый отчёт, отправить его в Slack, сохранить результаты в базу данных и запланировать повторное выполнение через cron. Контекст — 24 тысячи токенов.

Qwen 3.6 27B выполнила 9 из 10 прогонов без ошибок. Единственный сбой: модель перепутала порядок колонок при записи в базу данных на 7-м шаге, хотя предыдущие шаги были корректны. DeepSeek V4 Flash показала 6 из 10 успешных выполнений. Основная проблема в описании запуска — потеря контекста после 5-го шага: модель «забывала» начальную инструкцию и начинала импровизировать. В двух случаях импровизация привела к корректному результату, в двух — к полному провалу.

Ключевое различие в этих прогонах: Qwen 3.6 27B чаще явно проговаривала промежуточные цели в размышлениях, что помогало удерживать контекст. DeepSeek V4 Flash в том же сценарии генерировала более короткие рассуждения и экономила токены на размышлениях. Это даёт выигрыш в коротких задачах, но может приводить к деградации на длинных дистанциях. Причину нельзя уверенно сводить только к архитектуре модели: влиять могут промпт, параметры генерации и агентная обвязка.

Стабильность и надёжность: что показывают данные по Laguna

Модель Laguna, форк DeepSeek V4 Flash, обсуждается в контексте нестабильности. В исходном наборе замеров указано, что на 100 прогонах одной и той же агентной задачи Laguna показала 68% успешных завершений с дисперсией результатов 0.24. Для сравнения приведены стоковая DeepSeek V4 Flash с 74% и дисперсией 0.18, а также Qwen 3.6 27B с 91% и дисперсией 0.06. Версии моделей, условия запуска Laguna, критерий успеха и исходные логи не опубликованы, поэтому эти значения нельзя считать независимым подтверждением разницы между моделями.

В отдельном стресс-тесте с заявленным контекстом 128 тысяч токенов Qwen 3.6 27B сохраняла связность ответов на всей длине окна, а время ответа росло линейно. DeepSeek V4 Flash после 80 тысяч токенов начинала генерировать повторы и теряла нить рассуждения. Это наблюдаемое поведение конкретного запуска, но не доказательство предельного контекстного окна или общей проблемы всех версий моделей.

Объяснение через то, что эксперты MoE начинают «перегреваться», остаётся гипотезой. На длинный контекст также могут влиять маршрутизация экспертов, KV-cache, параметры sampling, квантование и реализация инференса. Без контрольного эксперимента с одинаковыми настройками нельзя выбрать одну причину.

В тестах с провокационными промптами, противоречивыми инструкциями и запросами на обход ограничений обе модели корректно отказывались от выполнения небезопасных действий. Qwen 3.6 27B была более консервативной и отклоняла запросы, которые DeepSeek V4 Flash пыталась выполнить с предупреждениями. Для продакшена это может означать меньше ложных срабатываний у Qwen, но и меньше гибкости. Поведение зависит от версии, системного промпта и настроек guardrails.

Бенчмарки vs реальность: почему результаты расходятся

В исходном тексте DeepSeek V4 Flash приписан результат pass@1 = 0.92 на HumanEval+. Ссылка на официальный отчёт, версия модели и настройки оценки не приведены. В сопоставленном запуске указано 0.84. Разницу в 8 процентных пунктов могут объяснять разные версии бенчмарка, наборы задач и настройки сэмплирования, но без первичных артефактов нельзя подтвердить конкретную причину.

Для Qwen 3.6 27B в исходном материале приведён результат 0.78 на AgentBench, тогда как в описанном замере получено 0.71. Расхождение составляет 7 процентных пунктов. Модель лучше работала с инструментами, описанными в формате, близком к обучающему, и хуже — с нестандартными API. Это может указывать на чувствительность к формату tool calling, но само по себе не доказывает переобучение или накрутку.

Практический вывод: официальные цифры полезны для первичного отсева моделей, но окончательное решение стоит принимать после проверки на собственных задачах. В приведённых примерах разрыв между бенчмарком и конкретным запуском составил 7–8 процентных пунктов; переносить этот диапазон на другие задачи нельзя.

Экономика: стоимость инференса и скорость

Актуальность цен: дата проверки и источник прайсинга в исходных данных не указаны. Значения ниже следует считать снимком конкретного сравнения и перепроверять перед расчётом бюджета или выбором провайдера.

В заявленном запуске DeepSeek V4 Flash указана цена $0.12 за 1M входных токенов и $0.48 за 1M выходных. Пропускная способность на стенде с 8x RTX A6000 и vLLM 0.6.3 составила 185 токенов/сек. Для Qwen 3.6 27B приведены $0.35 за 1M входных и $1.05 за 1M выходных токенов, а также скорость 62 токена/сек. Разница в стоимости по этим значениям — примерно в 2,5 раза в пользу DeepSeek.

Типовое агентное задание из 8 шагов в расчёте содержит около 15 тысяч входных и 3 тысячи выходных токенов. При таких допущениях стоимость выполнения составляет $0.0032 для DeepSeek V4 Flash и $0.0084 для Qwen 3.6 27B. При 1000 заданиях в день это даёт около $5.2 экономии в день, или примерно $156 за 30 дней. Расчёт не учитывает повторные вызовы, tool calls, кэширование, ошибки и плату за инфраструктуру.

Локальный запуск Qwen 3.6 27B, согласно исходному описанию, возможен на одной RTX 4090 с 24 ГБ VRAM и 4-битной квантизацией. Для DeepSeek V4 Flash указано требование минимум 48 ГБ VRAM даже в квантованном виде. Эти требования зависят от формата весов, длины контекста, KV-cache и рантайма, поэтому перед сборкой конфигурации их нужно проверить для конкретного checkpoint. Для конфиденциальных данных из двух рассматриваемых вариантов Qwen выглядит более практичным решением для локального запуска без внешнего API. Детальный разбор требований к железу есть в нашем сравнении агентных моделей — сравнении Minimax 2.7, DeepSeek V4 Flash и Laguna S 2.1 на стенде с 192 ГБ VRAM.

Рекомендации: какую модель выбрать для coding, AI-агентов и локального запуска

Матрица выбора по приведённым результатам конкретного запуска:

  • Максимальная скорость и минимальная стоимость: DeepSeek V4 Flash. Подходит для продакшен-пайплайнов с жёсткими бюджетами, если задачи атомарны и не требуют длинного контекста. Надёжность цепочки нужно проверять отдельно.
  • Стабильная агентная работа: Qwen 3.6 27B. Более осторожный выбор для автономных агентов, работающих длительное время без постоянного контроля. Для продакшена всё равно нужны guardrails, журналирование и возможность отката.
  • Локальный запуск и конфиденциальность: Qwen 3.6 27B. В описанных условиях модель требует меньше VRAM и не предполагает отправку данных во внешние API, но фактические требования зависят от квантизации и длины контекста.
  • Сложный рефакторинг и анализ кода: Qwen 3.6 27B. В приведённых качественных примерах глубже анализировала архитектуру и поток данных, предлагая более осмысленные улучшения.
  • Быстрый прототип и генерация кода: DeepSeek V4 Flash. Выигрывает в скорости, а качество кода на задачах средней сложности оказалось сопоставимым с Qwen.

Сценарии, где обе модели могут не справиться: задачи, требующие более 100 тысяч токенов контекста, жёсткие требования к безопасности без дополнительных guardrails и работа с доменно-специфичными языками без файнтюнинга. Для длинного контекста можно рассмотреть Claude 4 или Gemini 2.5 Pro, но их доступный контекст, цена и политики также нужно проверять на момент выбора. Для агентных задач стоит дополнительно рассмотреть Laguna S 2.1: в отдельном разборе Laguna S 2.1 против DeepSeek V4 Flash указано 70.2% на Terminal-Bench 2.1 при меньшей стоимости, однако этот результат получен в другой методологии и не является прямым сравнением с Qwen.

Если вы строите систему автоматизированного тестирования агентов, обратите внимание на фреймворк Harbor из материала о методике сквозного тестирования AI-агентов. Такой подход помогает повторять сценарии, фиксировать сбои и находить проблемы до выхода в продакшн; конкретный выигрыш по времени зависит от harness и инфраструктуры.

Подписаться на канал