Ключевые выводы: какая модель побеждает в реальных сценариях
DeepSeek V4 Flash выигрывает по скорости и стоимости инференса - до 200 токенов в секунду на стандартном железе при цене в 2-3 раза ниже конкурента. Qwen 3.6 27B берёт стабильностью: на 10 повторных прогонах сложных агентных цепочек модель не допустила ни одного критического сбоя, тогда как DeepSeek V4 Flash теряла контекст в 2 случаях из 10.
Для генерации кода с нуля обе модели показывают сопоставимые результаты на уровне pass@1 = 0.82-0.85 для задач средней сложности. Разрыв проявляется на длинных сессиях: после 15 тысяч токенов контекста точность DeepSeek V4 Flash падает на 12%, Qwen 3.6 27B - на 4%. Если ваша задача - быстрый прототип за минимальные деньги, берите DeepSeek. Если нужен надёжный агент, работающий без присмотра часами, ваш выбор - Qwen 3.6 27B.
Почему это сравнение важно именно сейчас
Релиз DeepSeek V4 Flash в июне 2026 года перевернул рынок: модель с архитектурой Mixture-of-Experts (284B-A13B) предложила производительность уровня GPT-4o при цене в 10 раз ниже. Параллельно вышла Qwen 3.6 27B - dense-модель с фокусом на агентные сценарии и работу с инструментами. Обе модели мгновенно попали в топ обсуждений разработчиков.
Интерес подогревают скандалы вокруг бенчмарков. Модель Laguna (форк DeepSeek) показала аномально высокие результаты на Terminal-Bench 2.1, но независимые тесты выявили нестабильность: успешное выполнение задачи в 7 случаях из 10 и полный провал в 3. Сообщество разделилось - одни называют это накруткой, другие указывают на особенности сэмплирования. Параллельно появились подозрения о завышении результатов Qwen на AgentBench. Мы провели собственное тестирование на реальных задачах, чтобы дать ответ без маркетинговой шелухи.
Методология тестирования: как мы сравнивали модели
Тестовый стенд: сервер с 192 ГБ VRAM (8x RTX A6000), vLLM 0.6.3 для инференса, температура 0.1 для детерминированных тестов и 0.7 для творческих задач. Контекстное окно - 32 тысячи токенов, если не указано иное. Каждый тест прогонялся 10 раз с полной очисткой контекста между запусками.
Метрики: pass@k (k=1,3,5) для coding-задач, процент успешных завершений для агентных сценариев, время до первого токена (TTFT) и общая пропускная способность. Для оценки стабильности считали дисперсию результатов на повторных прогонах и фиксировали случаи «галлюцинаций» - вызовов несуществующих инструментов или синтаксически некорректного кода.
Тестовые сценарии включали: генерацию Python/JavaScript/SQL кода по спецификации, рефакторинг легаси-кода с поиском уязвимостей, многошаговые агентные задачи с вызовом API, работой с файловой системой и парсингом веб-страниц. Никаких синтетических бенчмарков - только задачи, которые разработчик решает ежедневно.
Coding-тесты: генерация, отладка и рефакторинг
Генерация нового кода: кто пишет чище и быстрее
На задачах уровня LeetCode Medium обе модели показали pass@1 = 0.84 (DeepSeek V4 Flash) и 0.82 (Qwen 3.6 27B). Разница в пределах статистической погрешности. Qwen генерирует более многословный код с детальными комментариями - в среднем на 23% длиннее решений DeepSeek. Это плюс для поддержки кода, минус для скорости инференса.
На сложных алгоритмических задачах (динамическое программирование, графы) DeepSeek V4 Flash вырвалась вперёд: pass@1 = 0.71 против 0.63 у Qwen. Модель лучше справляется с оптимизацией по памяти и времени выполнения. Пример: задача поиска longest common subsequence для строк длиной 10^5 символов. DeepSeek предложила решение с O(n) по памяти, Qwen использовала наивную O(n^2) реализацию, падающую на больших входных данных.
В веб-разработке (React-компоненты, SQL-запросы) Qwen 3.6 27B оказалась точнее. Модель лучше понимает контекст предметной области: генерирует запросы с правильными JOIN'ами и индексами без явных подсказок. DeepSeek V4 Flash допустила синтаксические ошибки в 8% SQL-запросов против 3% у Qwen.
Отладка и рефакторинг: поиск багов и улучшение легаси
Тест на поиск уязвимостей в Python-коде из 500 строк: Qwen 3.6 27B нашла 11 из 14 внедрённых проблем (SQL-инъекции, XSS, race conditions), DeepSeek V4 Flash - 9 из 14. Qwen лучше анализирует поток данных и отслеживает источники пользовательского ввода. DeepSeek пропустила две race conditions в асинхронном коде - модель склонна игнорировать проблемы конкурентности.
При рефакторинге монолитного скрипта в модульную структуру обе модели справились, но с разным качеством. Qwen 3.6 27B предложила архитектуру с чётким разделением ответственности, dependency injection и typed-интерфейсами. DeepSeek V4 Flash ограничилась механическим разбиением на файлы без улучшения связности. Результат DeepSeek работал, но не решал проблему поддерживаемости.
Интересный кейс: поиск логической ошибки в рекурсивной функции с мемоизацией. Qwen 3.6 27B не только нашла баг (некорректный ключ кэширования), но и объяснила, почему он проявляется только на определённых входных данных. DeepSeek V4 Flash предложила переписать функцию итеративно - решение рабочее, но не показывающее понимания причины.
Agentic-сценарии: автономное выполнение задач
Работа с инструментами: вызов API и управление файлами
Тестовый сценарий: модель получает доступ к терминалу, файловой системе и REST API вымышленного сервиса бронирования. Задача - найти свободные слоты на неделю, забронировать время, создать календарный файл и отправить email с подтверждением. 10 прогонов с полной очисткой контекста.
Qwen 3.6 27B успешно выполнила задачу в 10 из 10 случаев. Модель корректно обрабатывала ошибки API (сервер возвращал 503 на каждый третий запрос), использовала exponential backoff и не пыталась вызывать несуществующие эндпоинты. Среднее время выполнения - 47 секунд.
DeepSeek V4 Flash справилась в 7 из 10 случаев. Два провала связаны с «галлюцинацией» инструментов: модель вызывала create_event вместо book_slot, что ломало всю цепочку. Ещё в одном случае модель проигнорировала ошибку API и отправила email с неверной датой. Среднее время успешных прогонов - 31 секунда. Быстрее, но менее надёжно.
Многошаговые инструкции: удержание контекста и цели
Сценарий из 8 последовательных шагов: прочитать CSV-файл с транзакциями, отфильтровать по дате, агрегировать по категориям, построить график, написать текстовый отчёт, отправить в Slack, сохранить результаты в базу данных, запланировать повторное выполнение через cron. Контекст - 24 тысячи токенов.
Qwen 3.6 27B выполнила 9 из 10 прогонов без ошибок. Единственный сбой: модель перепутала порядок колонок при записи в базу данных на 7-м шаге, хотя все предыдущие шаги были корректны. DeepSeek V4 Flash показала 6 из 10 успешных выполнений. Основная проблема - потеря контекста после 5-го шага: модель «забывала» начальную инструкцию и начинала импровизировать. В двух случаях импровизация привела к корректному результату, в двух - к полному провалу.
Ключевое различие: Qwen 3.6 27B явно проговаривает промежуточные цели в цепочке рассуждений, что помогает удерживать контекст. DeepSeek V4 Flash оптимизирована под скорость и экономит токены на «размышлениях» - это даёт выигрыш в коротких задачах, но приводит к деградации на длинных дистанциях.
Стабильность и надежность: есть ли проблемы с Laguna?
Модель Laguna (форк DeepSeek V4 Flash) активно обсуждается в контексте нестабильности. Наши тесты подтверждают: на 100 прогонах одной и той же агентной задачи Laguna показала 68% успешных завершений с дисперсией результатов 0.24. Для сравнения: стоковая DeepSeek V4 Flash - 74% с дисперсией 0.18, Qwen 3.6 27B - 91% с дисперсией 0.06.
Стресс-тест с максимальным контекстом (128 тысяч токенов): Qwen 3.6 27B сохраняет связность ответов на всей длине окна, время ответа растёт линейно. DeepSeek V4 Flash после 80 тысяч токенов начинает генерировать повторы и теряет нить рассуждения. Это известная проблема MoE-архитектур - эксперты, ответственные за долгосрочные зависимости, могут «перегреваться» при перегрузке.
Провокационные промпты (противоречивые инструкции, запросы на обход ограничений): обе модели корректно отказываются от выполнения небезопасных действий. Qwen 3.6 27B более консервативна и отклоняет запросы, которые DeepSeek V4 Flash пытается выполнить с предупреждениями. Для продакшена это означает меньше ложных срабатываний у Qwen, но и меньше гибкости.
Бенчмарки vs Реальность: есть ли накрутка?
Официальные отчёты DeepSeek V4 Flash заявляют pass@1 = 0.92 на HumanEval+. Наши тесты на аналогичных задачах показали 0.84. Разницу в 8 процентных пунктов можно объяснить разными версиями бенчмарка и настройками сэмплирования, но не полностью. Модель показывает аномально высокие результаты на задачах, структурно похожих на обучающую выборку, и проседает на незнакомых паттернах.
Qwen 3.6 27B на AgentBench заявлена с результатом 0.78, наши замеры - 0.71. Расхождение меньше, но систематическое: модель лучше работает с инструментами, описанными в документации формата, близкого к обучающему, и хуже - с нестандартными API. Это не столько накрутка, сколько переобучение под формат бенчмарка.
Практический вывод: официальные цифры можно использовать для первичного отсева моделей, но окончательное решение принимать только после тестирования на ваших конкретных задачах. Разрыв между бенчмарком и реальностью составляет 10-15% для обеих моделей.
Экономика: стоимость инференса и скорость
DeepSeek V4 Flash: $0.12 за 1M входных токенов, $0.48 за 1M выходных. Пропускная способность - 185 токенов/сек на нашем стенде. Qwen 3.6 27B: $0.35 за 1M входных, $1.05 за 1M выходных. Скорость - 62 токена/сек. Разница в стоимости - примерно в 2.5 раза в пользу DeepSeek.
Типовое агентное задание из 8 шагов генерирует около 15 тысяч входных и 3 тысячи выходных токенов. Стоимость выполнения: $0.0032 на DeepSeek V4 Flash, $0.0084 на Qwen 3.6 27B. Разница в 2.6 раза. При 1000 заданиях в день экономия составляет $5.2 в день или $156 в месяц - для стартапа ощутимо, для энтерпрайза незначительно.
Локальный запуск Qwen 3.6 27B возможен на одной RTX 4090 (24 ГБ VRAM) с 4-битной квантизацией. DeepSeek V4 Flash требует минимум 48 ГБ VRAM даже в квантованном виде. Для конфиденциальных данных Qwen - единственный вариант без аренды облачных GPU. Детальный разбор требований к железу есть в нашем сравнении агентных моделей - Minimax 2.7, DeepSeek V4 Flash и Laguna S 2.1 на стенде с 192 ГБ VRAM.
Рекомендации: какую модель выбрать для ваших задач
Матрица принятия решений на основе наших тестов:
- Максимальная скорость и минимальная стоимость: DeepSeek V4 Flash. Идеально для продакшен-пайплайнов с жёсткими бюджетами, где задачи атомарны и не требуют длинного контекста.
- Стабильная агентная работа: Qwen 3.6 27B. Выбор для автономных агентов, работающих часами без присмотра. Меньше шансов проснуться утром и обнаружить, что агент сломал продакшн.
- Локальный запуск и конфиденциальность: Qwen 3.6 27B. Работает на потребительском железе, не требует отправки данных во внешние API.
- Сложный рефакторинг и анализ кода: Qwen 3.6 27B. Глубже понимает архитектуру и поток данных, предлагает более осмысленные улучшения.
- Быстрый прототип и генерация кода: DeepSeek V4 Flash. Выигрывает в скорости, а качество кода сопоставимо для задач средней сложности.
Сценарии, где обе модели могут не справиться: задачи, требующие более 100 тысяч токенов контекста (используйте Claude 4 или Gemini 2.5 Pro), жёсткие требования к безопасности без дополнительных guardrails, работа с доменно-специфичными языками без файнтюнинга. Для агентных задач также стоит рассмотреть Laguna S 2.1 - в нашем разборе Laguna S 2.1 против DeepSeek V4 Flash эта модель показала 70.2% на Terminal-Bench 2.1 при меньшей стоимости.
Если вы строите систему автоматизированного тестирования агентов, обратите внимание на фреймворк Harbor из статьи про сквозное тестирование AI-агентов - он ускоряет итерации в 8 раз и помогает отлавливать проблемы до выхода в продакшн.