Неожиданное открытие: Low > High по токенам
Тестирование модели DeepSeek-V4-Flash-0731 выявило парадокс. Режим усилий рассуждений Low генерирует на 25-100% больше выходных токенов, чем режим High. Это противоречит интуитивной логике: обычно более высокий уровень усилий подразумевает более длинные цепочки рассуждений и, следовательно, больший объём токенов. Здесь картина обратная.
Измерения проводились на локальном кванте UD-Q2_K_XL и через официальный API DeepSeek. В обоих средах паттерн сохранялся. На простых запросах разница достигала 25%, на сложных аналитических задачах разрыв расширялся до 100% и более. Low не просто «размышляет» - он делает это многословно, часто дублируя логические шаги или добавляя избыточные пояснения. High, напротив, выдаёт более сжатый, структурированный результат. Это открытие напрямую влияет на расчёт стоимости инференса: выбор «низкого» режима может неожиданно увеличить счёт за API.
Практический вывод: ориентироваться на названия режимов нельзя. Нужно измерять реальное потребление токенов на своих задачах. В этой статье мы разберём методику тестирования, детально сравним поведение четырёх режимов (none, low, high, max), покажем баг в OpenRouter, который ломает управление усилиями, и дадим рекомендации по оптимизации затрат.
Методика тестирования: как мы измеряли токены
Для проверки гипотезы о нестандартной токенизации мы использовали две среды: локальный квант модели и удалённые API. Это позволило исключить влияние конкретной платформы и подтвердить, что аномалия заложена в самой модели.
Локальный квант UD-Q2_K_XL: особенности и ограничения
Квант UD-Q2_K_XL - это сильно сжатая версия модели, оптимизированная для запуска на потребительском оборудовании. Квантование снижает точность весов, что может влиять на генерацию: модель иногда становится более «болтливой» или, наоборот, теряет связность. Мы осознанно выбрали этот квант, чтобы проверить, сохраняется ли парадокс токенизации в условиях ограниченных ресурсов. Результат: паттерн Low > High проявился и здесь, хотя абсолютные цифры токенов отличались от API. Это важная оговорка - на других квантах (Q4_K_M, Q6_K) пропорции могут сдвигаться.
Официальный API DeepSeek и OpenRouter: две среды - два поведения
Официальный API DeepSeek служил эталоном. Мы отправляли одинаковые промпты с параметром reasoning_effort, установленным в none, low, high и max. API DeepSeek стабильно демонстрировал описанный парадокс. OpenRouter, позиционируемый как универсальный прокси-сервис, повёл себя иначе. На части запросов режимы усилий игнорировались, и модель отвечала так, будто параметр не задан. Это указывает на баг в проксировании вызовов, который мы детально разберём в отдельном разделе.
Режимы усилий рассуждений: что означают none, low, high, max
DeepSeek-V4-Flash-0731 поддерживает четыре уровня усилий, управляющих глубиной внутренних рассуждений перед финальным ответом. Параметр reasoning_effort передаётся в API и меняет поведение модели принципиально, а не просто обрезает длину вывода.
- None: модель не генерирует цепочку рассуждений. Ответ формируется напрямую, как в стандартных чат-моделях. Минимальная задержка, минимальное потребление токенов.
- Low: минимальные рассуждения. Модель делает короткие логические шаги, но по задумке должна оставаться лаконичной. На практике именно здесь обнаружен парадокс многословности.
- High: стандартный уровень. Модель строит развёрнутую цепочку мыслей, но контролирует её объём, стремясь к чёткости и структуре.
- Max: максимальные усилия. Модель исследует множество альтернативных путей решения, проверяет гипотезы, ищет краевые случаи. Самый дорогой режим по токенам, но и самый глубокий по качеству анализа.
Ожидаемое поведение: количество токенов растёт от none к max. Реальность для DeepSeek-V4-Flash-0731: Low обгоняет High, а иногда приближается к Max. Причина кроется в том, как модель интерпретирует «минимальные усилия» - она не сокращает рассуждения, а меняет их стиль на более свободный и менее структурированный.
Парадокс Low vs High: детальный разбор токенизации
Сравнение ответов модели в режимах Low и High на одних и тех же промптах выявило системную разницу в структуре вывода. Low склонен к повторению уже сказанного, переформулированию одной мысли разными словами и включению в ответ фрагментов, которые в High отбрасываются как избыточные. High действует как редактор: он оставляет основную логическую линию, убирает повторы и выдаёт плотный, информативный текст.
Гипотеза: в режиме Low модель использует менее строгие эвристики для остановки генерации. Она «зацикливается» на отдельных шагах, проверяя их снова и снова. В режиме High включаются механизмы самоконтроля, которые обрезают лишние ветви рассуждений. Это различие критически важно для управления затратами, особенно при массовых вызовах API. Мы уже анализировали экономическую эффективность DeepSeek в сравнении с конкурентами - цена за миллион токенов здесь экстремально низкая, но лишние токены всё равно увеличивают итоговый счёт.
Пример 1: простая задача - где Low проигрывает в эффективности
Промпт: «Объясни разницу между списком и кортежем в Python». В режиме High модель выдала ответ из 4 пунктов, использовав 120 токенов. Чётко, с примерами кода, без воды. В режиме Low ответ занял 180 токенов. Модель добавила вводную фразу «Давайте разберёмся, это важный вопрос», дублировала объяснение про изменяемость в двух абзацах и привела пример, который повторял уже сказанное словами. Качество не выросло, стоимость увеличилась на 50%.
Пример 2: сложное рассуждение - неожиданная многословность Low
Промпт: «Проанализируй, как изменение ставки рефинансирования влияет на венчурные инвестиции, и предложи стратегию для стартапа в такой ситуации». High построил трёхшаговую цепочку: макроэкономический эффект, влияние на оценку рисков, практические рекомендации. 450 токенов, структурированный вывод. Low сгенерировал 920 токенов. Он включил пространные рассуждения о каждом шаге, возвращался к уже сделанным выводам, перепроверял их и добавлял оговорки. Ответ стал более «человечным», но потерял в чёткости. Для принятия решений такая многословность вредна: ключевые инсайты тонут в объёме текста.
Баг в OpenRouter: как он ломает режимы усилий
OpenRouter выступает посредником между пользователем и множеством AI-провайдеров. При тестировании DeepSeek-V4-Flash-0731 через этот сервис мы обнаружили, что параметр reasoning_effort не всегда передаётся модели. В части вызовов модель отвечала одинаково при установке low, high и max. Количество токенов и содержание ответа совпадали, что указывает на игнорирование параметра. Баг проявлялся нестабильно: иногда режимы работали корректно, иногда нет. Это делает OpenRouter непригодным для точного тестирования и production-использования модели с управлением усилиями.
Риск для разработчика: вы настраиваете режим High для экономии, а OpenRouter прокидывает вызов без параметра, и модель работает в режиме по умолчанию. Вы получаете неожиданный объём токенов и некорректные метрики. Мы уже сталкивались с подобными проблемами при сравнении моделей через разные scaffolding-решения - разница в проксировании может исказить результаты сильнее, чем архитектурные особенности модели.
Как проверить, что режим усилий работает правильно
- Отправьте тестовый промпт с известным ожидаемым поведением. Например, запрос на решение математической задачи, где важна цепочка рассуждений.
- Выполните три вызова с параметрами
reasoning_effort='none',reasoning_effort='high'иreasoning_effort='max'. - Сравните количество выходных токенов и структуру ответа. При none ответ должен быть прямым, без рассуждений. При high - содержать логические шаги. При max - быть максимально детальным.
- Если ответы для high и max идентичны или не отличаются от none - режимы усилий не работают. Используйте официальный API DeepSeek.
Практические рекомендации: какой режим выбрать для оптимизации затрат
Выбор режима зависит от задачи и требуемого соотношения цена/качество. Мы свели результаты измерений в таблицу на основе тестов локального кванта и API. Цифры усреднены по 20 промптам разной сложности.
| Режим | Среднее кол-во токенов | Относительная стоимость | Качество (субъективно) |
|---|---|---|---|
| None | 80 | 1x | Низкое (без рассуждений) |
| Low | 340 | 4.25x | Среднее (многословно) |
| High | 220 | 2.75x | Высокое (чётко, структурировано) |
| Max | 580 | 7.25x | Очень высокое (глубокий анализ) |
High оказался оптимальным для большинства сценариев. Он даёт высокое качество ответа при меньшем количестве токенов, чем Low. Max оправдан только для сложных исследовательских задач, где глубина анализа критична, а стоимость вторична. None подходит для простых чат-ботов и классификации, где рассуждения не нужны. Low мы не рекомендуем к использованию в текущей версии модели - он проигрывает High и по стоимости, и по качеству.
Сценарий 1: быстрые ответы без рассуждений - режим none
Используйте none, когда задача требует прямого ответа без анализа. Примеры: извлечение именованных сущностей из текста, перевод, ответы на фактологические вопросы («Сколько ГБ в терабайте?»). Экономия токенов по сравнению с High - около 60%. Модель не тратит ресурсы на внутренние монологи, что ускоряет ответ и снижает затраты.
Сценарий 2: баланс цены и глубины - почему High часто лучше Low
Для задач, требующих логического вывода, генерации кода или структурированного анализа, High даёт лучший результат за меньшие деньги. Модель в этом режиме дисциплинированна: она строит цепочку рассуждений, но отбрасывает лишнее. Low, вопреки названию, ведёт себя как «разговорчивый коллега» - он может дать правильный ответ, но вы потратите время на чтение и деньги на лишние токены. Прямое сравнение DeepSeek V4 Flash с Qwen 3.6 27B подтверждает, что в кодинге и агентных сценариях чёткость вывода критична, и High её обеспечивает.
Выводы и дальнейшие шаги
Главный инсайд: режим Low в DeepSeek-V4-Flash-0731 не является «низким» по потреблению токенов. Он генерирует на 25-100% больше токенов, чем High, из-за менее строгого контроля над структурой рассуждений. Это парадокс, который должен учитывать каждый, кто считает стоимость API.
Рекомендации:
- Всегда тестируйте модель на своих данных, не полагайтесь на названия режимов.
- Используйте официальный API DeepSeek для точных измерений - OpenRouter может искажать поведение из-за бага с пробросом параметров.
- High - текущий стандарт для большинства задач. Он даёт структурированный ответ за меньшее количество токенов, чем Low.
- Max включайте только для глубокого исследовательского анализа, когда стоимость не критична.
Данные актуальны на момент тестирования (июль-август 2026). Модель может обновиться, баг в OpenRouter - исправиться. Мы продолжим следить за развитием DeepSeek-V4-Flash и публиковать результаты новых тестов. Если вы уже экспериментировали с режимами усилий на своих задачах - ваши цифры помогут сообществу точнее оценить модель.