Перейти к содержанию
Публикация AiManual

Kodacode против Claude Code и OpenCode: как агентная оболочка меняет результаты DeepSeek V4 Flash

Koda прогнала DeepSeek V4 Flash через пять агентных оболочек: на уровне Max её оболочка дала 52,2%, KiloCode - 49,5%, Claude Code - 48,2%, OpenCode - 47,6%. Раз

Коротко

Что будет в материале

  1. 01

    Что именно измерила Koda: суть эксперимента и главные цифры

  2. 02

    «Индекс Кода»: из чего состоит методология и что она измеряет

  3. 03

    Почему оболочка вообще влияет на результат одной и той же модели

  4. 04

    Koda, Claude Code, OpenCode, KiloCode: чем отличаются оболочки

Что именно измерила Koda: суть эксперимента и главные цифры

Koda запустила одну и ту же модель DeepSeek V4 Flash в пяти агентных оболочках: Koda, KiloCode, Claude Code, OpenCode и Ouroboros. Движок, задачи и оценочный набор остались неизменными, менялась только обвязка: системные инструкции, набор инструментов и логика агентного цикла. Оценка шла по «Индексу Кода», собственному набору Koda из 261 агентной задачи.

Прямой ответ на главный вопрос: на уровне рассуждений Max оболочка Koda показала 52,2%, KiloCode - 49,5%, Claude Code - 48,2%, OpenCode - 47,6%. Разрыв между лидером и замыкающим составляет 4,6 процентных пункта. Для одного и того же движка на одном и том же наборе задач это заметная дельта.

Оговорка, без которой цифры читаются неправильно: замер проводила сама Koda, и её оболочка в этом замере выиграла. Это не отменяет результаты, но превращает их в сигнал о влиянии обвязки, а не в независимый рейтинг инструментов.

Результаты на уровне Max: разрыв в 4,6 п.п.

ОболочкаИндекс Кода, уровень MaxОтставание от лидера
Koda52,2%-
KiloCode49,5%2,7 п.п.
Claude Code48,2%4,0 п.п.
OpenCode47,6%4,6 п.п.

Результат Ouroboros в опубликованном описании не приведён, поэтому ставить её в таблицу было бы домыслом. Оболочка участвовала в прогоне, её цифра в открытых данных отсутствует.

Ещё один момент из таблицы: KiloCode обошёл Claude Code на 1,3 п.п. Если обвязка решает, то громкое имя инструмента не гарантирует лучший результат на сторонней модели. Похожий вывод давало сравнение Claude Code, OpenCode и Pi на той же модели DeepSeek V4 Flash: качество правок совпадало, а время и расход токенов различались кардинально.

Уровень Medium: результаты плотнее и местами меняются

На уровне рассуждений Medium картина смазывается: разрыв между оболочками сокращается, а порядок мест местами меняется. Конкретные проценты Medium в доступном описании не приводятся, и подставлять сюда свои числа нельзя. Важен сам факт: преимущество оболочки зависит от того, сколько шагов рассуждения ей разрешено потратить.

Практический вывод: выбирать оболочку раз и навсегда по одному замеру не стоит. Если вы работаете на уровне Medium с ограниченным бюджетом токенов, лидерство может уйти к другому инструменту.

«Индекс Кода»: из чего состоит методология и что она измеряет

Индекс собрали из 261 агентной задачи, разбитой на три категории. Это не проверка генерации функций в вакууме, а набор сценариев, похожих на рабочую рутину кодового агента.

Три категории задач и вес 2,5 для проектирования ПО

  • Разработка в существующей кодовой базе. Работа с чужим кодом: правки, рефакторинг, исправление багов, встраивание новых функций в сложившуюся структуру.
  • Проектирование ПО. Архитектура, новые модули, структура решения. У этой категории повышенный вес 2,5, то есть её вклад в итоговый балл в 2,5 раза выше, чем у задач с базовым весом.
  • Анализ данных. Обработка данных, интерпретация результатов, скрипты и запросы.

Повышенный вес проектирования смещает итог. Оболочка, которая уверенно держит многошаговый план и не теряет контекст на длинной дистанции, получит больше баллов, чем та, что хороша только в точечных правках.

Ограничения методологии: одна модель и собственный индекс

Слабые места замера перечислим прямо.

  • Прогон шёл только на DeepSeek V4 Flash. Переносить выводы на Qwen, GLM, Claude или семейство GPT-5.6 без отдельной проверки нельзя.
  • Индекс построила Koda, и она же участвовала в сравнении. Конфликт интересов налицо.
  • Состав задач, критерии зачёта и способ подсчёта баллов в открытом описании не раскрыты, поэтому воспроизвести замер со стороны не получится.
  • На уровне Medium результаты плотнее, значит устойчивость выводов ниже.

Цифры годятся как сигнал: обвязка влияет на итог. Как окончательный рейтинг оболочек они не работают.

Почему оболочка вообще влияет на результат одной и той же модели

Модель внутри оболочки не решает задачу одним вызовом. Она получает системный промпт, выбирает инструмент, читает результат, корректирует план и повторяет цикл. На каждом шаге обвязка может помочь или помешать. Разбор архитектуры пяти кодинг-хабаров показал, что смена обвязки меняла результат заметно сильнее, чем смена модели, вплоть до кратности. Замер Koda укладывается в ту же логику, хотя разрыв здесь скромнее.

Агентный цикл: планирование, инструменты, обработка ошибок

Ключевые узлы обвязки:

  • Декомпозиция. Как оболочка разбивает задачу на шаги и удерживает план при отвлечении на подзадачи.
  • Набор инструментов. Чтение и запись файлов, терминал, поиск по репозиторию, запуск тестов, линтеры. Если агенту нечем запустить тесты, он не проверит свой код и отдаст правку вслепую.
  • Обработка ошибок. Сколько попыток даётся, что попадает обратно в контекст после сбоя, есть ли ограничение на число циклов.
  • Критерий остановки. Решение о завершении работы. Ранний выход оставляет баги, поздний сжигает токены.

Пример на пальцах: агент изменил функцию и не может запустить юнит-тесты. Он не узнает, что сломал импорт в соседнем модуле. Наличие терминала здесь решает больше, чем лишний миллиард параметров.

Системные инструкции и управление контекстом

Системный промпт задаёт роль, ограничения и формат работы. Одни оболочки жёстко структурируют ответ и требуют пошагового плана, другие дают модели больше свободы. У обеих крайностей есть цена: жёсткая схема мешает на нестандартных задачах, свободная приводит к хаотичным правкам.

Управление контекстом работает рядом: что попадает в окно, что суммируется, что обрезается при переполнении. Агрессивная обрезка заставляет модель забывать детали задачи к середине работы, а длинный контекст стоит денег и времени. Разные оболочки выбирают разные точки на этой шкале, и на 261 задаче такие различия накапливаются в проценты. Формулировки промптов Koda не публиковала, поэтому конкретный вклад каждого узла в разрыв 4,6 п.п. из открытых данных не вывести.

Koda, Claude Code, OpenCode, KiloCode: чем отличаются оболочки

По устройству участников замера открытых данных немного, и выдумывать функции не будем. Есть то, что подтверждается публикациями.

Claude Code: параллельные потоки и память о решениях

Anthropic обновила проекты в Claude Code: внутри одного проекта ассистент сам делит работу на параллельные потоки, координирует их и накапливает память о принятых решениях. Технически каждый поток - отдельная облачная сессия со своей веткой и своей копией репозитория. Если два потока трогают один и тот же код, конфликт разрешается как обычное слияние веток.

В замере Koda на DeepSeek V4 Flash Claude Code набрал 48,2% на уровне Max, то есть ниже Koda и KiloCode. Из этого не следует, что архитектура слабая: оболочку оптимизировали под модели Anthropic, а не под сторонний движок. Сторонняя модель в чужой обвязке и своя модель в родной - два разных сценария.

Koda: оболочка и собственные модели

Koda развивает и обвязку, и модели: Koda Base на Qwen 3.8 Flash 125B и Koda Pro на GLM 5.3. В замере на DeepSeek V4 Flash её оболочка вышла на первое место по уровню Max. Тест проводила та же компания, что усиливает риск смещения в свою пользу: подбор задач, формулировки и критерии зачёта остаются на стороне организатора.

Обновлённые модели Koda: Base на Qwen 3.8 Flash 125B и Pro на GLM 5.3

Вместе с замерами Koda сообщила об обновлении собственных моделей. Koda Base построена на Qwen 3.8 Flash 125B и вышла на 49,5% по «Индексу Кода», Koda Pro на GLM 5.3 - на 54,3%.

Сравнивать эти цифры с 52,2% DeepSeek V4 Flash в оболочке Koda нужно аккуратно, потому что измерялись разные вещи. 52,2% показывают, как сторонняя модель работает в обвязке Koda. 49,5% и 54,3% - результат связки «своя модель плюс своя обвязка» на том же индексе. Koda Pro обошла DeepSeek V4 Flash по этому индексу на 2,1 п.п., и это аргумент в пользу своей модели, но только в рамках одного бенчмарка. Утверждать, что Koda Pro сильнее DeepSeek V4 Flash в целом, по одному числу нельзя.

Что это значит на практике: как выбирать оболочку под свои задачи

Универсального победителя из замера не выводится. Разложим варианты по сценариям с оговорками.

Кому подойдёт Koda

Если вы гоняете DeepSeek V4 Flash и хотите выжать максимум на задачах разработки и проектирования, оболочку Koda разумно попробовать. Плюс есть смысл посмотреть на её модели: связка Base на Qwen 3.8 Flash 125B и Pro на GLM 5.3 даёт готовый стек от одного поставщика. Ограничения: замер внутренний, независимых подтверждений нет, детали реализации обвязки не раскрыты. Проверяйте на своих задачах.

Кому подойдёт Claude Code

Claude Code берут ради параллельных потоков, координации и памяти о решениях внутри проекта. На крупной работе это экономит время на ручном разделении задач. На DeepSeek V4 Flash он показал 48,2%, ниже Koda и KiloCode, но это не приговор: с моделями Anthropic родная обвязка обычно даёт больше, чем сторонняя. Если вы уже платите за экосистему Anthropic, менять инструмент ради пары процентных пунктов на чужой модели смысла мало.

Кому подойдут OpenCode и KiloCode

KiloCode набрал 49,5% и обошёл Claude Code, что делает его интересной альтернативой с менее громким именем. OpenCode замкнул список с 47,6%, но отставание от лидера составляет те же 4,6 п.п. Если вам важны открытость, локальный запуск или конкретные функции этих инструментов, оба остаются рабочими вариантами. Устройство их агентного цикла в открытом описании не раскрыто, поэтому решение стоит принимать после прогона на своих задачах. Полезный ориентир по методике - бенчмарк 35B-моделей для кодинга с прозрачной методологией, там видно, как отличать реальные различия от шума.

Контекст рынка: DeepSeek V4.1 Flash, V4 Pro и цены API

Стоимость инференса может перевесить пару процентных пунктов индекса. DeepSeek V4.1 Flash позиционируется для кодовых агентов с длинным контекстом, инструментами, изображениями и большим потоком задач. В непиковое время прямая API DeepSeek берёт $0.15 за миллион некэшированных входных токенов и $0.60 за миллион выходных.

DeepSeek V4 Pro после отмены плана перевода на V4.1 Flash 14 сентября остался отдельным маршрутом со своей тарификацией. Цены зависят от времени суток: вне пика кеш, новый вход и выход стоят $0.022, $0.66 и $1.98 за миллион токенов, в пик - $0.044, $1.32 и $3.96. Пиковые окна действуют с понедельника по пятницу, 01:00-04:00 и 06:00-10:00 UTC, в остальное время, включая выходные, работает непиковая цена. Для десяти запусков агента по 100 000 новых входных и 20 000 выходных токенов разница между непиком и пиком доходит примерно до $1,06 против $2,11. Планирование тяжёлых прогонов на ночь или выходные экономит заметные деньги.

Снимок DeepSeek V4 Pro 0813 заменил V4 Pro Preview: архитектура сохранена, добавлен модуль спекулятивного декодирования DSpark. Если выбираете движок под агентную обвязку, пригодятся и практические сравнения вроде теста DeepSeek V4 Flash против Qwen 3.6 27B.

Итоги: что запомнить о Kodacode, Claude Code и OpenCode

  • Оболочка влияет на результат одной и той же модели: на уровне Max разрыв между Koda (52,2%) и OpenCode (47,6%) составил 4,6 п.п.
  • На уровне Medium результаты плотнее и порядок мест местами меняется, устойчивость выводов ниже.
  • «Индекс Кода» из 261 задачи построила Koda, и она же выиграла замер. Это ограничение интерпретации, а не приговор цифрам.
  • Замер шёл только на DeepSeek V4 Flash. Переносить его на другие модели без проверки нельзя.
  • Собственные модели Koda: Koda Base на Qwen 3.8 Flash 125B (49,5%) и Koda Pro на GLM 5.3 (54,3%).

Что делать дальше: возьмите 5-10 своих типовых задач, прогоните их в двух-трёх оболочках на одной и той же модели и сравните не только итог, но и расход токенов, и время. Чужой замер говорит лишь о том, что обвязку стоит подбирать осознанно. Какая оболочка выиграет на вашем коде, покажет только ваш прогон.

Подписаться на канал