Что именно измерила Koda: суть эксперимента и главные цифры
Koda запустила одну и ту же модель DeepSeek V4 Flash в пяти агентных оболочках: Koda, KiloCode, Claude Code, OpenCode и Ouroboros. Движок, задачи и оценочный набор остались неизменными, менялась только обвязка: системные инструкции, набор инструментов и логика агентного цикла. Оценка шла по «Индексу Кода», собственному набору Koda из 261 агентной задачи.
Прямой ответ на главный вопрос: на уровне рассуждений Max оболочка Koda показала 52,2%, KiloCode - 49,5%, Claude Code - 48,2%, OpenCode - 47,6%. Разрыв между лидером и замыкающим составляет 4,6 процентных пункта. Для одного и того же движка на одном и том же наборе задач это заметная дельта.
Оговорка, без которой цифры читаются неправильно: замер проводила сама Koda, и её оболочка в этом замере выиграла. Это не отменяет результаты, но превращает их в сигнал о влиянии обвязки, а не в независимый рейтинг инструментов.
Результаты на уровне Max: разрыв в 4,6 п.п.
| Оболочка | Индекс Кода, уровень Max | Отставание от лидера |
|---|---|---|
| Koda | 52,2% | - |
| KiloCode | 49,5% | 2,7 п.п. |
| Claude Code | 48,2% | 4,0 п.п. |
| OpenCode | 47,6% | 4,6 п.п. |
Результат Ouroboros в опубликованном описании не приведён, поэтому ставить её в таблицу было бы домыслом. Оболочка участвовала в прогоне, её цифра в открытых данных отсутствует.
Ещё один момент из таблицы: KiloCode обошёл Claude Code на 1,3 п.п. Если обвязка решает, то громкое имя инструмента не гарантирует лучший результат на сторонней модели. Похожий вывод давало сравнение Claude Code, OpenCode и Pi на той же модели DeepSeek V4 Flash: качество правок совпадало, а время и расход токенов различались кардинально.
Уровень Medium: результаты плотнее и местами меняются
На уровне рассуждений Medium картина смазывается: разрыв между оболочками сокращается, а порядок мест местами меняется. Конкретные проценты Medium в доступном описании не приводятся, и подставлять сюда свои числа нельзя. Важен сам факт: преимущество оболочки зависит от того, сколько шагов рассуждения ей разрешено потратить.
Практический вывод: выбирать оболочку раз и навсегда по одному замеру не стоит. Если вы работаете на уровне Medium с ограниченным бюджетом токенов, лидерство может уйти к другому инструменту.
«Индекс Кода»: из чего состоит методология и что она измеряет
Индекс собрали из 261 агентной задачи, разбитой на три категории. Это не проверка генерации функций в вакууме, а набор сценариев, похожих на рабочую рутину кодового агента.
Три категории задач и вес 2,5 для проектирования ПО
- Разработка в существующей кодовой базе. Работа с чужим кодом: правки, рефакторинг, исправление багов, встраивание новых функций в сложившуюся структуру.
- Проектирование ПО. Архитектура, новые модули, структура решения. У этой категории повышенный вес 2,5, то есть её вклад в итоговый балл в 2,5 раза выше, чем у задач с базовым весом.
- Анализ данных. Обработка данных, интерпретация результатов, скрипты и запросы.
Повышенный вес проектирования смещает итог. Оболочка, которая уверенно держит многошаговый план и не теряет контекст на длинной дистанции, получит больше баллов, чем та, что хороша только в точечных правках.
Ограничения методологии: одна модель и собственный индекс
Слабые места замера перечислим прямо.
- Прогон шёл только на DeepSeek V4 Flash. Переносить выводы на Qwen, GLM, Claude или семейство GPT-5.6 без отдельной проверки нельзя.
- Индекс построила Koda, и она же участвовала в сравнении. Конфликт интересов налицо.
- Состав задач, критерии зачёта и способ подсчёта баллов в открытом описании не раскрыты, поэтому воспроизвести замер со стороны не получится.
- На уровне Medium результаты плотнее, значит устойчивость выводов ниже.
Цифры годятся как сигнал: обвязка влияет на итог. Как окончательный рейтинг оболочек они не работают.
Почему оболочка вообще влияет на результат одной и той же модели
Модель внутри оболочки не решает задачу одним вызовом. Она получает системный промпт, выбирает инструмент, читает результат, корректирует план и повторяет цикл. На каждом шаге обвязка может помочь или помешать. Разбор архитектуры пяти кодинг-хабаров показал, что смена обвязки меняла результат заметно сильнее, чем смена модели, вплоть до кратности. Замер Koda укладывается в ту же логику, хотя разрыв здесь скромнее.
Агентный цикл: планирование, инструменты, обработка ошибок
Ключевые узлы обвязки:
- Декомпозиция. Как оболочка разбивает задачу на шаги и удерживает план при отвлечении на подзадачи.
- Набор инструментов. Чтение и запись файлов, терминал, поиск по репозиторию, запуск тестов, линтеры. Если агенту нечем запустить тесты, он не проверит свой код и отдаст правку вслепую.
- Обработка ошибок. Сколько попыток даётся, что попадает обратно в контекст после сбоя, есть ли ограничение на число циклов.
- Критерий остановки. Решение о завершении работы. Ранний выход оставляет баги, поздний сжигает токены.
Пример на пальцах: агент изменил функцию и не может запустить юнит-тесты. Он не узнает, что сломал импорт в соседнем модуле. Наличие терминала здесь решает больше, чем лишний миллиард параметров.
Системные инструкции и управление контекстом
Системный промпт задаёт роль, ограничения и формат работы. Одни оболочки жёстко структурируют ответ и требуют пошагового плана, другие дают модели больше свободы. У обеих крайностей есть цена: жёсткая схема мешает на нестандартных задачах, свободная приводит к хаотичным правкам.
Управление контекстом работает рядом: что попадает в окно, что суммируется, что обрезается при переполнении. Агрессивная обрезка заставляет модель забывать детали задачи к середине работы, а длинный контекст стоит денег и времени. Разные оболочки выбирают разные точки на этой шкале, и на 261 задаче такие различия накапливаются в проценты. Формулировки промптов Koda не публиковала, поэтому конкретный вклад каждого узла в разрыв 4,6 п.п. из открытых данных не вывести.
Koda, Claude Code, OpenCode, KiloCode: чем отличаются оболочки
По устройству участников замера открытых данных немного, и выдумывать функции не будем. Есть то, что подтверждается публикациями.
Claude Code: параллельные потоки и память о решениях
Anthropic обновила проекты в Claude Code: внутри одного проекта ассистент сам делит работу на параллельные потоки, координирует их и накапливает память о принятых решениях. Технически каждый поток - отдельная облачная сессия со своей веткой и своей копией репозитория. Если два потока трогают один и тот же код, конфликт разрешается как обычное слияние веток.
В замере Koda на DeepSeek V4 Flash Claude Code набрал 48,2% на уровне Max, то есть ниже Koda и KiloCode. Из этого не следует, что архитектура слабая: оболочку оптимизировали под модели Anthropic, а не под сторонний движок. Сторонняя модель в чужой обвязке и своя модель в родной - два разных сценария.
Koda: оболочка и собственные модели
Koda развивает и обвязку, и модели: Koda Base на Qwen 3.8 Flash 125B и Koda Pro на GLM 5.3. В замере на DeepSeek V4 Flash её оболочка вышла на первое место по уровню Max. Тест проводила та же компания, что усиливает риск смещения в свою пользу: подбор задач, формулировки и критерии зачёта остаются на стороне организатора.
Обновлённые модели Koda: Base на Qwen 3.8 Flash 125B и Pro на GLM 5.3
Вместе с замерами Koda сообщила об обновлении собственных моделей. Koda Base построена на Qwen 3.8 Flash 125B и вышла на 49,5% по «Индексу Кода», Koda Pro на GLM 5.3 - на 54,3%.
Сравнивать эти цифры с 52,2% DeepSeek V4 Flash в оболочке Koda нужно аккуратно, потому что измерялись разные вещи. 52,2% показывают, как сторонняя модель работает в обвязке Koda. 49,5% и 54,3% - результат связки «своя модель плюс своя обвязка» на том же индексе. Koda Pro обошла DeepSeek V4 Flash по этому индексу на 2,1 п.п., и это аргумент в пользу своей модели, но только в рамках одного бенчмарка. Утверждать, что Koda Pro сильнее DeepSeek V4 Flash в целом, по одному числу нельзя.
Что это значит на практике: как выбирать оболочку под свои задачи
Универсального победителя из замера не выводится. Разложим варианты по сценариям с оговорками.
Кому подойдёт Koda
Если вы гоняете DeepSeek V4 Flash и хотите выжать максимум на задачах разработки и проектирования, оболочку Koda разумно попробовать. Плюс есть смысл посмотреть на её модели: связка Base на Qwen 3.8 Flash 125B и Pro на GLM 5.3 даёт готовый стек от одного поставщика. Ограничения: замер внутренний, независимых подтверждений нет, детали реализации обвязки не раскрыты. Проверяйте на своих задачах.
Кому подойдёт Claude Code
Claude Code берут ради параллельных потоков, координации и памяти о решениях внутри проекта. На крупной работе это экономит время на ручном разделении задач. На DeepSeek V4 Flash он показал 48,2%, ниже Koda и KiloCode, но это не приговор: с моделями Anthropic родная обвязка обычно даёт больше, чем сторонняя. Если вы уже платите за экосистему Anthropic, менять инструмент ради пары процентных пунктов на чужой модели смысла мало.
Кому подойдут OpenCode и KiloCode
KiloCode набрал 49,5% и обошёл Claude Code, что делает его интересной альтернативой с менее громким именем. OpenCode замкнул список с 47,6%, но отставание от лидера составляет те же 4,6 п.п. Если вам важны открытость, локальный запуск или конкретные функции этих инструментов, оба остаются рабочими вариантами. Устройство их агентного цикла в открытом описании не раскрыто, поэтому решение стоит принимать после прогона на своих задачах. Полезный ориентир по методике - бенчмарк 35B-моделей для кодинга с прозрачной методологией, там видно, как отличать реальные различия от шума.
Контекст рынка: DeepSeek V4.1 Flash, V4 Pro и цены API
Стоимость инференса может перевесить пару процентных пунктов индекса. DeepSeek V4.1 Flash позиционируется для кодовых агентов с длинным контекстом, инструментами, изображениями и большим потоком задач. В непиковое время прямая API DeepSeek берёт $0.15 за миллион некэшированных входных токенов и $0.60 за миллион выходных.
DeepSeek V4 Pro после отмены плана перевода на V4.1 Flash 14 сентября остался отдельным маршрутом со своей тарификацией. Цены зависят от времени суток: вне пика кеш, новый вход и выход стоят $0.022, $0.66 и $1.98 за миллион токенов, в пик - $0.044, $1.32 и $3.96. Пиковые окна действуют с понедельника по пятницу, 01:00-04:00 и 06:00-10:00 UTC, в остальное время, включая выходные, работает непиковая цена. Для десяти запусков агента по 100 000 новых входных и 20 000 выходных токенов разница между непиком и пиком доходит примерно до $1,06 против $2,11. Планирование тяжёлых прогонов на ночь или выходные экономит заметные деньги.
Снимок DeepSeek V4 Pro 0813 заменил V4 Pro Preview: архитектура сохранена, добавлен модуль спекулятивного декодирования DSpark. Если выбираете движок под агентную обвязку, пригодятся и практические сравнения вроде теста DeepSeek V4 Flash против Qwen 3.6 27B.
Итоги: что запомнить о Kodacode, Claude Code и OpenCode
- Оболочка влияет на результат одной и той же модели: на уровне Max разрыв между Koda (52,2%) и OpenCode (47,6%) составил 4,6 п.п.
- На уровне Medium результаты плотнее и порядок мест местами меняется, устойчивость выводов ниже.
- «Индекс Кода» из 261 задачи построила Koda, и она же выиграла замер. Это ограничение интерпретации, а не приговор цифрам.
- Замер шёл только на DeepSeek V4 Flash. Переносить его на другие модели без проверки нельзя.
- Собственные модели Koda: Koda Base на Qwen 3.8 Flash 125B (49,5%) и Koda Pro на GLM 5.3 (54,3%).
Что делать дальше: возьмите 5-10 своих типовых задач, прогоните их в двух-трёх оболочках на одной и той же модели и сравните не только итог, но и расход токенов, и время. Чужой замер говорит лишь о том, что обвязку стоит подбирать осознанно. Какая оболочка выиграет на вашем коде, покажет только ваш прогон.