Обновлённый бенчмарк SWE-rebench впервые вышел за пределы Python и теперь оценивает модели на реальных задачах программной инженерии сразу на пяти языках. Лидер первого раунда - GLM-5.2 с показателем Pass@1 62,9% и полным прохождением всех языков в 39,6% случаев. DeepSeek-V4 Pro набрал 40,2%, а Qwen3.6-27B - 31,2%, оставаясь ориентиром для локального развёртывания. Разработчики анонсировали следующий раунд через 3–4 недели с фокусом на моделях, пригодных для запуска на собственном железе.
Эти цифры - первый срез мультиязычной версии бенчмарка, который раньше работал только с Python-репозиториями. Теперь в пуле задач - Go, Java, Rust и TypeScript, что резко повышает практическую ценность результатов для команд, работающих в полиглотных средах. Разбираем детали.
Что такое SWE-rebench и почему мультиязычность - это важно
SWE-rebench - бенчмарк, построенный на реальных issue из open-source проектов. Модель получает описание бага или фичи, должна найти нужные файлы в репозитории и предложить корректное исправление. Задача максимально приближена к работе разработчика: чтение кода, понимание контекста, генерация патча.
Изначально бенчмарк ограничивался Python-проектами. Это создавало перекос: модели, натренированные на Python-коде, получали преимущество, а их способность работать с другими языками оставалась непроверенной. Разработчики, пишущие на Go, Java, Rust или TypeScript, не могли опереться на эти метрики при выборе инструмента.
Расширение на пять языков меняет правила игры. Модель, которая показывает высокий Pass@1 на всех языках, демонстрирует универсальность, а не узкую специализацию. Для инженеров это означает возможность использовать один инструмент в проектах с разным стеком без потери качества. Мультиязычный SWE-rebench также выявляет слабые места: модель может отлично справляться с Python и проваливаться на Rust из-за строгих правил borrow checker или нехватки обучающих данных.
Метрика Pass@1 - доля задач, решённых с первой попытки. Полное прохождение всех пяти языков означает, что модель успешно закрыла задачи на каждом языке в рамках одного тестового прогона. Это жёсткий критерий: одна ошибка на любом языке обнуляет результат для всей попытки.
Лидеры забега: GLM-5.2, DeepSeek-V4 Pro и Qwen3.6-27B - сравнение результатов
В первом мультиязычном раунде участвовали три открытые модели. Сводка результатов:
| Модель | Pass@1 | Полное прохождение 5 языков |
|---|---|---|
| GLM-5.2 | 62,9% | 39,6% |
| DeepSeek-V4 Pro | 40,2% | нет данных |
| Qwen3.6-27B | 31,2% | нет данных |
Разрыв между лидером и ближайшим преследователем - 22,7 процентных пункта. Это существенная дельта, которая прямо влияет на выбор модели для production-задач.
GLM-5.2: 62.9% Pass@1 и стабильность на всех языках
GLM-5.2 решает задачу с первой попытки почти в двух третях случаев. Полное прохождение всех пяти языков в 39,6% случаев - ключевой показатель универсальности. Модель не просто набирает высокий средний балл за счёт одного-двух языков, а стабильно работает на всём стеке.
Для практиков это означает: в четырёх из десяти проектов, где используется мультиязычная кодовая база, GLM-5.2 способна закрыть все задачи без единого промаха. В условиях реальной разработки такая надёжность сокращает время на проверку и правку сгенерированного кода. Модель также показывает самую низкую стоимость инференса среди конкурентов - по данным нашего разбора GLM-5.2, она до 30 раз дешевле Opus 4.8 на задачах кодинга.
DeepSeek-V4 Pro: сильный середняк с 40.2% Pass@1
40,2% - достойный результат, но отставание от GLM-5.2 более чем в полтора раза заставляет задуматься о сценариях применения. Если задача допускает несколько итераций и стоимость ошибки невысока, DeepSeek-V4 Pro остаётся рабочим вариантом. Модель активно используется в агентных сценариях - мы сравнивали её с Solar Open 2 в детальном разборе бенчмарков, где она показала конкурентные результаты на SWE-Bench Verified.
Разбивка по языкам для DeepSeek-V4 Pro пока недоступна, но общий балл указывает на то, что модель уверенно работает с Python и, вероятно, TypeScript, при этом может проседать на Rust или Go. Командам, рассматривающим эту модель, стоит провести собственные тесты на целевом стеке.
Qwen3.6-27B и MoE-версии: ориентир для локального развёртывания
31,2% Pass@1 - самый низкий результат в тройке, но Qwen3.6-27B занимает особую нишу. Это модель, которую можно развернуть локально на потребительском железе. Плотная версия и MoE-варианты запускаются на одной-двух GPU, что решает вопросы конфиденциальности кода и предсказуемости затрат.
Компромисс выглядит так: вы теряете 31,7 процентных пункта точности по сравнению с GLM-5.2, но получаете полный контроль над инференсом. Для внутренних инструментов разработки, где данные не должны покидать контур компании, это рабочий выбор. В нашем сравнении DeepSeek V4 Flash и Qwen 3.6 27B мы подробно разбирали, как модель показывает себя в агентных и coding-сценариях на реальных задачах.
Разбор по языкам: на чём модели спотыкаются, а где показывают класс
Детальная разбивка результатов по языкам пока не опубликована, но архитектурные особенности языков позволяют сделать обоснованные предположения о том, где модели сталкиваются с трудностями.
Python. Исторически самый сильный язык для AI-моделей в кодинге. Обилие обучающих данных, динамическая типизация, читаемый синтаксис. Все три модели, вероятно, показали на нём лучшие результаты. Python-задачи в SWE-rebench - это исправление багов в Django, Flask, pandas, и модели имеют огромный корпус примеров для обучения.
TypeScript. Второй по доступности данных язык. Строгая типизация помогает моделям: компилятор отсеивает часть ошибок ещё до запуска. Задачи на TypeScript часто связаны с React, Next.js, Node.js - проектами с активным сообществом и большим количеством публичного кода.
Go. Язык с минималистичным синтаксисом и встроенными инструментами форматирования. Модели могут спотыкаться на управлении горутинами и каналами, где ошибки проявляются только в рантайме. Объём обучающих данных по Go меньше, чем по Python и TypeScript, что снижает точность.
Java. Многословный синтаксис, обилие фреймворков, строгая типизация. Модели могут генерировать синтаксически корректный, но идиоматически неправильный код. Задачи на Java в бенчмарке часто связаны со Spring Boot и Maven/Gradle конфигурациями, где контекст выходит за пределы одного файла.
Rust. Самый сложный язык в пятёрке. Borrow checker, lifetimes, ownership - концепции, не имеющие прямых аналогов в других языках. Компилятор Rust отклоняет код, который выглядит логично для разработчика с опытом Python или Java. Модели, натренированные преимущественно на Python-коде, здесь ожидаемо проседают. Обучающих данных по Rust значительно меньше, а задачи сложнее: работа с unsafe-кодом, макросами, асинхронным рантаймом.
Практический вывод: если ваш стек - Python и TypeScript, любая из трёх моделей покажет приемлемый результат. Если в проекте активно используется Rust, разрыв между GLM-5.2 и Qwen3.6-27B будет больше, чем в среднем по бенчмарку.
Что дальше: следующий раунд тестирования и фокус на локальных моделях
Разработчики SWE-rebench анонсировали следующий раунд через 3–4 недели. Ключевое изменение - фокус на моделях, пригодных для локального развёртывания. Это ответ на запрос сообщества: не всем нужны облачные гиганты с миллиардами параметров. Многим командам важнее скорость инференса на собственном железе, конфиденциальность кодовой базы и предсказуемая стоимость.
Ожидаемые кандидаты для следующего раунда:
- Модели семейства Qwen3.6 с разными методами квантизации - мы тестировали спекулятивное декодирование на Qwen3.6-27B и получили ускорение до 4.6× на задачах math_reasoning с DFlash на SGLang.
- Компактные версии DeepSeek-Coder и CodeLlama, которые уже показали себя в агентных тестах - например, Nanbeige 4.2-3B с архитектурой Looped Transformer обходит Qwen3.5-9B на SWE-Bench при всего 3B параметров.
- Новые MoE-модели, способные работать на одной-двух потребительских GPU.
Разработчики бенчмарка приглашают сообщество предлагать кандидатов для тестирования. Если вы работаете с моделью, которая хорошо показывает себя в задачах программной инженерии на нескольких языках, стоит заявить её на следующий раунд.
Параллельно с SWE-rebench развиваются альтернативные методологии оценки. BigCodeArena, например, запускает код в реальных песочницах, что даёт дополнительную валидацию результатов. Комбинация нескольких бенчмарков даёт более полную картину, чем опора на единственный источник.
Как использовать результаты SWE-rebench в своей работе: практические выводы
Бенчмарк - ориентир, а не истина в последней инстанции. Результаты SWE-rebench полезны для первичного отсева моделей, но финальное решение требует тестирования на собственных задачах. Три типовых сценария:
Сценарий 1: максимальная точность. Выбираете GLM-5.2. Pass@1 62,9% и стабильность на всех языках означают меньше итераций и меньше ручной правки. Платите за облачный инференс или разворачиваете на мощном железе. Подходит для команд, где скорость и качество генерации кода прямо влияют на бизнес-метрики.
Сценарий 2: бюджетное локальное решение. Qwen3.6-27B или её MoE-варианты. Pass@1 31,2% - это каждая третья задача с первой попытки. Для внутренних инструментов, где код всё равно проходит ревью, такой точности может быть достаточно. Плюс - нулевая стоимость инференса после покупки железа и полная конфиденциальность.
Сценарий 3: компромисс. DeepSeek-V4 Pro с 40,2% Pass@1. Если модель доступна через API с приемлемым ценообразованием, это промежуточный вариант между флагманской точностью и бюджетной автономностью.
Важный нюанс: результаты актуальны на конец июля 2026 года. Через 3–4 недели выйдет новый раунд, и расстановка сил может измениться. Модели обновляются быстро, и бенчмарк, который вчера показывал лидера, завтра может выявить нового. Следите за результатами и тестируйте на своих задачах - это единственный способ не ошибиться с выбором.