На r/LocalLLaMA 22 сентября 2026 года появился пост с прямым вопросом: сколько ждать, пока открытая модель наберёт 58 баллов в рейтинге Artificial Analysis обсуждение на Reddit. Столько сейчас у закрытой Opus 5.5. Лучшая открытая модель по версии того же поста, mimo 2.6 pro, отстаёт на 12 пунктов, то есть идёт на 46 баллах.
Дальше начинается арифметика. Раньше лучшей открытой модели потребовалось около двух месяцев, чтобы подняться с 44 до 46 баллов. При сохранении такого темпа до 58 баллов уйдёт примерно шесть месяцев, а при ускорении - 4-5. Отсюда и взялась оценка в 4-6 месяцев до паритета.
Сразу о статусе источника: это оценки участников обсуждения на Reddit, а не подтверждённый прогноз и не официальные данные лабораторий. Рейтинг Artificial Analysis обновляется ежедневно, поэтому приведённые баллы могут меняться, а сам пост отражает срез на конкретную дату.
Что вообще произошло: 58 против 46 в рейтинге Artificial Analysis
В посте на Reddit исходное обсуждение утверждается: Opus 5.5 набирает 58 баллов, лучшая открытая mimo 2.6 pro идёт на 12 пунктов ниже, а переход от fable 5.1 к Opus 5.5 описывается как большой скачок. Все три утверждения - интерпретация автора поста, а не данные, опубликованные лабораториями или самой платформой.
Практическую ценность здесь имеют разрыв в 12 пунктов и сам факт скачка. Вместе они говорят одно: закрытый фронтир за последний цикл ушёл вперёд, а открытые модели не стоят на месте, но идут с отставанием.
Почему 12 баллов - это много
Калибровку удобно взять из свежего сравнения двух моделей, вышедших в сентябре 2026 года: закрытой GPT-6 Sol и открытой DeepSeek V4 Pro разбор сравнения. GPT-6 Sol набирает 48 баллов, DeepSeek V4 Pro - 36. Разрыв тот же, 12 пунктов, и оплачивается он разницей в цене в 1,5-4 раза в зависимости от того, чей тариф читать.
В Intelligence Index десять и больше баллов обычно отделяют одно поколение моделей от другого, а не соседние релизы внутри одной линейки. На верхнем конце шкалы собраны задачи, где модель либо ошибается реже, либо проходит многошаговые цепочки без подсказок и повторов. Разница в 12 пунктов означает, что открытая модель на таких задачах чаще требует проверки результата человеком.
Что именно измеряет Artificial Analysis
Artificial Analysis сводит результаты моделей по набору бенчмарков в единый Intelligence Index. Агрегированный балл даёт одну шкалу для моделей разных вендоров, и этим рейтинг удобен для быстрой ориентации: не нужно самому собирать десяток наборов тестов.
Ограничений у такой шкалы несколько. Сводный балл не показывает поведение модели на конкретной задаче: на коде, в агентных сценариях, при длинном контексте или на русском языке порядок моделей может отличаться от их мест в индексе. В индекс не входят цена за миллион токенов, лицензия и возможность локального запуска. Пост на Reddit, с которого начался разговор, как раз про балл, а не про эти три параметра.
Ещё одна оговорка, которая ломает интуицию: даже относительно невысокий балл может означать место в топ-10. DeepSeek V4 Pro с 36 баллами занимает 8-е место среди 114 измеренных моделей. Шкала плотная сверху, и разрыв между 8-м и 1-м местом укладывается в те же 12 пунктов.
Кто сейчас лидирует среди открытых моделей
Открытый фронтир - это группа моделей с разными профилями: у одной выше балл, у другой открытая лицензия, большое контекстное окно или удобная цена. Общую картину по свежим релизам открытых весов 2026 года даёт разбор новых open-weights моделей 2026 года, а ниже два конкретных репера из обсуждения и Research Pack.
mimo 2.6 pro: текущий лидер открытого лагеря
В обсуждении mimo 2.6 pro названа лучшей открытой моделью: 46 баллов и отставание от Opus 5.5 в 12 пунктов. Дальше начинаются пробелы. Ни размер модели, ни архитектура, ни лицензия, ни дата релиза в посте не раскрыты. Выводы о том, за счёт чего модель держит первое место среди открытых, делать пока не из чего: известна только позиция в рейтинге, и это ограничение источника, а не деталь, которую можно додумать.
DeepSeek V4 Pro: открытая альтернатива с лицензией MIT
Второй репер описан куда подробнее. DeepSeek V4 Pro вышла 13 августа 2026 года как MoE-модель под лицензией MIT: 1,6 трлн общих параметров при 49 млрд активных на токен сравнение GPT-6 Sol и DeepSeek V4 Pro. Смесь экспертов позволяет хранить большой общий размер, но тратить вычисления только на часть весов при обработке каждого токена. На практике это удешевляет инференс по сравнению с плотной моделью такого же масштаба.
Характеристики, важные для практики: контекстное окно 1M токенов, максимальный вывод 384K, цена $1,32 за миллион входных и $3,96 за миллион выходных токенов. В Intelligence Index - 36 баллов и 8-е место среди 114 моделей. В том же сравнении приводятся результаты на прикладных наборах: Terminal-Bench 2.1 - 87,9, SWE-bench Verified - 80,6, скорость вывода 67,8 токенов в секунду.
Лицензия MIT для части аудитории важнее пары баллов: она разрешает коммерческое использование, дообучение и развёртывание на своём железе. Цены API и скрытые издержки тарификации у моделей DeepSeek разобраны отдельно в материале DeepSeek vs конкуренты: анализ цены и производительности.
Откуда взялись 4-6 месяцев до паритета
Цепочка рассуждения в посте короткая. Лучшая открытая модель поднялась с 44 до 46 баллов примерно за два месяца пост с расчётом. Если темп сохранится, до 58 баллов уйдёт около шести месяцев, при более быстром прогрессе - 4-5. Ни методологии, ни списка моделей, которые дали прирост 44, 46, ни сведений о том, менялась ли методика подсчёта между двумя замерами, в посте нет.
Почему линейная экстраполяция здесь ненадёжна
Прогресс в Intelligence Index идёт ступенями. Модель выходит, несколько месяцев её никто не догоняет, потом появляется архитектурный приём или новый набор обучающих данных, и разрыв сокращается скачком. Два месяца на 2 балла - это одна точка на графике. По одной точке нельзя отличить линейный рост от ступенчатого.
Вторая проблема серьёзнее первой: цель движется. Opus 5.5 в том же обсуждении описывается как большой скачок относительно fable 5.1, значит закрытый лагерь прибавляет ступенями, а не ровным темпом. Пока открытые модели идут к 58 баллам, фронтир уйдёт дальше, и сравнивать придётся с новой отметкой. Отдельный разбор того, как открытые модели догоняют фронтир и что это даёт потребительскому железу к 2027 году, собран в материале про ускоряющуюся гонку открытых моделей: лаг сокращается, но не исчезает.
Что будет считаться паритетом
Слово «паритет» без уточнения критерия ничего не значит. Есть минимум три разных паритета, и наступают они в разное время.
По баллам Intelligence Index. Здесь разрыв 12 пунктов, и обсуждают в посте именно его.
По цене за миллион токенов. Тут картина обратная. DeepSeek V4 Pro стоит $1,32 за вход и $3,96 за выход, GPT-6 Sol - $2 и $10 тарифы и пороги пересчёта. У GPT-6 Sol есть порог: до 272 000 входных токенов цена держится, выше весь запрос пересчитывается, вход дорожает примерно до $4, а выход - до $15. По цене открытые модели уже паритетны, а на длинном контексте дешевле кратно.
По доступности. Лицензия MIT, локальный запуск, дообучение, контекст 1M токенов против 872 000 у GPT-6 Sol (по данным Artificial Analysis, при потолке 1,05M и ограничении вывода 128K). Здесь открытая модель выигрывает по правам и объёму контекста, но проигрывает по качеству на сложных задачах.
Таблица для наглядности:
| Модель | Балл Intelligence Index | Цена, вход/выход за 1M токенов | Лицензия | Контекст |
|---|---|---|---|---|
| Opus 5.5 | 58 | нет данных в источниках | закрытая | нет данных в источниках |
| mimo 2.6 pro | 46 | нет данных в источниках | открытая, условия не раскрыты | нет данных в источниках |
| GPT-6 Sol | 48 | $2 / $10 | закрытая | 872K по данным Artificial Analysis |
| DeepSeek V4 Pro | 36 | $1,32 / $3,96 | MIT | 1M, вывод до 384K |
Вывод простой: паритет по баллам не наступил, паритет по цене и доступности уже есть. Если выбирать модель под рабочий процесс, вторая и третья строки таблицы важнее первой.
Что реально ускоряет открытые модели
В обсуждении названы несколько рычагов: развёртывание большего числа GPU, масштабирование параметров, данных и вычислений, улучшение архитектуры. Разберём каждый и посмотрим, где он упирается в потолок.
GPU и compute: главный, но не единственный рычаг
Больше ускорителей означает больше параллельных прогонов и более короткий цикл проверки гипотез. Архитектурную идею можно оттестировать за дни, а не за недели, и таких итераций за квартал проходит больше. Для открытых лабораторий это ключевой ресурс: часть прогресса приходит из перебора вариантов, который без железа не сделать.
Потолок здесь структурный. Вычислительные бюджеты фронтирных лабораторий выше, а доступ к большим кластерам ограничен не только деньгами. Публичных цифр по объёмам кластеров у открытых команд в источниках нет, поэтому оценивать разрыв в compute по косвенным признакам не стоит.
Масштабирование параметров, данных и архитектуры
Параметры. Рост идёт через разреженные архитектуры. Пример - DeepSeek V4 Pro: 1,6 трлн общих параметров при 49 млрд активных на токен. MoE даёт большой общий размер, но не требует считать все веса на каждом токене.
Данные. Качество и объём обучающих корпусов, включая синтетические наборы. Точных цифр по датасетам открытых лабораторий в источниках нет, но именно данные часто определяют, сработает новая архитектура или нет.
Архитектура. Смесь экспертов, внимание с длинным контекстом, схемы пост-тренировки. Прирост даёт комбинация: новая архитектура без подходящих данных не работает, данные без compute не обрабатываются, а compute без архитектурной идеи уходит в масштабирование ради масштабирования.
Почему разрыв всё равно сохраняется
Причин три. У закрытых лабораторий больше compute, данных и людей на пост-тренировке. Методики пост-тренировки и выравнивания не публикуются, а именно они дают заметную часть прироста. Открытые модели догоняют с лагом: они воспроизводят уже известные приёмы, пока закрытые готовят следующие.
Иллюстрация из релиза GPT-6 Sol: по данным OpenAI, модель делает примерно вдвое меньше ошибок, чем GPT-5.6 Sol, и по некоторым бенчмаркам соответствует или превосходит Claude Fable 5.1 обзор релиза GPT-6 Sol и Luna. Речь не про баллы в индексе, а про надёжность и частоту ошибок. Это свойство набирается выравниванием и работой с отказами на пост-тренировке, и его трудно повторить по открытым публикациям.
Ещё один рычаг, которого нет в исходном обсуждении: обучение на выходах закрытых моделей и дистилляция. Часть открытых релизов сокращает разрыв именно так. Механизм объясняет, почему разрыв сжимается, но не исчезает: дистилляция переносит то, что закрытая модель уже умеет, и не даёт того, чего в её выходах нет.
Что это значит на практике: ждать или платить
Ждать паритета по баллам имеет смысл в одном случае: если задача действительно требует верхней части шкалы и цена ошибки в ней высока. В остальных сценариях выбор между открытой и закрытой моделью решается по другим параметрам.
Когда открытая модель уже сейчас - разумный выбор
Локальный запуск и контроль над данными: лицензия MIT у DeepSeek V4 Pro разрешает коммерческое использование, дообучение под свою задачу и развёртывание на своём железе. Этот сценарий закрытые модели не закрывают в принципе.
Про железо стоит сказать честно: 1,6 трлн параметров даже в 4-битном квантовании требуют сотен гигабайт памяти. Это серверный сценарий, а не домашний ПК, и рассчитывать на домашний запуск открытой модели такого класса в ближайшие месяцы не стоит.
Высокие объёмы инференса с чувствительностью к цене: $1,32 и $3,96 за миллион токенов против $2 и $10 у GPT-6 Sol. Если рабочий процесс генерирует миллионы токенов в месяц, разница ощутима. Ограничение тоже известно: 36 баллов против 48, и на сложных многошаговых задачах разрыв проявится в дополнительных проверках и повторных попытках.
Длинный контекст: 1M токенов с выводом до 384K. Для работы с большими документами и кодовыми базами это практический аргумент.
Когда закрытая модель всё ещё оправдывает цену
Многошаговые задачи, где ошибка дороже токенов: те же данные OpenAI про примерно вдвое меньшее число ошибок GPT-6 Sol относительно GPT-5.6 Sol что известно о GPT-6 Sol. Если ошибка в ответе стоит больше, чем разница в цене за миллион токенов, экономия на открытой модели обманчива.
Длинный контекст с предсказуемым качеством: 872 000 токенов по данным Artificial Analysis при потолке 1,05M и ограничении вывода 128K. Ловушка в тарификации: выше 272 000 входных токенов цена пересчитывается на весь запрос, вход дорожает примерно до $4, а выход - до $15. При постоянной работе с длинным контекстом базовая цена $2 и $10 перестаёт быть базовой.
Ещё одна тонкость при сравнении: GPT-6 Sol стоит вдвое меньше за токен, чем Opus 5.5, но Anthropic утверждает, что Opus 5.5 расходует меньше токенов на задачу, чем Opus 5 детали релиза GPT-6 Sol. Прямое сравнение по цене за токен здесь не работает: итоговая стоимость задачи зависит от числа токенов, которые модель тратит на её решение.
И про ожидание: цель движется. Через 4-6 месяцев сравнивать придётся уже с другими моделями, включая те, что выйдут за это время. Частота обновления закрытого фронтира видна по недельным анонсам, например в обзоре недели с Claude Opus 4.8 и открытой Minimax-M3: за семь дней выходит несколько флагманских релизов, и каждый сдвигает ориентир.
Как читать такие прогнозы и не обмануться
Обсуждения вроде этого полезны как повод проверить актуальные числа, а не как основание для планирования. Несколько правил, применимых к любому прогнозу сроков в AI.
- Проверьте, что именно измеряется. Балл в агрегированном рейтинге, цена за миллион токенов, лицензия и возможность локального запуска - разные вещи, и паритет по одному параметру ничего не говорит про остальные.
- Посчитайте точки в тренде. Два месяца на 2 балла - одна точка. Тренд начинается там, где есть несколько сопоставимых замеров с одной методологией.
- Помните, что цель движется. Пока открытые модели идут к текущей отметке фронтира, закрытые лаборатории выпускают следующее поколение.
- Различайте факт, оценку и прогноз. Числа 58, 46 и 12 - наблюдение участников обсуждения на конкретную дату; сроки 4-6 месяцев - их оценка, а не подтверждённый прогноз.
- Не смешивайте замеры из разных источников и лет. Методология бенчмарков меняется, и числа из разных реализаций оказываются несопоставимыми: почему так происходит, разобрано на примере сравнений моделей разных поколений.
В том же обсуждении упоминаются glm 5.5 и qwen 4, но подтверждённых данных об их статусе и результатах в источнике нет. Такие упоминания не стоит принимать за анонсы, пока не появились официальные релизы и замеры.
Практическое действие простое. Увидели очередной пост со сроком до паритета - откройте актуальный рейтинг и тарифные страницы и проверьте три числа: балл модели на вашем типе задач, цену за миллион токенов с учётом порогов пересчёта и условия лицензии. На этих цифрах решение о выборе модели строится надёжнее, чем на любом прогнозе сроков.