Прайс-лист за миллион токенов отвечает на один вопрос: сколько стоит один токен на входе или выходе. Сколько стоит решённая задача, он не показывает. Между двумя этими числами лежит разрыв, который растёт вместе с длиной агентной траектории, числом ретраев и объёмом контекста, который модель тащит через каждый ход.
Этот разрыв измеряет открытый бенчмарк-харнесс openai-on-aws/benchmarks-openai. Он сравнивает модели не по прайсу, а по стоимости успешного результата: все затраты на попытки делятся на число задач, которые модель действительно довела до правильного ответа. В сравнении участвуют три модели на Amazon Bedrock (gpt-5.6-luna, gpt-5.6-terra, gpt-5.6-sol) и два бюджетных варианта на OpenAI API (gpt-5.4-mini и gpt-5.4-nano).
Главный вывод замера: после снижения цен на GPT-5.6 Luna и Terra на Amazon Bedrock в июле 2026 года gpt-5.6-luna показывает самую низкую наблюдаемую стоимость за успешный результат в большинстве сценариев. Новый прайс здесь не единственная причина. Меньшее число ходов агента и более экономный расход токенов дают больший эффект, чем разница в цене за миллион. Выборка ограничена 48-198 вопросами, а у моделей на Bedrock отключён reasoning, поэтому ранжирование стоит перепроверять на своих задачах.
Почему цена за миллион токенов не говорит о реальной стоимости
Прайс за миллион токенов удобен для быстрой прикидки и почти бесполезен для планирования бюджета продукта. Он не учитывает, сколько раз модель ошибётся, сколько шагов сделает агент и сколько контекста придётся переотправлять на каждом шаге.
Возьмём типичный агентный сценарий. Модель получает задачу, вызывает инструмент, читает результат, уточняет запрос и повторяет цикл. Каждый ход заново отправляет в модель историю диалога, а иногда и весь рабочий контекст. Если одна модель проходит маршрут за два хода, а вторая за пять, вторая прогоняет через себя в разы больше токенов на ту же самую задачу. Разница в цене за миллион перекрывается разницей в поведении.
Есть и третий слой: кэширование промптов. Повторяющийся префикс контекста может стоить заметно дешевле при чтении из кэша, поэтому две модели с одинаковым прайсом дают разный счёт, если по-разному переиспользуют кэш. Как это выглядит на практике при больших объёмах работы, разобрано в материале о том, как масштабировать AI-агентов до миллиарда токенов в день и не разориться.
Что такое стоимость успешного результата
Метрика считается одной формулой: суммарные затраты на все попытки делятся на число задач, решённых правильно.
cost_per_success = сумма затрат на все попытки / число успешных задач
Неудачная попытка бьёт по метрике дважды: она увеличивает числитель и не увеличивает знаменатель. Модель, отвечающая верно с первого раза, может стоить дороже за токен, но дешевле за результат, чем модель, которой нужно три подхода. То же правило работает для агентных маршрутов, где в стоимость попадает каждая ветка, включая тупиковую.
Именно эту логику переносят на измеримые наборы задач: AIME, GPQA Diamond и MMLU-Pro дают цену одного правильного ответа, DeepSearchQA показывает стоимость агентных траекторий на живых веб-задачах, GDPval оценивает качество профессиональных документов по рубрикам и цену достижения нужного качества.
Число ходов агента и эффективность токенов
Итоговый счёт определяют два фактора. Первый: число ходов агента. Второй: эффективность токенов, то есть какая доля отправленного контекста реально нужна для решения.
Ходы стоят дорого по накопительной схеме. Пять шагов означают пять отправок контекста, и на каждом шаге в промпт попадают результаты предыдущих вызовов инструментов, фрагменты документов и служебные сообщения. Агент, который делает пять ходов вместо двух, может обойтись дороже при более низком прайсе за миллион токенов. Эффективность добавляет второй множитель: если модель тянет через контекст лишние страницы, стоимость хода растёт без улучшения результата.
Отсюда практическое следствие: сокращение числа шагов и чистка контекста дают такой же эффект, как скидка на прайс, только без переговоров с провайдером. Компакция истории, ограничение выдачи инструментов по объёму, отказ от повторных чтений одного документа, кэширование стабильного префикса промпта, всё это прямо снижает стоимость успешного результата.
Что измеряет бенчмарк-харнесс openai-on-aws/benchmarks-openai
Харнесс собирает три группы метрик, и вместе они покрывают разные типы работы: академические задачи с однозначным ответом, агентный поиск в интернете и подготовку деловых документов.
| Группа метрик | Что измеряет | Что попадает в стоимость |
|---|---|---|
| AIME, GPQA Diamond, MMLU-Pro | Цену одного правильного ответа | Все попытки по каждому вопросу, делённые на число верных |
| DeepSearchQA | Стоимость агентной траектории на живых веб-задачах | Все шаги агента, включая неудачные ветки маршрута |
| GDPval | Качество профессиональных документов по рубрикам | Затраты на достижение требуемого качества, включая итерации |
Проект открытый, поэтому методику можно проверить и переиспользовать: код и наборы данных стоит смотреть в репозитории харнесса. Точные значения стоимости и точности по каждой модели тоже лежат там, и они меняются по мере обновления замеров.
AIME, GPQA Diamond и MMLU-Pro: цена правильного ответа
Три академических набора проверяют разные типы мышления: AIME это олимпиадная математика, GPQA Diamond это вопросы уровня аспирантуры по естественным наукам, MMLU-Pro это широкий срез знаний по десяткам дисциплин. В харнессе для каждого вопроса фиксируются расходы на все попытки, после чего сумма делится на число правильных ответов.
Ключевая деталь: выборка небольшая, от 48 до 198 вопросов. Этого хватает, чтобы заметить крупные различия между моделями, но мало для тонких выводов о разнице в доли процента. Один случайный провал на таком объёме заметно двигает итоговую цифру.
DeepSearchQA: стоимость агентных траекторий на веб-задачах
DeepSearchQA состоит из живых веб-задач, где агенту нужно искать информацию в интернете, открывать страницы и собирать ответ из нескольких источников. Здесь модель работает не одним запросом, а последовательностью шагов: поиск, чтение, уточнение, повторный поиск.
Стоимость считается по всей траектории, включая неудачные попытки и лишние обращения к инструментам. Это самая чувствительная к поведению агента группа метрик: именно здесь число ходов определяет счёт сильнее, чем прайс за токен. Модель с низкой ценой за миллион, но склонная к долгим поискам, легко проигрывает более дорогой и более собранной сопернице.
GDPval: качество профессиональных документов по рубрикам
GDPval оценивает документы по рубрикам, то есть по наборам критериев качества для конкретного типа профессиональной работы. Харнесс считает не абстрактную оценку, а стоимость достижения нужного уровня: если модель выдаёт приемлемый черновик только с третьего прохода, в стоимость попадают все три.
Логика простая. Дешёвая модель с длинным циклом доработок может оказаться дороже в расчёте на готовый документ, чем модель с высоким прайсом, которая попадает в требования с первого захода. Для документов это особенно заметно, потому что каждая итерация включает весь предыдущий текст и правки.
Сравнение моделей: gpt-5.6-luna, terra, sol против gpt-5.4-mini и nano
В харнессе пять участников: gpt-5.6-luna, gpt-5.6-terra и gpt-5.6-sol, работающие через Amazon Bedrock, против gpt-5.4-mini и gpt-5.4-nano на OpenAI API. Бюджетные модели заявлены как дешёвый вариант по прайсу, и вопрос в том, сохраняется ли это преимущество после деления на число успешных результатов.
Наблюдаемый итог: после снижения цен на GPT-5.6 Luna и Terra на Amazon Bedrock в июле 2026 года gpt-5.6-luna даёт самую низкую стоимость успешного результата в большинстве сценариев харнесса. Это результат конкретных замеров на конкретных наборах задач, а не универсальное правило для любых нагрузок. Точные значения по моделям и наборам стоит смотреть в репозитории, потому что они обновляются вместе с прайсом и настройками.
Почему бюджетные модели на OpenAI API не всегда выигрывают
gpt-5.4-mini и gpt-5.4-nano выигрывают по цене за токен почти по определению. Вопрос в том, что происходит дальше: если бюджетная модель чаще ошибается и требует дополнительных попыток, знаменатель в формуле стоимости успешного результата не растёт, а числитель растёт.
Второй эффект связан с длиной маршрута. На задачах DeepSearchQA и в работе с документами GDPval модель может делать больше шагов, чем нужно, или дольше уточнять запрос. Каждый лишний шаг добавляет расходы на контекст, который переотправляется целиком. В агентных сценариях это перекрывает экономию на прайсе.
Отдельный слой это качество ответа на сложных задачах. Если модель не доходит до правильного результата, все потраченные токены уходят в стоимость неудачи и не дают успешного результата вообще. Метрика в этом случае не просто растёт, а становится неопределённой: делить не на что.
Роль снижения цен на Luna и Terra в июле 2026 года
Снижение цен на GPT-5.6 Luna и Terra на Amazon Bedrock в июле 2026 года изменило расклад внутри Bedrock-группы. До него разница в стоимости успешного результата между luna, terra и sol могла объясняться прайсом, после него на первый план вышла эффективность работы: сколько ходов тратит модель и насколько экономно расходует токены.
Ранжирование стоит читать как наблюдаемое в конкретных условиях. Оно верно для наборов AIME, GPQA Diamond, MMLU-Pro, DeepSearchQA и GDPval, для использованных промптов и настроек, для цен, действовавших на момент замера. Для другой смеси задач порядок моделей может отличаться.
Ограничения замеров: почему ранжирование может измениться
У любого бенчмарка есть границы применимости. Здесь их несколько, и о каждой стоит помнить, прежде чем переносить выводы на продакшен.
Малая выборка и её влияние на выводы
Объём набора составляет 48-198 вопросов. На такой выборке случайный провал или случайная удача заметно сдвигают среднюю стоимость правильного ответа. Разница между двумя моделями, которая выглядит уверенной, может оказаться в пределах колебаний.
Практический вывод: относитесь к порядку моделей как к гипотезе, которую нужно проверить на своих данных. Если две модели различаются незначительно, выбор стоит делать по другим критериям, таким как доступность в нужном регионе, поддержка кэширования промптов, лимиты и сложность интеграции. Как условия запуска и версия модели меняют картину на бенчмарках, подробно разобрано в материале о том, отстал ли DeepSeek в гонке открытых LLM или это только так выглядит.
Отключённый reasoning у моделей на Bedrock
В харнессе reasoning у моделей на Amazon Bedrock отключён. Режим рассуждения меняет и качество, и расход токенов: модель может генерировать длинные цепочки размышлений перед ответом.
Отключённый reasoning может как занижать результат модели на сложных задачах, так и делать её дешевле по числу потраченных токенов. При включении режима стоимость успешного результата изменится: часть задач, которые сейчас решаются неверно, может решиться, но цена каждого ответа вырастет. Для академических наборов и для GDPval это особенно чувствительный параметр.
Настройки харнесса, такие как лимит шагов, системный промпт и инструменты, тоже влияют на счёт. Другая версия промпта или другое ограничение на число вызовов инструментов смещает результат агентных задач.
Как воспроизвести замеры на своих задачах
Собственный замер полезнее любого публичного бенчмарка, потому что он учитывает именно вашу смесь задач. Харнесс openai-on-aws/benchmarks-openai можно взять как основу и заменить наборы данных на свои.
- Определите задачу и метрику успеха. Для ответов с однозначной проверкой это точное совпадение, для документов это рублика с критериями.
- Залогируйте входные и выходные токены по каждому вызову модели.
- Фиксируйте число ходов агента и число попыток на задачу.
- Суммируйте затраты на все попытки, включая неудачные.
- Разделите сумму на число успешно решённых задач.
- Прогоните все сравниваемые модели на одинаковых промптах, настройках и данных.
Какие метрики логировать
Минимальный набор для честного расчёта: входные токены, выходные токены, число ходов агента, число попыток, признак успеха, время выполнения. К этому полезно добавить долю токенов, прочитанных из кэша, потому что она напрямую снижает цену повторяющегося контекста.
Без учёта ходов и попыток вы получите просто счёт за токены, то есть ровно ту цифру, которая вводит в заблуждение. Стоимость успешного результата появляется только тогда, когда есть деление на число решённых задач.
Как адаптировать харнесс под свои задачи
Схема адаптации простая: набор данных заменяется на ваш, метрика успеха описывается под ваш домен, а логика расчёта стоимости остаётся прежней. Важное условие одно: все модели должны работать в одинаковых условиях. Если одна модель получает кэширование промптов, а другая нет, сравнение теряет смысл.
Для агентных сценариев стоит отдельно замерять худший случай, а не только средний. Одна задача, где агент зациклился и сжёг в разы больше токенов, чем планировалось, заметно ухудшает экономику продукта.
Что это значит на практике: как выбирать модель
Четыре правила, которые следуют из методики. Считайте стоимость успешного результата, а не цену за токен. Учитывайте число ходов агента и эффективность расхода токенов. Проверяйте публичные выводы на своих задачах. Держите в голове ограничения выборки и настроек, при которых сделан замер.
Выводы по академическим наборам AIME, GPQA Diamond и MMLU-Pro, по агентным веб-задачам DeepSearchQA и по документам GDPval могут расходиться между собой. Модель, которая дешевле всех на вопросах с коротким ответом, не обязана быть дешевле на длинных агентных маршрутах. Разбор того, когда переплата за инференс окупается, а когда нет, есть в отдельной статье: дешёвые AI-модели против дорогих.
Когда стоит смотреть на бюджетные модели OpenAI API
gpt-5.4-mini и gpt-5.4-nano разумны там, где задача решается за один-два хода и не требует инструментов: классификация, короткое извлечение данных, черновики, разбор простых запросов. В этих сценариях число шагов минимально, вероятность каскада ошибок низкая, и низкий прайс за токен превращается в низкую стоимость результата.
Для агентных задач с поиском и для подготовки документов по рубрикам экономия на прайсе может не дожить до финального счёта. Проверяйте именно свою смесь задач и не переносите вывод с простых сценариев на сложные.
Когда Amazon Bedrock с gpt-5.6-luna выгоднее
После снижения цен в июле 2026 года gpt-5.6-luna показывает самую низкую наблюдаемую стоимость за успешный результат в большинстве сценариев харнесса. Это справедливо для условий, в которых проводился замер: отключённый reasoning, конкретные наборы задач, конкретные промпты и цены на момент тестирования.
Если ваш профиль нагрузки близок к агентному поиску или к работе с документами, стоит начать с воспроизведения замера на своих данных, а не с переноса чужого рейтинга. Логирование токенов, ходов и попыток даст ответ за несколько дней работы, и этот ответ будет отражать именно вашу экономику, а не усреднённую картину публичного бенчмарка.