Перейти к содержанию
Публикация AiManual

GPT-6 Sol и GPT-6 Luna в Amazon Bedrock: как выбрать модель под задачу и не переплатить

Разбираем, чем GPT-6 Sol отличается от Luna, как распределить их по этапам пайплайна в Amazon Bedrock, сколько стоит запрос с учётом кэширования и порога 272 00

Коротко

Что будет в материале

  1. 01

    Что такое GPT-6 Sol и GPT-6 Luna и зачем они в Bedrock

  2. 02

    Сколько стоят GPT-6 Sol и Luna и как считать реальную стоимость

  3. 03

    Как распределять модели по этапам пайплайна

  4. 04

    Инфраструктура и безопасность в Amazon Bedrock

Что такое GPT-6 Sol и GPT-6 Luna и зачем они в Bedrock

GPT-6 Sol и GPT-6 Luna - две новые модели OpenAI, которые стали общедоступны на Amazon Bedrock. Разделение между ними проходит по экономике запроса: Luna берёт массовые однотипные операции с высоким объёмом, где решают задержка и цена каждого вызова, а Sol закрывает ресурсоёмкие повторяющиеся задачи в разработке и операциях, которые нужно довести до готового результата. Обе модели стоят заметно дешевле своих предшественников GPT-5.6 по API. Об этом сообщает AWS в анонсе.

Задачи Luna: извлечение информации из больших коллекций документов, суммаризация входящих материалов, классификация входных данных и ответы на точечные вопросы в масштабе тысяч пользователей. Задачи Sol: реализация функций, отладка проблем, рефакторинг и ревью кода, анализ данных и многошаговые процессы с переходами между инструментами и приложениями.

Цены различаются на порядок. GPT-6 Sol - $2 за миллион входных токенов и $10 за миллион выходных, вдвое дешевле GPT-5.6 Sol. GPT-6 Luna - $0.10 и $0.50, снижение с $0.20 и $1.20 соответственно (данные MacRumors).

Sol вышла 22 сентября 2026 года как закрытая фронтир-модель по цене вдвое ниже собственного предшественника (разбор сравнения Sol и DeepSeek V4 Pro).

Ключевые различия Sol и Luna

КритерийGPT-6 SolGPT-6 Luna
Тип задачРесурсоёмкие, многошаговые, с ветвлениями и проверкамиМассовые однотипные, потоковые
ПримерыРеализация функций, отладка, рефакторинг, ревью кода, анализ данныхИзвлечение данных из документов, классификация, суммаризация, точечные вопросы
Что оптимизированоДоведение задачи до результатаЗадержка и стоимость отдельного запроса
Цена за 1 млн токенов$2 вход / $10 выход$0.10 вход / $0.50 выход
Кэширование промптовПоддерживается, 90% скидки на чтение кэшаПоддерживается, 90% скидки на чтение кэша

По внутренней оценке OpenAI, GPT-6 Sol допустила примерно вдвое меньше фактических ошибок, чем GPT-5.6 Sol, а улучшения в кодинге и computer use помогают ей провести задачу от разбора до реализации и проверки, сохраняя контекст принятых решений. Меньше ошибок означает меньше повторных прогонов и ручных правок, и это напрямую отражается на итоговом счёте за месяц (оценка OpenAI в анонсе AWS).

Почему Amazon Bedrock, а не прямой API OpenAI

Bedrock встраивает модель в периметр AWS: доступ выдают ролям через IAM, вызовы фиксируются в CloudTrail, трафик можно увести в приватную сеть через VPC-эндпоинты, а инференс изолирован от других клиентов. Для компании, которая уже живёт в AWS, это меньше новых сущностей в архитектуре: те же роли, те же логи, те же способы ограничивать исходящий трафик.

Модели доступны и вне AWS: они разворачиваются в ChatGPT Work и Codex для пользователей Plus, Pro, Business, Enterprise и Edu, а Luna дополнительно доступна пользователям Free и Go в десктопном приложении (сообщение о развёртывании). Если продакшен живёт в AWS, Bedrock убирает лишний слой интеграции. Если нет, придётся взвешивать стоимость переезда.

Вызов моделей семейства OpenAI на Bedrock, кэширование, квоты и управление усилиями рассуждения мы разбирали по шагам в гайде по запуску моделей OpenAI на Amazon Bedrock.

Сколько стоят GPT-6 Sol и Luna и как считать реальную стоимость

МодельВход, за 1 млн токеновВыход, за 1 млн токеновИзменение
GPT-6 Sol$2$10Вдвое дешевле GPT-5.6 Sol
GPT-6 Luna$0.10$0.50Было $0.20 и $1.20

У Sol есть порог по длине контекста: ставка $2/$10 действует ниже 272 000 входных токенов. Как только запрос переходит эту границу, пересчитывается весь запрос целиком: вход дорожает примерно до $4, выход - примерно до $15. Разбить большую задачу на несколько запросов с общим кэшируемым префиксом обычно дешевле и предсказуемее по бюджету, чем отправить один запрос на 300 тысяч токенов (данные по порогу пересчёта).

Цена за токен - половина картины. Вторая половина - сколько токенов и повторных прогонов уходит на то, чтобы задача дошла до результата. Дешёвая модель, которой нужно пять итераций и ручная правка между ними, легко обойдётся дороже модели, решающей задачу за один проход. Считать стоит стоимость успешного результата: токены всех попыток плюс время инженера.

Кэширование промптов: как сэкономить до 90% на входных токенах

Обе модели поддерживают улучшенное кэширование промптов: агенты переиспользуют больше контекста, отвечают быстрее, а чтение кэшированных входных токенов идёт со скидкой 90% (описание улучшений кэширования). Скидка касается чтения, поэтому эффект появляется там, где один и тот же префикс повторяется из запроса в запрос.

Что кладут в кэшируемый префикс на практике: системные инструкции, описания инструментов и схемы функций, справочные материалы по продукту, статические части шаблонов писем и отчётов. Переменные данные - текст тикета, фрагмент документа, вопрос пользователя - идут в конец промпта. Агент с десятком инструментов перестаёт оплачивать их описания по полной ставке на каждом шаге.

Когда кэш не помогает: если каждый запрос уникален и общего префикса нет, экономии не будет, а платить придётся по базовой ставке.

Сравнение с DeepSeek V4 Pro и другими альтернативами

В Intelligence Index Artificial Analysis GPT-6 Sol набирает 48 баллов, DeepSeek V4 Pro - 36. На той же площадке Sol стоит $2.00 за миллион входных и $10.00 за миллион выходных токенов, DeepSeek V4 Pro - $1.32 и $3.96. Обе модели относят к reasoning-моделям с контекстным окном около миллиона токенов (сравнение бенчмарков и цен).

Разрыв в 12 баллов индекса и четырёхкратная разница в цене выхода объясняют, почему эти модели попадают в разные слоты пайплайна. DeepSeek V4 Pro - открытая модель с лицензией MIT, её можно развернуть на своей инфраструктуре, что меняет расклад для команд с собственными GPU. Сравнение при этом неполное: у DeepSeek V4 Pro действует пиковое и непиковое расписание цен, у Sol - порог пересчёта при длинном контексте, а Artificial Analysis обновляет данные ежедневно.

Для массовых операций рядом с ними стоит Luna с $0.10 и $0.50 на Bedrock. В извлечении и классификации, где качество фронтир-модели избыточно, разница в цене перекрывает разницу в баллах.

Как распределять модели по этапам пайплайна

Рабочая схема - три уровня по возрастанию стоимости и качества запроса:

  • Luna - маршрутизация и простые операции: классификация, извлечение, суммаризация, точечные вопросы. Ставка $0.10/$0.50 позволяет пропускать через неё весь входящий поток.
  • Sol - сложные случаи: многошаговый разбор, работа с кодом, анализ данных, когда ответ требует нескольких источников и проверок.
  • Astra - задачи, где качество результата важнее стоимости запроса. Sol и Luna используют улучшения Astra, но верхнюю границу семейства задаёт именно она, о чём подробнее в разборе GPT-6 Astra на Amazon Bedrock.

Критерии распределения: задержка, стоимость запроса и точность. Их нужно мерить на своих данных - долю запросов, которые Luna закрывает без эскалации, и стоимость успешного результата на каждом уровне.

Пример пайплайна: от маршрутизации до сложного анализа

  1. Входящий поток (тикеты, документы, отзывы) попадает в Luna: классификация, извлечение сущностей, короткое резюме, определение приоритета.
  2. Простые обращения закрываются на этом уровне: ответ по шаблону, разметка категории, выгрузка реквизитов.
  3. Сложный случай (несколько источников, противоречивые данные, нужен разбор причин) уходит в Sol: собрать контекст, проверить гипотезы, предложить решение с обоснованием.
  4. Если цена ошибки высока - юридический риск, финансовое решение - подключается Astra.

Кэширование работает сквозь все уровни: инструкции, описания инструментов и справочники держат в общем префиксе, чтобы каждый шаг агента не оплачивал их заново. Один и тот же справочник, разложенный по префиксу, дешевеет при каждом обращении.

Практический старт: логировать на каждом запросе уровень, модель, число токенов и результат, а не включать трёхуровневую схему с первого дня. Через пару недель по логам видно, где эскалация в Sol действительно нужна, а где Luna справляется сама.

Инфраструктура и безопасность в Amazon Bedrock

Bedrock даёт четыре элемента, которых не будет при прямом вызове модели из приложения: управление доступом через IAM, аудит через CloudTrail, приватные VPC-эндпоинты через PrivateLink и изоляцию инференса. В анонсе GPT-6 Sol и Luna эти механизмы не расписаны, поэтому конкретные настройки и формулировки условий проверяйте в документации AWS на дату внедрения.

Кросс-региональный инференс и контроль расходов в Bedrock меняются от релиза к релизу: обзор изменений платформы за август 2026 мы собирали в материале об обновлениях Amazon Bedrock, AgentCore и Strands.

Настройка IAM и CloudTrail для контроля доступа

IAM позволяет выдать право на вызов конкретной модели конкретной роли. Схема, которая экономит бюджет: сервисная роль массовой обработки имеет доступ только к Luna, а к Sol обращается отдельная роль, которую нельзя получить без ревью. Так дорогая модель физически не попадает в цикл, где задача решается дешёвой.

CloudTrail фиксирует вызовы API AWS, а это след для двух задач: разобрать инцидент и понять, кто выжигает бюджет. Учёт по ролям, регионам и моделям снимает споры о том, почему счёт вырос вдвое за неделю.

VPC-эндпоинты и PrivateLink: изоляция трафика

VPC-эндпоинт через AWS PrivateLink уводит трафик к сервису внутрь сети AWS, без выхода в публичный интернет. Для приложений, которые обрабатывают персональные данные или документы под NDA, это убирает целый класс сетевых рисков и упрощает согласование со службой безопасности.

Изоляция инференса означает, что запросы одного клиента не смешиваются с данными других. Это стандартное обещание управляемых AI-сервисов, и именно такой пункт чаще всего проверяют в регулируемых отраслях, поэтому формулировки из актуальных условий AWS стоит держать под рукой при согласовании внедрения.

Ограничения и подводные камни: что нужно знать до внедрения

Три вещи, которые стоит проговорить с командой до пилота: привязка к AWS, условия хранения данных для автоматического обнаружения злоупотреблений и расчёт стоимости по результату, а не по токену.

Привязка к AWS и альтернативы

Всё, что работает через Bedrock, работает в AWS: квоты, регионы, сеть, биллинг. Компании с мультиоблачной стратегией получают лишний контур согласований, а команда без опыта IAM и VPC - дополнительные задачи. Оцените, какая часть инфраструктуры уже в AWS: если существенная, Bedrock встраивается почти бесплатно. Если продакшен в другом облаке, сравните полную стоимость владения с альтернативами, включая доступ через ChatGPT Work и Codex и локальные модели.

Материалы анонса не описывают, как именно ограничена привязка: конкретные квоты, доступные регионы и условия стоит смотреть в документации AWS.

Хранение данных и обнаружение злоупотреблений

Условия хранения данных для автоматического обнаружения злоупотреблений в материалах анонса не раскрыты. Это стандартный для крупных AI-платформ пункт, и он чаще всего не совпадает с внутренними политиками компаний, работающих с персональными данными или коммерческой тайной. Порядок действий: найти актуальные условия обработки данных AWS, показать их юристам и службе безопасности, и только потом решать, какие данные вообще можно отправлять в модель.

PrivateLink и изоляция инференса закрывают сетевую часть вопроса, но не заменяют юридическую оценку. Отдельно держите в голове порог 272 000 входных токенов у Sol: длинные запросы пересчитываются по повышенным ставкам.

Кому и когда выгоден стек GPT-6 + Amazon Bedrock

Стек окупается при двух условиях: заметный объём запросов и уже существующая инфраструктура AWS. Первое даёт экономию на разнице цен, второе - экономию на интеграции.

Сценарии для разработчиков и DevOps

Sol закрывает работу, где важна вся цепочка: разобрать инцидент, найти причину, написать фикс, проверить его. Отладка, рефакторинг, ревью кода, анализ логов и метрик, многошаговые операции с инструментами. Luna берёт рутину: фильтрация и классификация алертов, извлечение полей из логов, короткие резюме инцидентов для дежурного.

Кэширование промптов здесь даёт заметный эффект: описания инструментов и правила разбора не меняются от вызова к вызову, а занимают значительную часть входного контекста агента.

Сценарии для бизнеса и продакт-менеджеров

Массовая обработка отзывов и обращений: Luna размечает категории, тональность и сущности, Sol разбирает случаи, где клиент описывает проблему из нескольких частей или спорит с предыдущим ответом. Бюджет распределяется по факту: дешёвый слой обслуживает весь поток, дорогой включается на доле процентов.

Метрика, по которой стоит считать выгоду, - стоимость решённого обращения, а не цена за миллион токенов. В неё входят обращения на каждом уровне, доля эскалаций, повторные прогоны и время поддержки.

Когда схема не окупается: объёмы небольшие, AWS в компании нет, а запросы уникальны настолько, что кэшируемый префикс не набирается. В этих случаях одна модель на все задачи дешевле в сопровождении, чем трёхуровневый пайплайн.

Итог: как выбрать модель под задачу

  • Массовые однотипные операции, высокий объём, важна задержка: Luna, $0.10 за миллион входных и $0.50 за миллион выходных токенов.
  • Сложные многошаговые задачи, код, анализ данных: Sol, $2 и $10; помните про пересчёт всего запроса выше 272 000 входных токенов.
  • Высокая цена ошибки, качество важнее стоимости запроса: Astra.
  • Считайте стоимость успешного результата: токены всех попыток плюс время инженера.
  • Кэшируйте статику: инструкции, описания инструментов, справочные материалы.

Старт, который занимает минимум времени: выбрать одну массовую операцию, например разметку обращений, и прогнать её на Luna с логированием токенов и эскалаций. Через две недели у вас будут свои цифры по доле сложных случаев, и по ним можно решать, нужен ли в пайплайне Sol и в каком объёме.

Подписаться на канал