Что такое GPT-6 Sol и GPT-6 Luna и зачем они в Bedrock
GPT-6 Sol и GPT-6 Luna - две новые модели OpenAI, которые стали общедоступны на Amazon Bedrock. Разделение между ними проходит по экономике запроса: Luna берёт массовые однотипные операции с высоким объёмом, где решают задержка и цена каждого вызова, а Sol закрывает ресурсоёмкие повторяющиеся задачи в разработке и операциях, которые нужно довести до готового результата. Обе модели стоят заметно дешевле своих предшественников GPT-5.6 по API. Об этом сообщает AWS в анонсе.
Задачи Luna: извлечение информации из больших коллекций документов, суммаризация входящих материалов, классификация входных данных и ответы на точечные вопросы в масштабе тысяч пользователей. Задачи Sol: реализация функций, отладка проблем, рефакторинг и ревью кода, анализ данных и многошаговые процессы с переходами между инструментами и приложениями.
Цены различаются на порядок. GPT-6 Sol - $2 за миллион входных токенов и $10 за миллион выходных, вдвое дешевле GPT-5.6 Sol. GPT-6 Luna - $0.10 и $0.50, снижение с $0.20 и $1.20 соответственно (данные MacRumors).
Sol вышла 22 сентября 2026 года как закрытая фронтир-модель по цене вдвое ниже собственного предшественника (разбор сравнения Sol и DeepSeek V4 Pro).
Ключевые различия Sol и Luna
| Критерий | GPT-6 Sol | GPT-6 Luna |
|---|---|---|
| Тип задач | Ресурсоёмкие, многошаговые, с ветвлениями и проверками | Массовые однотипные, потоковые |
| Примеры | Реализация функций, отладка, рефакторинг, ревью кода, анализ данных | Извлечение данных из документов, классификация, суммаризация, точечные вопросы |
| Что оптимизировано | Доведение задачи до результата | Задержка и стоимость отдельного запроса |
| Цена за 1 млн токенов | $2 вход / $10 выход | $0.10 вход / $0.50 выход |
| Кэширование промптов | Поддерживается, 90% скидки на чтение кэша | Поддерживается, 90% скидки на чтение кэша |
По внутренней оценке OpenAI, GPT-6 Sol допустила примерно вдвое меньше фактических ошибок, чем GPT-5.6 Sol, а улучшения в кодинге и computer use помогают ей провести задачу от разбора до реализации и проверки, сохраняя контекст принятых решений. Меньше ошибок означает меньше повторных прогонов и ручных правок, и это напрямую отражается на итоговом счёте за месяц (оценка OpenAI в анонсе AWS).
Почему Amazon Bedrock, а не прямой API OpenAI
Bedrock встраивает модель в периметр AWS: доступ выдают ролям через IAM, вызовы фиксируются в CloudTrail, трафик можно увести в приватную сеть через VPC-эндпоинты, а инференс изолирован от других клиентов. Для компании, которая уже живёт в AWS, это меньше новых сущностей в архитектуре: те же роли, те же логи, те же способы ограничивать исходящий трафик.
Модели доступны и вне AWS: они разворачиваются в ChatGPT Work и Codex для пользователей Plus, Pro, Business, Enterprise и Edu, а Luna дополнительно доступна пользователям Free и Go в десктопном приложении (сообщение о развёртывании). Если продакшен живёт в AWS, Bedrock убирает лишний слой интеграции. Если нет, придётся взвешивать стоимость переезда.
Вызов моделей семейства OpenAI на Bedrock, кэширование, квоты и управление усилиями рассуждения мы разбирали по шагам в гайде по запуску моделей OpenAI на Amazon Bedrock.
Сколько стоят GPT-6 Sol и Luna и как считать реальную стоимость
| Модель | Вход, за 1 млн токенов | Выход, за 1 млн токенов | Изменение |
|---|---|---|---|
| GPT-6 Sol | $2 | $10 | Вдвое дешевле GPT-5.6 Sol |
| GPT-6 Luna | $0.10 | $0.50 | Было $0.20 и $1.20 |
У Sol есть порог по длине контекста: ставка $2/$10 действует ниже 272 000 входных токенов. Как только запрос переходит эту границу, пересчитывается весь запрос целиком: вход дорожает примерно до $4, выход - примерно до $15. Разбить большую задачу на несколько запросов с общим кэшируемым префиксом обычно дешевле и предсказуемее по бюджету, чем отправить один запрос на 300 тысяч токенов (данные по порогу пересчёта).
Цена за токен - половина картины. Вторая половина - сколько токенов и повторных прогонов уходит на то, чтобы задача дошла до результата. Дешёвая модель, которой нужно пять итераций и ручная правка между ними, легко обойдётся дороже модели, решающей задачу за один проход. Считать стоит стоимость успешного результата: токены всех попыток плюс время инженера.
Кэширование промптов: как сэкономить до 90% на входных токенах
Обе модели поддерживают улучшенное кэширование промптов: агенты переиспользуют больше контекста, отвечают быстрее, а чтение кэшированных входных токенов идёт со скидкой 90% (описание улучшений кэширования). Скидка касается чтения, поэтому эффект появляется там, где один и тот же префикс повторяется из запроса в запрос.
Что кладут в кэшируемый префикс на практике: системные инструкции, описания инструментов и схемы функций, справочные материалы по продукту, статические части шаблонов писем и отчётов. Переменные данные - текст тикета, фрагмент документа, вопрос пользователя - идут в конец промпта. Агент с десятком инструментов перестаёт оплачивать их описания по полной ставке на каждом шаге.
Когда кэш не помогает: если каждый запрос уникален и общего префикса нет, экономии не будет, а платить придётся по базовой ставке.
Сравнение с DeepSeek V4 Pro и другими альтернативами
В Intelligence Index Artificial Analysis GPT-6 Sol набирает 48 баллов, DeepSeek V4 Pro - 36. На той же площадке Sol стоит $2.00 за миллион входных и $10.00 за миллион выходных токенов, DeepSeek V4 Pro - $1.32 и $3.96. Обе модели относят к reasoning-моделям с контекстным окном около миллиона токенов (сравнение бенчмарков и цен).
Разрыв в 12 баллов индекса и четырёхкратная разница в цене выхода объясняют, почему эти модели попадают в разные слоты пайплайна. DeepSeek V4 Pro - открытая модель с лицензией MIT, её можно развернуть на своей инфраструктуре, что меняет расклад для команд с собственными GPU. Сравнение при этом неполное: у DeepSeek V4 Pro действует пиковое и непиковое расписание цен, у Sol - порог пересчёта при длинном контексте, а Artificial Analysis обновляет данные ежедневно.
Для массовых операций рядом с ними стоит Luna с $0.10 и $0.50 на Bedrock. В извлечении и классификации, где качество фронтир-модели избыточно, разница в цене перекрывает разницу в баллах.
Как распределять модели по этапам пайплайна
Рабочая схема - три уровня по возрастанию стоимости и качества запроса:
- Luna - маршрутизация и простые операции: классификация, извлечение, суммаризация, точечные вопросы. Ставка $0.10/$0.50 позволяет пропускать через неё весь входящий поток.
- Sol - сложные случаи: многошаговый разбор, работа с кодом, анализ данных, когда ответ требует нескольких источников и проверок.
- Astra - задачи, где качество результата важнее стоимости запроса. Sol и Luna используют улучшения Astra, но верхнюю границу семейства задаёт именно она, о чём подробнее в разборе GPT-6 Astra на Amazon Bedrock.
Критерии распределения: задержка, стоимость запроса и точность. Их нужно мерить на своих данных - долю запросов, которые Luna закрывает без эскалации, и стоимость успешного результата на каждом уровне.
Пример пайплайна: от маршрутизации до сложного анализа
- Входящий поток (тикеты, документы, отзывы) попадает в Luna: классификация, извлечение сущностей, короткое резюме, определение приоритета.
- Простые обращения закрываются на этом уровне: ответ по шаблону, разметка категории, выгрузка реквизитов.
- Сложный случай (несколько источников, противоречивые данные, нужен разбор причин) уходит в Sol: собрать контекст, проверить гипотезы, предложить решение с обоснованием.
- Если цена ошибки высока - юридический риск, финансовое решение - подключается Astra.
Кэширование работает сквозь все уровни: инструкции, описания инструментов и справочники держат в общем префиксе, чтобы каждый шаг агента не оплачивал их заново. Один и тот же справочник, разложенный по префиксу, дешевеет при каждом обращении.
Практический старт: логировать на каждом запросе уровень, модель, число токенов и результат, а не включать трёхуровневую схему с первого дня. Через пару недель по логам видно, где эскалация в Sol действительно нужна, а где Luna справляется сама.
Инфраструктура и безопасность в Amazon Bedrock
Bedrock даёт четыре элемента, которых не будет при прямом вызове модели из приложения: управление доступом через IAM, аудит через CloudTrail, приватные VPC-эндпоинты через PrivateLink и изоляцию инференса. В анонсе GPT-6 Sol и Luna эти механизмы не расписаны, поэтому конкретные настройки и формулировки условий проверяйте в документации AWS на дату внедрения.
Кросс-региональный инференс и контроль расходов в Bedrock меняются от релиза к релизу: обзор изменений платформы за август 2026 мы собирали в материале об обновлениях Amazon Bedrock, AgentCore и Strands.
Настройка IAM и CloudTrail для контроля доступа
IAM позволяет выдать право на вызов конкретной модели конкретной роли. Схема, которая экономит бюджет: сервисная роль массовой обработки имеет доступ только к Luna, а к Sol обращается отдельная роль, которую нельзя получить без ревью. Так дорогая модель физически не попадает в цикл, где задача решается дешёвой.
CloudTrail фиксирует вызовы API AWS, а это след для двух задач: разобрать инцидент и понять, кто выжигает бюджет. Учёт по ролям, регионам и моделям снимает споры о том, почему счёт вырос вдвое за неделю.
VPC-эндпоинты и PrivateLink: изоляция трафика
VPC-эндпоинт через AWS PrivateLink уводит трафик к сервису внутрь сети AWS, без выхода в публичный интернет. Для приложений, которые обрабатывают персональные данные или документы под NDA, это убирает целый класс сетевых рисков и упрощает согласование со службой безопасности.
Изоляция инференса означает, что запросы одного клиента не смешиваются с данными других. Это стандартное обещание управляемых AI-сервисов, и именно такой пункт чаще всего проверяют в регулируемых отраслях, поэтому формулировки из актуальных условий AWS стоит держать под рукой при согласовании внедрения.
Ограничения и подводные камни: что нужно знать до внедрения
Три вещи, которые стоит проговорить с командой до пилота: привязка к AWS, условия хранения данных для автоматического обнаружения злоупотреблений и расчёт стоимости по результату, а не по токену.
Привязка к AWS и альтернативы
Всё, что работает через Bedrock, работает в AWS: квоты, регионы, сеть, биллинг. Компании с мультиоблачной стратегией получают лишний контур согласований, а команда без опыта IAM и VPC - дополнительные задачи. Оцените, какая часть инфраструктуры уже в AWS: если существенная, Bedrock встраивается почти бесплатно. Если продакшен в другом облаке, сравните полную стоимость владения с альтернативами, включая доступ через ChatGPT Work и Codex и локальные модели.
Материалы анонса не описывают, как именно ограничена привязка: конкретные квоты, доступные регионы и условия стоит смотреть в документации AWS.
Хранение данных и обнаружение злоупотреблений
Условия хранения данных для автоматического обнаружения злоупотреблений в материалах анонса не раскрыты. Это стандартный для крупных AI-платформ пункт, и он чаще всего не совпадает с внутренними политиками компаний, работающих с персональными данными или коммерческой тайной. Порядок действий: найти актуальные условия обработки данных AWS, показать их юристам и службе безопасности, и только потом решать, какие данные вообще можно отправлять в модель.
PrivateLink и изоляция инференса закрывают сетевую часть вопроса, но не заменяют юридическую оценку. Отдельно держите в голове порог 272 000 входных токенов у Sol: длинные запросы пересчитываются по повышенным ставкам.
Кому и когда выгоден стек GPT-6 + Amazon Bedrock
Стек окупается при двух условиях: заметный объём запросов и уже существующая инфраструктура AWS. Первое даёт экономию на разнице цен, второе - экономию на интеграции.
Сценарии для разработчиков и DevOps
Sol закрывает работу, где важна вся цепочка: разобрать инцидент, найти причину, написать фикс, проверить его. Отладка, рефакторинг, ревью кода, анализ логов и метрик, многошаговые операции с инструментами. Luna берёт рутину: фильтрация и классификация алертов, извлечение полей из логов, короткие резюме инцидентов для дежурного.
Кэширование промптов здесь даёт заметный эффект: описания инструментов и правила разбора не меняются от вызова к вызову, а занимают значительную часть входного контекста агента.
Сценарии для бизнеса и продакт-менеджеров
Массовая обработка отзывов и обращений: Luna размечает категории, тональность и сущности, Sol разбирает случаи, где клиент описывает проблему из нескольких частей или спорит с предыдущим ответом. Бюджет распределяется по факту: дешёвый слой обслуживает весь поток, дорогой включается на доле процентов.
Метрика, по которой стоит считать выгоду, - стоимость решённого обращения, а не цена за миллион токенов. В неё входят обращения на каждом уровне, доля эскалаций, повторные прогоны и время поддержки.
Когда схема не окупается: объёмы небольшие, AWS в компании нет, а запросы уникальны настолько, что кэшируемый префикс не набирается. В этих случаях одна модель на все задачи дешевле в сопровождении, чем трёхуровневый пайплайн.
Итог: как выбрать модель под задачу
- Массовые однотипные операции, высокий объём, важна задержка: Luna, $0.10 за миллион входных и $0.50 за миллион выходных токенов.
- Сложные многошаговые задачи, код, анализ данных: Sol, $2 и $10; помните про пересчёт всего запроса выше 272 000 входных токенов.
- Высокая цена ошибки, качество важнее стоимости запроса: Astra.
- Считайте стоимость успешного результата: токены всех попыток плюс время инженера.
- Кэшируйте статику: инструкции, описания инструментов, справочные материалы.
Старт, который занимает минимум времени: выбрать одну массовую операцию, например разметку обращений, и прогнать её на Luna с логированием токенов и эскалаций. Через две недели у вас будут свои цифры по доле сложных случаев, и по ним можно решать, нужен ли в пайплайне Sol и в каком объёме.