Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Claude Sonnet 5 и конкуренты: как новые модели и инфраструктурные решения меняют рынок AI в 2026

Claude Sonnet 5 со скидкой 30% на агентный кодинг, разблокировка Mythos и Fable, чип Etched от 400 инженеров NVIDIA и TSMC, open-source Longcat 2.0 MoE — полный

Коротко

Что будет в материале

  1. 01

    Ключевые события недели: что изменилось в ландшафте AI

  2. 02

    Claude Sonnet 5: ставка на агентный кодинг и временные скидки

  3. 03

    Mythos и Fable без ограничений: новые возможности для разработчиков

  4. 04

    Etched: полностековое инференсное оборудование как вызов NVIDIA

Запуск Claude Sonnet 5 с временными скидками на API для агентного кодинга, снятие правительственных ограничений с моделей Mythos и Fable, анонс полностекового инференсного чипа от Etched и выход open-source модели Longcat 2.0 MoE с новой техникой масштабирования - эти четыре события определяют расстановку сил на рынке AI в июле 2026. Для разработчиков и технических руководителей это означает немедленный пересчет экономики инференса и появление новых сценариев, которые еще неделю назад были недоступны.

Прямой ответ на главный вопрос: Claude Sonnet 5 показывает прирост в 12-18% на задачах агентного кодинга по сравнению с Sonnet 4.5, а временное снижение цены на 30% делает его самым дешевым среди frontier-моделей для генерации кода. Разблокировка Mythos и Fable возвращает на рынок модели с производительностью, сопоставимой с GPT-5.6 Sol, но с другой архитектурой безопасности. Проект Etched с командой из 400+ инженеров NVIDIA и TSMC - это первая реальная заявка на снижение стоимости инференса в 3-5 раз в течение 18 месяцев. Longcat 2.0 MoE доказывает, что open-source модели могут конкурировать с проприетарными по качеству кода при самостоятельном хостинге на GPU среднего ценового сегмента.

Ключевые события недели: что изменилось в ландшафте AI

Неделя 21-27 июля 2026 года сконцентрировала несколько разнонаправленных сигналов. С одной стороны - ценовая война и временные скидки от Anthropic, с другой - аппаратный прорыв, способный изменить себестоимость инференса для всей индустрии. Выделим пять событий, которые напрямую влияют на выбор инструментов прямо сейчас.

Первое: Anthropic выпустила Claude Sonnet 5 с фокусом на агентное кодирование. Модель доступна через API со скидкой 30% до 15 августа 2026 года. Второе: правительство США сняло ограничения на использование Mythos 5 и Fable 5, введенные в июне после инцидентов с jailbreak-ами. Третье: стартап Etched подтвердил привлечение команды из более чем 400 инженеров из NVIDIA и TSMC для создания специализированного инференсного чипа. Четвертое: китайская лаборатория выпустила Longcat 2.0 MoE - open-source модель с архитектурой Mixture of Experts и новыми техниками динамической маршрутизации. Пятое: консорциум SWE-bench представил расширенный бенчмарк для оценки агентных систем на длинных горизонтах - от 50 до 500 последовательных операций.

Практическая значимость этих событий для бизнеса: появляется окно для миграции на более дешевый API с повышенным качеством кода, возвращается выбор между моделями с разными политиками безопасности, а среднесрочный прогноз по стоимости инференса требует пересмотра бюджетов на 2027 год.

Claude Sonnet 5: ставка на агентный кодинг и временные скидки

Anthropic позиционирует Sonnet 5 как основную рабочую модель для агентных систем, которые пишут, отлаживают и рефакторят код в автономном режиме. В отличие от Opus 5, который ориентирован на исследовательские задачи и мультимодальный анализ, Sonnet 5 оптимизирован под сценарий «получил задачу - спланировал - написал код - запустил тесты - исправил ошибки - сдал результат».

Производительность в агентных задачах: цифры и сравнение

По данным внутреннего тестирования Anthropic и независимых замеров на SWE-bench Extended, Claude Sonnet 5 показывает следующие результаты:

Модель SWE-bench Extended (pass@1) HumanEval+ (pass@1) AgentBench Coding Стоимость 1M токенов (вход)
Claude Sonnet 5 67.3% 94.1% 82.4 $2.20 (со скидкой)
Claude Sonnet 4.5 58.9% 91.7% 76.1 $3.15
GPT-5.6 Sol 68.1% 93.8% 83.0 $3.50
Gemini 3.1 Pro 61.2% 90.3% 78.5 $2.80
Mythos 5 65.7% 92.4% 80.2 $3.00

Прирост в 8.4 процентных пункта на SWE-bench Extended относительно предыдущей версии - это результат двух изменений. Во-первых, модель получила расширенное контекстное окно в 500K токенов с улучшенным вниманием к середине и концу контекста. Во-вторых, Anthropic внедрила многошаговое обучение с подкреплением на траекториях агентного взаимодействия: модель училась не просто генерировать код, а планировать последовательность действий, запускать тесты и интерпретировать их результаты.

Сильная сторона Sonnet 5 - отладка чужого кода. На подзадаче bug-fixing из SWE-bench Extended модель набирает 71.2% против 64.5% у GPT-5.6 Sol. Слабая сторона - задачи, требующие генерации более 500 строк кода за один проход: здесь Sol опережает Sonnet на 3-4 процентных пункта.

Экономика использования: как скидки меняют расчеты

Временное снижение цены на 30% действует до 15 августа 2026 года для всех пользователей API. Базовая цена Sonnet 5 составляет $3.15 за 1M входных токенов и $12.60 за 1M выходных. Со скидкой - $2.20 и $8.80 соответственно.

Для стартапа из 5 разработчиков, которые генерируют суммарно 10M токенов в день (вход) и 2M токенов (выход), месячные затраты составят:

  • Claude Sonnet 5 со скидкой: (10 × $2.20 + 2 × $8.80) × 30 = $1,188 в месяц
  • GPT-5.6 Sol: (10 × $3.50 + 2 × $14.00) × 30 = $1,890 в месяц
  • Claude Sonnet 4.5: (10 × $3.15 + 2 × $12.60) × 30 = $1,701 в месяц

Разница в $702 между Sonnet 5 и GPT-5.6 Sol при сопоставимом качестве на агентных задачах - это экономия, которая для стартапа может означать один дополнительный GPU в месяц или оплату двух фрилансеров для разметки данных. После 15 августа цена вернется к базовой, и разрыв сократится до $189. Это создает окно для миграции: те, кто перейдет сейчас, получат не только скидку, но и время на оптимизацию промптов под новую модель до возврата стандартных цен.

Для enterprise с объемом 500M+ токенов в день экономия исчисляется десятками тысяч долларов в месяц. Компании, которые уже используют GPT-5.6 в production-сценариях, могут рассмотреть гибридную схему: направить задачи агентного кодинга на Sonnet 5, а мультимодальный анализ оставить на Sol.

Mythos и Fable без ограничений: новые возможности для разработчиков

В июне 2026 года правительство США потребовало от Anthropic ограничить доступ к моделям Mythos 5 и Fable 5 после серии jailbreak-ов, которые позволили обойти встроенные механизмы безопасности. 20 июля ограничения были сняты. Результат переговоров между Anthropic и регуляторами - внедрение дополнительного слоя мониторинга на уровне API без изменения архитектуры самих моделей.

Что умеют Mythos и Fable: обзор архитектур и бенчмарков

Mythos 5 - это модель с 5 триллионами параметров (по неподтвержденным данным), оптимизированная для рассуждений и многошагового планирования. Fable 5 - модель того же семейства с фокусом на креативные задачи и генерацию текстов. Обе используют архитектуру, которая в сравнении LLM Kimi K3, Fable и Sol показала преимущество в задачах на логический вывод и RAG.

Ключевые результаты на стандартных бенчмарках:

Бенчмарк Mythos 5 Fable 5 GPT-5.6 Sol Claude Opus 5
MMLU-Pro 89.2 87.8 88.5 90.1
GPQA Diamond 72.4 68.9 71.8 73.5
HumanEval+ 92.4 88.1 93.8 93.2
SWE-bench Extended 65.7 58.3 68.1 69.4

Снятие ограничений возвращает разработчикам выбор между двумя подходами к безопасности. GPT-5.6 Sol использует жесткую модерацию на уровне системного промпта, которая иногда блокирует легитимные запросы на анализ уязвимостей. Mythos 5 с новым слоем мониторинга применяет детекцию аномалий в реальном времени - это снижает число ложных срабатываний на 40% по сравнению с июньской версией, но добавляет задержку в 200-300 мс на каждый запрос.

Для компаний, которые работают с чувствительными данными и не могут отправлять их в API, разблокировка ничего не меняет: Mythos и Fable остаются проприетарными моделями без возможности локального развертывания. Однако для облачных сценариев это расширяет выбор: теперь доступны три модели с производительностью выше 65% на SWE-bench Extended - Sonnet 5, GPT-5.6 Sol и Mythos 5.

Etched: полностековое инференсное оборудование как вызов NVIDIA

Стартап Etched, основанный в 2024 году, объявил о привлечении более 400 инженеров из NVIDIA и TSMC для создания специализированного чипа, который выполняет только инференс трансформерных моделей. Никаких других задач. Это ставка на то, что универсальность GPU перестала быть преимуществом, когда 90% вычислительной нагрузки в дата-центрах приходится на инференс LLM.

Технические амбиции: что известно о чипах Etched

Публичные данные о чипе ограничены. Известно, что Etched проектирует ASIC на техпроцессе 3 нм с тензорными ядрами, оптимизированными под архитектуру transformer. Заявленная производительность - 1.2 петафлопс на чип в режиме INT8, что примерно в 3 раза выше, чем у NVIDIA H100 на задачах инференса GPT-подобных моделей. Энергопотребление - 250 Вт против 700 Вт у H100.

Ключевое отличие от GPU: чип Etched не имеет программируемых шейдерных ядер, блоков растеризации и других компонентов, необходимых для графики или научных вычислений. Вся площадь кристалла отдана под матричные умножители и память HBM4 объемом 192 ГБ с пропускной способностью 8 ТБ/с. Это позволяет запускать модель с 1 триллионом параметров на одном чипе без разрезания на несколько устройств.

Команда из 400+ инженеров - это не маркетинговое преувеличение. Etched подтвердила найм ключевых архитекторов чипов из NVIDIA (серии H100 и B100) и технологов из TSMC, которые работали над 3-нм техпроцессом. Дорожная карта предполагает тестовые образцы в Q2 2027 и серийное производство в Q4 2027.

Влияние на рынок: когда ждать дешевый инференс

Если Etched выполнит заявленные спецификации, стоимость инференса 1M токенов для модели уровня GPT-5.6 может упасть с текущих $3.50 до $0.70-1.00. Это изменит экономику всех AI-сервисов. Стратегия Microsoft в 2026 году по интеграции Copilot и Fabric предполагает именно такое снижение себестоимости для массового внедрения AI-агентов.

Реалистичный сценарий: первые облачные инстансы на чипах Etched появятся в конце 2027 года. До этого времени рынок будет работать на GPU NVIDIA Blackwell и AMD MI400. Однако сам факт появления специализированного инференсного чипа с командой из 400+ инженеров - это сигнал для вендоров GPU ускорить разработку аналогичных решений. NVIDIA уже анонсировала Grace-Hopper Next с оптимизациями под инференс, но без радикального отказа от универсальности.

Longcat 2.0 MoE: китайский open-source ответ в гонке эффективности

Китайская лаборатория Longcat AI выпустила вторую версию своей модели с архитектурой Mixture of Experts. Longcat 2.0 MoE содержит 1.2 триллиона параметров, из которых активны только 45 миллиардов на каждый токен. Это прямой конкурент моделям уровня Kimi K3 с 2.8 трлн параметров, но с более агрессивной оптимизацией под локальный запуск.

Техники масштабного обучения: что нового привнесла Longcat

Главная инновация Longcat 2.0 - динамическая маршрутизация экспертов с обратной связью по качеству. В стандартной MoE-архитектуре роутер обучается один раз и затем статически распределяет токены между экспертами. Longcat использует двухэтапную маршрутизацию: первый этап - быстрый роутер на основе хеша, который за 0.1 мс выбирает 8 экспертов из 256; второй этап - верификатор, который за 0.5 мс проверяет качество ответа каждого эксперта на маленькой выборке и перераспределяет нагрузку, если качество падает ниже порога.

Это решает проблему «мертвых экспертов», когда часть параметров модели не используется из-за неудачной инициализации роутера. В Longcat 2.0 коэффициент использования экспертов составляет 94% против 78% у Mixtral 8x22B и 82% у Qwen 3.8 Max.

Вторая инновация - обучение с прогрессивным расширением контекста. Модель обучалась на 8K токенов первые 500 миллиардов токенов данных, затем контекст расширялся до 32K, 128K и финальных 256K с добучением на каждом этапе. Это снизило потери на длинных последовательностях на 12% по сравнению с обучением сразу на полном контексте.

Сравнение с облачными API: когда open-source выгоднее

Longcat 2.0 MoE доступна для скачивания под лицензией Apache 2.0. Квантованная 4-битная версия занимает 240 ГБ в GPU-памяти и запускается на 4×RTX 4090 или 2×A100. Результаты на бенчмарках:

Бенчмарк Longcat 2.0 MoE Llama 4 405B Qwen 3.8 Max Claude Sonnet 5
HumanEval+ 88.3% 85.1% 87.6% 94.1%
SWE-bench Lite 52.4% 48.9% 50.2% 67.3%
MMLU-Pro 82.7 80.3 83.1 87.5

Отставание от Sonnet 5 на SWE-bench составляет 14.9 процентных пункта - это существенно для задач, где критично качество кода. Однако для сценариев с высокими требованиями к приватности или при объеме более 500M токенов в месяц локальный запуск Longcat 2.0 становится экономически оправданным.

Расчет для объема 500M входных токенов в месяц:

  • Claude Sonnet 5 API (со скидкой): 500 × $2.20 = $1,100
  • Аренда 4×RTX 4090 в облаке: $2.80/час × 24 × 30 = $2,016 (с запасом по производительности для 500M токенов)
  • Собственные 4×RTX 4090: $8,000 единоразово + $200/мес электричество

Точка окупаемости собственного железа - 8 месяцев при объеме 500M токенов в месяц. Для стартапа, который уже имеет GPU для обучения, добавление инференса Longcat 2.0 - это нулевые предельные затраты.

Новые бенчмарки для длинных агентных задач: как меняется оценка моделей

Консорциум SWE-bench 21 июля 2026 года выпустил расширение своего бенчмарка - SWE-bench Extended с задачами на 50, 100, 200 и 500 последовательных операций. До этого стандартный бенчмарк оценивал способность модели исправить баг в одном файле за 1-3 операции. Новый формат тестирует сценарий «получил доступ к репозиторию с 50+ файлами, найди баг, напиши фикс, запусти тесты, исправь регрессии, задокументируй изменения».

Методология: каждая задача содержит описание проблемы на естественном языке, модель получает доступ к файловой системе через API, может запускать команды git, pytest, линтеры. Оценивается не только факт исправления бага, но и отсутствие регрессий, качество документации и время выполнения.

Результаты тестирования на задачах из 100 операций:

Модель 100-op Fix Rate Регрессии (↓) Среднее время Качество документации
Claude Sonnet 5 61.2% 8.3% 4.2 мин 7.8/10
Mythos 5 58.7% 7.1% 5.1 мин 8.1/10
GPT-5.6 Sol 62.4% 9.5% 3.8 мин 7.2/10
Longcat 2.0 MoE 44.8% 14.2% 6.7 мин 6.5/10

Ключевой вывод: на горизонте 100 операций разрыв между моделями сокращается. Sonnet 5 и Sol идут вровень, Mythos 5 отстает на 3.7 процентных пункта, но генерирует меньше регрессий. Longcat 2.0 серьезно проседает - с 52.4% на стандартном SWE-bench до 44.8% на расширенном. Это подтверждает, что техники обучения с подкреплением на агентных траекториях, которые используют Anthropic и OpenAI, дают преимущество именно на длинных горизонтах.

Для практического выбора модели эти результаты означают: если ваш агент выполняет 5-10 операций за сессию, разница между Sonnet 5 и Longcat 2.0 составляет 5-7 процентных пунктов. Если 50-100 операций - разница вырастает до 15-20 пунктов, и open-source модель перестает быть адекватной заменой.

Практические выводы: как выбрать инструменты в 2026 году

События этой недели формируют матрицу выбора, в которой цена, качество кода и доступность образуют три оси. Универсального лидера нет - решение зависит от профиля использования.

Сценарии использования: когда локальный запуск действительно экономит бюджет

Критерии для выбора между облачным API и собственным хостингом по состоянию на июль 2026:

  • Объем до 100M токенов в месяц: всегда выгоднее API. Экономия от локального запуска не окупает затраты на администрирование.
  • Объем 100M-500M токенов: зона неопределенности. Если у вас уже есть GPU для обучения - локальный запуск Longcat 2.0 или Qwen 3.8 Max дает экономию 30-40%. Если GPU нужно покупать специально - API выгоднее.
  • Объем более 500M токенов: локальный запуск выгоднее при любом сценарии. Точка окупаемости собственного кластера из 8×RTX 4090 - 6-8 месяцев.
  • Требования к качеству кода выше 60% на SWE-bench Extended: только API (Sonnet 5, Sol, Mythos 5). Open-source модели не дотягивают.
  • Требования к приватности (данные не могут покидать контур): только локальный запуск, компромисс по качеству неизбежен.

Готовы сократить затраты на AI-разработку? План действий

Чек-лист для оптимизации расходов на API и инференс в июле 2026:

  1. Аудит текущих расходов. Соберите метрики за последние 30 дней: объем токенов по моделям, распределение по задачам (кодинг, анализ, генерация текстов), пиковые нагрузки.
  2. Тестирование альтернатив. Выделите 5% трафика на тестирование Sonnet 5 со скидкой. Сравните качество на ваших данных, не на бенчмарках. Замерьте реальную задержку и число ретраев.
  3. Оценка локального запуска. Возьмите квантованную Longcat 2.0 MoE, разверните на тестовом GPU, прогоните 1000 типовых запросов. Сравните качество и задержку с API.
  4. Пилотный проект. Перенесите одну изолированную задачу (например, генерацию unit-тестов) на новую модель. Замеряйте метрики две недели.
  5. Масштабирование. При положительных результатах расширяйте использование новой модели на другие задачи с мониторингом качества.

Прогноз на ближайшие 6-12 месяцев: скидки на API станут регулярным инструментом конкуренции между Anthropic и OpenAI. Цена инференса для frontier-моделей снизится до $1.50-2.00 за 1M токенов к середине 2027 года за счет конкуренции и новых чипов. Open-source модели сократят отставание в агентных задачах до 8-10 процентных пунктов. BigCodeArena и аналогичные бенчмарки с реальным запуском кода станут стандартом оценки, вытесняя статические тесты. Компании, которые сейчас создадут инфраструктуру для быстрого переключения между моделями, получат конкурентное преимущество в стоимости и качестве AI-разработки.

Подписаться на канал