Kimi K3 от Moonshot AI появилась на Amazon Bedrock 18 сентября 2026 года. Это открытая модель с нативным зрением, контекстным окном на 1 млн токенов и явным кэшированием промптов. По заявлению разработчика, она стала первой открытой моделью с 2,8 трлн параметров и даёт примерно 2,5-кратный прирост эффективности масштабирования по сравнению с Kimi K2.
Вызвать её можно через OpenAI-совместимые Responses и Chat Completions API и через Amazon Bedrock Invoke и Converse API. Доступны два профиля кросс-регионального инференса: global.moonshotai.kimi-k3 и us.moonshotai.kimi-k3. Глобальный стоит примерно на 10% меньше, американский удерживает обработку в границах США.
Ниже: характеристики модели, подключение, механика явного кэширования, рабочие сценарии и ограничения, которые стоит учесть до того, как строить на K3 продакшен.
Что такое Kimi K3 и почему она важна для Bedrock
Kimi K3 - открытая модель Moonshot AI, которую AWS описывает как новый open-weight вариант для программирования и работы со знаниями. Анонс на Bedrock вышел 18 сентября 2026 года.
Ключевой для платформы момент: K3 стала первой открытой моделью на Bedrock с поддержкой явного кэширования промптов. Раньше открытые модели здесь можно было вызывать с длинным контекстом, но пометить переиспользуемый префикс было нельзя.
Почва под релиз уже была готова. С 2025 года Bedrock добавил десятки открытых моделей от DeepSeek, Google, MiniMax, Mistral AI, Moonshot AI, NVIDIA, OpenAI и Qwen. В 2026 году платформа получила tool calling, структурированный вывод, рассуждения, потоковую передачу ответов и API Responses и Chat Completions. K3 приходит на готовую инфраструктуру, а не прокладывает её с нуля.
Ключевые характеристики Kimi K3
| Параметр | Значение |
|---|---|
| Разработчик | Moonshot AI |
| Число параметров | 2,8 трлн (заявление Moonshot AI) |
| Контекстное окно | 1 млн токенов |
| Модальности | Текст и изображения (нативное зрение) |
| Кэширование промптов | Явное, минимальный префикс 1024 токена |
| Эффективность масштабирования | примерно 2,5-кратный прирост к Kimi K2 (заявление Moonshot AI) |
| Профили инференса | global.moonshotai.kimi-k3, us.moonshotai.kimi-k3 |
Цифры по числу параметров и эффективности масштабирования идут от Moonshot AI. Независимых замеров, которые бы их подтверждали, в открытых источниках на момент публикации нет, поэтому дальше речь о заявленных характеристиках, а не о проверенных фактах.
Чем Kimi K3 отличается от Kimi K2
От K2 к K3 разработчик заявляет два сдвига: рост до 2,8 трлн параметров и примерно 2,5-кратный прирост эффективности масштабирования. Формулировка про эффективность масштабирования описывает, сколько качества удаётся получить на единицу вычислений, а не скорость работы модели на конкретном железе.
Практические отличия, заметные в API: нативное зрение и явное кэширование промптов. Первое открывает анализ изображений в том же вызове, что и текст. Второе влияет на задержку и стоимость повторных обращений с общим контекстом.
Устройство модели разобрано в отдельном материале про архитектуру K3 и подводные камни отчёта Moonshot: 896 экспертов, гибридное внимание KDA/MLA, а также критика отчёта, где заявленное ускорение 2,5× осталось без доказательств.
Ждать, что K3 обойдёт все проприетарные модели, не стоит. 2,8 трлн параметров и миллион токенов контекста описывают возможности, а не превосходство в каждом бенчмарке. Сравнение с frontier-моделями по реальным метрикам и цене API разобрано отдельно.
Как подключить Kimi K3 на Amazon Bedrock
Модель вызывается через bedrock-runtime endpoint. Отдельный контракт или отдельная SDK не нужны: подпись запросов, лимиты и логирование остаются такими же, как у других моделей Bedrock.
Доступные API и эндпоинты
- OpenAI-совместимые Responses API и Chat Completions API - подходят, если код уже написан под OpenAI SDK: потребуются правки в конфигурации, а не переписывание логики.
- Amazon Bedrock Invoke API - базовый одиночный вызов модели.
- Amazon Bedrock Converse API - унифицированный интерфейс для диалогов и вызова инструментов, общий для моделей платформы.
Выбор сводится к тому, что уже есть в проекте. Если остальные модели подключены через Converse, K3 логично добавить туда же, чтобы не плодить второй стек обработки ответов. Если приложение живёт на OpenAI SDK, дешевле по времени идти через Responses или Chat Completions. Подробных примеров кода в анонсе AWS нет, поэтому конкретные схемы запросов стоит брать из документации по выбранному API.
Выбор гео-профиля: global vs us
Для рабочих нагрузок без региональных ограничений AWS рекомендует глобальный профиль global.moonshotai.kimi-k3: он маршрутизирует запросы в поддерживаемые коммерческие регионы AWS по всему миру. Профиль us.moonshotai.kimi-k3 удерживает обработку в пределах США.
Разница в цене: глобальный кросс-региональный инференс обходится примерно на 10% дешевле географического профиля. Решение при этом принимает не экономика, а требования к резидентности данных. Если политика компании требует обработки внутри США, экономия в 10% не аргумент, и профиль us остаётся единственным вариантом.
Явное кэширование промптов: как это работает и что даёт
Явное кэширование означает, что разработчик сам решает, какую часть входа переиспользовать. Помеченный префикс сохраняется и подставляется в следующие вызовы, что снижает задержку и стоимость входных токенов при повторных обращениях с тем же контекстом. Автоматика здесь не догадывается за вас: без явной метки префикс не кэшируется.
Как настроить кэширование префиксов
Минимальный размер префикса, который можно пометить, - 1024 токена. Всё, что короче, кэшировать нельзя. Общий подход такой: вы собираете стабильную часть запроса (системный промпт, схемы инструментов, описание проекта, переиспользуемый блок документов), помечаете её как кэшируемую и держите неизменной между вызовами. Синтаксис метки зависит от API: Responses, Chat Completions, Invoke и Converse передают её по-разному, поэтому точные параметры смотрите в документации AWS по выбранному интерфейсу.
Логика простая: кэш ломается, если меняется начало промпта. Один новый абзац перед помеченным блоком обнуляет всю выгоду. Поэтому статичный контент ставьте первым, изменяемый - после него, и не переставляйте блоки между вызовами ради «красоты» шаблона.
Ограничения и условия тарификации кэширования
Анонс AWS ограничивается общей формулировкой: кэширование снижает задержку и стоимость входных токенов при повторном использовании контекста. Конкретных ставок за запись и чтение кэша, минимального времени жизни записи и правил списания в источнике нет. Практический вывод: перед расчётом бюджета берите актуальные тарифы из документации Bedrock, а не из новостей о релизе.
Второе ограничение - порог в 1024 токена. Для коротких запросов (классификация, извлечение полей, короткий чат) механика просто не включится, и размечать префикс бессмысленно. Выигрыш появляется там, где один и тот же крупный блок уходит в модель десятки раз.
Для каких задач Kimi K3 подходит лучше всего
AWS позиционирует модель для программирования и работы со знаниями. Оба сценария опираются на одно и то же: длинный контекст и фиксированный префикс, который можно кэшировать.
Программирование и работа с большими репозиториями
1 млн токенов позволяет отдать в модель крупную часть репозитория в одном запросе: код модулей, схемы данных, конфиги, тесты, README. Это меняет характер задач. Рефакторинг с учётом всех зависимостей, поиск причины бага по цепочке вызовов, генерация кода в стиле проекта перестают требовать ручной нарезки контекста на части и сборки выжимок.
Кэширование здесь работает естественно: структура репозитория и его ядро меняются редко, а вопросы к модели - постоянно. Стабильная часть уходит в кэш, меняется только формулировка задачи.
Косвенное подтверждение спроса на K3 в coding-инструментах: 18 сентября 2026 года Cline сделала модель бесплатной в Cline Desktop на ограниченный срок, точные даты акции не объявлены (условия акции). Результаты K3 в бенчмарке NextJS для генерации React/Next.js-кода разобраны отдельно.
Работа со знаниями и мультимодальные задачи
Нативное зрение вместе с контекстом 1 млн токенов позволяет обрабатывать документы, где текст перемешан с картинками: технические руководства со схемами, научные статьи с графиками, финансовые отчёты с таблицами. Модель видит изображение и текст в одном запросе и может связать подпись к диаграмме с абзацем в другом разделе.
Для повторяющихся запросов к одному корпусу документов явное кэширование снимает главную статью расходов: каждый новый вопрос не заставляет заново оплачивать весь переданный контекст по цене входных токенов. Сценарии, где это работает: RAG-пайплайны с фиксированным набором документов, AI-агенты с длинным системным промптом, многошаговый анализ одного и того же файла.
В табличных задачах K3 показала результат выше проприетарных конкурентов: первое место в SpreadsheetBench 2. Это ориентир для сценариев с финансовыми моделями и сводными таблицами, хотя переносить результат бенчмарка на свой датасет без проверки не стоит.
Безопасность и соответствие требованиям на Amazon Bedrock
Данные обрабатываются в границах AWS, не передаются провайдеру модели и не используются для обучения базовой модели, указывает AWS в анонсе. Для запросов инференса всегда включено нулевое хранение данных, а нулевой операторский доступ не даёт операторам AWS заглядывать в промпты и ответы.
Для корпоративных внедрений это убирает два типовых возражения службы безопасности: что данные уйдут стороннему вендору и что сотрудники облачного провайдера смогут их прочитать. Отдельно стоит учесть выбор гео-профиля: он определяет, в каких границах физически идёт обработка, и это уже вопрос внутренних политик, а не технических настроек.
Тарификация и альтернативные способы попробовать Kimi K3
Единственный конкретный ориентир по цене в анонсе: глобальный профиль обходится примерно на 10% дешевле географического. Абсолютных ставок за 1 млн токенов для Bedrock в источнике нет, их нужно смотреть на странице тарифов AWS: цены на инференс меняются чаще, чем выходят новые версии моделей.
На стороне инструментов есть два ориентира. В Cline Desktop модель сделали бесплатной на ограниченный срок с 18 сентября 2026 года. Справочная цена Kimi K3 в ClinePass - $3 за 1 млн входных токенов и $15 за 1 млн выходных (данные по акции и ценам). Это ориентир по порядку величин, а не тариф Bedrock, и фактические условия могут отличаться.
Стоит ли использовать Kimi K3: выводы и рекомендации
Kimi K3 закрывает нишу, которая до неё на Bedrock была пустой: открытая модель с контекстом 1 млн токенов, зрением и явным кэшированием промптов в одном пакете. Если задача требует держать в контексте большой репозиторий или корпус документов и обращаться к нему многократно, сочетание длинного окна и управляемого кэша даёт прямую экономию на входных токенах.
Кому подходит в первую очередь:
- разработчикам, которые работают с крупными монорепозиториями и агентными coding-инструментами;
- командам, строящим RAG и AI-агентов с длинным неизменным префиксом;
- тем, кто обрабатывает документы с изображениями и таблицами;
- компаниям, которым важны границы AWS по данным и нулевое хранение.
Ограничения, о которых стоит помнить:
- 2,8 трлн параметров и 2,5-кратный прирост эффективности масштабирования - заявления Moonshot AI, независимых замеров нет;
- тарифы кэширования в анонсе не расписаны, бюджет придётся считать по документации AWS;
- минимальный кэшируемый префикс 1024 токена отсекает короткие запросы;
- для работы через Bedrock нужен аккаунт AWS и выбранный гео-профиль, а он влияет на резидентность данных.
Практичный порядок действий: если хочется быстро потрогать модель без облачной настройки, начните с Cline Desktop на время акции. Если нужен продакшен с гарантиями по данным, берите Bedrock, ставьте глобальный профиль для нагрузок без региональных ограничений и сразу проектируйте промпты так, чтобы стабильная часть шла первой и попадала в кэш.