Moonshot AI, китайский разработчик больших языковых моделей, в июле 2026 года впервые в своей истории столкнулась с полным исчерпанием GPU-мощностей. Компания приостановила регистрацию новых пользователей и отключила бесплатный тариф для сервиса Kimi. Причина - лавинообразный рост спроса на инференс после релиза модели Kimi K3 с 2.8 трлн параметров, совпавший с жёсткими экспортными ограничениями США на поставки ускорителей в Китай.
Этот инцидент - не частный сбой, а симптом системного кризиса индустрии. Обучение одной модели уровня GPT-4 требует кластера из тысяч ускорителей, срок ожидания заказа H100 у NVIDIA достигает шести месяцев, а цены на облачные GPU-инстансы выросли на 40-60% за последний год. В этой статье разбираем причины дефицита, его влияние на бизнес-модели AI-компаний и конкретные стратегии управления ресурсами - от квантизации до multi-cloud.
Кризис GPU: почему Moonshot AI остановила новых пользователей
Кейс Moonshot AI показывает, как быстро успешный продукт может упереться в аппаратный потолок. Компания, ещё в начале 2026 года уверенно наращивавшая аудиторию, за две недели прошла путь от первых признаков перегрузки до экстренной блокировки доступа для новых пользователей. Разберём хронологию и корневые причины.
Хронология: от нехватки до отключения бесплатного доступа
Первые сигналы появились в конце июня 2026 года: пользователи Kimi начали жаловаться на задержки при обработке запросов, время ответа выросло с 2-3 до 12-15 секунд. Инженеры Moonshot AI зафиксировали утилизацию GPU на уровне 94-97% в пиковые часы - при норме 70-80%. 5 июля компания разослала предупреждение корпоративным клиентам о возможных перебоях. 12 июля официально объявила о приостановке новых подписок. 15 июля отключила бесплатный тариф, оставив доступ только платным пользователям с приоритетной очередью. Под ограничения попали чат-бот Kimi и API-эндпоинты для разработчиков.
Экспортные ограничения как катализатор дефицита
Корень проблемы Moonshot AI - не в плохом планировании, а в геополитике. В октябре 2022 года США ввели первый пакет экспортного контроля, запретив поставки в Китай ускорителей A100 и H100 без специальной лицензии. В октябре 2023 года правила ужесточили: под запрет попали даже урезанные версии A800 и H800, которые NVIDIA разработала специально для китайского рынка. Moonshot AI, как и другие китайские AI-компании, оказалась отрезана от передовых чипов. Накопленные запасы ускорителей таяли, а альтернативы - китайские чипы Huawei Ascend и Cambricon - уступают NVIDIA по производительности и зрелости софта. Подробный разбор того, как экспортные ограничения парадоксально ускорили развитие китайского AI, мы давали в статье о факторах рывка Китая в фундаментальных моделях.
Анатомия дефицита: почему GPU-мощностей не хватает всей индустрии
Проблема Moonshot AI - частный случай глобального дисбаланса. Спрос на вычисления растёт экспоненциально, а предложение упирается в физические ограничения производства и монополию одного вендора. Три фактора создают идеальный шторм.
Сколько GPU нужно современной AI-компании
Цифры отрезвляют. Обучение модели с 70 млрд параметров требует кластера из ~1000 ускорителей A100 в течение 2-4 недель. Инференс для 1 млн активных пользователей - 30-50 GPU в режиме 24/7. Для модели уровня Kimi K3 с 2.8 трлн параметров потребности на порядок выше: только на обслуживание инференса после релиза Moonshot AI задействовала более 2000 ускорителей. Затраты на электроэнергию и охлаждение такого кластера достигают $50-80 тысяч в месяц. Это объясняет, почему компания была вынуждена отключить бесплатный тариф - каждый запрос нерентабельного пользователя сжигал дорогостоящий ресурс.
Почему облачные провайдеры не спасают
Облако кажется очевидным решением, но реальность жёстче. AWS, GCP и Azure ввели квоты на GPU-инстансы: новый клиент без истории потребления может получить отказ на запрос более 8 ускорителей. Стоимость on-demand инстанса с H100 достигает $40-50 в час, что делает круглосуточный инференс экономически нецелесообразным для средних компаний. Спотовые инстансы дешевле на 60-70%, но их могут отозвать в любой момент, и в периоды пикового спроса доступность спотов падает до нуля. В результате облако - не страховка от дефицита, а ещё один дефицитный ресурс с непредсказуемой доступностью.
Стратегии выживания: как управлять GPU-ресурсами в условиях дефицита
Переходим к практическим решениям. Четыре направления, которые позволяют снизить зависимость от дефицитных ускорителей без потери качества сервиса.
Оптимизация инференса: меньше железа, та же производительность
Самый быстрый способ высвободить ресурсы - выжать максимум из имеющегося железа. Квантизация модели с FP16 до INT8 сокращает потребление видеопамяти на 40-50% при падении точности в пределах 1-2%. Дистилляция позволяет обучить компактную модель-студент на выходах большой модели-учителя: student-модель с 7B параметров может показывать 85-90% качества 70B-версии. Специализированные рантаймы - TensorRT от NVIDIA и ONNX Runtime - дают прирост скорости инференса на 20-35% за счёт оптимизации вычислительного графа. Фреймворки vLLM и TGI реализуют эффективный батчинг запросов и PagedAttention, повышая пропускную способность одного GPU в 2-3 раза. Практический пример: переход с vanilla PyTorch на vLLM с INT8-квантизацией сокращает необходимый парк GPU для инференса на 60%.
Облачные тактики: аренда кластеров, спотовые инстансы, multi-cloud
Гибкость - главное оружие против дефицита. Спотовые инстансы дают экономию до 60% относительно on-demand, но требуют автоматизации: скрипт должен уметь за 30 секунд переключить нагрузку на резервный провайдер при отзыве инстанса. Multi-cloud стратегия с распределением нагрузки между AWS, GCP и Azure снижает риск отказа из-за квот у одного провайдера. Резервирование инстансов на 1-3 года фиксирует цену и гарантирует доступность, но требует точного прогноза потребления. Компаниям с переменной нагрузкой выгодна комбинация: 50-70% reserved под базовую нагрузку, остальное - spot для пиков. Автоматизация переключения между провайдерами реализуется через оркестраторы вроде Kubernetes с федеративным кластером.
Аппаратные альтернативы: не только NVIDIA
Монополия NVIDIA создаёт узкое место, но альтернативы есть. Intel Gaudi2 на бенчмарках MLPerf показывает 90-95% производительности A100 на задачах обучения языковых моделей при цене на 30% ниже. AMD Instinct MI250 конкурирует с H100 в задачах инференса, а экосистема ROCm постепенно догоняет CUDA по зрелости. Google TPU v5 доступен только в GCP, но для компаний, уже использующих это облако, переход на TPU может дать 20-30% экономии. Тренд на собственные чипы - Amazon Trainium, Microsoft Maia - пока ограничен внутренними задачами гигантов, но в перспективе 2-3 лет эти решения могут выйти на внешний рынок. Для китайских компаний, отрезанных от NVIDIA, критически важен прогресс Huawei Ascend: последнее поколение чипов сократило отставание от A100 до 30-40%.
Организационные меры: планирование, мониторинг, культура эффективности
Технологии работают только в связке с процессами. Мониторинг утилизации GPU через Prometheus + DCGM даёт картину реального потребления и выявляет неэффективные задачи. Компания, внедрившая дашборды с алертами на простой GPU, сократила нецелевое использование на 30% за первый месяц. Планирование закупок с горизонтом 6-12 месяцев критически важно при текущих сроках поставок. Внутренняя очередь задач с приоритезацией предотвращает ситуацию, когда эксперимент младшего исследователя блокирует ресурсы для продуктового инференса. Прозрачная система тегов и учёта потребления GPU на уровне команд создаёт культуру эффективности: когда каждый инженер видит стоимость своего эксперимента, решения становятся взвешеннее.
Уроки Moonshot AI: как не повторить её ошибок
Кейс Moonshot AI кристаллизует три правила для AI-компаний любого масштаба. Первое: диверсификация источников GPU обязательна - один поставщик или одно облако рано или поздно станут точкой отказа. Второе: буфер мощности в 20-30% от пикового потребления должен быть зарезервирован заранее, а не докупаться в момент кризиса. Третье: оптимизация инференса - не проект на потом, а непрерывный процесс, который должен идти параллельно с разработкой моделей. Релиз Kimi K3 и последовавший коллапс инфраструктуры Moonshot AI мы детально разбирали в статье о новом витке гонки ИИ между Китаем и США.
Чек-лист: готова ли ваша инфраструктура к дефициту GPU
- Мониторинг утилизации GPU внедрён и покрывает все кластеры. Вы знаете среднюю и пиковую загрузку за последние 30 дней.
- План перехода на спотовые инстансы протестирован: скрипты миграции отрабатывают за время, не превышающее таймаут вашего сервиса.
- Минимум одна альтернативная аппаратная платформа (Intel Gaudi, AMD Instinct или TPU) проверена на вашей модели, бенчмарки сняты.
- Эффект от квантизации INT8/INT4 измерен: вы знаете точное падение accuracy и выигрыш в скорости для вашего стека.
- Резервный облачный провайдер настроен, квоты подтверждены, проведено тестовое переключение трафика.
- Горизонт планирования закупок GPU - минимум 6 месяцев, бюджет зафиксирован.
- Внутренняя очередь задач с приоритезацией работает, все команды знают правила доступа к GPU-кластерам.