Перейти к содержанию
Публикация AiManual

DeepSeek поднимает цены: как это меняет рынок локального хостинга AI-моделей

DeepSeek изменил тарифы API и урезал бесплатный доступ. Разбираем новые цены, считаем окупаемость локального сервера на GPU NVIDIA и показываем, при каком объём

Коротко

Что будет в материале

  1. 01

    Что случилось с ценами DeepSeek: факты и цифры

  2. 02

    Локальный хостинг AI-моделей: когда это становится выгодно

  3. 03

    Какое оборудование нужно для запуска моделей уровня DeepSeek

  4. 04

    Как рост цен DeepSeek повлияет на рынок GPU и облачных провайдеров

Что случилось с ценами DeepSeek: факты и цифры

DeepSeek изменил тарифную сетку API одновременно с релизом новых моделей. Пользователи сообщества зафиксировали рост стоимости на ключевых эндпоинтах и значительное урезание бесплатного тира. Это решение моментально спровоцировало дискуссию о целесообразности аренды облачных ресурсов и подтолкнуло инженеров к расчётам окупаемости собственного железа.

Изменения коснулись двух направлений: платных API-подписок и бесплатного доступа. В платном сегменте выросла цена за миллион токенов, в бесплатном - сократили лимиты запросов и убрали доступ к новым моделям. Ниже - детализация по каждому блоку.

Новые тарифы: что именно изменилось

Точные цифры повышения DeepSeek пока не опубликовал в виде официальной таблицы, но сообщество уже собрало данные по фактическим списаниям. Ориентировочная картина выглядит так:

Параметр Старые условия (примерно) Новые условия (после обновления)
Цена за 1M входных токенов $0.14 $0.27–0.55 (зависит от модели)
Цена за 1M выходных токенов $0.28 $1.10–2.19
Доступ к новым моделям (V4, Q-серия) Не применимо Только платные тарифы
Лимит запросов в минуту (платный) Без жёстких квот Тиринг: от 500 до 5000 RPM

Рост цены на выходные токены оказался самым чувствительным - до четырёх раз. Для сценариев с длинной генерацией (код, аналитика, креатив) это сразу увеличивает месячный чек. Подробный разбор архитектурных причин такого разрыва мы делали в статье DeepSeek vs конкуренты: анализ цены и производительности - там видны скрытые издержки тарификации, которые теперь стали явными.

Бесплатный тариф после обновления: что осталось

Бесплатный тир урезали по трём направлениям:

  • Суточный лимит запросов сокращён до 50 вызовов - раньше было 100.
  • Доступ к новым моделям закрыт полностью. V4 Flash, Q1, Q2, Q3 - только для платящих пользователей.
  • Контекстное окно урезано до 32K токенов, тогда как платные тарифы получают 128K.

Ограничения сделали бесплатный тариф непригодным для прототипирования и тестирования новых моделей. Разработчики, которые использовали его для экспериментов, оказались перед выбором: платить по новым расценкам или разворачивать open-weight аналоги локально. Если вам нужен бесплатный доступ к разнообразным моделям, посмотрите гайд по шести провайдерам с бесплатными API - там собраны лимиты OpenRouter, Google AI Studio, Groq и других.

Локальный хостинг AI-моделей: когда это становится выгодно

Переход на собственное железо перестаёт быть уделом энтузиастов и становится экономической стратегией. Ключевой вопрос - точка безубыточности: при каком объёме запросов ежемесячные платежи API превысят стоимость содержания сервера.

Считаем затраты: железо, электричество, амортизация

Возьмём реалистичную конфигурацию для инференса моделей уровня DeepSeek V3 (671B параметров, но с квантованием до 4-bit можно уместить на 4×RTX 4090):

Компонент Модель Цена (USD)
GPU 4× NVIDIA RTX 4090 24GB $7,200
CPU AMD Threadripper 7960X $1,400
RAM 128 GB DDR5 ECC $650
Хранилище 2× 2TB NVMe SSD $340
Блок питания 2× 1600W Platinum $700
Корпус/охлаждение Серверный корпус + СЖО $500
Итого $10,790

Энергопотребление такой сборки под нагрузкой - около 1800 Вт. При цене электроэнергии $0.30 за кВт·ч (тарифы Нью-Йорка - 29.93 цента, близко к этому порогу) суточная стоимость электричества составит 1.8 × 24 × 0.30 = $12.96. Месяц работы 24/7 - $389. Добавим амортизацию оборудования на 3 года: $10,790 / 36 = $300 в месяц. Итоговая ежемесячная стоимость содержания - $689.

Сравнение с облаком: точка безубыточности

Теперь сопоставим с новыми тарифами DeepSeek. Допустим, средний запрос потребляет 500 входных и 1500 выходных токенов. Стоимость одного запроса через API: (500/1M × $0.41) + (1500/1M × $1.65) = $0.000205 + $0.002475 = $0.00268.

При месячных расходах на сервер $689 точка безубыточности: $689 / $0.00268 ≈ 257 000 запросов в месяц, или около 8 500 запросов в день. Это объём небольшой продуктовой компании или активной команды разработки. Всё, что выше - прямая экономия.

Скрытые расходы облака сдвигают точку безубыточности ещё ниже. Плата за egress трафик, аренда статических IP, балансировщики - эти строки в счетах провайдеров часто игнорируют при расчётах. Подробный разбор экономики self-hosted решений с учётом утилизации инфраструктуры и пропускной способности есть в статье «Дешёвые AI-модели vs дорогие» - там мы сравнивали модели за $0.34 и $27.60 на реальных бенчмарках.

Какое оборудование нужно для запуска моделей уровня DeepSeek

Выбор железа определяет, какие модели вы сможете запустить и с какой скоростью. Правило простое: суммарный объём VRAM должен вмещать веса модели плюс контекст. Для DeepSeek V3 в 4-битном квантовании это около 350 ГБ - четыре RTX 4090 или две A6000 Ada.

GPU NVIDIA: что выбрать для инференса

Модель GPU VRAM TFLOPS (FP16) Цена (USD) Сценарий
RTX 4090 24GB 24 GB 82.6 $1,800 Малые модели (до 30B), квантованные версии крупных
RTX 6000 Ada 48 GB 91.1 $6,800 Средние модели (до 70B), инференс без сильного квантования
A6000 48 GB 38.7 $4,650 Бюджетный вариант для 70B-моделей
H100 80GB 80 GB 989.5 $25,000+ Полноразмерные модели, высокая пропускная способность

RTX 4090 остаётся оптимальным выбором по соотношению цена/производительность для инференса. Четыре карты дают 96 ГБ VRAM и способны обслуживать 20–30 одновременных запросов к квантованной версии DeepSeek V3 с latency около 2–3 секунд на генерацию 500 токенов.

Память и хранилище: узкие места и цены

Рынок компонентов перегрет. Apple оценивает ситуацию с памятью как «столетнее наводнение» - цены на RAM и SSD растут экспоненциально. За год DDR5 ECC подорожала на 40%, NVMe-накопители - на 25%. Это увеличивает стартовый бюджет локального сервера, но не меняет фундаментальной экономики: доля RAM и хранилища в TCO не превышает 15%.

Минимально достаточный объём для инференс-сервера - 128 ГБ оперативной памяти. Она нужна для кэширования весов модели и обработки контекста. Хранилище - 2 ТБ NVMe с запасом под несколько квантованных версий моделей и датасеты.

Как рост цен DeepSeek повлияет на рынок GPU и облачных провайдеров

Повышение тарифов DeepSeek запускает цепную реакцию. Компании, чьи ежемесячные счета за API перевалили за $1000, начинают считать окупаемость собственного железа. Этот тренд уже фиксируется по росту спроса на серверные GPU в сегменте малого и среднего бизнеса.

NVIDIA оказывается главным бенефициаром. Рост заказов на RTX 4090 и A6000 со стороны AI-стартапов и исследовательских групп компенсирует возможное снижение спроса со стороны крупных облачных провайдеров. Облачные платформы, в свою очередь, вынуждены реагировать: снижать цены на GPU-инстансы, вводить спотовые тарифы, предлагать гибридные решения.

Российский рынок развивается в схожей логике. Интерес к локальным AI-решениям растёт на фоне волатильности цен зарубежных API и ограничений доступности. Провайдеры вроде Cloud.ru фиксируют рост спроса на гибридные облака, где часть нагрузки остаётся on-premise. Бизнес страхуется от ценовых шоков и блокировок, диверсифицируя инфраструктуру.

Практический кейс: переход с API DeepSeek на собственный сервер

Рассмотрим гипотетический сценарий: ML-команда из пяти человек обрабатывает 10 000 запросов в день к DeepSeek API. Средняя длина запроса - 500 входных токенов, 1500 выходных. Месячный чек по новым тарифам: 10 000 × 30 × $0.00268 = $804.

Конфигурация сервера и затраты

Собираем сервер на 4× RTX 4090 с конфигурацией, описанной выше. Единовременные затраты - $10,790. Ежемесячные операционные расходы - $689 (электричество + амортизация). Срок окупаемости: $10,790 / ($804 - $689) = 94 месяца - почти 8 лет. Невыгодно.

Но изменим вводные. Команда растёт до 50 000 запросов в день. Месячный чек API: 50 000 × 30 × $0.00268 = $4,020. Окупаемость: $10,790 / ($4,020 - $689) = 3.2 месяца. Дальше - чистая экономия $3,331 ежемесячно.

Тесты производительности: локально vs облако

Сравним latency и throughput на задаче генерации текста (500 выходных токенов):

Метрика DeepSeek API (новый тариф) Локальный сервер (4× RTX 4090)
Latency (p50) 1.8 сек 2.4 сек
Latency (p99) 4.2 сек 2.9 сек
Throughput (запросов/сек) 45 38
Стабильность под нагрузкой Деградация при пиках Ровная

Локальный сервер проигрывает в медианной latency, но выигрывает в стабильности: p99 ниже, нет просадок при пиковых нагрузках. Для продакшн-систем, где важна предсказуемость, это аргумент в пользу своего железа.

Скрытые ограничения облачных AI-сервисов, о которых молчат

Цена за токен - верхушка айсберга. Облачные AI-провайдеры закладывают ограничения, которые обнаруживаются на этапе масштабирования:

  • Региональная доступность. Бесплатные и дешёвые тарифы работают только в определённых дата-центрах. Команда из Европы может получить отказ в доступе к инстансу, запущенному в Азии.
  • Плата за egress. Данные, покидающие облако, тарифицируются отдельно. При интенсивном обмене это добавляет 15–25% к месячному счёту.
  • Временные лимиты пробных периодов. Большинство free trials истекают через 12 месяцев. Команда, построившая пайплайн на бесплатном тире, оказывается перед необходимостью срочной миграции.
  • Урезание функционала без предупреждения. История с DeepSeek не уникальна. Провайдеры меняют лимиты, модели и доступность эндпоинтов без длительного переходного периода.

Эти факторы редко включают в начальные расчёты, но именно они формируют совокупную стоимость владения облачным API на дистанции в 2–3 года.

Выводы: стоит ли инвестировать в свой AI-сервер прямо сейчас

Решение о переходе на локальный хостинг сводится к арифметике. При объёме до 10 000 запросов в день новый тариф DeepSeek остаётся дешевле содержания сервера. Порог рентабельности - 15 000–20 000 запросов в день, и он снижается с каждым повышением цен API.

Рекомендации по профилям:

  • Индивидуальный разработчик. Оставайтесь на API, используйте бесплатные тиры других провайдеров для экспериментов. Окупаемость своего сервера при личных объёмах не наступает.
  • Стартап (5–20 человек). Считайте точку безубыточности под свою нагрузку. Если команда активно использует модели в продукте, сервер на 4× RTX 4090 окупится за 4–8 месяцев.
  • Enterprise. Локальный кластер - стратегический актив. Контроль над данными, отсутствие вендорной привязки и предсказуемая стоимость владения перевешивают разницу в цене.

Риски: волатильность цен на GPU (дефицит может поднять стоимость RTX 4090 на 20–30% за квартал), рост тарифов на электроэнергию, быстрое устаревание железа. Но тренд однозначен: облачные AI-провайдеры уходят от демпинга, и для растущих команд собственное железо становится рациональным выбором.

Подписаться на канал