Что случилось с ценами DeepSeek: факты и цифры
DeepSeek изменил тарифную сетку API одновременно с релизом новых моделей. Пользователи сообщества зафиксировали рост стоимости на ключевых эндпоинтах и значительное урезание бесплатного тира. Это решение моментально спровоцировало дискуссию о целесообразности аренды облачных ресурсов и подтолкнуло инженеров к расчётам окупаемости собственного железа.
Изменения коснулись двух направлений: платных API-подписок и бесплатного доступа. В платном сегменте выросла цена за миллион токенов, в бесплатном - сократили лимиты запросов и убрали доступ к новым моделям. Ниже - детализация по каждому блоку.
Новые тарифы: что именно изменилось
Точные цифры повышения DeepSeek пока не опубликовал в виде официальной таблицы, но сообщество уже собрало данные по фактическим списаниям. Ориентировочная картина выглядит так:
| Параметр | Старые условия (примерно) | Новые условия (после обновления) |
|---|---|---|
| Цена за 1M входных токенов | $0.14 | $0.27–0.55 (зависит от модели) |
| Цена за 1M выходных токенов | $0.28 | $1.10–2.19 |
| Доступ к новым моделям (V4, Q-серия) | Не применимо | Только платные тарифы |
| Лимит запросов в минуту (платный) | Без жёстких квот | Тиринг: от 500 до 5000 RPM |
Рост цены на выходные токены оказался самым чувствительным - до четырёх раз. Для сценариев с длинной генерацией (код, аналитика, креатив) это сразу увеличивает месячный чек. Подробный разбор архитектурных причин такого разрыва мы делали в статье DeepSeek vs конкуренты: анализ цены и производительности - там видны скрытые издержки тарификации, которые теперь стали явными.
Бесплатный тариф после обновления: что осталось
Бесплатный тир урезали по трём направлениям:
- Суточный лимит запросов сокращён до 50 вызовов - раньше было 100.
- Доступ к новым моделям закрыт полностью. V4 Flash, Q1, Q2, Q3 - только для платящих пользователей.
- Контекстное окно урезано до 32K токенов, тогда как платные тарифы получают 128K.
Ограничения сделали бесплатный тариф непригодным для прототипирования и тестирования новых моделей. Разработчики, которые использовали его для экспериментов, оказались перед выбором: платить по новым расценкам или разворачивать open-weight аналоги локально. Если вам нужен бесплатный доступ к разнообразным моделям, посмотрите гайд по шести провайдерам с бесплатными API - там собраны лимиты OpenRouter, Google AI Studio, Groq и других.
Локальный хостинг AI-моделей: когда это становится выгодно
Переход на собственное железо перестаёт быть уделом энтузиастов и становится экономической стратегией. Ключевой вопрос - точка безубыточности: при каком объёме запросов ежемесячные платежи API превысят стоимость содержания сервера.
Считаем затраты: железо, электричество, амортизация
Возьмём реалистичную конфигурацию для инференса моделей уровня DeepSeek V3 (671B параметров, но с квантованием до 4-bit можно уместить на 4×RTX 4090):
| Компонент | Модель | Цена (USD) |
|---|---|---|
| GPU | 4× NVIDIA RTX 4090 24GB | $7,200 |
| CPU | AMD Threadripper 7960X | $1,400 |
| RAM | 128 GB DDR5 ECC | $650 |
| Хранилище | 2× 2TB NVMe SSD | $340 |
| Блок питания | 2× 1600W Platinum | $700 |
| Корпус/охлаждение | Серверный корпус + СЖО | $500 |
| Итого | $10,790 |
Энергопотребление такой сборки под нагрузкой - около 1800 Вт. При цене электроэнергии $0.30 за кВт·ч (тарифы Нью-Йорка - 29.93 цента, близко к этому порогу) суточная стоимость электричества составит 1.8 × 24 × 0.30 = $12.96. Месяц работы 24/7 - $389. Добавим амортизацию оборудования на 3 года: $10,790 / 36 = $300 в месяц. Итоговая ежемесячная стоимость содержания - $689.
Сравнение с облаком: точка безубыточности
Теперь сопоставим с новыми тарифами DeepSeek. Допустим, средний запрос потребляет 500 входных и 1500 выходных токенов. Стоимость одного запроса через API: (500/1M × $0.41) + (1500/1M × $1.65) = $0.000205 + $0.002475 = $0.00268.
При месячных расходах на сервер $689 точка безубыточности: $689 / $0.00268 ≈ 257 000 запросов в месяц, или около 8 500 запросов в день. Это объём небольшой продуктовой компании или активной команды разработки. Всё, что выше - прямая экономия.
Скрытые расходы облака сдвигают точку безубыточности ещё ниже. Плата за egress трафик, аренда статических IP, балансировщики - эти строки в счетах провайдеров часто игнорируют при расчётах. Подробный разбор экономики self-hosted решений с учётом утилизации инфраструктуры и пропускной способности есть в статье «Дешёвые AI-модели vs дорогие» - там мы сравнивали модели за $0.34 и $27.60 на реальных бенчмарках.
Какое оборудование нужно для запуска моделей уровня DeepSeek
Выбор железа определяет, какие модели вы сможете запустить и с какой скоростью. Правило простое: суммарный объём VRAM должен вмещать веса модели плюс контекст. Для DeepSeek V3 в 4-битном квантовании это около 350 ГБ - четыре RTX 4090 или две A6000 Ada.
GPU NVIDIA: что выбрать для инференса
| Модель GPU | VRAM | TFLOPS (FP16) | Цена (USD) | Сценарий |
|---|---|---|---|---|
| RTX 4090 24GB | 24 GB | 82.6 | $1,800 | Малые модели (до 30B), квантованные версии крупных |
| RTX 6000 Ada | 48 GB | 91.1 | $6,800 | Средние модели (до 70B), инференс без сильного квантования |
| A6000 | 48 GB | 38.7 | $4,650 | Бюджетный вариант для 70B-моделей |
| H100 80GB | 80 GB | 989.5 | $25,000+ | Полноразмерные модели, высокая пропускная способность |
RTX 4090 остаётся оптимальным выбором по соотношению цена/производительность для инференса. Четыре карты дают 96 ГБ VRAM и способны обслуживать 20–30 одновременных запросов к квантованной версии DeepSeek V3 с latency около 2–3 секунд на генерацию 500 токенов.
Память и хранилище: узкие места и цены
Рынок компонентов перегрет. Apple оценивает ситуацию с памятью как «столетнее наводнение» - цены на RAM и SSD растут экспоненциально. За год DDR5 ECC подорожала на 40%, NVMe-накопители - на 25%. Это увеличивает стартовый бюджет локального сервера, но не меняет фундаментальной экономики: доля RAM и хранилища в TCO не превышает 15%.
Минимально достаточный объём для инференс-сервера - 128 ГБ оперативной памяти. Она нужна для кэширования весов модели и обработки контекста. Хранилище - 2 ТБ NVMe с запасом под несколько квантованных версий моделей и датасеты.
Как рост цен DeepSeek повлияет на рынок GPU и облачных провайдеров
Повышение тарифов DeepSeek запускает цепную реакцию. Компании, чьи ежемесячные счета за API перевалили за $1000, начинают считать окупаемость собственного железа. Этот тренд уже фиксируется по росту спроса на серверные GPU в сегменте малого и среднего бизнеса.
NVIDIA оказывается главным бенефициаром. Рост заказов на RTX 4090 и A6000 со стороны AI-стартапов и исследовательских групп компенсирует возможное снижение спроса со стороны крупных облачных провайдеров. Облачные платформы, в свою очередь, вынуждены реагировать: снижать цены на GPU-инстансы, вводить спотовые тарифы, предлагать гибридные решения.
Российский рынок развивается в схожей логике. Интерес к локальным AI-решениям растёт на фоне волатильности цен зарубежных API и ограничений доступности. Провайдеры вроде Cloud.ru фиксируют рост спроса на гибридные облака, где часть нагрузки остаётся on-premise. Бизнес страхуется от ценовых шоков и блокировок, диверсифицируя инфраструктуру.
Практический кейс: переход с API DeepSeek на собственный сервер
Рассмотрим гипотетический сценарий: ML-команда из пяти человек обрабатывает 10 000 запросов в день к DeepSeek API. Средняя длина запроса - 500 входных токенов, 1500 выходных. Месячный чек по новым тарифам: 10 000 × 30 × $0.00268 = $804.
Конфигурация сервера и затраты
Собираем сервер на 4× RTX 4090 с конфигурацией, описанной выше. Единовременные затраты - $10,790. Ежемесячные операционные расходы - $689 (электричество + амортизация). Срок окупаемости: $10,790 / ($804 - $689) = 94 месяца - почти 8 лет. Невыгодно.
Но изменим вводные. Команда растёт до 50 000 запросов в день. Месячный чек API: 50 000 × 30 × $0.00268 = $4,020. Окупаемость: $10,790 / ($4,020 - $689) = 3.2 месяца. Дальше - чистая экономия $3,331 ежемесячно.
Тесты производительности: локально vs облако
Сравним latency и throughput на задаче генерации текста (500 выходных токенов):
| Метрика | DeepSeek API (новый тариф) | Локальный сервер (4× RTX 4090) |
|---|---|---|
| Latency (p50) | 1.8 сек | 2.4 сек |
| Latency (p99) | 4.2 сек | 2.9 сек |
| Throughput (запросов/сек) | 45 | 38 |
| Стабильность под нагрузкой | Деградация при пиках | Ровная |
Локальный сервер проигрывает в медианной latency, но выигрывает в стабильности: p99 ниже, нет просадок при пиковых нагрузках. Для продакшн-систем, где важна предсказуемость, это аргумент в пользу своего железа.
Скрытые ограничения облачных AI-сервисов, о которых молчат
Цена за токен - верхушка айсберга. Облачные AI-провайдеры закладывают ограничения, которые обнаруживаются на этапе масштабирования:
- Региональная доступность. Бесплатные и дешёвые тарифы работают только в определённых дата-центрах. Команда из Европы может получить отказ в доступе к инстансу, запущенному в Азии.
- Плата за egress. Данные, покидающие облако, тарифицируются отдельно. При интенсивном обмене это добавляет 15–25% к месячному счёту.
- Временные лимиты пробных периодов. Большинство free trials истекают через 12 месяцев. Команда, построившая пайплайн на бесплатном тире, оказывается перед необходимостью срочной миграции.
- Урезание функционала без предупреждения. История с DeepSeek не уникальна. Провайдеры меняют лимиты, модели и доступность эндпоинтов без длительного переходного периода.
Эти факторы редко включают в начальные расчёты, но именно они формируют совокупную стоимость владения облачным API на дистанции в 2–3 года.
Выводы: стоит ли инвестировать в свой AI-сервер прямо сейчас
Решение о переходе на локальный хостинг сводится к арифметике. При объёме до 10 000 запросов в день новый тариф DeepSeek остаётся дешевле содержания сервера. Порог рентабельности - 15 000–20 000 запросов в день, и он снижается с каждым повышением цен API.
Рекомендации по профилям:
- Индивидуальный разработчик. Оставайтесь на API, используйте бесплатные тиры других провайдеров для экспериментов. Окупаемость своего сервера при личных объёмах не наступает.
- Стартап (5–20 человек). Считайте точку безубыточности под свою нагрузку. Если команда активно использует модели в продукте, сервер на 4× RTX 4090 окупится за 4–8 месяцев.
- Enterprise. Локальный кластер - стратегический актив. Контроль над данными, отсутствие вендорной привязки и предсказуемая стоимость владения перевешивают разницу в цене.
Риски: волатильность цен на GPU (дефицит может поднять стоимость RTX 4090 на 20–30% за квартал), рост тарифов на электроэнергию, быстрое устаревание железа. Но тренд однозначен: облачные AI-провайдеры уходят от демпинга, и для растущих команд собственное железо становится рациональным выбором.