Сколько на самом деле зарабатывают inference-провайдеры
При месячной выручке около 10 000 долларов у небольшого inference-провайдера остаётся примерно 200 долларов прибыли. Это маржинальность порядка 2%. Такие цифры приводят участники обсуждения на Reddit, где провайдеры инференса и люди, работающие в этой сфере, описывают свою экономику.
Оговорка, без которой цифра превращается в кликбейт: это личный опыт участников дискуссии, а не аудированная отчётность. Проверить числа по публичным документам не получится. Показательно другое: почти вся выручка уходит на GPU, а на маркетинг, зарплаты и разработку остаются крохи.
Базовое предоставление GPU-часов под инференс - бизнес с тонкой маржой, где всё решает себестоимость вычислений. Ниже разберём, из чего складывается эта себестоимость, кто давит на цены и где в цепочке всё-таки остаются деньги.
Что стоит за цифрой $200 прибыли при выручке $10 000
Арифметика простая: 10 000 долларов выручки минус затраты на GPU дают около 200 долларов на руки. То есть на вычисления и сопутствующую инфраструктуру уходит примерно 9 800 долларов в месяц.
Такая структура встречается у небольших провайдеров, которые арендуют ускорители либо держат собственные карты без серьёзной работы над загрузкой. Если GPU простаивает, он всё равно стоит денег: аренда идёт по часам, амортизация не останавливается, электричество и охлаждение расходуются.
Второй момент, который легко упустить: выручка не равна загрузке. 10 000 долларов в месяц можно собрать с одной плотно загруженной машины или с нескольких, работающих вполсилы. Во втором случае накладные расходы выше, а маржа ниже. Поэтому у двух провайдеров с одинаковой выручкой прибыль может отличаться в разы.
Что усугубляет картину: у базового инференса почти нет способов отстроиться. Клиент получает тот же токен-в-токен результат, что и у соседа, и выбирает по цене. Этот механизм разберём подробнее в разделе про ценовое давление.
Почему это не значит, что весь рынок AI-инференса убыточен
Опыт участников Reddit описывает сегмент небольших провайдеров, а не рынок целиком. Компании с собственными дата-центрами, долгосрочными контрактами на поставку ускорителей и своим программным слоем считают экономику иначе. Их себестоимость токена ниже, а часть выручки приходит не с продажи GPU-часов, а с сервисов вокруг.
Маржинальность 2% на перепродаже вычислений ничего не говорит о маржинальности настройки инференса под требования заказчика, оркестрации или мониторинга. Это разные бизнесы с разной структурой затрат.
Из чего складываются затраты inference-провайдера
Основные статьи расходов выглядят так:
- аренда ускорителей или платежи по кредиту за купленное оборудование;
- амортизация GPU: техника дорогая и быстро теряет актуальность;
- электроэнергия и охлаждение, которые зависят от плотности стоек и тарифов площадки;
- сеть и трафик между узлами, особенно при распределённом инференсе;
- обслуживание, замена вышедших из строя карт, склад запчастей;
- зарплаты инженеров, которые следят за доступностью и обновляют рантаймы;
- резерв на простой: железо должно переживать пики, а платить за него приходится постоянно.
Первые две позиции съедают основную часть бюджета. Именно они превращают 10 000 долларов выручки в 200 долларов прибыли.
Аренда GPU для инференса: почему это основная статья расходов
Если провайдер не владеет оборудованием, он платит за аренду по рыночным ставкам. Эти ставки формируют крупные поставщики мощностей, у которых есть собственные дата-центры и контракты на поставку карт напрямую. Небольшой игрок выходит на тот же рынок в роли покупателя и получает цену без скидки за объём.
Дальше начинается знакомая механика: чтобы купить или арендовать больше ускорителей, нужны деньги, а их берут в долг под будущие контракты. Как это устроено у AI-облаков и neocloud-провайдеров, подробно разобрано в материале о том, почему AI-инфраструктура уходит в долг. Короткая версия: контракт с клиентом становится обеспечением, а сроки ввода мощностей жёстко привязаны к графику платежей.
Для небольшого провайдера это означает двойное давление. Ему нужно платить за ресурс по рыночной цене и одновременно держать цены на уровне конкурентов. Нехватка вычислений, их стоимость и конкуренция делают такой старт малопривлекательным, несмотря на масштаб рынка.
Почему Nvidia и её экосистема влияют на экономику небольших провайдеров
Инфраструктура Nvidia стала базовой платформой для всех ведущих ИИ-моделей. Дженсен Хуанг подчёркивал, что на ней работают и закрытые решения OpenAI, Google и Anthropic, и модели с открытыми весами. Для провайдера это означает простую вещь: программный стек, драйверы, библиотеки и оптимизации заточены под один тип железа, и выбирать особо не из чего.
Nvidia поставляет комплексные вычислительные системы, а не отдельные чипы. Пример такой сборки: 36 процессоров Grace и 72 GPU Blackwell в одном шасси, при этом ежемесячный рост продаж этого продукта, по заявлению компании, составляет 27%. Финансовые ожидания Nvidia опираются на прогноз роста выручки на 70% в следующем году, при том что аналитики оценивают текущий финансовый год примерно в 400 млрд долларов. К этим прогнозам стоит относиться осторожно: в публичных пересказах цифры компании расходятся, поэтому воспринимайте их как порядок величин, а не как точный план.
Что это значит для небольшого игрока? Спрос на вычисления растёт, а значит, растёт и цена ресурса. Доступность и стоимость мощностей определяют не малые провайдеры, а те, кто эти мощности производит и распределяет. Это структурный эффект, а не чей-то злой умысел: Nvidia не выдавливает малых провайдеров целенаправленно, она продаёт то, что покупают крупные.
Отдельный слой риска лежит в поставках памяти. Когда рынок HBM лихорадит, это быстро отражается на ценах и сроках поставки ускорителей. Как такие сдвиги выглядят на практике, показывает разбор падения акций SK Hynix и его влияния на цепочки поставок AI-оборудования. Для провайдера это риск пересмотра закупочных цен задним числом.
Давление крупных игроков и ценовая конкуренция
Два фактора загоняют небольших провайдеров в угол: клиенты сравнивают цены и уходят к более дешёвым, а крупные игроки, по ощущениям участников обсуждения, работают при низкой или отрицательной марже. Разберём каждый.
Почему клиенты диктуют цены
Базовый инференс легко сравнить. Одна и та же модель, один и тот же формат API, сопоставимая задержка. Если разницы в качестве и SLA нет, остаётся цена. Клиент открывает прайс-листы двух провайдеров, видит разницу и уходит туда, где дешевле, или требует у текущего поставщика снизить цену до уровня конкурента.
Именно это и описывают участники обсуждения: клиенты снижают цены до уровня конкурентов. Позиция провайдера здесь слабая: отказать - значит потерять выручку, согласиться - сжать маржу ещё сильнее.
Цены на инференс при этом не стоят на месте: они зависят от того, что происходит у разработчиков моделей и на рынке открытых весов. Сценарии, при которых стоимость токена может измениться заметно, разобраны в материале о том, что будет с локальными LLM при ослаблении frontier-лабораторий. Прайс-лист на инференс - переменная, а не константа, и планировать по нему экономику на год вперёд рискованно.
Игра на распределение при низкой марже: что это значит для рынка
Крупные игроки могут держать низкую или отрицательную маржу на инференсе, потому что у них есть другие источники денег: облачные сервисы, подписки, реклама, интеграции с корпоративными продуктами. Инференс для них - точка входа, а не источник прибыли.
Важная оговорка: тезис о работе в убыток на инференсе высказан участниками обсуждения как ощущение, а не как подтверждённый факт. Считать его доказанной стратегией демпинга нельзя. Но даже без злого умысла эффект для рынка одинаковый.
Получается ловушка. Поднять цены провайдер не может: клиент уйдёт к тому, кто дешевле. Снизить издержки до уровня крупного игрока тоже не может: у него нет скидок за объём, собственной генерации и дешёвого капитала. Остаётся работать на тонкой марже и ждать, пока кто-то из конкурентов не выйдет из игры.
Почему масштаб рынка не гарантирует прибыль
Рынок AI-инференса растёт, и это легко перепутать с ростом прибыли. Объём обработанных токенов увеличивается, число компаний, использующих модели, тоже. Прибыль при этом может не расти, потому что ресурсы дорожают, а цены на токен падают.
Куда уходит маржа, если рынок растёт
Большую часть денег рынка забирают те, кто контролирует физический слой. Поставщики ускорителей, памяти, сетей и стоек получают оплату независимо от того, заработал провайдер на своих клиентах или нет. Если у небольшого провайдера выручка выросла вдвое, затраты на GPU тоже выросли, и абсолютная прибыль почти не изменилась.
На капитальном уровне это видно по объёмам привлекаемых денег: в AI-инфраструктуру заходят суммы, которые не окупаются на горизонте пары кварталов. Насколько крупным бывает разрыв между планами и реальностью, показывает кейс Databricks с привлечением 5 млрд долларов при оценке 190 млрд вместо изначально запланированного 1 млрд. Ориентироваться на такие цифры при построении своего бизнес-плана не стоит: у больших игроков другая стоимость капитала и другой горизонт.
Nvidia с прогнозом роста выручки на 70% в следующем году показывает, куда перетекает значительная часть денег рынка. Это не значит, что провайдеры не зарабатывают. Это значит, что их доля в общей выручке рынка скромная.
Почему нехватка вычислений усиливает неравенство
Когда ускорителей не хватает, доступ к ним получают те, кто платит больше или подписал долгосрочный контракт заранее. Небольшой провайдер оказывается в конце очереди: он либо покупает по спотовой цене, либо ждёт поставку. Оба варианта плохо сочетаются с обещанием клиенту стабильного SLA.
Дефицит бьёт и по планам роста. Чтобы взять нового клиента, нужна свободная мощность. Если её нет, провайдер либо отказывает, либо покупает ресурс по пиковой цене и теряет маржу на этом клиенте. Разрыв между теми, кто владеет мощностями, и теми, кто их арендует, в такие периоды расширяется.
Ирония в том, что дефицит должен был бы поднять цены на инференс. На практике крупные игроки удерживают их низкими, и небольшие провайдеры не могут воспользоваться моментом.
Где остаются прибыльные ниши вокруг инференса
Программные слои вокруг инференса сохраняют хорошую маржинальность именно потому, что не требуют владения GPU и не конкурируют по цене за вычисления. Разберём, как это работает.
Оптимизация под SLA: почему это прибыльно
SLA, или соглашение об уровне обслуживания, фиксирует, что именно получит клиент: целевую задержку, доступность, допустимую долю ошибок, время реакции на инцидент. Настроить инференс так, чтобы укладываться в эти параметры, заметно сложнее, чем просто поднять сервер.
Приходится работать с батчингом запросов, квантованием, выбором рантайма, распределением нагрузки между разными ускорителями, прогревом моделей. Это инженерная работа, и её результат клиент видит напрямую: стабильные 300 миллисекунд на запрос вместо случайных значений в диапазоне от 200 до 3000.
Провайдер, который гарантирует конкретную задержку для конкретной модели при пиковой нагрузке, может брать за это больше, чем тот, кто просто продаёт GPU-часы. Клиенты платят за предсказуемость, а не за токены как таковые. Капитальных затрат на оборудование такая работа почти не требует: железо остаётся чужим, вы продаёте компетенцию.
Другие программные слои с хорошей маржинальностью
Логика одна: слой не должен конкурировать с крупными игроками по цене за GPU-час. Под это подходят:
- оркестрация инференса, когда запросы распределяются между несколькими моделями и провайдерами по правилам заказчика;
- маршрутизация: дешёвая модель отвечает на простые запросы, дорогая подключается только там, где нужна точность;
- кэширование ответов и префиксов, которое снижает стоимость повторяющихся запросов;
- мониторинг и логирование с понятной отчётностью по расходам на токены;
- тонкая настройка под конкретный домен: юридические документы, медицина, техподдержка;
- обвязка вокруг бизнес-процессов, где инференс спрятан внутри продукта и клиент платит за результат, а не за токены.
Ни один из этих пунктов не гарантирует прибыль сам по себе. Порог входа здесь не деньги, а экспертиза, и конкурентов в нише может оказаться больше, чем кажется. Рабочая рамка для оценки такая: если направление не требует владения GPU и закрывает конкретную боль клиента, шансы на нормальную маржу выше, чем при перепродаже вычислений. Если же вся ценность сводится к тому, что у вас есть свободные ускорители, вы конкурируете в самой слабой позиции.
Стоит ли начинать бизнес на инференсе: практические выводы
Универсального ответа нет, есть набор условий, при которых экономика складывается в вашу пользу или против вас. Ниже чек-лист и разбор сценариев, где вход оправдан.
Чек-лист для оценки inference-бизнеса
Ответьте на вопросы честно, без оптимизма в свою сторону:
- Есть ли доступ к GPU дешевле рыночной ставки: собственное железо, долгосрочный контракт, скидка за объём?
- Есть ли уникальный программный слой, за который клиент платит отдельно: гарантии SLA, маршрутизация, дообучение под домен?
- Есть ли клиенты, готовые платить больше за предсказуемость и качество, а не только за низкую цену?
- Удастся ли наращивать объём без пропорционального роста затрат на вычисления?
- Какой запас прочности по деньгам, если цены на инференс упадут ещё на 20-30%?
- Что произойдёт, если ключевой клиент потребует снизить цену до уровня конкурента?
Если на большинство вопросов ответ «нет», бизнес держится на текущей конъюнктуре и рухнет при первом же ценовом витке. Если хотя бы на первые два вопроса есть внятный ответ, позиция уже другая.
Когда inference-бизнес всё-таки имеет смысл
Есть несколько конфигураций, в которых экономика выглядит иначе:
- Своя инфраструктура с низкой стоимостью владения. Если ускорители уже куплены и амортизированы, а электричество дешёвое, себестоимость токена падает до уровня, недоступного арендному провайдеру.
- Нишевые клиенты с особыми требованиями. Данные не должны покидать контур, задержка критична, модель дообучена под конкретный домен. Здесь цена уходит на второй план.
- Инференс как часть более крупного продукта. Клиент платит за решение задачи, а не за токены, и провайдер не конкурирует в открытом прайс-листе.
- Комбинация вычислений с прибыльным программным слоем. Сами GPU-часы продаются по рынку, а деньги приносит обвязка: SLA, мониторинг, маршрутизация.
Полезно посчитать альтернативу: если задача сводится к запуску модели для собственных нужд, покупка API по рыночной цене часто дешевле, чем поднятие своего сервера. Разбор того, как рост цен DeepSeek меняет рынок локального хостинга моделей, помогает определить точку окупаемости своего железа на конкретных объёмах запросов.
Бизнес на перепродаже GPU-часов уязвим к ценовому давлению со всех сторон. Бизнес на инженерной работе вокруг инференса живёт по другим правилам, потому что продаёт не ресурс, а результат. Цифры про 10 000 долларов выручки и 200 долларов прибыли - это опыт участников обсуждения, а не формула. Но направление, в котором стоит искать свою точку входа, они показывают довольно точно.