Короткий ответ: когда владение H200 выгоднее аренды
Собственный 8-GPU сервер NVIDIA HGX H200 отбивает вложения за 14,4 месяца, если загружен круглосуточно на 100%. При 60% загрузки срок растёт до 24 месяцев, при 40% до 36. Такой расчёт приводит автор разбора экономики покупки против аренды (публикация на r/LocalLLaMA).
Базовые условия: сервер стоит около $370 тыс., аренда эквивалентна $35,20 за час работы восьми GPU. Вывод автора прямой: если команда устойчиво держит загрузку около 60% и планирует минимум два года, покупать выгоднее. Если загрузка ниже 40%, аренда дешевле.
Важный нюанс: расчёт учитывает только железо. Питание и охлаждение, амортизация, инженерные часы на обслуживание и простои в него не заложены. Значит, 14,4-36 месяцев - это нижняя граница, а реальный срок окупаемости окажется больше.
Из чего складывается расчёт: цена сервера и ставка аренды
В расчёте две входные величины.
Стоимость сервера. 8-GPU сервер HGX H200 укладывается в диапазон $320-420 тыс., средняя точка около $370 тыс.
Эквивалент аренды. Медианная цена аренды H200 по требованию (on-demand) у 34 провайдеров на 18 сентября 2026 года - около $4,40 за GPU-час. Восемь ускорителей дают $35,20 за час работы сервера, то есть за час аренды сопоставимой конфигурации.
Формула простая: срок окупаемости = цена сервера / (ставка за час × фактическая загрузка). Считаем: $370 000 / $35,20 = 10 511 часов, или около 14,4 месяца при 730 часах в месяц. Сценарии с меньшей загрузкой получаются делением базового срока на коэффициент: 14,4 / 0,6 = 24 месяца, 14,4 / 0,4 = 36 месяцев.
Модель линейная и держится, пока цена железа и ставка аренды не меняются. На горизонте 2-3 года это сильное допущение: рынок аренды перестраивается, а цены на ускорители реагируют на баланс спроса и предложения (разбор сценариев по локальным LLM и ценам на GPU).
Почему $2-3 за GPU-час - это не та ставка для расчёта
Ставки $2-3 за GPU-час ближе к спотовым. Спот продаётся по остаточному принципу: машину могут забрать под другую задачу, цена меняется, длительного резерва никто не гарантирует. Медиана $4,40 у 34 провайдеров устойчивее как ориентир для планирования на два года.
Арифметика чувствительна к подстановке. По $2,50 за GPU-час (это $20 за час сервера) окупаемость на 100% загрузке растягивается примерно до 25 месяцев, по $3 ($24 в час) до 21 месяца, по $2 ($16 в час) до 32 месяцев. Соблазн взять спот вместо on-demand понятен, но цена такой экономии - риск остаться без мощностей в нужный момент. Провайдеры сами работают с тонкой маржой и живут под ценовым давлением (экономика inference-провайдеров), поэтому устойчивого спота заметно ниже медианы ждать не стоит.
Точка безубыточности при загрузке 100%, 60% и 40%
Три сценария из расчёта автора в одной таблице.
| Загрузка | GPU-часы в месяц | Эквивалент аренды в месяц | Окупаемость железа |
|---|---|---|---|
| 100% | 5760 | $25 344 | около 14,4 месяца |
| 60% | 3456 | $15 206 | около 24 месяцев |
| 40% | 2304 | $10 138 | около 36 месяцев |
Срок растёт быстрее, чем падает загрузка. Переход со 100% на 60% удлиняет окупаемость примерно в 1,7 раза, со 100% на 40% в 2,5 раза. Дело в делении: стоимость сервера фиксирована, а часов, за которые она отбивается, становится меньше.
Сценарий 100% стоит держать в голове как теоретический потолок. Автор разбора прямо отмечает: небольшие команды с неравномерным обучением и стабильным инференсом такую загрузку не поддерживают. Обучение идёт пиками, а инференс, даже постоянный, редко утилизирует все восемь GPU круглосуточно.
Как посчитать свою загрузку
Возьмите средние GPU-часы за последние 3-6 месяцев и разделите на 5760: столько даёт полная загрузка 8 GPU (8 × 24 × 30).
Пример: 3456 GPU-часов в месяц - это 60%. Столько набегает, если в среднем заняты почти пять ускорителей из восьми круглосуточно. Другой типичный профиль: неделю обучение идёт на всех восьми GPU, потом две недели простой. Пики запоминаются лучше, чем тишина в мониторинге, поэтому средняя загрузка обычно ниже, чем кажется. Брать в расчёт пиковые значения - самый быстрый способ ошибиться в прогнозе окупаемости.
Что не входит в расчёт: четыре скрытые статьи расходов
Автор расчёта называет их прямо: питание и охлаждение, амортизация, собственное время специалистов, простои. Разберём каждую.
Питание и охлаждение: почему colo-клетка может удивить ценой
Сервер HGX H200 с восемью ускорителями потребляет сотни ватт на каждую карту и требует не только электричества, но и отвода тепла. Домашний вариант для такого железа почти нереализуем: нужны промышленное питание, защита от шума и серьёзное охлаждение. На практике сервер ставят в colo-клетку у провайдера.
Здесь и обнаруживается разрыв с бюджетом: автору назвали цену colo-клетки выше, чем он закладывал. Конкретные суммы зависят от площадки, региона и типа охлаждения, поэтому счёт от провайдера стоит получить до покупки железа. Как устроен отвод тепла в современных стойках и почему плотность размещения диктует тип охлаждения, разбираем отдельно (системы охлаждения для ИИ-ЦОД).
Амортизация и остаточная стоимость: почему автор советует делить на два
Амортизация отражает реальное обесценивание железа, бухгалтерская запись здесь вторична. Дата-центровые комплектующие предыдущего поколения теряют в цене быстро, и продать сервер через три года за заметную долю покупной цены не выйдет. Автор советует закладывать половину предполагаемой амортизации: остаточная стоимость комплектующих поколения H200 к моменту продажи с высокой вероятностью окажется низкой.
Проверять это стоит на своём горизонте. Если окупаемость 24-36 месяцев, а через три-четыре года железо стоит немного, экономика владения ухудшается ровно на величину недооценённого износа. Пример расчёта TCO на три года с учётом энергопотребления и обновления компонентов есть в отдельном разборе (сборка AI-ассистента 24/7).
Время специалистов. Сервер требует обслуживания: драйверы и прошивки, мониторинг, разбор отказов, работа с BMC, замена дисков и вентиляторов. Это инженерные часы, и кто-то их оплачивает. Если этим занимается ваша команда, часы всё равно стоят денег, просто не отдельной строкой в счёте.
Простои. Всё время, когда сервер не загружен, он уже куплен и работает в минус. Простой напрямую связан с реальной загрузкой: сценарий 40% означает, что 60% календарного времени железо стоит без дела.
Сложите четыре пункта, и базовые 14,4-36 месяцев превращаются в нижнюю границу. Точная поправка зависит от региона и характера нагрузки, но направление одно: реальный срок окупаемости больше расчётного.
Как компенсировать простой: offtake-сети и другие варианты
Логика простая: если сервер простаивает 40-60% времени, эти часы можно продавать и сдвигать точку безубыточности обратно в сторону владения. Автор упоминает сдачу простаивающих мощностей offtake-сетям, чтобы компенсировать стоимость устройства (разбор экономики покупки против аренды).
Ограничения стоит держать в голове. Прерывать можно не всякую нагрузку: обучение с чекпоинтами переживёт вытеснение, а продовый инференс с SLA нет. Спрос на свободные мощности не гарантирован, а доход от сдачи обычно ниже медианной ставки аренды, потому что вы продаёте тот же ресурс с меньшими обязательствами. Считать offtake-сети надёжной статьёй дохода в бизнес-плане рискованно; корректнее видеть в них бонус, который улучшает экономику, но не переворачивает решение.
Когда покупать, а когда арендовать: критерии решения
Владение выгоднее, когда выполняются условия:
- загрузка устойчиво держится около 60% и выше;
- горизонт планирования два года и больше;
- есть бюджет на colo, электричество, охлаждение и обслуживание сверх цены железа;
- в команде есть человек, готовый заниматься инфраструктурой.
Аренда выгоднее, когда:
- загрузка ниже 40%;
- нагрузка неравномерная и плохо предсказуемая;
- горизонт короткий, например под конкретный проект;
- нет ресурсов на обслуживание сервера;
- важна гибкость: под новые модели и ускорители железо придётся менять, а в облаке достаточно сменить инстанс.
Пограничная зона 40-60%: что проверить перед покупкой
В этой зоне решение определяется не базовым расчётом, а скрытыми расходами. Что уточнить до подписи в счёте:
- цену colo-клетки и электричества в своём регионе;
- стоимость инженерных часов на обслуживание за год;
- прогноз загрузки на 24-36 месяцев, а не на квартал;
- условия сдачи мощностей offtake-сетям и реальный спрос на них;
- остаточную стоимость сервера через три года.
Если по этим пунктам цифры сходятся, базовые 24 месяца при 60% можно считать реалистичными. Если нет, реальный срок скорее окажется ближе к 30-36 месяцам, и разрыв с арендой сокращается до незначительного.
Итог: что делать с этим расчётом
Ключевые числа: HGX H200 примерно за $370 тыс., медиана аренды $4,40 за GPU-час, окупаемость железа 14,4 месяца при 100% загрузке, 24 месяца при 60% и 36 месяцев при 40%. Расчёт сделан только по железу, и питание, охлаждение, амортизация, инженерные часы и простои сдвигают точку безубыточности вправо.
Следующий шаг: выгрузите потребление GPU-часов за последние 3-6 месяцев, разделите на 5760 и получите фактическую загрузку. Затем запросите у провайдера счёт за colo и электричество, добавьте оценку инженерных часов и подставьте свои числа в формулу: цена сервера / (ставка аренды × часы загрузки). Если после этой арифметики срок окупаемости выходит больше срока, на который вы готовы заморозить бюджет, аренда остаётся рабочим вариантом, а собственный сервер разумно брать вторым шагом, когда загрузка станет предсказуемой.