Перейти к содержанию
Публикация AiManual

Покупать или арендовать сервер на H200: расчёт точки безубыточности при 40, 60 и 100% загрузки

Считаем окупаемость 8-GPU сервера HGX H200 против аренды: 14,4 месяца при 100% загрузке, 24 при 60% и 36 при 40%. Плюс четыре расхода владения, которые обычно н

Коротко

Что будет в материале

  1. 01

    Короткий ответ: когда владение H200 выгоднее аренды

  2. 02

    Из чего складывается расчёт: цена сервера и ставка аренды

  3. 03

    Точка безубыточности при загрузке 100%, 60% и 40%

  4. 04

    Что не входит в расчёт: четыре скрытые статьи расходов

Короткий ответ: когда владение H200 выгоднее аренды

Собственный 8-GPU сервер NVIDIA HGX H200 отбивает вложения за 14,4 месяца, если загружен круглосуточно на 100%. При 60% загрузки срок растёт до 24 месяцев, при 40% до 36. Такой расчёт приводит автор разбора экономики покупки против аренды (публикация на r/LocalLLaMA).

Базовые условия: сервер стоит около $370 тыс., аренда эквивалентна $35,20 за час работы восьми GPU. Вывод автора прямой: если команда устойчиво держит загрузку около 60% и планирует минимум два года, покупать выгоднее. Если загрузка ниже 40%, аренда дешевле.

Важный нюанс: расчёт учитывает только железо. Питание и охлаждение, амортизация, инженерные часы на обслуживание и простои в него не заложены. Значит, 14,4-36 месяцев - это нижняя граница, а реальный срок окупаемости окажется больше.

Из чего складывается расчёт: цена сервера и ставка аренды

В расчёте две входные величины.

Стоимость сервера. 8-GPU сервер HGX H200 укладывается в диапазон $320-420 тыс., средняя точка около $370 тыс.

Эквивалент аренды. Медианная цена аренды H200 по требованию (on-demand) у 34 провайдеров на 18 сентября 2026 года - около $4,40 за GPU-час. Восемь ускорителей дают $35,20 за час работы сервера, то есть за час аренды сопоставимой конфигурации.

Формула простая: срок окупаемости = цена сервера / (ставка за час × фактическая загрузка). Считаем: $370 000 / $35,20 = 10 511 часов, или около 14,4 месяца при 730 часах в месяц. Сценарии с меньшей загрузкой получаются делением базового срока на коэффициент: 14,4 / 0,6 = 24 месяца, 14,4 / 0,4 = 36 месяцев.

Модель линейная и держится, пока цена железа и ставка аренды не меняются. На горизонте 2-3 года это сильное допущение: рынок аренды перестраивается, а цены на ускорители реагируют на баланс спроса и предложения (разбор сценариев по локальным LLM и ценам на GPU).

Почему $2-3 за GPU-час - это не та ставка для расчёта

Ставки $2-3 за GPU-час ближе к спотовым. Спот продаётся по остаточному принципу: машину могут забрать под другую задачу, цена меняется, длительного резерва никто не гарантирует. Медиана $4,40 у 34 провайдеров устойчивее как ориентир для планирования на два года.

Арифметика чувствительна к подстановке. По $2,50 за GPU-час (это $20 за час сервера) окупаемость на 100% загрузке растягивается примерно до 25 месяцев, по $3 ($24 в час) до 21 месяца, по $2 ($16 в час) до 32 месяцев. Соблазн взять спот вместо on-demand понятен, но цена такой экономии - риск остаться без мощностей в нужный момент. Провайдеры сами работают с тонкой маржой и живут под ценовым давлением (экономика inference-провайдеров), поэтому устойчивого спота заметно ниже медианы ждать не стоит.

Точка безубыточности при загрузке 100%, 60% и 40%

Три сценария из расчёта автора в одной таблице.

ЗагрузкаGPU-часы в месяцЭквивалент аренды в месяцОкупаемость железа
100%5760$25 344около 14,4 месяца
60%3456$15 206около 24 месяцев
40%2304$10 138около 36 месяцев

Срок растёт быстрее, чем падает загрузка. Переход со 100% на 60% удлиняет окупаемость примерно в 1,7 раза, со 100% на 40% в 2,5 раза. Дело в делении: стоимость сервера фиксирована, а часов, за которые она отбивается, становится меньше.

Сценарий 100% стоит держать в голове как теоретический потолок. Автор разбора прямо отмечает: небольшие команды с неравномерным обучением и стабильным инференсом такую загрузку не поддерживают. Обучение идёт пиками, а инференс, даже постоянный, редко утилизирует все восемь GPU круглосуточно.

Как посчитать свою загрузку

Возьмите средние GPU-часы за последние 3-6 месяцев и разделите на 5760: столько даёт полная загрузка 8 GPU (8 × 24 × 30).

Пример: 3456 GPU-часов в месяц - это 60%. Столько набегает, если в среднем заняты почти пять ускорителей из восьми круглосуточно. Другой типичный профиль: неделю обучение идёт на всех восьми GPU, потом две недели простой. Пики запоминаются лучше, чем тишина в мониторинге, поэтому средняя загрузка обычно ниже, чем кажется. Брать в расчёт пиковые значения - самый быстрый способ ошибиться в прогнозе окупаемости.

Что не входит в расчёт: четыре скрытые статьи расходов

Автор расчёта называет их прямо: питание и охлаждение, амортизация, собственное время специалистов, простои. Разберём каждую.

Питание и охлаждение: почему colo-клетка может удивить ценой

Сервер HGX H200 с восемью ускорителями потребляет сотни ватт на каждую карту и требует не только электричества, но и отвода тепла. Домашний вариант для такого железа почти нереализуем: нужны промышленное питание, защита от шума и серьёзное охлаждение. На практике сервер ставят в colo-клетку у провайдера.

Здесь и обнаруживается разрыв с бюджетом: автору назвали цену colo-клетки выше, чем он закладывал. Конкретные суммы зависят от площадки, региона и типа охлаждения, поэтому счёт от провайдера стоит получить до покупки железа. Как устроен отвод тепла в современных стойках и почему плотность размещения диктует тип охлаждения, разбираем отдельно (системы охлаждения для ИИ-ЦОД).

Амортизация и остаточная стоимость: почему автор советует делить на два

Амортизация отражает реальное обесценивание железа, бухгалтерская запись здесь вторична. Дата-центровые комплектующие предыдущего поколения теряют в цене быстро, и продать сервер через три года за заметную долю покупной цены не выйдет. Автор советует закладывать половину предполагаемой амортизации: остаточная стоимость комплектующих поколения H200 к моменту продажи с высокой вероятностью окажется низкой.

Проверять это стоит на своём горизонте. Если окупаемость 24-36 месяцев, а через три-четыре года железо стоит немного, экономика владения ухудшается ровно на величину недооценённого износа. Пример расчёта TCO на три года с учётом энергопотребления и обновления компонентов есть в отдельном разборе (сборка AI-ассистента 24/7).

Время специалистов. Сервер требует обслуживания: драйверы и прошивки, мониторинг, разбор отказов, работа с BMC, замена дисков и вентиляторов. Это инженерные часы, и кто-то их оплачивает. Если этим занимается ваша команда, часы всё равно стоят денег, просто не отдельной строкой в счёте.

Простои. Всё время, когда сервер не загружен, он уже куплен и работает в минус. Простой напрямую связан с реальной загрузкой: сценарий 40% означает, что 60% календарного времени железо стоит без дела.

Сложите четыре пункта, и базовые 14,4-36 месяцев превращаются в нижнюю границу. Точная поправка зависит от региона и характера нагрузки, но направление одно: реальный срок окупаемости больше расчётного.

Как компенсировать простой: offtake-сети и другие варианты

Логика простая: если сервер простаивает 40-60% времени, эти часы можно продавать и сдвигать точку безубыточности обратно в сторону владения. Автор упоминает сдачу простаивающих мощностей offtake-сетям, чтобы компенсировать стоимость устройства (разбор экономики покупки против аренды).

Ограничения стоит держать в голове. Прерывать можно не всякую нагрузку: обучение с чекпоинтами переживёт вытеснение, а продовый инференс с SLA нет. Спрос на свободные мощности не гарантирован, а доход от сдачи обычно ниже медианной ставки аренды, потому что вы продаёте тот же ресурс с меньшими обязательствами. Считать offtake-сети надёжной статьёй дохода в бизнес-плане рискованно; корректнее видеть в них бонус, который улучшает экономику, но не переворачивает решение.

Когда покупать, а когда арендовать: критерии решения

Владение выгоднее, когда выполняются условия:

  • загрузка устойчиво держится около 60% и выше;
  • горизонт планирования два года и больше;
  • есть бюджет на colo, электричество, охлаждение и обслуживание сверх цены железа;
  • в команде есть человек, готовый заниматься инфраструктурой.

Аренда выгоднее, когда:

  • загрузка ниже 40%;
  • нагрузка неравномерная и плохо предсказуемая;
  • горизонт короткий, например под конкретный проект;
  • нет ресурсов на обслуживание сервера;
  • важна гибкость: под новые модели и ускорители железо придётся менять, а в облаке достаточно сменить инстанс.

Пограничная зона 40-60%: что проверить перед покупкой

В этой зоне решение определяется не базовым расчётом, а скрытыми расходами. Что уточнить до подписи в счёте:

  • цену colo-клетки и электричества в своём регионе;
  • стоимость инженерных часов на обслуживание за год;
  • прогноз загрузки на 24-36 месяцев, а не на квартал;
  • условия сдачи мощностей offtake-сетям и реальный спрос на них;
  • остаточную стоимость сервера через три года.

Если по этим пунктам цифры сходятся, базовые 24 месяца при 60% можно считать реалистичными. Если нет, реальный срок скорее окажется ближе к 30-36 месяцам, и разрыв с арендой сокращается до незначительного.

Итог: что делать с этим расчётом

Ключевые числа: HGX H200 примерно за $370 тыс., медиана аренды $4,40 за GPU-час, окупаемость железа 14,4 месяца при 100% загрузке, 24 месяца при 60% и 36 месяцев при 40%. Расчёт сделан только по железу, и питание, охлаждение, амортизация, инженерные часы и простои сдвигают точку безубыточности вправо.

Следующий шаг: выгрузите потребление GPU-часов за последние 3-6 месяцев, разделите на 5760 и получите фактическую загрузку. Затем запросите у провайдера счёт за colo и электричество, добавьте оценку инженерных часов и подставьте свои числа в формулу: цена сервера / (ставка аренды × часы загрузки). Если после этой арифметики срок окупаемости выходит больше срока, на который вы готовы заморозить бюджет, аренда остаётся рабочим вариантом, а собственный сервер разумно брать вторым шагом, когда загрузка станет предсказуемой.

Подписаться на канал