Дешёвый API в 2026 году почти всегда выигрывает у self-hosting той же модели. Прямой ответ: для 90% сценариев покупка собственного GPU для инференса LLM экономически не оправдана. Точка безубыточности наступает только при круглосуточной загрузке дорогих ускорителей и замене закрытых API уровня GPT-5.6. Переопределим метрику сравнения: считать нужно не цену за токен, а стоимость успешно решённой задачи с учётом качества. SWE-bench Verified становится эталоном для такой оценки.
Разберём реальную экономику на цифрах: от расчёта совокупной стоимости владения (TCO) для self-hosting до операционных рисков вроде вендорной привязки и амортизации ускорителей. В качестве практического доказательства - кейс с 1800 ботами в World of Warcraft, где локальная Ollama провалилась, а DeepSeek API справился с задержкой 1-2 секунды и стоимостью $0.30 за сцену.