Перейти к содержанию
Публикация AiManual

Локальный AI против облака: куда движется рынок AI-инфраструктуры

Разбираем, куда движется рынок AI-инфраструктуры: пойдёт ли AI по пути облака или часть рынка выберет локальный хостинг. Сравнение по контролю над данными, стои

Коротко

Что будет в материале

  1. 01

    Куда движется рынок AI-инфраструктуры: постановка вопроса

  2. 02

    Что такое локальный хостинг AI и облачные AI-сервисы

  3. 03

    Аргументы за локальный хостинг AI

  4. 04

    Требования к оборудованию для локального запуска AI

Куда движется рынок AI-инфраструктуры: постановка вопроса

Однозначного прогноза, куда движется рынок AI-инфраструктуры, нет ни у поставщиков, ни у сообщества. Публичный сигнал, с которого началось это обсуждение, - пост в r/LocalLLaMA, где автор задаёт вопрос о траектории: пойдёт ли AI по пути «облако сначала, а затем отдельные энтузиасты собирают стенды в подвалах» или значительная часть рынка выберет собственный хостинг.

Параллель, на которую опирается вопрос, взята из истории ИТ. В начале 2000-х был огромный спрос на десктопы, серверы и специализированные устройства, и всё размещалось in house. Узким местом тогда был интернет. Потом появилось облако, и инфраструктура переехала с собственных стоек на чужие серверы - об этом прямо говорится в том же обсуждении.

Дальше разберём, что стоит за выбором между локальным и облачным AI: аргументы за собственный хостинг, требования к железу, экономику владения и факторы, которые определят расклад. Статистики по рынку в открытых источниках мало, поэтому вместо прогнозов - логика решений и конкретные сценарии.

Почему параллель с 2000-ми работает не полностью

Переносить историю ИТ один в один на AI не стоит. Различий как минимум три.

  • Другое узкое место. В 2000-х ограничителем был канал связи, поэтому держать сервис у себя означало решать проблему доступа извне. Сегодня ограничитель другой: стоимость GPU и VRAM, доступность моделей и политика облачных провайдеров.
  • Разная природа выбора. In house в начале 2000-х был вынужденным режимом: зрелых альтернатив почти не было. Облако сейчас - зрелая опция с готовыми API, биллингом и масштабированием. Локальный хостинг выбирают при наличии альтернативы, а не из-за её отсутствия.
  • Особая профильность AI-нагрузок. Веб-хостинг упирается в CPU, диск и сеть. Инференс LLM упирается в пропускную способность памяти VRAM и латентность: важно, сколько токенов в секунду выдаёт модель и за какое время приходит первый токен.

Ещё один нюанс: облако для AI и облако для веб-приложений устроены по-разному. GPU-инстансы дороже и дефицитнее обычных, а цена за час аренды складывается из дефицитного железа. История 2000-х даёт рамку для разговора, но не готовый ответ.

Что такое локальный хостинг AI и облачные AI-сервисы

Локальный хостинг AI - запуск моделей на собственном оборудовании: домашнем ПК, рабочей станции, домашнем или офисном сервере. Веса модели лежат на ваших дисках, вычисления идут на ваших GPU или CPU, данные не уходят за пределы вашей сети.

Облачные AI-сервисы - использование моделей через API или веб-интерфейс провайдера. Вы платите за токены или подписку, железо и обслуживание остаются на стороне поставщика, модели и их версии обновляет он же.

Между этими полюсами есть промежуточные варианты: гибридные схемы, когда чувствительные задачи идут локально, а тяжёлые - в облако; приватное облако на собственных или арендованных стойках; colocation, когда своё железо стоит в чужом дата-центре, а вы платите за место, питание и канал. Выбор не бинарный: один и тот же человек может держать локальную модель для рабочих документов и вызывать облачный API для разовых сложных задач.

ПараметрЛокальный хостинг AIОблачные AI-сервисы
Контроль над даннымиПолный: данные не покидают ваш периметрЗависит от условий провайдера и настроек
Капитальные затратыВысокие: GPU, память, питание, корпусНет
Текущие расходыЭлектроэнергия, амортизация, обслуживаниеОплата по факту или по подписке
МасштабированиеОграничено вашим железомПочти мгновенное, в пределах квот
Доступ к новейшим моделямТолько к открытым весамСразу после релиза у провайдера
Зависимость от поставщикаОтсутствуетЕсть: цены, лимиты, блокировки
ОбслуживаниеНа вас: драйверы, движки, обновленияНа провайдере

Аргументы за локальный хостинг AI

Причины запускать модели у себя делятся на четыре группы: контроль над данными, независимость от провайдера, экономика при высокой загрузке и свобода экспериментов.

Данные не покидают периметр. Это главный аргумент для компаний, работающих с персональными данными, коммерческой тайной, медицинской или юридической информацией. Локальная модель не отправляет промпт на чужой сервер, поэтому вопрос «что провайдер делает с моими данными» просто не возникает.

Нет привязки к поставщику. Цены на API, лимиты запросов, условия использования данных и доступность конкретных моделей меняются по решению провайдера. Локальный стенд от этих решений не зависит.

Стоимость владения предсказуема при постоянной загрузке. Если инференс идёт каждый день и помногу, расходы на электричество и амортизацию фиксированы, тогда как счёт за API растёт вместе с объёмом.

Свобода экспериментов. Локально можно менять системные промпты, крутить параметры сэмплинга, подключать свои данные и дообучать модель без оглядки на лимиты и правила платформы.

Ограничения тоже конкретные: высокий порог входа по железу, необходимость самому следить за драйверами и движками инференса, потолок по размеру модели из-за объёма VRAM. Локальный хостинг перекладывает на владельца ответственность за доступность и обновления.

Контроль над данными и конфиденциальность

Политики облачных провайдеров различаются, и разница принципиальная. По данным разбора условий OpenAI, для API и корпоративных аккаунтов (Enterprise, Team) обучение на переданных данных по умолчанию отключено, а соглашение об обработке данных (DPA) юридически запрещает использовать организационные данные для тренировки моделей. Для потребительских аккаунтов ChatGPT логика обратная: данные могут использоваться для обучения, если пользователь вручную не отключит это в настройках приватности, а исторические разговоры остаются доступными для обучения, пока их не удалили.

Отказ от обучения не устраняет хранение данных полностью. По тому же разбору, OpenAI хранит данные до 30 дней для мониторинга злоупотреблений и безопасности, если не настроен режим Zero Data Retention (ZDR), который доступен только по Enterprise-соглашениям. То есть даже при отключённом обучении часть логов сохраняется.

Утверждать, что облако всегда небезопасно, неверно: риски зависят от конкретных условий, режимов хранения и корпоративных соглашений. Но проверка этих условий - отдельная работа, а локальный запуск снимает вопрос по умолчанию.

Типовые сценарии, где локальный запуск закрывает требование по данным: разбор внутренних договоров, работа с медицинскими записями, обработка клиентской базы, анализ финансовой отчётности до публикации. В каждом из них утечка промпта или ответа модели равна утечке самих документов.

Ещё один практический момент: инциденты с утечками через облачные сервисы чаще связаны не со взломом провайдера, а с настройками доступа на стороне клиента. Локальный стенд убирает этот класс ошибок, но добавляет свои: физический доступ к машине, шифрование диска, изоляция в отдельной сети.

Независимость от провайдеров и политики облаков

Риски облачной привязки выглядят так: рост цен на API, ужесточение лимитов, изменение условий использования данных, блокировка аккаунта, снятие с поддержки конкретной версии модели, региональные ограничения на доступ. Каждый пункт по отдельности маловероятен, но вместе они дают заметный фон неопределённости для тех, кто строит на облаке рабочий процесс.

Локальный хостинг снимает эти риски и добавляет свои: ваше железо может выйти из строя, а новую модель с открытыми весами придётся ждать, пока её выложат. Зато скачанная версия модели продолжает работать, даже если автор её забросил или закрыл доступ к репозиторию.

Проект уже разбирал, как такие ставки выглядят на практике: почему в 2026 году пользователи отказываются от подписок OpenAI и Anthropic, какие экономические расчёты за этим стоят и какие технические решения позволяют запускать очень крупные модели на обычном железе.

Требования к оборудованию для локального запуска AI

Три параметра определяют, что вообще запустится на вашей машине: объём VRAM, пропускная способность памяти и вычислительная мощность GPU. Первый задаёт потолок по размеру модели, второй - скорость генерации, третий влияет на обработку длинного контекста и параллельные запросы.

Грубые ориентиры по классам моделей при 4-битной квантизации (Q4):

Класс моделиОриентир по VRAMКомментарий
до 7B8-12 ГБКомфортно на потребительской карте, высокая скорость генерации
13B16-24 ГБНужна карта с большим объёмом памяти или две средние
34B24-48 ГБНесколько GPU или объединение памяти
70B48-80 ГБНесколько GPU, объединение памяти или сильное квантование

Переход с 4-битной на 16-битную точность (FP16) увеличивает потребление памяти примерно в 3-4 раза. Модели с большим числом параметров в 8-битной или 4-битной квантизации занимают меньше памяти, но теряют в качестве ответов. Чем агрессивнее сжатие, тем заметнее деградация на сложных задачах: код, длинные цепочки рассуждений, точные вычисления.

CPU-инференс возможен, и для моделей на 1-3B он местами терпим, но на серьёзных объёмах скорость падает в разы. Память системы тоже работает как буфер: если модель не влезает в VRAM целиком, часть слоёв уходит в оперативную память, и скорость проваливается.

GPU и VRAM: минимальные ориентиры

Отталкиваться стоит от задачи, а не от желания купить карту помощнее. Для чата с моделью на 7-14B в 4-битном квантовании достаточно потребительской карты с 12-16 ГБ VRAM. Для агентных сценариев с длинным контекстом и параллельными запросами запас памяти нужен больше, и вот почему.

Длинный контекст сам по себе существенно увеличивает потребление VRAM через KV-cache. По оценкам из разборов по сайзингу, для 70B-модели KV-cache занимает около 1,3-3 ГБ на 4K токенов и 3-6 ГБ на 8K токенов в зависимости от архитектуры и рантайма, а при batch size 8 кеш умножается почти на восемь. При росте контекста с 4K до 32K потребление растёт на 30-50%. На практике это выглядит так: модель может влезать в 24 ГБ VRAM при контексте 2K, но падать по ошибке памяти при 16K токенов и пяти параллельных диалогах.

Для запуска 70B-модели в квантизации Q4 нужен ориентир 40-48 ГБ VRAM. Варианты железа под такой сценарий: две RTX 4090, NVIDIA RTX 6000 Ada (48 ГБ), NVIDIA A100 (40 или 80 ГБ), NVIDIA H100 или две NVIDIA Tesla V100 по 32 ГБ.

Для обучения и тонкой настройки требования выше, чем для инференса: нужны запасы VRAM под градиенты и состояния оптимизатора, а часть работы переносится на QLoRA-подходы. Если план - только inference, ориентиры из таблицы выше актуальны.

Как это выглядит в реальных сборках, видно на примере разбора архитектуры домашнего инференса: две RTX 5060 Ti и Mac Studio на 96 ГБ, разделение на два пула контекста и вынесение точки входа на отдельный VPS.

Отдельная тема - запуск моделей уровня 27B на Apple Silicon: разбор Qwen3.6-27B на M4 Ultra с бенчмарками, экономикой локального инференса и инструкцией по установке.

Энергопотребление, охлаждение и шум

Мощные GPU потребляют сотни ватт, требуют качественного блока питания и продуманного охлаждения. Для домашнего использования это часто критичнее, чем производительность: одна карта под нагрузкой способна нагреть комнату и шуметь как пылесос на средней скорости.

Серверные ускорители обычно не подходят для дома: у них турбинное охлаждение, рассчитанное на продув в стойке, высокие требования к питанию и громкий звук. Собирая домашний AI-сервер, стоит заранее посчитать, сколько ватт уйдёт из розетки за месяц при ежедневной нагрузке, и сравнить эту сумму со счётом за облако.

Экономика: когда локальный AI окупается, а когда облако дешевле

Стоимость владения локальным стендом складывается из капитальных затрат на GPU и систему, расходов на электроэнергию, амортизации и времени на обслуживание. Последний пункт чаще всего недооценивают: драйверы, обновления движка инференса, разбор падений и подбор квантизаций съедают часы.

У облака другая структура: капитальных затрат нет, оплата идёт по факту использования или по подписке, обслуживание на провайдере. При эпизодических задачах это почти всегда дешевле. При постоянной высокой загрузке счёт за API растёт линейно вместе с объёмом, и точка, где локальное железо выходит вперёд, сдвигается в его пользу.

Готовых универсальных цифр окупаемости нет, и любые усреднённые сроки стоит воспринимать скептически: они зависят от тарифа на электричество, стоимости карт в конкретном регионе, интенсивности нагрузки и того, считаете ли вы своё время бесплатным.

Сценарии, где локальный AI оправдан

  • Постоянный инференс: чат-бот для команды, автоматизация рутинных операций, агент, который работает весь день.
  • Строгие требования к конфиденциальности: персональные данные, медицинские и юридические документы, внутренняя отчётность.
  • Тонкая настройка под свои данные: дообучение на закрытом корпусе без отправки его третьей стороне.
  • Нестабильный интернет или ограниченный доступ к облачным сервисам.
  • Эксперименты и разработка: свободно менять модели, промпты и параметры без лимитов.

Сценарии, где облако остаётся разумнее

  • Эпизодические задачи: несколько запросов в неделю не окупят карту.
  • Пиковые нагрузки: короткие всплески проще закрыть арендой, чем докупать железо.
  • Нужны самые большие и новые модели, которых нет в открытых весах.
  • Нет времени и желания обслуживать систему.
  • Быстрый старт проекта: прототип на API дешевле и быстрее, чем сборка стенда.

Что будет определять выбор: факторы рынка AI-инфраструктуры

На траекторию рынка влияют пять групп факторов.

  • Цены на GPU и VRAM. Удешевление карт с большим объёмом памяти расширяет локальный сегмент, дефицит и рост цен его сжимают. По данным Jon Peddie Research, во втором квартале 2026 года поставки дискретных видеокарт выросли до 12,5 млн штук, хотя рынок настольных процессоров за тот же период упал на 33% год к году; одним из факторов высокого спроса на мощные GPU исследователи называют развитие ИИ-инфраструктуры. В конце августа 2026 года сообщалось о резком подорожании GeForce RTX 50 в США: некоторые модели за лето прибавили в цене более 30%, а RTX 5060 Ti с 16 ГБ памяти подорожала примерно на 39%. Отдельно отмечается, что RTX 5090 всё чаще используется не в игровых ПК, а в системах для искусственного интеллекта, а в Китае их переоборудуют в ИИ-ускорители, из-за чего часть устройств не доходит до обычных покупателей.
  • Квантование и скорость движков инференса. Чем эффективнее сжатие и быстрее рантайм, тем крупнее модели влезают в потребительское железо. Это работает в пользу локального хостинга без покупки нового оборудования.
  • Политика облачных провайдеров. Цены, лимиты и условия использования данных влияют на выбор между локальным и облачным хостингом. Прямой статистики о том, насколько именно эти решения перемещают пользователей между сегментами, в доступных источниках нет, поэтому связь стоит рассматривать как логическую, а не измеренную.
  • Регуляторные требования. Правила обработки персональных данных и отраслевые нормы могут сделать локальный запуск обязательным для отдельных категорий организаций. В России с 1 июля 2025 года не допускается использование зарубежных баз данных при первичном сборе персональных данных граждан РФ: оператор обязан обеспечить запись, систематизацию, накопление и хранение ПДн граждан РФ с использованием баз данных на территории России (ч. 5 ст. 18 № 152-ФЗ). Передача персональных данных в публичные ИИ-сервисы (ChatGPT, Gemini и другие) считается трансграничной передачей ПДн и должна соответствовать требованиям 152-ФЗ; при отсутствии законного основания использование такого сервиса может привести к нарушению законодательства. Полностью локальное развертывание (on-premise) обеспечивает обработку персональных данных без выхода за периметр и совместимость с требованиями ФСТЭК России. За утечку ПДн организациям грозят штрафы от 3-5 до 15-20 млн рублей в зависимости от масштаба нарушения, а за повторную утечку - оборотный штраф от 1 до 3% годовой выручки, но не менее 20 млн и не более 500 млн рублей.
  • Качество открытых моделей. Если разрыв между открытыми и закрытыми весами сокращается, аргумент «в облаке модель лучше» слабеет. По оценке Epoch AI, лучшие открытые модели с января 2026 года в среднем отстают от закрытого фронтира на четыре месяца, что эквивалентно средней разнице в восемь пунктов по композитному индексу ECI. Разрыв зависит от задачи: открытые модели часто выглядят ближе всего на тестах генерации кода, но это не означает замену фронтирного кодинг-агента, поскольку восстановление после ошибок и связная работа на многих шагах остаются сложнее.

Сценарии, при которых баланс сильно меняется, разбирали отдельно: что будет с локальными LLM, если frontier-лаборатории потеряют позиции в 2026 году. Там же - практические критерии выбора локального стека.

Регулирование влияет на расклад не меньше железа: разбор заявления о том, что развитие AI не стоит замедлять, и принципа winners take all показывает, как политические решения связаны с доступом к GPU.

Останется ли локальный AI нишевым увлечением или станет массовым

Наиболее вероятный сценарий - сегментация, а не победа одной модели развёртывания. Облако останется основным каналом для массовых и пиковых задач: там новые модели появляются сразу, ничего не нужно обслуживать, а платить можно по факту. Локальный хостинг займёт устойчивую нишу там, где важны конфиденциальность, постоянная нагрузка и независимость от поставщика.

Полного замещения облака не произойдёт по простой причине: модели с закрытыми весами нельзя скачать и запустить на своём железе - доступ к ним есть только через сервис провайдера. Обратное тоже верно: часть задач не уедет в облако никогда, потому что их данные не должны покидать периметр.

Стоит различать open-weight и open-source. Большинство «open-source LLM» на деле являются open-weight LLM: открытые веса позволяют скачать и запустить параметры модели, тогда как полностью открытые системы могут также публиковать код обучения, данные, оценочные стенды и лицензию, совместимую с Open Source Definition. Для локального хостинга это различие практическое: скачать веса можно, но воспроизвести обучение или дообучить модель на равных условиях - не всегда.

Экономика тоже не сводится к «бесплатным весам». Закрытый фронтир обычно выигрывает по потолку возможностей, тогда как открытые веса и self-hosted развертывания могут выигрывать по маржинальной стоимости, выбору провайдера и экономике кеша. Но «бесплатные веса» не означают бесплатный инференс: в знаменателе - железо, инженерное время, наблюдаемость, батчинг, простой мощности и восстановление после сбоев.

Автор обсуждения на Reddit допускал, что значительная часть рынка выберет собственный хостинг AI, и спрашивал, по каким причинам это произойдёт. Обычно называют цену при высокой нагрузке, контроль над данными и нежелание зависеть от чужих решений о ценах и лимитах.

Против массовости работает порог входа: цена карты, сложность настройки, обслуживание и шум. За массовость - рост доступности моделей с открытыми весами, готовые движки инференса и то, что запуск локальной модели уже давно не требует навыков ML-инженера.

Практический вывод: как выбрать между локальным AI и облаком

Чек-лист, по которому можно принять решение для себя или компании:

  1. Оцените объём нагрузки. Несколько запросов в неделю - облако. Ежедневный интенсивный инференс - считайте локальное железо.
  2. Определите требования к данным. Если документы или переписка не должны покидать контур, локальный запуск становится обязательным, а не опциональным.
  3. Посчитайте бюджет целиком: карта, блок питания, корпус, охлаждение, электричество за год, плюс ваше время на обслуживание.
  4. Проверьте, есть ли под задачу открытые модели нужного качества. Если нет, вопрос закрыт в пользу облака до их появления.
  5. Оцените готовность обслуживать систему: обновления драйверов, движки инференса, разбор падений, резервные копии.
  6. Решите, нужен ли доступ к новейшим моделям сразу после релиза.

Рабочий компромисс для большинства - гибрид. Локально держат чувствительные и постоянные задачи: обработку внутренних документов, рутинную автоматизацию, агентов с приватными данными. В облако уходят пиковые нагрузки, эксперименты с новыми моделями и разовые сложные задачи, где нужна максимальная планка качества.

Решение не высечено в камне. Цены на GPU, качество открытых весов и условия облачных провайдеров меняются, поэтому разумно пересматривать расклад раз в полгода-год. Практический старт: возьмите одну задачу с реальной нагрузкой, посчитайте её стоимость в облаке за месяц и сравните с ценой железа, которое её потянет. Если разница не в разы, оставайтесь в облаке и не усложняйте инфраструктуру раньше времени.

Подписаться на канал