Перейти к содержанию
Публикация AiManual

Локальный AI против облака: где точка перехода и что будет с доступом к моделям

Локальный запуск LLM окупается не всегда и не для каждой задачи. Показываем, сколько VRAM нужно моделям 7-8B, как квантизация Q4_K_M, Q5_K_M и Q8_0 меняет качес

Коротко

Что будет в материале

  1. 01

    Почему вопрос «локально или облако» стал актуальным именно сейчас

  2. 02

    Кто на самом деле запускает LLM локально: портрет пользователя

  3. 03

    Что реально нужно для локального запуска LLM: VRAM, квантизация и скорость

  4. 04

    Экономика локального и облачного подходов: как считать точку перехода

Единой точки перехода между локальным AI и облачными frontier-моделями нет. Формулы вида «если железо дороже X, выгоднее подписка» тоже нет: ответ зависит от задач, требований к качеству, бюджета и текущих цен провайдеров. Точку перехода считают заново под свой сценарий, и она сдвигается каждый раз, когда меняются цены на GPU или условия подписок на Claude, ChatGPT Plus и Gemini.

Практическая логика такая. Локальный запуск оправдан, когда задача упирается в приватность, офлайн-работу или в сумму подписок и API-платежей, которая за год-два превышает стоимость подходящего железа. Облако выигрывает, когда нужны самые сильные модели, длинные контексты и минимум времени на настройку.

Оснований для пересчёта добавляет разрыв в ценах: топовая видеокарта стоит тысячи долларов, подписка на frontier-модель - десятки долларов в месяц. При такой пропорции срок окупаемости легко растягивается на годы, и это видно на простой арифметике, которую разберём ниже.

Почему вопрос «локально или облако» стал актуальным именно сейчас

Совпали два фактора. Первый: доступ к frontier-моделям держится на условиях, которые провайдер меняет в одностороннем порядке. Второй: железо для локального запуска подорожало и стало дефицитным, поэтому выбор между GPU, Mac с большим объёмом памяти и подпиской перестал быть очевидным.

Автор поста в r/LocalLLaMA формулирует риск прямо:

Мне не кажется, что бесплатная поездка, которую мы получаем сейчас, продлится вечно: либо цены на подписки сильно вырастут, либо лимиты станут жёстче, либо и то и другое вместе.

Это его личная оценка, а не подтверждённый факт, но она объясняет, почему тема экономики локального запуска собирает столько комментариев (обсуждение доступности локального AI на Reddit).

Второй фактор - состояние рынка комплектующих. По наблюдениям того же автора, оборудование для локального AI часто уходит на предзаказ: сконфигурированные по максимуму M5 Mac Studio ждут с конца октября до февраля. Сроки поставок меняются от партии к партии и от региона к региону, поэтому их стоит проверять у продавца, а не переносить из чужого опыта.

Кто на самом деле запускает LLM локально: портрет пользователя

Локальный запуск LLM остаётся практикой узкого круга. Средний технический специалист чаще работает через веб-интерфейс или API: это дешевле по времени, не требует подбора квантизации и не упирается в объём видеопамяти. Локальные модели выбирают те, кому нужен контроль над данными, офлайн-доступ, независимость от лимитов или сам процесс настройки железа.

Показательный пример из того же обсуждения: автор поста пришёл в локальный AI в том числе чтобы меньше зависеть от frontier-моделей, и параллельно пробует Deepseek Flash 4.1 и GLM 5.3 Flash на Openrouter, а также разные варианты Qwen 3.8 в Unsloth (пост о доступности локального AI). Схема типичная: облачный агрегатор как рабочий инструмент, локальные эксперименты рядом с ним. Названия моделей приведены так, как они указаны автором; актуальные версии и доступность стоит проверять отдельно.

Почему даже мощные ноутбуки оказываются «нижним средним» в мире локального AI

У автора поста MacBook Pro на чипе M5 Pro с 48 ГБ объединённой памяти. По обычным ноутбучным меркам это верхний средний сегмент, но в сообществе локального AI такую конфигурацию воспринимают скорее как нижний средний уровень. Причина в планке требований: модели крупнее 8B или квантизация помягче требуют заметно больше VRAM или объединённой памяти, а 16 ГБ видеопамяти закрывают лишь часть сценариев.

Если бюджет ограничен, начинать логично не с покупки GPU: разбор старта без мощной видеокарты показывает, как оценить VRAM и tokens/s через API, CPU и компактные модели, а к CUDA и multi-GPU переходить только при реальной необходимости.

Что реально нужно для локального запуска LLM: VRAM, квантизация и скорость

Ориентиры по моделям класса 7B дают наглядную картину. Qwen2.5 Coder 7B Instruct в квантизации Q4 оценивается как помещающаяся на RTX 4080: около 5 ГБ VRAM и примерно 123 токена в секунду. У карты при этом 16 ГБ памяти, то есть занято меньше трети (расчёт VRAM и скорости для Qwen2.5 Coder 7B Instruct на RTX 4080).

Файл Q4_K_M для этой модели занимает 4.7 ГБ и состоит из двух частей. Это размер для скачивания, а не потребление памяти в работе: в рантайме добавляются KV-кэш и другие буферы, поэтому фактический объём выше (страница с оценками по RTX 4080).

Как квантизация влияет на качество и скорость: Q4_K_M, Q5_K_M, Q8_0

Квантизация сжимает веса, и платить за это приходится качеством и скоростью. Порядок величин для 8B-моделей виден по измерениям llama.cpp: на Llama-3-8B схема Q4_K_M добавляет +0.1754 к перплексии относительно полной точности, Q5_K_M - +0.0569, Q8_0 - +0.0026. Перплексия здесь служит метрикой уверенности модели в предсказании текста: чем больше прирост, тем сильнее сжатие сказывается на редких конструкциях (сравнение Q4_K_M, Q5_K_M и Q8_0).

СхемаБит на весСкорость генерацииПрирост перплексииПамять и скорость относительно Q4_K_M
Q4_K_M4.894471.93 ток/с+0.1754базовый уровень
Q5_K_M5.703667.23 ток/с+0.0569+16.5% памяти, около -6.5% скорости
Q8_08.500850.93 ток/с+0.0026+74% размера, около -29% скорости

Биты на вес и скорость измерены на Llama-3.1-8B, перплексия - на Llama-3-8B. Цифры не переносятся на другие модели автоматически, их стоит считать ориентиром, а не гарантией (данные по квантизациям GGUF).

Практический вывод: Q4_K_M остаётся разумным выбором по умолчанию, около 4.9 ГБ для 8B-модели при небольшой измеренной потере качества. Q5_K_M требует на 16.5% больше памяти и примерно на 6.5% медленнее в генерации, зато сокращает потерю перплексии примерно на 68% по сравнению с Q4_K_M. Q8_0 близок к полной точности, но на 74% больше Q4_K_M и примерно на 29% медленнее. Как прирост перплексии отразится на конкретной задаче, зависит от задачи: для генерации кода и длинных инструкций имеет смысл прогнать Q5_K_M и Q8_0 на своих примерах и сравнить результат.

Сколько VRAM нужно на самом деле: файл модели против реального потребления

Распространённая ошибка - считать требования по размеру файла. KV-кэш растёт с длиной контекста и зависит от архитектуры модели, поэтому при увеличении окна даже та же модель требует больше памяти. Оценка в 5 ГБ для Qwen2.5 Coder 7B Instruct в Q4 сделана без вычислительных буферов, накладных расходов рантайма и памяти, которую занимают другие приложения, так что запас нужен всегда.

Для моделей крупнее 7-8B планка сдвигается предсказуемо: веса занимают больше места, KV-кэш больше, а агрессивное сжатие сильнее бьёт по качеству. Практичная зона для домашней машины сегодня - модели, комфортно влезающие в 16-24 ГБ VRAM; что с ними можно делать в повседневной работе, разобрано в материале про квантованные модели на 16-24 ГБ VRAM.

Экономика локального и облачного подходов: как считать точку перехода

Методика простая и не требует бенчмарков. Считаем полную стоимость локального варианта: железо, будущие апгрейды, электричество, время на настройку и поддержку, минус остаточная стоимость при продаже. Делим на месячные расходы на подписку или API и получаем срок окупаемости. Дальше остаётся честно ответить, будете ли вы пользоваться этой конфигурацией дольше полученного срока.

Арифметика на публичных ценах. ASUS ROG Astral RTX 5090 White OC на момент выпуска стоила 2799 долларов без учёта налогов, а дефицит чипов GB202 разогнал цены на вторичном рынке до 4500-5000 долларов за стандартные версии без автографов (материал о ценах на RTX 5090 и дефиците GB202). Если подписка на frontier-модель стоит порядка 20 долларов в месяц, то 2799 / 20 дает около 140 месяцев окупаемости только по цене карты. Для человека с одной подпиской и обычными задачами такая покупка экономически не сходится.

Картина меняется, когда облачные расходы выше: несколько подписок, оплата API по токенам, командный тариф, а также требования к приватности. Формула грубая и не учитывает электричество, амортизацию и время на настройку, поэтому реальный срок окупаемости всегда длиннее расчётного. Цены из примера относятся к периоду выпуска карты и дефицита GB202, а не к сентябрю 2026 года: вторичный рынок волатилен, и розничная цена не гарантирует доступность.

Какие факторы учитывать помимо цены железа и подписки

  • Приватность: если код, документы или персональные данные нельзя отправлять наружу, локальный запуск закрывает вопрос без оговорок.
  • Автономность: без интернета облачные модели недоступны, локальные работают.
  • Контроль версий: локальная модель не изменится без вашего решения, облачную провайдер обновляет или снимает с поддержки по своему графику.
  • Время: настройка рантайма, подбор квантизации и разбор ошибок съедают часы, которые в облаке тратятся на работу.
  • Качество: frontier-модели обычно сильнее на сложных рассуждениях и длинных контекстах, локальные 7-8B в Q4 им уступают.
  • Масштаб расходов: у локального варианта платежи разовые, у облачного они растут вместе с числом запросов и токенов.

Отдельный пункт - электричество и охлаждение. Мощная карта под нагрузкой потребляет сотни ватт, и при круглосуточной работе это заметная строка в бюджете, которой нет у подписки.

Примерный расчёт: когда локальный запуск может окупиться

Логика расчёта на условных данных, а не результат замера: если месячные расходы на облако обозначить X, а стоимость железа Y, то срок окупаемости равен Y / X, после чего к результату добавляется поправка на электричество, амортизацию и остаточную стоимость. При X порядка 20 долларов в месяц окупаемость карты за 2799 долларов выходит за горизонт разумного планирования. При X в районе 200 долларов в месяц (несколько подписок, API-расходы команды) срок сокращается до 15 месяцев, и тогда локальный вариант уже стоит считать всерьёз.

Требования к железу зависят от задач, поэтому и точка перехода у всех разная. Пример конкретной архитектуры с двумя GPU, Mac Studio в лизинге и посчитанными месячными затратами разобран в статье про домашний инференс вместо облака. Там же перечислены сценарии, при которых такая ставка не сыграет.

Риски зависимости от облачных frontier-моделей

Основной риск коммерческий, а не технический: условия доступа меняются без участия пользователя. Автор поста допускает три варианта развития событий: рост цен на подписки, ужесточение лимитов или комбинация того и другого. Это предположение, а не прогноз с датой, и относиться к нему стоит соответственно.

Второй риск - региональный. Для OpenAI API ключ создаётся бесплатно, а запросы оплачиваются по токенам, но Россия не входит в список поддерживаемых стран. У Gemini в Google AI Studio есть бесплатный уровень с ограничениями, при этом Россия также не входит в список доступных регионов (гид по получению API-ключей). Для русскоязычного пользователя часть облачных маршрутов закрыта либо требует обходных схем с собственными рисками и условиями.

Что может измениться в доступе к моделям и как к этому готовиться

  • Диверсификация поставщиков: агрегаторы вроде Openrouter позволяют менять модели без переписывания кода, так что выпадение одного вендора не останавливает работу.
  • Локальный резерв для критичных задач: даже слабая модель на своём железе закрывает рутину, когда внешний доступ пропал.
  • Отсутствие жёсткой привязки к одному SDK и формату запросов: переключение должно занимать часы, а не недели.
  • Бюджет с запасом на рост цен: если расходы на API удвоятся, процесс не должен останавливаться.

Пример подготовки из обсуждения: автор поста держит доступ к нескольким моделям через Openrouter, включая Deepseek Flash 4.1 и GLM 5.3 Flash, и параллельно пробует варианты Qwen 3.8 в Unsloth. Это гибридная схема, где облако даёт максимум качества, а локальные запуски страхуют зависимость.

Дефицит железа для AI: кто на самом деле скупает GPU

Автор поста сомневается, что дефицит объясняется массовыми покупками частных лиц: конфигурации за 5, 10, 15 тысяч долларов и выше покупают не настолько массово, чтобы вызвать наблюдаемый хаос. Его версия - значительную часть закупок делают корпорации и исследовательские группы (обсуждение дефицита железа). Подтверждённых данных о распределении спроса в открытых источниках нет, поэтому это гипотеза, а не установленный факт.

Волатильность рынка видна по ценам: дефицит чипов GB202 поднял стоимость стандартных версий на вторичном рынке до 4500-5000 долларов, тогда как розничная цена ASUS ROG Astral RTX 5090 White OC на старте составляла 2799 долларов без налогов (обзор цен и дефицита GB202). К этому добавляются сроки ожидания: топовые конфигурации M5 Mac Studio заказывают с ожиданием от конца октября до февраля.

Что это значит на практике: планировать апгрейд по сегодняшним ценам рискованно, закладывать задержки поставок нужно заранее, а конфигурацию выбирать под конкретные модели, которые вы собираетесь запускать, а не «на вырост».

Практические критерии выбора: локально, облако или гибрид

КритерийЛокальный запускОблако
Конфиденциальные данныеДанные не покидают машинуНужно доверять провайдеру и его политике
Офлайн-работаРаботает без сетиНедоступно
Качество на сложных задачахОграничено размером модели и квантизациейОбычно выше
Стартовые расходыТысячи долларов на железоБлизки к нулю
Переменные расходыЭлектричество и апгрейдыРастут с числом токенов и запросов
Время на настройкуЧасы и дниМинуты

Когда локальный запуск оправдан, а когда нет

Локальный запуск имеет смысл, когда есть конфиденциальные данные, потребность в офлайн-доступе, желание зафиксировать версию модели или интерес к экспериментам и обучению. Облако выгоднее, когда нужны самые сильные модели, длинные контексты, минимальный бюджет на старте и минимум времени на поддержку инфраструктуры.

Пример по масштабу задачи: Qwen2.5 Coder 7B Instruct в Q4 на RTX 4080 с оценкой около 123 токенов в секунду закрывает автодополнение кода и рутинные правки, а для сложных рассуждений часто требуется модель крупнее или облачный сервис (оценки для RTX 4080).

Гибридный подход снимает большую часть противоречий: локальные модели для рутины и приватных файлов, облачные - для задач, где важно максимальное качество. При таком раскладе рост цен на подписку бьёт по бюджету, но не останавливает работу.

Что будет с доступом к моделям: сценарии и подготовка

Реалистично рассматривать три сценария. Условия доступа остаются примерно теми же: облако работает как раньше, локальный запуск остаётся нишей. Цены растут и лимиты сжимаются: часть рутинных задач переезжает на своё железо. Доступ фрагментируется по регионам и тарифам: растёт значение агрегаторов и локальных моделей. Ни один сценарий не подтверждён, но все три требуют одинаковой подготовки - возможности переключиться.

Аргумент в пользу локального резерва даёт и рынок открытых моделей: по отчёту Mozilla открытые китайские модели отстают от передовых американских примерно на четыре месяца, зато заметно выигрывают по стоимости использования. Что это меняет для домашнего запуска, разобрано в материале про открытые китайские AI-модели. Дополнительный контекст по сценариям рынка есть в разборе про будущее локальных LLM при ослаблении frontier-лабораторий.

Конкретный шаг, который стоит сделать сейчас: выпишите месячные расходы на подписки и API, определите две-три задачи, которые дают основную нагрузку, и проверьте, какая локальная модель в реалистичной квантизации их закрывает. Затем сравните стоимость подходящей конфигурации с годовыми расходами на облако. Полученное соотношение и будет вашей точкой перехода, которую придётся пересчитывать при каждом изменении цен, задач или доступного железа.

Подписаться на канал