Перейти к содержанию
Публикация AiManual

Локальный AI вместо облака: две RTX 5060 Ti и Mac Studio на 96 ГБ

Две RTX 5060 Ti на ~100 tok/s и два пула контекста по ~175K токенов, Mac Studio на 96 ГБ в лизинге за $117/мес, VLAN-изоляция и VPS за $5. Разбираем архитектуру

Коротко

Что будет в материале

  1. 01

    Зачем переходить с облачного инференса на локальный

  2. 02

    Конфигурация на двух RTX 5060 Ti: производительность и контекст

  3. 03

    Mac Studio на 96 ГБ как основной офлайн-инференс-апплаенс

  4. 04

    Архитектура изоляции: VLAN, LAN-only и VPS за $5/мес

Зачем переходить с облачного инференса на локальный

Автор уходит от облака не потому, что локальное железо дешевле сегодня. Ставка в другом: купить постоянный «пол» инференса и рассчитывать, что за три года то же железо станет полезнее за счёт улучшений открытых моделей, квантизации, движков инференса, кэширования и агентных архитектур. Свою мотивацию и всю конфигурацию он описал в посте на r/LocalLLaMA.

Второй мотив - управляемость. Локальный контур частично изолирует от будущих изменений цен, ограничений и политик провайдеров API и подписок. Пока инференс идёт на своём железе, рост тарифа или новые лимиты не останавливают работу. Облако остаётся в схеме, но как осознанный дополнительный контур, а не как единственный канал доступа к моделям.

Автор прямо оговаривает две вещи. Первая: подход дорог по обычным меркам, и более мощные модели доступны через подписки и API за существенно меньшие первоначальные затраты. Вторая: он не утверждает, что сегодняшние локальные модели останутся конкурентоспособными с фронтирными облачными. Ценность схемы в другом - фиксированная база возможностей, которая не исчезает при смене условий у провайдера.

Конфигурация на двух RTX 5060 Ti: производительность и контекст

Рабочий десктоп автора оснащён двумя RTX 5060 Ti. Карты куплены примерно за $400 каждая, около $800 суммарно, до роста цен на видеокарты. По его оценке, собрать такую же конфигурацию сегодня было бы существенно дороже: за время AI-бума цены на GPU для локального инференса выросли, и смета любой домашней сборки считается уже по другим цифрам.

Скорость и модель: Occamy 1.0 на ~100 tok/s

На этих двух картах запущена Occamy 1.0, и она выдаёт около 100 tok/s, по заявлению автора. Цифра относится к текущему рабочему стенду, на котором он работает повседневно, а не к лабораторному замеру в вакууме. Независимого подтверждения этой скорости в открытых источниках нет, поэтому воспринимать её стоит как заявленную конфигурацию, а не как воспроизводимый результат.

Практический вывод: две карты среднего сегмента закрывают интерактивную работу с моделью, если она помещается в память целиком. Ответ в несколько сотен токенов при такой выдаче приходит за считанные секунды, а не за минуты ожидания.

Два пула контекста по ~175K токенов для параллельных агентов

Доступной памяти хватает на два независимых пула контекста примерно по 175K токенов каждый. Для агентных сценариев это важнее пиковой скорости: каждый субагент работает со своим контекстом и не вытесняет историю соседа. Когда несколько задач идут параллельно, не приходится пересобирать длинный контекст заново или ждать, пока освободится общий пул.

Речь про текущую конфигурацию автора, а не про гипотетическую возможность. Оговорка та же, что и со скоростью: 175K токенов на пул - заявленная цифра из его описания, независимых замеров нет. Как ведёт себя связка при одновременной загрузке обоих пулов, автор не уточняет.

Mac Studio на 96 ГБ как основной офлайн-инференс-апплаенс

Основным офлайн-инференс-устройством станет Mac Studio с 96 ГБ памяти. В источнике он упомянут как 96 GB M5 Ultra, других характеристик устройства в материалах нет. На момент описания это план, а не работающая система, и дальше речь именно о плане.

Финансовая схема - лизинг за $117 в месяц через программу апгрейда Apple. Регулярный платёж вместо разового снижает порог входа и упрощает смену конфигурации при апгрейде. Что стоит за формулировкой «идеальный Mac для локальных AI-агентов» и какие у неё ограничения, разобрано в отдельном материале про Mac Studio с M5 Ultra.

Почему 96 ГБ памяти меняет расклад

У Apple Silicon память унифицированная: GPU получает доступ ко всему объёму, а не к отдельному пулу VRAM. Практический смысл для инференса в том, что в память помещаются модели крупнее тех, что укладываются в две RTX 5060 Ti, и остаётся запас под KV-кэш длинного контекста. Объём памяти, а не пиковая вычислительная мощность, чаще определяет, запустится модель локально или нет.

Qwen 3.8 Next Flash и бэкенд oMLX

Планируемая модель для Mac Studio - Qwen 3.8 Next Flash, бэкенд - oMLX. Характеристики ни модели, ни бэкенда в материалах не раскрыты, поэтому конкретных цифр производительности этой связки пока нет. Цель понятна: основной инференс идёт локально и не зависит от внешних API.

Архитектура изоляции: VLAN, LAN-only и VPS за $5/мес

Сеть построена вокруг одного принципа: инференс-устройство не имеет прямого выхода в интернет. Mac будет помещён в отдельный VLAN, останется доступен по LAN и будет лишён доступа в WAN.

VLAN и запрет WAN: что это даёт на практике

VLAN отделяет инференс-апплаенс от остальной домашней сети, а запрет WAN закрывает исходящие соединения. Поверхность атаки сокращается: устройство не может само отправить данные наружу, а обращения к нему ограничены локальным сегментом. Цена решения - администрирование. Правила сегментации и запреты нужно поддерживать, иначе изоляция быстро превращается в формальность.

VPS за $5/мес как контролируемый шлюз

Связь с внешним миром идёт через VPS за $5 в месяц. Он становится единственной контролируемой точкой входа, а Mac при этом не открывается напрямую в WAN. Конкретные протоколы и сервисы в описании не раскрыты, поэтому это принцип архитектуры, а не готовая инструкция по настройке.

OpenChamber: постоянное рабочее пространство с десктопа, ноутбука и телефона

OpenChamber - постоянное рабочее пространство, доступное с десктопа, ноутбука и телефона. Рабочее состояние не привязано к одной машине: начать сессию можно за столом, продолжить с ноутбука, проверить с телефона. Функции OpenChamber в материалах не детализированы, так что оценивать их по описанию не стоит.

ZDR API: осознанное подключение облачных моделей

ZDR API доступен только тогда, когда автор осознанно хочет использовать более крупную облачную модель. Это исключение, а не постоянный канал: повседневный трафик идёт на локальное железо, облако подключается под конкретную задачу, где локальных возможностей не хватает.

Экономика и риски: честный разбор

Затраты по описанию выглядят так.

КомпонентСтоимостьТип платежа
Две RTX 5060 Tiоколо $800 суммарно, примерно $400 за картуразово, до роста цен
Mac Studio с 96 ГБ$117в месяц, лизинг
VPS$5в месяц

Регулярная часть - около $122 в месяц без учёта электричества: данных о потреблении и тарифах в описании нет, подставлять свои цифры здесь не стоит. Отдельный нюанс: $117 в месяц - это не разовая покупка, а платёж на весь срок лизинга, и считать его нужно частью постоянного бюджета.

Сравнение с облачными подписками и API

Автор пишет прямо: подход дорог по обычным меркам, а доступ к более мощным моделям можно получить через подписки и API за существенно меньшие первоначальные затраты. Он не утверждает, что локальное железо сегодня дешевле облака. Категоричного вывода тут не получится: тарифы на API и подписки меняются, а стоимость локального токена зависит от модели, квантования и энергопотребления. Как считают цену инференса на Apple Silicon, показано в разборе экономики инференса LLM на Apple Silicon.

Три сценария, при которых ставка не сыграет

  1. Облачный инференс резко подешевеет. Если подписки и API будут постоянно дешеветь, локальное железо проиграет по деньгам, а зафиксированный «пол» окажется оплаченным дороже облачного доступа.
  2. Открытые модели застопорятся. Если улучшения открытых моделей остановятся, то же железо не станет полезнее через год или два, и смысл владения им размывается.
  3. Требования к памяти вырастут. Если новые модели потребуют заметно больше памяти, чем есть в Mac Studio и в двух RTX 5060 Ti, локальный контур перестанет запускать то, что нужно.

Автор допускает, что ошибается в двух местах сразу: и в ставке против постоянного удешевления подписок и API, и в ставке против резкого удешевления инференс-железа в ближайшие 2-3 года. Если сбудется любое из двух, покупка сегодня будет выглядеть неразумной.

Ставка на три года: как железо будет становиться полезнее

Логика ставки: владение постоянным «полом» инференса вместе с будущими улучшениями сделает то же железо полезнее в течение следующих трёх лет. Конкретных цифр роста производительности автор не обещает, речь о направлениях, где улучшения уже идут.

Открытые модели и квантизация

Если открытые модели продолжают догонять фронтир, на том же железе со временем запускаются более способные модели. Квантизация работает в ту же сторону: более агрессивные схемы сжатия позволяют уместить модель в имеющуюся память с меньшей потерей качества. Как меняется расстановка сил в этой гонке, разобрано в материале про открытые модели и потребительское железо.

Движки инференса и кэширование

Улучшения движков инференса дают прирост скорости и эффективности использования памяти без замены железа. Кэширование снижает объём повторных вычислений: если агент работает с одним и тем же длинным контекстом, считать его целиком на каждом шаге не нужно. Для двух пулов по 175K токенов это экономия времени на каждой итерации.

Агентные архитектуры

Развитие агентных архитектур повышает отдачу от параллельных пулов контекста. Чем лучше оркестрация, тем больше задач выполняется локальными моделями и тем реже возникает повод подключать облако через ZDR API. Здесь выигрыш приходит от схемы работы, а не от нового железа.

Кому подходит такая архитектура, а кому - нет

Конфигурация с двумя RTX 5060 Ti и Mac Studio на 96 ГБ подходит тем, кто:

  • готов вкладываться в железо и считать горизонт владения годами;
  • ценит независимость от облачных провайдеров и их политик;
  • работает с параллельными субагентами и длинными контекстами;
  • готов администрировать VLAN, запрет WAN и VPS.

Не подходит тем, кто:

  • хочет максимальные возможности сегодня за минимальные деньги: подписки и API дадут больше при меньшем стартовом платеже;
  • не готов поддерживать сетевую изоляцию и шлюз;
  • зависит от фронтирных облачных моделей и не готов ждать, пока открытые подтянутся;
  • ожидает, что локальная скорость и качество совпадут с облачными.

Это конкретный кейс с ограничениями, а не универсальная рекомендация. Если выбираете между дискретной картой и Apple Silicon для инференса, пригодится сравнение RTX 5090 и M5 Ultra Mac Studio.

Подписаться на канал