Перейти к содержанию
Публикация AiManual

Framework Desktop в DIY-версии с AMD Ryzen AI Max 400 и 192 ГБ памяти: что даёт предзаказ тем, кто запускает LLM локально

Framework открыла предзаказ на Framework Desktop в DIY-версии с AMD Ryzen AI Max 400 Series и 192 ГБ памяти. Разбираем, какие модели реально влезают в unified m

Коротко

Что будет в материале

  1. 01

    Что именно открыла Framework: коротко о предзаказе

  2. 02

    AMD Ryzen AI Max 400 Series и 192 ГБ unified memory: что это за платформа

  3. 03

    Какие LLM реально помещаются в 192 ГБ памяти

  4. 04

    DIY Edition против готовой конфигурации: что придётся собирать самому

Что именно открыла Framework: коротко о предзаказе

Framework начала принимать предзаказы на настольную систему Framework Desktop в DIY-версии (DIY Edition) на базе процессора AMD Ryzen AI Max 400 Series с 192 ГБ памяти. Об этом 30 сентября 2026 года сообщило сообщество r/LocalLLaMA. По формату это компактный настольный ПК, а не стоечный сервер и не ноутбук: одна небольшая коробка, которая ставится на стол.

Оговорка, без которой новость читается неправильно: в публикации, на которую опирается материал, нет ни цены, ни сроков поставки, ни полных спецификаций. Эти данные могут меняться, поэтому единственный надёжный источник по ним - официальная страница предзаказа самого Framework. Всё, что ниже, либо опирается на подтверждённое сообщение о предзаказе, либо описывает общие принципы работы платформ такого класса, а не результаты измерений конкретного устройства.

Почему это важно именно для локальных LLM

Ключевая цифра здесь - 192 ГБ памяти в одном пуле. Потребительские видеокарты дают 8-24 ГБ VRAM, отдельные топовые модели доходят до 48 ГБ. Этого хватает для моделей класса 7B-32B в квантованном виде, но крупные веса и длинные контексты в такой бюджет не помещаются. Задачи, где объём памяти важнее пиковой вычислительной мощности, как раз и упираются в этот потолок: 70B в высоком квантовании, крупные MoE-модели, длинные контексты для RAG.

Поэтому новость про APU с 192 ГБ попала в поле зрения тех, кто запускает модели локально: она предлагает другой компромисс, где в жертву приносится скорость, а взамен даётся объём.

AMD Ryzen AI Max 400 Series и 192 ГБ unified memory: что это за платформа

AMD Ryzen AI Max 400 Series - процессор класса APU: CPU-ядра и встроенная графика (iGPU) находятся на одном кристалле и используют общую память. Такая схема называется unified memory: единый пул, к которому обращаются и CPU, и iGPU, без копирования данных между системной RAM и отдельной видеопамятью.

Практический смысл в том, что модель, загруженная в этот пул, доступна ускорителю целиком. Нет операции копирования весов из RAM в VRAM и нет жёсткого лимита в 8-24 ГБ. Линейка продолжает логику предыдущего поколения этого класса, Ryzen AI Max+ 395 (Strix Halo), где объём выделяемой под VRAM памяти настраивается на уровне драйвера и ОС. Как эта настройка выглядит в связке с llama.cpp и Vulkan, разбирается в отдельном материале про запуск Qwen3.8-Flash-Next на Strix Halo.

В сообщении речь идёт о конфигурации на 192 ГБ. Полный список доступных вариантов, частоты памяти, число ядер и TDP в исходных данных не приводятся, поэтому финальные характеристики стоит сверять на официальной странице предзаказа.

Чем unified memory отличается от VRAM дискретной видеокарты

Дискретная видеокарта даёт быструю память: GDDR7 или HBM с пропускной способностью в сотни гигабайт в секунду, иногда больше терабайта. Но её мало, и она не расширяется. APU даёт обратную пропорцию: памяти много, а пропускная способность ниже, потому что это мобильная LPDDR5X, а не HBM.

Отсюда простое правило: если модель и её контекст влезают в VRAM карты, карта почти всегда будет быстрее. Если не влезают, объём начинает решать больше, чем скорость памяти.

Какие LLM реально помещаются в 192 ГБ памяти

Вес модели в памяти считается грубо: число параметров умножается на размер одного веса в байтах. В FP16 это 2 байта на параметр, в 8-битном квантовании около 1 байта, в 4-битном примерно 0,5 байта плюс накладные расходы на метаданные и групповые масштабы. Отсюда ориентиры, которые не зависят от конкретного железа:

  • модель 7B в Q4 занимает порядка 4-5 ГБ;
  • 32B в Q4 - примерно 18-20 ГБ;
  • 70B в Q4 - около 40 ГБ;
  • 70B в FP16 - порядка 140 ГБ;
  • крупные MoE-модели на сотни миллиардов параметров - сотни гигабайт и больше.

Эти прикидки - общеизвестная арифметика, а не замеры конкретной системы. Их достаточно, чтобы увидеть главное: 192 ГБ открывают класс моделей, который в 24-48 ГБ VRAM просто не помещается. 70B в FP16 или в 8-битном квантовании становится запускаемой задачей, а не упражнением по частичной выгрузке слоёв на диск.

Квантование и KV-кэш: куда уходит память

Заявленные 192 ГБ - это не 192 ГБ под веса. Часть забирают ОС, драйверы, фоновые процессы и сам стек инференса. Отдельная статья расходов - KV-кэш, который хранит состояния внимания для обработанного контекста. Его размер растёт с длиной контекста, числом слоёв и размерностью модели, а также с количеством одновременных запросов (batch size).

На длинных контекстах, например в RAG на десятки тысяч токенов, KV-кэш может съедать десятки гигабайт. С ростом batch он растёт пропорционально. Поэтому большой объём памяти под длинный контекст и под несколько параллельных запросов - практическая необходимость, а не запас на будущее.

DIY Edition против готовой конфигурации: что придётся собирать самому

DIY Edition - версия для самостоятельной сборки. Готовая конфигурация приходит собранной и проверенной производителем. Точный состав DIY-комплекта и его отличия от готовой версии нужно сверять на официальной странице предзаказа: в сообщении, на которое опирается материал, этих деталей нет.

Типовые шаги для систем такого класса выглядят так: установить накопитель (обычно M.2 SSD), поставить модули памяти, если они не распаяны, подключить охлаждение и питание, собрать корпус, затем поставить ОС и драйверы. У платформ с unified memory память часто распаивают на плате ради высокой частоты и стабильности: пункт с модулями тогда отпадает, но выбрать объём на будущее уже не получится, он фиксируется при покупке. Что именно в комплекте Framework Desktop, надо уточнять по спецификации.

Кому DIY-версия подходит, а кому - нет

DIY берут, когда есть опыт сборки, желание сэкономить на работе производителя и контроль над накопителями и ОС. Это разумно, если вы и так ставите Linux и настраиваете драйверы руками. Готовая сборка нужна, когда система должна заработать из коробки и не превращаться в проект на выходные. Разница в цене и составе между двумя версиями решается только по актуальной странице предзаказа.

Скорость инференса: где 192 ГБ помогают, а где мешают

Скорость генерации токенов на этапе decode упирается в пропускную способность памяти, а не в её объём. Чтобы выдать один токен, модели нужно прочитать веса, и на каждой итерации они читаются заново. Чем выше пропускная способность, тем быстрее цикл. У APU с LPDDR5X пропускная способность ниже, чем у дискретной карты с GDDR или HBM, поэтому на моделях, которые влезают в VRAM карты, видеокарта будет быстрее.

Обратная сторона: на моделях, которые в VRAM не влезают, карта вынуждена выгружать часть слоёв в системную память или на диск, и скорость обваливается. Здесь APU с 192 ГБ выигрывает за счёт того, что задача вообще решается в оперативной памяти без выгрузки. Конкретные значения tokens per second стоит смотреть в независимых бенчмарках после выхода устройства: в исходном сообщении их нет, и подставлять сюда цифры было бы выдумкой.

Prefill против decode: что важнее для вашего сценария

Prefill - обработка промпта: модель прогоняет весь входной текст, этап хорошо параллелится и упирается в вычисления. Decode - генерация по токену, этап упирается в память. Для интерактивного чата с короткими вопросами важнее decode. Для RAG с длинными документами и batch-обработки критичнее prefill и объём памяти под контекст.

Практический вывод: если ваш профиль - длинные контексты и большие модели, 192 ГБ дают больше, чем высокая пропускная способность VRAM. Если профиль - быстрый диалог на модели, которая влезает в 16-24 ГБ, дискретная карта остаётся выгоднее.

Кому стоит смотреть на Framework Desktop, а кому - на альтернативы

Подходит тем, кто запускает крупные модели локально и упирается в объём: 70B в высоком квантовании, большие MoE, длинные контексты для RAG, домашний AI-сервер в тихом компактном корпусе с умеренным энергопотреблением относительно GPU-сборки. Сюда же те, кому важен форм-фактор: одна коробка вместо корпуса с несколькими картами.

Не подходит тем, кому нужна максимальная скорость на моделях, влезающих в VRAM, кто занимается обучением и fine-tuning (там решают вычислительная мощность и объём VRAM), и кто ограничен бюджетом: за те же деньги часто собирается GPU-система с меньшим объёмом, но большей скоростью. Альтернативы без выдуманных цифр:

  • дискретная видеокарта с большим VRAM в обычном ПК, если модели влезают в её память;
  • мини-ПК и платформы на APU предыдущего поколения: подробный разбор в материале о том, стоит ли покупать Strix Halo сейчас и ждать ли снижения цен;
  • рабочие станции класса NVIDIA DGX Station 2026, если нужны многопользовательский инференс и AI-разработка, а не одиночные запуски;
  • аренда GPU в облаке, когда нагрузка непостоянная;
  • б/у оборудование, если бюджет жёсткий: как не переплатить за бесполезную редкость, разбирается в материале про поиск и оценку AI-железа на вторичке.

Универсального ответа нет: выбор между большим объёмом памяти с умеренной скоростью и малым объёмом с высокой скоростью определяется тем, какие модели вы запускаете.

Что проверить перед оформлением предзаказа

Цены, сроки поставок и финальные характеристики могут меняться, поэтому перед оплатой имеет смысл пройтись по списку:

  1. Актуальная конфигурация и цена на официальной странице предзаказа. Ориентироваться на неё, а не на пересказы в соцсетях и новостях.
  2. Сроки поставки и риск сдвига. Предзаказ не равен наличию на складе: дату стоит уточнить и заложить запас.
  3. Состав DIY-комплекта. Что входит, а что докупать: накопитель, память, ОС, охлаждение.
  4. Поддержка ОС и драйверов. Уточнить статус Linux и Windows, доступность драйверов для iGPU и совместимость со стеком инференса.
  5. Гарантия, возврат и условия для вашего региона, включая доставку и таможенные платежи.
  6. Способ оплаты, если заказ оформляется на зарубежном сайте. Для расчётов за иностранные сервисы при недоступности локальных карт подойдёт виртуальная банковская карта зарубежного банка с пополнением в рублях через СБП и управлением через мессенджер.

После выхода устройства появится то, чего сейчас не хватает больше всего: независимые замеры скорости prefill и decode на конкретных моделях. До этого момента разумно оценивать платформу по объёму памяти, который она даёт, и понимать, что скорость генерации будет ниже, чем у дискретных GPU того же ценового уровня.

Подписаться на канал