Что это за сборка и почему она стоит внимания
Домашний сервер для локального инференса LLM примерно за $3000 собрали на четырёх GPU Radeon V620, что даёт 128 ГБ VRAM суммарно, процессоре EPYC 7452, материнской плате Huanandzhi D12D, 256 ГБ DDR4 RDIMM 2666, блоке питания ASRock на 1600 Вт и SSD Samsung 970 EVO на 1 ТБ. Это описание работающей конфигурации со слов её владельца, а не лабораторный тест редакции.
Ключевые цифры выглядят так. На модели Qwen3.8-next-flash в квантовании Autoround W4A16 и форке vLLM с MTP-2 автор заявляет около 1,3k токенов/с на prefill, порядка 70 токенов/с на генерации кода и 60 токенов/с на прозе при контексте 128k+. Питание при этом держится в районе 700-900 Вт на prefill и 500-600 Вт на decode.
Ценность кейса в сочетании объёма и цены: новые профессиональные ускорители с суммарными 128 ГБ VRAM в бюджет $3000 не укладываются. Здесь тот же порядок объёма собран из четырёх карт, а экономия оплачена нестандартным программным стеком, высоким энергопотреблением и привязкой к конкретному форку инференс-движка.
Конфигурация и бюджет: из чего собраны 128 ГБ VRAM
| Компонент | Что используется | Роль в сборке |
|---|---|---|
| GPU | 4× Radeon V620, 128 ГБ VRAM суммарно | Основной объём видеопамяти под веса модели и KV-кэш |
| CPU | EPYC 7452 | Серверная платформа с запасом линий PCIe под четыре карты |
| Материнская плата | Huanandzhi D12D | База под несколько GPU и серверную память |
| ОЗУ | 256 ГБ DDR4 RDIMM 2666 | Загрузка моделей, работа ОС, обслуживание инференса |
| Блок питания | ASRock 1600 Вт | Запас мощности под пиковое потребление 700-900 Вт |
| Накопитель | Samsung 970 EVO 1 ТБ | Система, модели, кэш |
Итоговая стоимость сборки около $3000. Разбивки по компонентам автор не приводит, поэтому судить о том, сколько ушло на карты, а сколько на платформу и память, не по чему. Основной вклад в бюджет дают четыре GPU и серверная платформа с памятью, но конкретные цены по позициям в описании отсутствуют.
Для сравнения: бюджет $3500 закрывает три GPU на 48 ГБ VRAM на современной платформе с DDR5, такой вариант разобран в материале про 3× RX 9060 XT против 3× RTX 5060 Ti. Компромисс обратный: меньше видеопамяти, но предсказуемее совместимость и свежее железо.
Если повторять сборку, карты и серверную платформу разумно искать на вторичном рынке. Как проверять такие комплектующие и не купить убитую карту, разобрано в материале о поиске AI-оборудования на вторичке.
Почему именно Radeon V620 и EPYC 7452
Четыре Radeon V620 дают 128 ГБ VRAM, то есть по 32 ГБ на карту. Для локального инференса объём видеопамяти важнее пиковой вычислительной мощности: он определяет, поместится ли модель целиком или часть весов придётся разгружать в системную память, теряя скорость. Контекст 128k+ требует ещё и места под KV-кэш, поэтому запас VRAM здесь не роскошь.
EPYC 7452 и плата Huanandzhi D12D закрывают вторую часть задачи. Это серверная платформа с большим числом линий PCIe под несколько карт и поддержкой RDIMM. 256 ГБ DDR4 RDIMM 2666 нужны под загрузку моделей, работу ОС и обслуживание инференса, а также под разгрузку части весов, если модель не помещается в VRAM.
Логика выбора подчинена одной задаче: локальный инференс LLM с длинным контекстом. Для универсальной рабочей станции такая конфигурация избыточна. Четыре ускорителя, серверная память и плата под них дают много VRAM и мало повседневной пользы за пределами инференса.
Роль блока питания и накопителя
Блок питания ASRock на 1600 Вт выбран с запасом относительно 700-900 Вт на prefill и 500-600 Вт на decode. Запас нужен по двум причинам: пиковые броски потребления у нескольких GPU выше среднего, а работа на пределе мощности для блока питания плохо заканчивается. Соотношение 1600 Вт против пиковых 900 Вт оставляет почти двукратный резерв.
Samsung 970 EVO на 1 ТБ закрывает систему, модели и кэш. Один терабайт для сервера, который держит несколько LLM, это узкое место: веса в 4-битном квантовании занимают десятки гигабайт на модель, плюс нужны место под систему и временные файлы. Сколько моделей хранится на диске одновременно, в описании не уточняется.
Почему автор отказался от Lenovo P620
Изначально автор рассматривал готовую рабочую станцию Lenovo P620, но отказался от неё из-за большого количества проприетарных решений Lenovo и в итоге вернул покупку. Станция сама по себе не плохая: причина конкретная и практическая.
Готовые workstation такого класса часто идут с нестандартными блоками питания, креплениями и разъёмами, а прошивка ограничивает список совместимых карт расширения. Если планируется поставить четыре GPU, заменить охлаждение и питание, каждый нестандартный узел превращается в отдельную проблему: деталь сложно заменить, а альтернативу от сторонних производителей подобрать нельзя. Кастомная сборка на Huanandzhi D12D и EPYC 7452 таких ограничений не создаёт: платформа рассчитана на серверные комплектующие общего стандарта.
Обратная сторона решения тоже есть. Подбор совместимых компонентов, корпус, охлаждение и настройка ПО ложатся на владельца, и никто не гарантирует, что всё заведётся с первого раза.
Производительность: prefill, decode и контекст 128k+
Prefill это обработка промпта: модель читает входной текст и строит состояние для генерации. Decode это сама генерация, токен за токеном. Первый этап упирается в вычисления, поэтому идёт быстро и потребляет много. Второй зависит от пропускной способности памяти, поэтому идёт медленнее.
Заявленные цифры: около 1,3k токенов/с на prefill и порядка 70 токенов/с на генерации кода, 60 токенов/с на прозе при контексте 128k+. По ощущениям 60-70 токенов/с быстрее скорости чтения человеком, то есть текст появляется в интерфейсе без заметных пауз. Prefill на 1,3k токенов/с значит, что длинный контекст в 128k не превращается в минуты ожидания перед первым токеном.
Что даёт форк vLLM с MTP-2
Все показатели получены на форке vLLM с MTP-2, а не на стандартной сборке движка. Аббревиатура MTP указывает на multi-token prediction, предсказание нескольких токенов за шаг, а цифра 2 говорит о двух токенах. Такие схемы относятся к спекулятивному декодированию и драфтерам, их влияние на скорость разбиралось на примере запуска моделей на ПК с RTX 5090 и 192 ГБ RAM.
Практический вывод: эти цифры нельзя переносить на стандартный vLLM или llama.cpp. Форк это отдельная сборка, которую нужно собрать, настроить и обновлять самостоятельно, а совместимость с новыми моделями появляется в ней с задержкой.
Квантование Autoround W4A16 и его влияние
Модель Qwen3.8-next-flash запускалась в квантовании Autoround W4A16: четыре бита на веса и 16 бит на активации. Смысл квантования в сокращении объёма занимаемой памяти, за счёт чего модель влезает в доступную VRAM или занимает меньше места на диске. Плата - возможная потеря качества ответов и необходимость проверять, как метод работает с конкретной архитектурой.
Насколько качество проседает в этом кейсе, автор не приводит: замеров качества нет, есть только скорости. Сравнения с полной точностью в описании тоже отсутствуют, поэтому воспринимать W4A16 стоит как компромисс с неизмеренной второй половиной.
Энергопотребление и тепловыделение: 700-900 Вт на prefill
700-900 Вт на prefill и 500-600 Вт на decode при работе с Qwen3.8-next-flash в Autoround W4A16 это нагрузка уровня бытовой электроплиты. Для дома отсюда следуют практические выводы.
- Проводка и розетки. Обычная розетка на 16 А при 220 В держит около 3,5 кВт, так что формальный запас есть, но линию под сервер лучше не нагружать другой техникой.
- Охлаждение помещения. 900 Вт электрической мощности почти целиком превращаются в тепло, и комната будет греться.
- Шум. Четыре карты и серверный блок питания требуют продува, а значит корпуса с нормальной вентиляцией и вентиляторов, которые слышно.
- Счёт за электричество. 600 Вт постоянной нагрузки это 14,4 кВт·ч в сутки, если сервер работает круглосуточно.
Блок питания на 1600 Вт из этой картины следует напрямую: он даёт запас на пиковые броски нескольких GPU одновременно.
Компромиссы и подводные камни сборки
- Привязка к форку vLLM с MTP-2. Скорость, о которой говорит автор, держится на нестандартной сборке движка.
- Квантование Autoround W4A16. Метод экономит память, но качество модели в этом режиме не измерялось.
- Потребление 500-900 Вт. Заметная нагрузка для квартиры и ощутимый счёт при круглосуточной работе.
- SSD на 1 ТБ. Под систему, модели и кэш этого мало, если держать несколько моделей одновременно.
- Нет детализации цен. $3000 это итоговая сумма, распределение по компонентам автор не приводит.
- Нет независимой проверки. Все замеры и впечатления идут от владельца сборки, редакция их не воспроизводила.
Разочарование в Qwen3.8-27B и удовлетворённость Qwen3.8-next
Первоначально автор был разочарован скоростью Qwen3.8-27B, но результатами на Qwen3.8-next остался доволен и рассчитывает на дальнейшие улучшения. Показательный сигнал: одинаковое железо даёт принципиально разный опыт на разных моделях, и 128 ГБ VRAM сами по себе не гарантируют комфортной скорости в классе 27B, если архитектура и стек работают неудачно.
Практика запуска моделей этого класса на другой конфигурации разобрана в материале про Qwen 3.8 27B на Debian с llama.cpp и llama-swap: там видно, как на результат влияют квантование, speculative decoding, KV-кэш и параллельные запросы.
Кому подходит такая сборка и что учесть перед повторением
Сборка рассчитана на один сценарий: локальный инференс LLM с большим контекстом, где нужен объём VRAM, а не минимум энергопотребления и шума.
Подойдёт, если:
- нужны 128 ГБ VRAM под модели с контекстом 128k+ и вы готовы разбираться с квантованием Autoround W4A16;
- есть место, проводка и охлаждение под сервер с потреблением до 900 Вт;
- вы готовы собирать и обновлять форк vLLM своими руками;
- задачи это генерация кода и проза в интерактивном режиме, где 60-70 токенов/с закрывают потребность.
Не подойдёт, если нужен сервер из коробки, если электрическая сеть в помещении слабая или если важна тишина: четыре GPU и блок на 1600 Вт собираются в шумную машину.
Перед повторением зафиксируйте ожидания по скорости на конкретной модели. Автор прошёл путь от разочарования в Qwen3.8-27B до довольства Qwen3.8-next и рассчитывает, что стек будет улучшаться дальше. Насколько быстро это произойдёт, зависит от развития форков vLLM, методов квантования и появления новых моделей. Домашние серверы развиваются и в другом направлении: про платформу AMD Threadripper Halo Station на 10 сентября 2026 года известно не всё, и без недостающих характеристик оценить её пригодность для локальных LLM нельзя.
Что делать, если собираетесь повторить конфигурацию: начните с расчёта бюджета по компонентам, потому что четыре GPU это основная статья расходов. Затем зафиксируйте модель и квантование, под которые берёте железо, и только после этого выбирайте движок. И заранее посчитайте, во что обойдётся год работы сервера на 500-600 Вт постоянной нагрузки.