Почему 48 ГБ VRAM - новый стандарт для домашних LLM-серверов
Модели уровня 27B–35B в 4-битном квантовании требуют 20–30 ГБ видеопамяти. С учётом MoE-архитектур, где активируются не все параметры, но эксперты требуют быстрой подкачки, 48 ГБ VRAM становятся разумным минимумом для комфортной работы без постоянного offloading в RAM. Command R, Yi-34B, Mixtral 8x22B - эти модели уже сейчас упираются в потолок 24 ГБ одной карты. Две карты по 24 ГБ решают проблему, но выходят за бюджет в $3,5k. Три карты по 16 ГБ - компромисс, который даёт 48 ГБ VRAM и оставляет запас для KV-кэша и будущих экспериментов.
Этот материал - не абстрактное сравнение спецификаций. Мы разбираем практический кейс: как собрать сервер с тремя GPU по 16 ГБ, выбрать между AMD и NVIDIA, между AM5 и б/у EPYC, и не выйти за рамки бюджета. Прямой ответ: если стабильность и совместимость критичны - берите NVIDIA на платформе с гарантированным PCIe P2P. Если готовы экспериментировать и экономить - AMD с оговорками по зрелости ROCm на RDNA4.
Ранее мы уже разбирали, как две RTX 3080 20GB дают 40 ГБ видеопамяти дешевле одной RTX 3090, и тестировали гибридную сборку NVIDIA + AMD для LLM. Теперь шагнём дальше - три карты, 48 ГБ, бюджет $3,5k.
Выбор GPU: RX 9060 XT vs RTX 5060 Ti - битва за 16 ГБ
Обе карты выходят в 2026 году с 16 ГБ VRAM и ориентировочным TDP 160–180 Вт. RTX 5060 Ti использует GDDR7 с пропускной способностью около 448 ГБ/с, RX 9060 XT - GDDR6 с 384 ГБ/с. Разница в 17% по пропускной способности памяти заметна при работе с большими батчами, но для домашнего инференса с одним-двумя пользователями критичнее софтовая экосистема.
ROCm на RDNA4: готов ли AMD к бою?
RDNA4 получает официальную поддержку ROCm с версии 6.2, но статус - «beta» для multi-GPU инференса. llama.cpp работает через HIP-бэкенд с тензорным разделением, vLLM требует ручной сборки с флагами под RDNA4. Пользовательские отчёты за август 2026 показывают: одиночная RX 9070 XT на RDNA3 выдаёт 85–90% производительности RTX 4070 Ti Super в llama.cpp на моделях 7B–13B. Для трёх карт RDNA4 данных пока нет - риск нарваться на нестабильность P2P-пересылок реален. Наш тест Intel Arrow Lake для multi-GPU инференса показал, что без работающего PCIe P2P tensor parallel выдаёт мусор. С AMD на RDNA4 ситуация может быть аналогичной - проверяйте перед покупкой.
CUDA против ROCm: цена стабильности
RTX 5060 Ti на старте продаж - $449, RX 9060 XT - $379. Разница $70 с карты, $210 за три штуки. За эти деньги вы получаете: гарантированную работу llama.cpp и vLLM «из коробки», поддержку FlashAttention 3, NCCL для межкарточного обмена, зрелые драйверы. AMD экономит бюджет, но время на отладку ROCm, подбор версий библиотек и решение проблем с P2P может стоить дороже $210, если считать почасовую ставку ML-инженера. Для продакшен-нагрузок переплата за NVIDIA оправдана. Для домашней песочницы, где время не деньги, - AMD даёт шанс сэкономить.
Платформа и PCIe: AM5 с разделением x8/x8/x4 против б/у EPYC SP3
Три карты требуют три физических слота PCIe. На AM5 это означает bifurcation: два слота x8 и один x4 через чипсет или райзер. EPYC SP3 даёт 128 линий PCIe 4.0 - три полноценных x16 без компромиссов.
Влияние PCIe 4.0 x4 на инференс LLM: мифы и реальность
После загрузки модели в VRAM основная нагрузка на PCIe - передача данных между картами при tensor parallelism. Для моделей 7B–13B с tensor split в llama.cpp пропускной способности x4 (8 ГБ/с) хватает: обмен активациями между слоями измеряется мегабайтами. Для 27B+ с TP в vLLM картина меняется: при параллелизме по тензорам каждый шаг инференса требует синхронизации весов, и x4 становится узким местом. Оценка: падение производительности 15–25% по сравнению с x8. Если третья карта используется только как хранилище экспертов в MoE, а не для TP, влияние x4 минимально - подкачка экспертов идёт реже.
128 ГБ DDR5 против 128 ГБ ECC DDR4: что важнее для MoE?
Двухканальная DDR5-6000 на AM5 даёт ~96 ГБ/с. Восьмиканальная DDR4-3200 на EPYC - ~204 ГБ/с. Для MoE-моделей вроде Mixtral 8x22B, где эксперты подкачиваются из RAM в VRAM по мере необходимости, пропускная способность памяти определяет задержки. EPYC выигрывает вдвое по скорости и добавляет ECC - критичный фактор при инференсе длительностью в часы. Одиночный битовый сбой в DDR5 без ECC может испортить выход модели без видимых причин. Для offloading больших MoE платформа EPYC предпочтительнее.
Собираем конфигурации: три сценария под бюджет $3,5k
Цены на август 2026, новые комплектующие, если не указано иное. Блок питания 1200 Вт с запасом по нагрузке, корпус с тремя вертикальными слотами и активным продувом.
Бюджетный максимум: AM5 + 3x RX 9060 XT
- CPU: Ryzen 7 8700F - $270
- Плата: ASRock B650E PG Riptide (x8/x8/x4 через CPU + чипсет) - $240
- RAM: 128 ГБ DDR5-5600 (2x48 ГБ + 2x16 ГБ) - $380
- GPU: 3x RX 9060 XT 16GB - $1137
- SSD: 1 ТБ NVMe PCIe 4.0 - $80
- БП: 1200 Вт Gold - $180
- Корпус + райзеры: $150
Итого: ~$2437. Остаётся запас $1000 на эксперименты или апгрейд. Риски: нестабильность ROCm на трёх картах RDNA4, третья карта на PCIe 4.0 x4 через чипсет B650E (нет P2P с картами на CPU).
Оптимальный баланс: AM5 + 3x RTX 5060 Ti
- CPU: Ryzen 7 8700F - $270
- Плата: ASRock B650E PG Riptide - $240
- RAM: 128 ГБ DDR5-5600 - $380
- GPU: 3x RTX 5060 Ti 16GB - $1347
- SSD: 1 ТБ NVMe - $80
- БП: 1200 Вт Gold - $180
- Корпус + райзеры: $150
Итого: ~$2647. Переплата $210 за NVIDIA даёт гарантированную работу CUDA, NCCL и vLLM без бубна. Та же проблема с третьей картой на x4, но NCCL умеет работать через CPU-мост с минимальными потерями для инференса.
Путь энтузиаста: б/у EPYC + 3x RTX 5060 Ti
- CPU: EPYC 7302 (16 ядер, б/у) - $180
- Плата: Supermicro H11SSL-i (SP3, б/у) - $320
- RAM: 128 ГБ DDR4-3200 ECC RDIMM (8x16 ГБ, б/у) - $280
- GPU: 3x RTX 5060 Ti 16GB - $1347
- SSD: 1 ТБ NVMe - $80
- БП: 1200 Вт Gold - $180
- Корпус + райзеры: $200 (учтён больший форм-фактор)
Итого: ~$2587. Три карты на x16, 204 ГБ/с пропускной способности RAM с ECC, 128 линий PCIe для будущего расширения до четырёх-пяти GPU. Б/у платформа требует проверки совместимости райзеров и охлаждения VRM на плате, но даёт максимум за те же деньги. AI-налог на железо делает новые серверные платформы недоступными, но б/у EPYC Rome остаётся разумным выбором.
Практические советы по сборке и настройке multi-GPU сервера
Корпус - не место для экономии. Три карты с TDP 160–180 Вт каждая выделяют до 540 Вт тепла. Нужен сквозной продув: два 140-мм вентилятора на вдув спереди, один на выдув сзади, и перфорированная боковая стенка. Райзеры - только PCIe 4.0 с экранированием, длина до 30 см. Длиннее - сигнал деградирует, получаете ошибки PCIe и падение скорости до 2.0.
В BIOS для AM5: включите bifurcation x8/x8 на слотах CPU, отключите ненужные контроллеры (SATA, аудио, WiFi) для освобождения линий. Для EPYC: настройте NUMA nodes per socket в зависимости от модели CPU - Rome и Milan работают лучше с 4 NUMA на сокет для multi-GPU нагрузок.
Андервольтинг GPU снижает TDP на 15–20% без потери производительности в инференсе. Для NVIDIA - через nvidia-smi -pl, для AMD - через rocm-smi. Кривые вентиляторов настраивайте на удержание температуры VRAM ниже 85°C - при 90°C GDDR6/GDDR7 начинают троттлить.
После установки драйверов прогоните базовые тесты: llama.cpp с моделью 7B Q4_K_M на одной, двух и трёх картах. Сравните tok/s. Если на трёх картах скорость ниже, чем на двух - проблема в P2P или x4. Для vLLM проверьте tensor parallel size=3 на модели 27B - если инференс падает с ошибками, проверьте NCCL-тесты между всеми парами GPU.
Выводы: какая платформа лучше для ваших задач
Матрица решений по состоянию на август 2026:
- Бюджет жёсткий, готовы к отладке - AM5 + 3x RX 9060 XT. Экономия $210, но время на настройку ROCm может занять недели.
- Нужна стабильность «из коробки» - AM5 + 3x RTX 5060 Ti. Переплата за CUDA окупается отсутствием сюрпризов.
- Планируете расти, работать с MoE, добавлять GPU - б/у EPYC + 3x RTX 5060 Ti. 128 линий PCIe и 8-канальная ECC-память дают запас на годы вперёд.
Финальный совет: дождитесь реальных тестов RX 9060 XT в multi-GPU конфигурациях перед покупкой. Ранние ревизии ROCm под RDNA4 могут преподнести сюрпризы, которые не стоят сэкономленных $210. Если время поджимает - NVIDIA на AM5 или EPYC даст предсказуемый результат. Для тех, кто только начинает путь в локальном AI, рекомендуем наш материал по бюджетным конфигурациям за $500–1200 - там разобраны основы, которые пригодятся при сборке сервера любого масштаба.