Перейти к содержанию
Публикация AiManual

Две видеокарты для локальных LLM: Radeon 7900 XT/XTX на X570/X870 Taichi в 2026 году

Разбираем систему из двух Radeon 7900 XT или 7900 XTX для Qwen3: PCIe x8/x8 на X570/X870 Taichi, VRAM в llama.cpp, Linux, питание и сравнение с USB4 eGPU.

Коротко

Что будет в материале

  1. 01

    Две видеокарты для локальных LLM: короткий ответ перед покупкой

  2. 02

    Запуск Qwen3-27B на двух видеокартах: какую память нужно считать

  3. 03

    X570 и X870 Taichi: что дает PCIe x8/x8 для двух Radeon

  4. 04

    llama.cpp и split-бэкенды: как распределяется модель между двумя GPU

Две видеокарты для локальных LLM: короткий ответ перед покупкой

Система из двух AMD Radeon 7900 XT или 7900 XTX на материнской плате ASRock X570/X870 Taichi может быть оправдана, если нужно разместить крупную модель уровня Qwen3-27B или Qwen3-30B-A3B в видеопамяти. Две карты не превращаются автоматически в один ускоритель с удвоенной производительностью. Прирост скорости зависит от того, как llama.cpp распределит модель между GPU и насколько эффективно будет использовать пропускную способность PCIe x8/x8.

Решение имеет смысл при одновременном выполнении нескольких условий: выбранный бэкенд действительно умеет распределять модель между двумя AMD GPU, плата и процессор предоставляют нужную конфигурацию PCIe, корпус и блок питания рассчитаны на две карты, а вы готовы настраивать Linux и разбираться с драйверами. Без подтвержденных характеристик конкретных плат, версий программного стека и воспроизводимых тестов нельзя обещать конкретный прирост токенов в секунду.

Стационарная система лучше подходит для постоянной работы и максимального объема VRAM. USB4 eGPU обеспечивает мобильность и возможность не менять ноутбук, но ограничен пропускной способностью внешнего подключения и сложнее в настройке multi-GPU.

Когда две Radeon действительно решают задачу

Две видеокарты нужны, если одна карта не вмещает модель вместе с KV-кэшем и служебными буферами. Это типично для Qwen3-27B в 4-битном квантовании с длинным контекстом или для Qwen3-30B-A3B. Вторая карта позволяет избежать частичного offload в системную RAM, который резко снижает скорость генерации.

Для локального кодинга важны задержка первого токена, скорость генерации, обработка длинного промпта и стабильность. Увеличение суммарной VRAM не гарантирует пропорционального ускорения, но может сделать работу с большим контекстом возможной.

Кому лучше не собирать такую систему

Если приоритетом является простая настройка, низкая задержка, компактность или гарантированная поддержка конкретного программного стека, двухGPU-система может быть избыточной. Владельцам ноутбуков с USB4 стоит рассмотреть eGPU-док. Тем, кто не готов поддерживать сложный Linux/AMD-стек, лучше выбрать одну мощную карту или облачный сервис.

Запуск Qwen3-27B на двух видеокартах: какую память нужно считать

Расчет по объему VRAM одной только модели недостаточен. Нужно учитывать веса модели в выбранном квантовании, служебный overhead, KV-кэш, длину контекста, временные буферы и настройки offload. Все численные значения следует брать из подтвержденных карточек моделей, документации и воспроизводимых расчетов.

Qwen3-27B: вес модели не равен полному потреблению VRAM

Перед расчетом нужно зафиксировать: формат и квантование, размер контекста, batch size, режим offload и наличие других процессов на GPU. Запас памяти важен для стабильного интерактивного кодинга, поскольку нехватка VRAM приводит к частичному offload на RAM, росту задержек и ошибкам выделения буферов.

Qwen3-30B-A3B: что означает архитектура MoE для локального запуска

MoE-модель имеет общее число параметров и число активных параметров на токен. По обозначению A3B нельзя достоверно вычислить требования к VRAM без знания формата модели и того, как конкретный бэкенд хранит и распределяет экспертные веса. Нужно проверять документацию модели и бэкенда.

Почему запас памяти важнее красивого расчета впритык

Запуск на границе доступной VRAM чреват частичным offload на RAM, ростом задержек, ошибками выделения буферов и необходимостью уменьшать контекст или batch size. Рекомендуется проверять реальное потребление памяти на тестовом прогоне и оставлять запас не менее 10-15%.

X570 и X870 Taichi: что дает PCIe x8/x8 для двух Radeon

Одинаковая маркировка двух слотов не гарантирует одинаковое поведение в реальной системе. Нужно проверять схему распределения линий, зависимость режима от установленного CPU, отключение других слотов или M.2, поддержку bifurcation и фактический режим, который видит Linux.

Как проверить, что оба слота действительно работают в режиме x8/x8

Изучите руководство материнской платы: схему распределения линий, зависимость режима от установленного CPU, отключение других слотов или M.2, поддержку bifurcation. В Linux фактический режим можно проверить командой lspci -vv или через dmesg.

PCIe x8/x8 и инференс: где возможны потери

Загрузка модели, обмен данными во время генерации и обработка больших батчей по-разному зависят от пропускной способности шины. Нельзя утверждать конкретный процент потерь без тестов для той же модели, квантования, версии llama.cpp и конфигурации PCIe.

Физическая совместимость важнее записи в спецификации

Две карты могут быть электрически совместимы, но не помещаться в корпус или плохо охлаждаться. Проверьте толщину карт, расстояние между слотами, доступ к разъемам питания, длину видеокарт, перекрытие нижних слотов и возможность установить дополнительные вентиляторы.

llama.cpp и split-бэкенды: как распределяется модель между двумя GPU

Split-режимы распределяют части модели и связанные с ними буферы между устройствами, но не создают единую VRAM без накладных расходов. Для актуальной сборки llama.cpp нужно проверить поддерживаемый AMD-бэкенд, параметры выбора устройств и способы задания пропорций распределения.

Суммирование VRAM: что оно означает на практике

Модель может быть разделена между двумя устройствами, однако часть операций требует обмена между GPU и зависит от реализации бэкенда. Важно понимать, какие слои, тензоры и временные буферы размещаются на каждой карте.

Какие параметры llama.cpp нужно проверить

В документации используемой сборки проверьте параметры выбора устройств, режима split, распределения тензоров и главного GPU. Не указывайте неподтвержденные флаги как универсальные для всех версий.

Как понять, что модель распределилась правильно

Проверьте видимость обеих карт, фактическое потребление VRAM, загрузку GPU, сообщения бэкенда и поведение при увеличении контекста. Отдельно проверьте сценарий, когда одна карта фактически простаивает или часть работы уходит в системную память.

Скорость инференса двух Radeon: что важно для кодинга

Для программирования важны задержка первого токена, скорость генерации, обработка длинного промпта, размер контекста, стабильность и возможность держать несколько запросов. Любые числа нужно подавать только с описанием модели, квантования, версии llama.cpp, Linux-стека и режима распределения.

Почему вторая видеокарта не дает автоматическое удвоение скорости

Накладные расходы на синхронизацию и обмен данными через PCIe, неравномерное распределение частей модели и различия между prompt processing и генерацией токенов не позволяют ожидать линейного масштабирования. Итог зависит от конкретного split-режима и нагрузки.

Кодинг, длинный контекст и интерактивный диалог

Короткие запросы, анализ больших файлов, генерация патчей, работа с несколькими файлами и последовательные уточнения по-разному нагружают систему. Больший объем доступной VRAM полезнее пикового показателя генерации, когда нужно держать длинный контекст или несколько параллельных запросов.

Как должен выглядеть честный тест производительности

Зафиксируйте одинаковые модель, квантование, контекст, prompt, batch size, версии драйвера и llama.cpp. Отдельно измеряйте загрузку модели, prompt processing, генерацию, пиковую VRAM, температуру и ошибки.

Linux с двумя AMD GPU: драйверы, настройка и диагностика

Стек состоит из ядра Linux, драйвера, пользовательских библиотек, AMD-бэкенда llama.cpp, прав доступа и обнаружения устройств. Версии и команды нужно брать из актуальной документации выбранного дистрибутива и бэкенда.

Проверка устройств до установки llama.cpp

Проверьте, видит ли система обе карты, корректно ли определяются их идентификаторы, доступна ли нужная вычислительная библиотека и не конфликтуют ли устройства с графическим окружением или другими задачами.

Сборка и запуск llama.cpp с AMD-бэкендом

Факт сборки программы не означает готовую multi-GPU-конфигурацию. Зафиксируйте используемый бэкенд, параметры компиляции, список устройств и режим распределения модели. Не обещайте одинаковую поддержку всех функций в каждой сборке; проверяйте документацию и changelog конкретной версии.

Типовые симптомы неисправной конфигурации

Признаки проблем: невидимая вторая карта, падение при выделении памяти, загрузка только одного GPU, неожиданный уход в RAM, нестабильность при длинном контексте и ошибки библиотек. Для каждого симптома собирайте соответствующие логи и показатели.

Питание, охлаждение и корпус для двух Radeon

Расчет нужно строить на официальном энергопотреблении конкретных Radeon, процессора и остальных компонентов с учетом пиковых нагрузок, запаса БП и условий работы. Не называйте универсальную мощность без точных моделей карт, CPU, накопителей и режима эксплуатации.

Как рассчитать блок питания без гадания

Сложите потребление двух GPU, процессора и системы, учтите пиковые значения, запас по мощности, качество платформы БП и нужные разъемы. Проверьте возможность использовать независимые PCIe-кабели для каждой карты.

Температуры и воздушный поток между двумя картами

Оцените расстояние между картами, направление выдува, фронтальный и нижний приток, задний выхлоп, температуру VRAM и риск троттлинга. Результаты зависят от конкретного кулера, корпуса и кривых вентиляторов.

Корпус, шум и круглосуточная нагрузка

Проверьте длину и толщину GPU, места для вентиляторов, свободный доступ к кабелям и обслуживание фильтров. Разделите требования для эпизодического кодинга и длительной генерации или серверного режима.

7900 XT или 7900 XTX: как выбрать конфигурацию для LLM

Сравнение нужно строить по подтвержденному объему VRAM, энергопотреблению, габаритам, цене на момент публикации и поддержке выбранного программного стека. Не используйте непроверенные цены и не объявляйте XTX автоматически лучшим выбором для любого сценария.

Когда приоритетом становится объем VRAM

Для крупной модели память может быть важнее сырой вычислительной производительности. Свяжите выбор GPU с размером квантованной модели, контекстом и запасом под KV-кэш. Проверьте, дает ли дополнительная память каждой карты возможность избежать offload в RAM или уменьшить число компромиссов.

Когда две XT могут быть рациональнее пары XTX

Сравните не только суммарную VRAM и скорость, но и требования к БП, охлаждению, корпусу, стоимости платформы и готовности мириться с более жесткими настройками модели. При ограниченном бюджете и питании две XT могут быть разумным выбором.

Стоит ли смешивать разные карты

Различия по объему памяти, производительности, частотам, охлаждению и распределению нагрузки добавляют переменные в multi-GPU-конфигурацию. Если смешанная пара не рассматривается, ограничьте выводы одинаковыми картами.

USB4 eGPU против стационарной системы на Taichi

Результат eGPU зависит от ноутбука, USB4-контроллера, дока, кабеля, внешнего монитора, операционной системы и конкретной видеокарты. Сопоставляйте не только пропускную способность, но и удобство, мобильность, охлаждение, стоимость апгрейда и поддержку multi-GPU.

Что ограничивает eGPU по USB4

Путь данных между ноутбуком, USB4-контроллером, доком и GPU включает дополнительные задержки и ограничения пропускной способности. Не приводите фиксированные потери производительности без тестов конкретной связки; отдельно учитывайте внутренний и внешний дисплей.

Когда eGPU удобнее двух карт в настольном ПК

Для владельца ноутбука eGPU дает мобильность, отсутствие полной пересборки ПК, возможность подключать GPU по необходимости и более простой путь к расширению вычислительных ресурсов. Одновременно отмечайте зависимость от драйверов и корпуса дока.

Когда стационарная система на X570/X870 Taichi предпочтительнее

Для постоянной нагрузки, нескольких GPU, охлаждения, питания, доступа к накопителям и тонкой настройки Linux стационарная система предпочтительнее. Вывод привязывайте к конкретной конфигурации, а не объявляйте один вариант универсально лучшим.

Итог: кому стоит собирать систему в 2026 году

Решение зависит от сценария: уже есть X570 Taichi; собирается новая система на X870 Taichi; нужна максимальная доступная VRAM для Qwen3; приоритетом является скорость интерактивного кодинга; нужен мобильный вариант на USB4; нет желания поддерживать сложный Linux/AMD-стек. Для каждого случая укажите условия, при которых выбор оправдан, и что необходимо проверить до покупки.

Чек-лист перед покупкой

  • Проверьте официальные характеристики GPU: объем VRAM, энергопотребление, габариты.
  • Проверьте схему PCIe платы и процессора: режим x8/x8, поддержку bifurcation, отключение слотов.
  • Проверьте физические размеры карт и совместимость с корпусом.
  • Рассчитайте блок питания с запасом и нужными разъемами.
  • Проверьте охлаждение: воздушный поток, расстояние между картами, риск троттлинга.
  • Проверьте совместимость Linux-бэкенда llama.cpp с двумя AMD GPU.
  • Проверьте распределение модели в llama.cpp: параметры split, выбор устройств.
  • Проверьте требования Qwen3: формат, квантование, размер контекста, KV-кэш.
  • Проверьте воспроизводимость тестового сценария: модель, квантование, промпт, batch size.

Какие выводы нельзя делать без собственных тестов

Не обещайте конкретные токены в секунду, линейное масштабирование, стабильную поддержку любого драйвера или одинаковое поведение всех сборок llama.cpp. Перечислите параметры, которые должны быть подтверждены источниками или тестом именно нужной конфигурации.

Подписаться на канал