Перейти к содержанию
Публикация AiManual

Две RTX 3090 в локальном AI-сервере: что реально даёт вторая карта

Разбираем, когда вторая RTX 3090 реально ускоряет локальные LLM и генерацию, а когда простаивает: суммарные 48 ГБ VRAM, multi-GPU, PCIe, NVLink и проверка софта

Коротко

Что будет в материале

  1. 01

    Короткий ответ: когда вторая RTX 3090 реально нужна

  2. 02

    Что меняет вторая RTX 3090: VRAM, вычисления и параллелизм

  3. 03

    Как проверить, использует ли ваш софт две RTX 3090

  4. 04

    Ограничения: PCIe, NVLink и накладные расходы

Короткий ответ: когда вторая RTX 3090 реально нужна

Вторая RTX 3090 даёт заметную пользу только там, где программа умеет раскладывать работу на два GPU. Рабочих сценариев четыре: суммарные 48 ГБ VRAM под крупные модели и длинные контексты, распределение одной задачи между картами, одновременный запуск двух независимых пайплайнов и ускорение инференса в рантаймах с поддержкой multi-GPU. Всё остальное упирается в то, что вторая карта просто не получает работы.

Исходный кейс выглядит так: локальный AI-сервер на 96 ГБ DDR5 с одной RTX 3090. На нём уже запускаются krea2, qwen image 2.1, minimax h3, ltx 2.5, qwen 3.6, qwen 3.8 q4 и qwen 3.8 Flash next. После покупки второй 3090 владелец не увидел выгоды и спросил сообщество, что вообще делают с двумя картами, потому что остаётся единственным пользователем машины (обсуждение на r/LocalLLaMA).

Короткий ответ на его вопрос: сама по себе вторая карта не ускоряет ничего. Она расширяет возможности, которые приложение должно использовать явно. Если пайплайн рассчитан на одно устройство и модель помещается в 24 ГБ, вы получите карту в простое, лишнее тепловыделение и повышенный расход электроэнергии.

Что меняет вторая RTX 3090: VRAM, вычисления и параллелизм

Три вида выгоды часто смешивают в одну. Разделим их, потому что это независимые оси: можно выиграть в памяти и не выиграть в скорости, а можно не получить ни того, ни другого.

  1. Объём VRAM. 48 ГБ суммарно вместо 24 ГБ. Это про то, влезает ли модель вместе с контекстом, а не про то, как быстро она считается.
  2. Вычислительная мощность. Две карты могут считать быстрее одной, но только если задача распараллеливается и накладные расходы на обмен не съедают выигрыш.
  3. Параллелизм. Две карты обслуживают две разные задачи одновременно. Каждая по отдельности не ускоряется, зато машина делает вдвое больше работы за то же время.

VRAM: 24 ГБ против 48 ГБ суммарно

Для локальных LLM видеопамять - главный ограничитель. Пока модель и контекст помещаются в 24 ГБ, вторая карта не нужна. Как только перестают помещаться, вариантов три: сильнее квантовать, выгружать часть слоёв в системную RAM или добавлять памяти.

Насколько крупными бывают модели, видно по карточке на Hugging Face: Qwen3.8-Flash-Next GSQ-RCO Coder - это mixture-of-experts с 512 экспертами, у которой удалена половина экспертов, с сохранением мультимодальности и упором на код. В квантованном виде она занимает 58,4 ГБ против 354 ГБ в BF16, что соответствует примерно 1,89 бита на параметр исходного трансформера (ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-Coder-GGUF).

58,4 ГБ не влезают целиком ни в 24, ни в 48 ГБ. Здесь и работает комбинация: часть модели или экспертов остаётся в 96 ГБ DDR5, горячая часть живёт в VRAM. Вторая карта повышает долю, которая попадает на быструю память, а это напрямую влияет на скорость генерации токенов. Гарантировать, что конкретная сборка запустится на двух 3090, нельзя: всё зависит от рантайма, квантизации и длины контекста. Похожая логика с выгрузкой экспертов и работой двух GPU через vLLM разобрана в материале про конфигурацию 2× Radeon AI PRO R9700 для Qwen 3.8 и Flash Next.

Вычисления: когда две карты считают быстрее

Ускорение появляется, когда рантайм умеет делить одну задачу между GPU. Схема первая: tensor parallelism, при котором каждый слой считается на обеих картах сразу, а результат синхронизируется. Схема вторая: layer splitting или pipeline parallelism, где разные слои живут на разных картах. Первый вариант даёт больше выигрыша по скорости и больше обмена между картами, второй проще и дешевле по трафику.

Для генерации изображений и видео распараллеливание часто менее эффективно: там много мелких операций и синхронизаций, и накладные расходы могут перекрыть пользу от второй карты. Конкретные проценты ускорения приводить не будем: они зависят от модели, разрешения, батча, версии рантайма и платформы. В открытых источниках, на которые опирается этот разбор, замеров по двум 3090 нет.

Отдельный момент: для модели, которая целиком помещается в одну карту, вторая обычно не даёт ничего. Задача просто не распараллеливается, а обмен между устройствами добавляет задержку.

Параллелизм: две карты, две задачи одновременно

Это единственный сценарий, где одиночный пользователь получает ощутимую пользу без поддержки multi-GPU в самом приложении: разнести разные инструменты по разным картам. Одна 3090 держит LLM и отвечает на запросы, вторая в это время генерирует изображения или видео. Или наоборот: интерактивная сессия на первой карте, фоновый батч на второй.

Для исходной конфигурации это самый очевидный путь: krea2, qwen image 2.1, minimax h3, ltx 2.5 и Qwen-модели можно попробовать развести так, чтобы каждый процесс видел только свою карту. Ограничение здесь не в GPU, а в софте: не каждая обёртка даёт выбрать устройство, и не каждый пайплайн переживёт одновременный запуск рядом с другим.

Выгода измеряется не токенами в секунду, а тем, что длинная генерация видео больше не блокирует чат с моделью. Если вы всё равно ждёте очередь, потому что запускаете задачи по одной, вторая карта ничего не изменит.

Как проверить, использует ли ваш софт две RTX 3090

Проверка занимает несколько минут и не требует чтения исходников.

  1. Поищите в документации инструмента флаги multi-GPU, tensor parallel, device map, gpu-layers или явный выбор устройства. Отсутствие таких настроек - плохой знак.
  2. Запустите типичную задачу и посмотрите загрузку через nvidia-smi или ваш мониторинг. Нужны обе карты, а не только первая.
  3. Проверьте, растёт ли потребление VRAM на второй карте. Если там 0 МБ и 0% загрузки, софт её не видит.
  4. Сравните время выполнения одной и той же задачи на одной и двух картах. Разница в пределах погрешности означает, что распараллеливание не работает.

Инструменты, которые обычно умеют multi-GPU

Проверять стоит три класса софта. Серверы инференса LLM: vLLM с tensor parallelism, llama.cpp с раскладкой слоёв между устройствами. Фреймворки для обучения и тонкой настройки: PyTorch с DistributedDataParallel или FSDP. Отдельные пайплайны ComfyUI, где распределение по устройствам сделано кастомными узлами.

Конкретика зависит от версии и сборки. Один и тот же инструмент в разных релизах может поддерживать multi-GPU по-разному или не поддерживать вовсе, поэтому проверять нужно свою установку, а не общие обещания. Как разные режимы multi-GPU ведут себя с памятью и обменом, разбиралось в статье про две RTX 5060 Ti и объединение GPU для LLM и ComfyUI.

Инструменты, где вторая карта чаще простаивает

Многие пайплайны генерации изображений и видео написаны под одну карту: они либо не видят вторую, либо используют её неэффективно. Часть обёрток над LLM тоже рассчитана на одно устройство и не имеет настроек распределения.

Про krea2, qwen image 2.1, minimax h3 и ltx 2.5 в открытых материалах нет данных о поддержке multi-GPU. Утверждать, что они ускоряются на двух 3090, нельзя. Проверять придётся на своей машине по чек-листу выше: сначала замер на одной карте, потом тот же замер с двумя, и только затем вывод.

Ограничения: PCIe, NVLink и накладные расходы

При работе на двух GPU карты обмениваются данными: активациями, частями тензоров, промежуточными результатами. Обмен идёт через PCIe или NVLink, и его стоимость вычитается из выигрыша. Именно поэтому две карты почти никогда не дают двойного ускорения.

NVLink и SLI: что это значит для AI

SLI - режим для игр, к AI он отношения не имеет. NVLink - отдельная высокоскоростная шина между картами, и у RTX 3090 разъём NVLink есть. Мост снижает накладные расходы на обмен, но помогает только если приложение умеет этим пользоваться и если платформа поддерживает такой режим. Обязательным условием для multi-GPU инференса NVLink не является: многие рантаймы спокойно работают через PCIe.

Когда узкое место - не GPU, а PCIe

Потребительские платформы делят линии между слотами. Типовая схема на две карты - x8/x8, иногда вторая карта висит на чипсете. Чем больше синхронизаций в задаче, тем заметнее упор в шину. Tensor parallelism обменивается данными на каждом слое, layer splitting - на границах блоков, поэтому второй вариант к пропускной способности менее чувствителен.

Отсюда практическое правило: если модель целиком помещается в одну карту, вторая часто не даёт ничего, а обмен только добавляет задержку. Точных замеров падения производительности и пропускной способности в доступных источниках нет, поэтому конкретные цифры приводить не станем.

Сценарии для одного пользователя: как выжать пользу из второй 3090

Четыре сценария, которые имеют смысл при одном активном пользователе.

  • Разделение задач по картам. LLM на одной, генерация изображений или видео на второй. Самый предсказуемый вариант, он не требует поддержки multi-GPU.
  • Фоновые процессы. Апскейл, батч-генерация, пакетная обработка картинок живут на второй карте, пока первая занята интерактивом.
  • Эксперименты. Пока рабочая модель крутится на первой карте, вторая свободна для тестов новых квантизаций, LoRA или обновлений рантайма.
  • Крупная модель на двух картах. Запуск квантованной MoE-модели с распределением слоёв или экспертов, если рантайм это умеет. Выигрыш здесь в памяти, а не в скорости.

В исходном кейсе есть что распределять: krea2, qwen image 2.1 и Qwen-модели можно развести по устройствам, а minimax h3 и ltx 2.5 отдать под фоновую генерацию видео. Конкретный прирост никто не обещает, но такая схема превращает вторую карту из балласта в рабочий ресурс даже без multi-GPU поддержки в самих инструментах.

Сколько VRAM нужно для локальной LLM: ориентиры

Потребление видеопамяти складывается из трёх частей: веса модели, KV-кэш контекста и служебные буферы рантайма. Веса зависят от числа параметров и типа квантования, KV-кэш растёт вместе с длиной контекста и числом параллельных запросов.

Ориентир по весам даёт пример выше: одна и та же MoE-модель занимает 58,4 ГБ в квантованном виде и 354 ГБ в BF16 (карточка модели). Разница почти в шесть раз, и получена она только за счёт квантизации.

Универсальной формулы нет: у dense-моделей и MoE расход считается по-разному, а KV-кэш при длинном контексте легко съедает больше памяти, чем сами веса. Считать нужно по фактическому потреблению в мониторинге и обязательно с KV-кэшем, а не только по размеру файла модели. Эту ошибку разбирали в материале о том, как выбирать GPU для локальных LLM в 2026 году.

Две RTX 3090 или одна карта с большей памятью

Второй путь - одна карта с большим объёмом VRAM. Он избавляет от обмена по PCIe и от зависимости от multi-GPU поддержки: модель целиком лежит на одном устройстве.

Что учитывать при сравнении:

  • Ёмкость. Две 3090 дают 48 ГБ суммарно. Флагманские потребительские карты отличаются по этому параметру: у RTX 4090 те же 24 ГБ, что у 3090, то есть по памяти апгрейда не будет, у RTX 5090 - 32 ГБ. Карты с 48 ГБ и больше относятся к профессиональному сегменту.
  • Стоимость. Цены зависят от рынка и момента, поэтому конкретные суммы здесь не приводим. Общий принцип: одна карта с большим объёмом памяти обычно дороже двух 3090 при сопоставимой ёмкости.
  • Сложность. Две карты требуют блока питания с запасом, места в корпусе, нормального продува и разбирательств с рантаймом. Одна карта проще и предсказуемее.
  • Сценарии. Если задачи помещаются в 24 ГБ и не распараллеливаются, вторая 3090 не окупится. Если нужны крупные модели и длинные контексты, две 3090 могут оказаться дешевле.

Экономику такого сравнения на примере двух карт по 20 ГБ против одной 3090 разбирали в статье про сборку AI-сервера на двух RTX 3080 20GB. Похожий расчёт по памяти, PCIe и питанию есть в материале про RTX 2000 Ada 16 ГБ рядом с RTX 4070 Super.

Итог: кому вторая RTX 3090 даст пользу, а кому нет

Вторая 3090 оправдана в трёх случаях: вы упираетесь в 24 ГБ и готовы разбираться с multi-GPU рантаймами; вам нужно параллелить независимые задачи; вы хотите запас по памяти под длинные контексты и крупные квантизованные модели. Она не оправдана, если весь ваш софт работает на одной карте и всё помещается в 24 ГБ.

Чек-лист для владельца одной 3090, который думает о второй:

  1. Проверьте, упоминает ли документация ваших инструментов multi-GPU, tensor parallel или выбор устройства.
  2. Замерьте время типовых задач на одной карте.
  3. Добавьте вторую карту и повторите замер, следя за загрузкой через nvidia-smi.
  4. Если вторая карта не загружается, ищите не ускорение, а параллелизм: разнесите LLM и генерацию по разным устройствам.
  5. Если и это не нужно, вложение не окупится. Тогда вторая карта останется запасом под крупные модели и длинные контексты.

В исходном кейсе вторая 3090 пока простаивает именно потому, что вопрос был про ускорение (обсуждение на r/LocalLLaMA). Правильнее начать с проверки загрузки карт на своих задачах, а уже потом решать, нужен ли multi-GPU рантайм или достаточно развести инструменты по устройствам.

Подписаться на канал