Короткий ответ: когда вторая RTX 3090 реально нужна
Вторая RTX 3090 даёт заметную пользу только там, где программа умеет раскладывать работу на два GPU. Рабочих сценариев четыре: суммарные 48 ГБ VRAM под крупные модели и длинные контексты, распределение одной задачи между картами, одновременный запуск двух независимых пайплайнов и ускорение инференса в рантаймах с поддержкой multi-GPU. Всё остальное упирается в то, что вторая карта просто не получает работы.
Исходный кейс выглядит так: локальный AI-сервер на 96 ГБ DDR5 с одной RTX 3090. На нём уже запускаются krea2, qwen image 2.1, minimax h3, ltx 2.5, qwen 3.6, qwen 3.8 q4 и qwen 3.8 Flash next. После покупки второй 3090 владелец не увидел выгоды и спросил сообщество, что вообще делают с двумя картами, потому что остаётся единственным пользователем машины (обсуждение на r/LocalLLaMA).
Короткий ответ на его вопрос: сама по себе вторая карта не ускоряет ничего. Она расширяет возможности, которые приложение должно использовать явно. Если пайплайн рассчитан на одно устройство и модель помещается в 24 ГБ, вы получите карту в простое, лишнее тепловыделение и повышенный расход электроэнергии.
Что меняет вторая RTX 3090: VRAM, вычисления и параллелизм
Три вида выгоды часто смешивают в одну. Разделим их, потому что это независимые оси: можно выиграть в памяти и не выиграть в скорости, а можно не получить ни того, ни другого.
- Объём VRAM. 48 ГБ суммарно вместо 24 ГБ. Это про то, влезает ли модель вместе с контекстом, а не про то, как быстро она считается.
- Вычислительная мощность. Две карты могут считать быстрее одной, но только если задача распараллеливается и накладные расходы на обмен не съедают выигрыш.
- Параллелизм. Две карты обслуживают две разные задачи одновременно. Каждая по отдельности не ускоряется, зато машина делает вдвое больше работы за то же время.
VRAM: 24 ГБ против 48 ГБ суммарно
Для локальных LLM видеопамять - главный ограничитель. Пока модель и контекст помещаются в 24 ГБ, вторая карта не нужна. Как только перестают помещаться, вариантов три: сильнее квантовать, выгружать часть слоёв в системную RAM или добавлять памяти.
Насколько крупными бывают модели, видно по карточке на Hugging Face: Qwen3.8-Flash-Next GSQ-RCO Coder - это mixture-of-experts с 512 экспертами, у которой удалена половина экспертов, с сохранением мультимодальности и упором на код. В квантованном виде она занимает 58,4 ГБ против 354 ГБ в BF16, что соответствует примерно 1,89 бита на параметр исходного трансформера (ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-Coder-GGUF).
58,4 ГБ не влезают целиком ни в 24, ни в 48 ГБ. Здесь и работает комбинация: часть модели или экспертов остаётся в 96 ГБ DDR5, горячая часть живёт в VRAM. Вторая карта повышает долю, которая попадает на быструю память, а это напрямую влияет на скорость генерации токенов. Гарантировать, что конкретная сборка запустится на двух 3090, нельзя: всё зависит от рантайма, квантизации и длины контекста. Похожая логика с выгрузкой экспертов и работой двух GPU через vLLM разобрана в материале про конфигурацию 2× Radeon AI PRO R9700 для Qwen 3.8 и Flash Next.
Вычисления: когда две карты считают быстрее
Ускорение появляется, когда рантайм умеет делить одну задачу между GPU. Схема первая: tensor parallelism, при котором каждый слой считается на обеих картах сразу, а результат синхронизируется. Схема вторая: layer splitting или pipeline parallelism, где разные слои живут на разных картах. Первый вариант даёт больше выигрыша по скорости и больше обмена между картами, второй проще и дешевле по трафику.
Для генерации изображений и видео распараллеливание часто менее эффективно: там много мелких операций и синхронизаций, и накладные расходы могут перекрыть пользу от второй карты. Конкретные проценты ускорения приводить не будем: они зависят от модели, разрешения, батча, версии рантайма и платформы. В открытых источниках, на которые опирается этот разбор, замеров по двум 3090 нет.
Отдельный момент: для модели, которая целиком помещается в одну карту, вторая обычно не даёт ничего. Задача просто не распараллеливается, а обмен между устройствами добавляет задержку.
Параллелизм: две карты, две задачи одновременно
Это единственный сценарий, где одиночный пользователь получает ощутимую пользу без поддержки multi-GPU в самом приложении: разнести разные инструменты по разным картам. Одна 3090 держит LLM и отвечает на запросы, вторая в это время генерирует изображения или видео. Или наоборот: интерактивная сессия на первой карте, фоновый батч на второй.
Для исходной конфигурации это самый очевидный путь: krea2, qwen image 2.1, minimax h3, ltx 2.5 и Qwen-модели можно попробовать развести так, чтобы каждый процесс видел только свою карту. Ограничение здесь не в GPU, а в софте: не каждая обёртка даёт выбрать устройство, и не каждый пайплайн переживёт одновременный запуск рядом с другим.
Выгода измеряется не токенами в секунду, а тем, что длинная генерация видео больше не блокирует чат с моделью. Если вы всё равно ждёте очередь, потому что запускаете задачи по одной, вторая карта ничего не изменит.
Как проверить, использует ли ваш софт две RTX 3090
Проверка занимает несколько минут и не требует чтения исходников.
- Поищите в документации инструмента флаги multi-GPU, tensor parallel, device map, gpu-layers или явный выбор устройства. Отсутствие таких настроек - плохой знак.
- Запустите типичную задачу и посмотрите загрузку через nvidia-smi или ваш мониторинг. Нужны обе карты, а не только первая.
- Проверьте, растёт ли потребление VRAM на второй карте. Если там 0 МБ и 0% загрузки, софт её не видит.
- Сравните время выполнения одной и той же задачи на одной и двух картах. Разница в пределах погрешности означает, что распараллеливание не работает.
Инструменты, которые обычно умеют multi-GPU
Проверять стоит три класса софта. Серверы инференса LLM: vLLM с tensor parallelism, llama.cpp с раскладкой слоёв между устройствами. Фреймворки для обучения и тонкой настройки: PyTorch с DistributedDataParallel или FSDP. Отдельные пайплайны ComfyUI, где распределение по устройствам сделано кастомными узлами.
Конкретика зависит от версии и сборки. Один и тот же инструмент в разных релизах может поддерживать multi-GPU по-разному или не поддерживать вовсе, поэтому проверять нужно свою установку, а не общие обещания. Как разные режимы multi-GPU ведут себя с памятью и обменом, разбиралось в статье про две RTX 5060 Ti и объединение GPU для LLM и ComfyUI.
Инструменты, где вторая карта чаще простаивает
Многие пайплайны генерации изображений и видео написаны под одну карту: они либо не видят вторую, либо используют её неэффективно. Часть обёрток над LLM тоже рассчитана на одно устройство и не имеет настроек распределения.
Про krea2, qwen image 2.1, minimax h3 и ltx 2.5 в открытых материалах нет данных о поддержке multi-GPU. Утверждать, что они ускоряются на двух 3090, нельзя. Проверять придётся на своей машине по чек-листу выше: сначала замер на одной карте, потом тот же замер с двумя, и только затем вывод.
Ограничения: PCIe, NVLink и накладные расходы
При работе на двух GPU карты обмениваются данными: активациями, частями тензоров, промежуточными результатами. Обмен идёт через PCIe или NVLink, и его стоимость вычитается из выигрыша. Именно поэтому две карты почти никогда не дают двойного ускорения.
NVLink и SLI: что это значит для AI
SLI - режим для игр, к AI он отношения не имеет. NVLink - отдельная высокоскоростная шина между картами, и у RTX 3090 разъём NVLink есть. Мост снижает накладные расходы на обмен, но помогает только если приложение умеет этим пользоваться и если платформа поддерживает такой режим. Обязательным условием для multi-GPU инференса NVLink не является: многие рантаймы спокойно работают через PCIe.
Когда узкое место - не GPU, а PCIe
Потребительские платформы делят линии между слотами. Типовая схема на две карты - x8/x8, иногда вторая карта висит на чипсете. Чем больше синхронизаций в задаче, тем заметнее упор в шину. Tensor parallelism обменивается данными на каждом слое, layer splitting - на границах блоков, поэтому второй вариант к пропускной способности менее чувствителен.
Отсюда практическое правило: если модель целиком помещается в одну карту, вторая часто не даёт ничего, а обмен только добавляет задержку. Точных замеров падения производительности и пропускной способности в доступных источниках нет, поэтому конкретные цифры приводить не станем.
Сценарии для одного пользователя: как выжать пользу из второй 3090
Четыре сценария, которые имеют смысл при одном активном пользователе.
- Разделение задач по картам. LLM на одной, генерация изображений или видео на второй. Самый предсказуемый вариант, он не требует поддержки multi-GPU.
- Фоновые процессы. Апскейл, батч-генерация, пакетная обработка картинок живут на второй карте, пока первая занята интерактивом.
- Эксперименты. Пока рабочая модель крутится на первой карте, вторая свободна для тестов новых квантизаций, LoRA или обновлений рантайма.
- Крупная модель на двух картах. Запуск квантованной MoE-модели с распределением слоёв или экспертов, если рантайм это умеет. Выигрыш здесь в памяти, а не в скорости.
В исходном кейсе есть что распределять: krea2, qwen image 2.1 и Qwen-модели можно развести по устройствам, а minimax h3 и ltx 2.5 отдать под фоновую генерацию видео. Конкретный прирост никто не обещает, но такая схема превращает вторую карту из балласта в рабочий ресурс даже без multi-GPU поддержки в самих инструментах.
Сколько VRAM нужно для локальной LLM: ориентиры
Потребление видеопамяти складывается из трёх частей: веса модели, KV-кэш контекста и служебные буферы рантайма. Веса зависят от числа параметров и типа квантования, KV-кэш растёт вместе с длиной контекста и числом параллельных запросов.
Ориентир по весам даёт пример выше: одна и та же MoE-модель занимает 58,4 ГБ в квантованном виде и 354 ГБ в BF16 (карточка модели). Разница почти в шесть раз, и получена она только за счёт квантизации.
Универсальной формулы нет: у dense-моделей и MoE расход считается по-разному, а KV-кэш при длинном контексте легко съедает больше памяти, чем сами веса. Считать нужно по фактическому потреблению в мониторинге и обязательно с KV-кэшем, а не только по размеру файла модели. Эту ошибку разбирали в материале о том, как выбирать GPU для локальных LLM в 2026 году.
Две RTX 3090 или одна карта с большей памятью
Второй путь - одна карта с большим объёмом VRAM. Он избавляет от обмена по PCIe и от зависимости от multi-GPU поддержки: модель целиком лежит на одном устройстве.
Что учитывать при сравнении:
- Ёмкость. Две 3090 дают 48 ГБ суммарно. Флагманские потребительские карты отличаются по этому параметру: у RTX 4090 те же 24 ГБ, что у 3090, то есть по памяти апгрейда не будет, у RTX 5090 - 32 ГБ. Карты с 48 ГБ и больше относятся к профессиональному сегменту.
- Стоимость. Цены зависят от рынка и момента, поэтому конкретные суммы здесь не приводим. Общий принцип: одна карта с большим объёмом памяти обычно дороже двух 3090 при сопоставимой ёмкости.
- Сложность. Две карты требуют блока питания с запасом, места в корпусе, нормального продува и разбирательств с рантаймом. Одна карта проще и предсказуемее.
- Сценарии. Если задачи помещаются в 24 ГБ и не распараллеливаются, вторая 3090 не окупится. Если нужны крупные модели и длинные контексты, две 3090 могут оказаться дешевле.
Экономику такого сравнения на примере двух карт по 20 ГБ против одной 3090 разбирали в статье про сборку AI-сервера на двух RTX 3080 20GB. Похожий расчёт по памяти, PCIe и питанию есть в материале про RTX 2000 Ada 16 ГБ рядом с RTX 4070 Super.
Итог: кому вторая RTX 3090 даст пользу, а кому нет
Вторая 3090 оправдана в трёх случаях: вы упираетесь в 24 ГБ и готовы разбираться с multi-GPU рантаймами; вам нужно параллелить независимые задачи; вы хотите запас по памяти под длинные контексты и крупные квантизованные модели. Она не оправдана, если весь ваш софт работает на одной карте и всё помещается в 24 ГБ.
Чек-лист для владельца одной 3090, который думает о второй:
- Проверьте, упоминает ли документация ваших инструментов multi-GPU, tensor parallel или выбор устройства.
- Замерьте время типовых задач на одной карте.
- Добавьте вторую карту и повторите замер, следя за загрузкой через nvidia-smi.
- Если вторая карта не загружается, ищите не ускорение, а параллелизм: разнесите LLM и генерацию по разным устройствам.
- Если и это не нужно, вложение не окупится. Тогда вторая карта останется запасом под крупные модели и длинные контексты.
В исходном кейсе вторая 3090 пока простаивает именно потому, что вопрос был про ускорение (обсуждение на r/LocalLLaMA). Правильнее начать с проверки загрузки карт на своих задачах, а уже потом решать, нужен ли multi-GPU рантайм или достаточно развести инструменты по устройствам.