Перейти к содержанию
Публикация AiManual

Две RTX 3060 или одна RTX 3090 для локального LLM-сервера в 2026 году

Сравниваем две RTX 3060 12 ГБ и одну RTX 3090 24 ГБ для локального LLM-сервера: как считать VRAM, KV-кэш и offload, проверить multi-GPU и PCIe, оценить 27B dens

Коротко

Что будет в материале

  1. 01

    Короткий ответ: RTX 3090 или две RTX 3060 для LLM

  2. 02

    VRAM: почему 12 + 12 ГБ не равны одной RTX 3090 24 ГБ

  3. 03

    Как распределить модель между двумя GPU

  4. 04

    Пропускная способность памяти и ограничения PCIe

Короткий ответ: RTX 3090 или две RTX 3060 для LLM

Если сервер должен запускать одну крупную локальную модель с минимальным числом программных условий, RTX 3090 24 ГБ обычно выглядит более предсказуемым выбором. У неё единый пул VRAM, проще подбор рантайма и меньше зависимость от схемы PCIe на материнской плате.

Две RTX 3060 12 ГБ дают 24 ГБ суммарной видеопамяти, но эти 24 ГБ находятся в двух отдельных устройствах. Модель должна уметь распределять веса и вычисления между GPU. Поэтому конфигурация 2 x RTX 3060 не превращается автоматически в аналог одной RTX 3090 24 ГБ.

Для домашнего LLM-сервера с работой 24/7, 32 ГБ системной RAM и моделями уровня 27B dense или MoE отправной точкой чаще становится RTX 3090. Две RTX 3060 оправданы, когда карты уже доступны по хорошей цене, материнская плата поддерживает нужную схему PCIe, а выбранный backend точно умеет работать с multi-GPU. Итог зависит от модели, квантования, контекста, числа параллельных запросов и требований к скорости.

Когда одна RTX 3090 выглядит более предсказуемо

RTX 3090 с 24 ГБ VRAM удобнее для сценария «одна модель на сервере». Рантайму не приходится делить слои между двумя адресными пространствами, синхронизировать несколько устройств и выбирать баланс загрузки. Это сокращает количество переменных при запуске и диагностике.

  • Вся видеопамять доступна одному GPU как единый адресуемый ресурс.
  • Проще оценить, помещаются ли веса, KV-кэш и временные буферы.
  • Меньше требований к числу PCIe-линий и расположению слотов.
  • Проще искать причину сбоя, перегрева или нехватки памяти.
  • Одна карта оставляет больше места внутри корпуса для воздушного потока.

RTX 3090 не отменяет проверку состояния конкретной карты. Для бывшего в употреблении экземпляра нужно оценить работу вентиляторов, температурный режим, состояние памяти, разъёмы питания и стабильность под длительной нагрузкой. Крупная карта с 24 ГБ может оказаться практичнее двух малых карт, но она всё равно требует подходящего корпуса, блока питания и охлаждения.

Когда две RTX 3060 могут быть разумным компромиссом

Две RTX 3060 имеют смысл при другой исходной логике. Пользователь может уже владеть одной картой, найти вторую по приемлемой цене или планировать несколько независимых задач. В последнем случае каждая GPU обслуживает отдельный процесс, и распределять одну модель между устройствами не требуется.

  • Карты доступны дешевле одной RTX 3090 с сопоставимой задачей по памяти.
  • Нужный рантайм подтверждённо поддерживает multi-GPU для выбранного формата модели.
  • Материнская плата предоставляет два полноразмерных слота с подходящими режимами PCIe.
  • Корпус пропускает воздух между картами и оставляет место для кабелей.
  • Пользователь готов самостоятельно тестировать драйвер, CUDA, backend и распределение нагрузки.

Экономия на покупке может исчезнуть после расходов на новую материнскую плату, корпус, дополнительные вентиляторы, блок питания и настройку. Две карты подходят энтузиасту, который принимает сложность конфигурации как часть задачи. Для сервера, который должен работать без постоянного ручного контроля, единая RTX 3090 чаще снижает количество потенциальных отказов.

VRAM: почему 12 + 12 ГБ не равны одной RTX 3090 24 ГБ

Сумма 12 + 12 ГБ корректна только как общий физический объём памяти двух GPU. У каждой RTX 3060 остаётся собственные 12 ГБ, собственный контроллер памяти и собственный адресный диапазон. Рантайм должен явно разложить модель по устройствам или отправить разные процессы на разные карты.

У RTX 3090 все 24 ГБ находятся на одном устройстве. Это особенно удобно, когда отдельный слой, матрица или набор служебных буферов не помещается в 12 ГБ. В конфигурации с двумя RTX 3060 распределение может помочь, но свободная память второй карты не становится мгновенным продолжением первой.

Что занимает память при инференсе LLM

Память под запуск модели можно оценивать по формуле:

VRAM total = веса модели + KV-кэш + временные буферы + overhead рантайма

Каждый компонент зависит от настроек:

  1. Веса модели. Их размер определяется числом параметров, форматом хранения и квантованием.
  2. KV-кэш. Он растёт вместе с длиной контекста и числом одновременно обрабатываемых последовательностей. При длинном контексте именно KV-кэш может стать причиной ошибки нехватки памяти.
  3. Временные буферы. Backend выделяет память под промежуточные вычисления, рабочие тензоры и операции загрузки.
  4. Служебные данные. В эту категорию входят структуры CUDA, память самого рантайма и данные для токенизации или обработки запросов.
  5. CPU-offload. Часть весов или вычислений можно держать в системной RAM, если это поддерживает конкретная связка модели и backend.

Два файла с одинаковым количеством параметров могут занимать разный объём памяти. Причины включают формат весов, размер групп квантования, служебные метаданные, архитектуру модели, размер контекста и настройки batch size.

Как квантование меняет требования к VRAM

Квантование уменьшает размер весов за счёт хранения параметров в формате с меньшей разрядностью. Q4, Q8, FP16 и BF16 дают разные требования к памяти и разное качество работы. Один и тот же 27B-чекпойнт в этих форматах нельзя оценивать по одному числу параметров.

Полезно отделять математическую нижнюю границу от реального файла. Для 27 млрд параметров арифметика выглядит так:

27 000 000 000 x 4 бита / 8 = около 13,5 GB
27 000 000 000 x 8 бит / 8 = около 27 GB
27 000 000 000 x 16 бит / 8 = около 54 GB

Это расчёт для самих значений параметров. В реальном формате добавляются масштабы квантования, метаданные и память под работу backend. К полученному размеру нужно добавить KV-кэш и запас для runtime. Поэтому Q4 может стать кандидатом для 24 ГБ VRAM, а Q8 или BF16 требуют отдельной проверки и, вероятно, offload или более крупной конфигурации.

Перед покупкой полезно выполнить четыре шага:

  1. Уточнить точный формат файла: GGUF, GPTQ, AWQ, EXL2, safetensors или другой вариант.
  2. Посмотреть размер весов и требования конкретного backend.
  3. Добавить память под выбранный контекст, KV-кэш и рабочие буферы.
  4. Оставить запас, потому что запуск модели впритык часто приводит к нестабильности после увеличения контекста или появления второго запроса.

Практическая методика оценки памяти с учётом квантования, KV-кэша и CPU-offload разобрана в статье о самостоятельной проверке, помещается ли локальная LLM в память.

Сколько VRAM нужно для локальной LLM 27B

Универсального числа для 27B нет. Сначала нужно определить, это dense-модель или MoE, в каком формате хранятся веса, какой контекст требуется и сколько запросов обрабатывается одновременно.

Тип моделиЧто хранится и считаетсяЧто проверить
27B denseВсе параметры участвуют в каждом токене. Веса занимают основную часть памяти.Формат весов, размер файла, KV-кэш, контекст, batch size и запас VRAM.
27B MoEНа одном токене активна часть экспертов, но нужные веса экспертов должны где-то находиться.Общий объём параметров, активные параметры, схема загрузки экспертов и поддержка offload.
27B с частичным offloadЧасть данных хранится в системной RAM и передаётся через CPU и PCIe.Свободная RAM, пропускная способность памяти, задержки обмена и поведение backend.

Для 27B dense RTX 3090 чаще даёт более простой путь к запуску низкоразрядной версии, если размер весов и контекст укладываются в доступный запас. Две RTX 3060 могут помочь только при корректном распределении слоёв или тензоров. Для MoE название «27B» тем более недостаточно: активные параметры описывают вычислительную нагрузку на токен, а объём всех весов определяет требования к хранению.

В разборе бюджетных GPU для локальных моделей уровня 27B отдельно показано, почему VRAM нужно считать вместе с KV-кэшем, runtime, операционной системой и охлаждением: сравнение вариантов для 27B Q4.

Как распределить модель между двумя GPU

Multi-GPU может работать по разным схемам. Выбор зависит от архитектуры модели и рантайма. Сам факт, что в системе видны две видеокарты, не гарантирует загрузку одной LLM на обеих.

Распределение слоёв и tensor parallelism

При распределении слоёв разные части последовательности модели размещаются на разных устройствах. Один GPU обрабатывает свою часть слоёв и передаёт результат следующему. Такой подход позволяет использовать суммарную память карт, но требует корректной балансировки.

Tensor parallelism делит отдельные тензорные операции между несколькими GPU. Устройства чаще обмениваются промежуточными данными и синхронизируются. При высокой скорости меж-GPU обмена это может работать эффективно. При обмене через ограниченный PCIe результат сильнее зависит от задержек и пропускной способности шины.

Есть и третий сценарий, запуск независимых процессов. В таком режиме одна RTX 3060 обслуживает одну модель или очередь, вторая карта работает со второй задачей. Память не складывается, зато процессы меньше мешают друг другу. Каждая модель должна помещаться в доступную память своей карты с учётом собственного KV-кэша.

Что проверить в vLLM, llama.cpp и Ollama

РантаймЧто проверить перед покупкойРиск для 2 x RTX 3060
vLLMПоддержку tensor parallelism для нужной версии, архитектуры модели, формата весов и CUDA-окружения.Режим может требовать конкретного распределения памяти и заметного обмена между GPU.
llama.cppПоддержку multi-GPU, layer offload, split mode и выбранного формата модели в актуальной сборке.Автоматическое распределение может дать плохой баланс или оставить мало памяти под KV-кэш.
OllamaКак текущая версия выбирает устройства, работает с конкретной моделью и реагирует на нехватку VRAM.Упрощённый интерфейс скрывает часть настроек, поэтому результат нужно проверять на рабочем сценарии.

Проверка должна проходить на той версии драйвера, CUDA и рантайма, которую планируется использовать на сервере. Поддержка multi-GPU у проекта не означает одинаковое поведение для всех архитектур, форматов и размеров контекста. Ищите в документации термины multi-GPU, layer offload, tensor parallelism, device mapping и описание ограничений конкретного backend.

Сравнение конфигураций с несколькими GPU и подробный разбор требований к памяти есть в материале о добавлении RTX 2000 Ada к RTX 4070 Super: multi-GPU, PCIe и RAM для моделей 27B.

Почему RTX 3060 SLI для нейросетей - неточная формулировка

SLI относится к игровому распределению кадров и графических задач. Инференс LLM проходит через вычислительный фреймворк, CUDA и функции конкретного рантайма. Для запуска модели важны layer offload, device mapping или tensor parallelism, а не игровой профиль SLI.

Поисковый запрос «RTX 3060 SLI для нейросетей» часто скрывает другой вопрос: умеет ли выбранная программа разделить веса, промежуточные тензоры и KV-кэш между устройствами. Ответ нужно искать в документации backend и подтверждать коротким запуском тестовой модели.

Пропускная способность памяти и ограничения PCIe

Объём VRAM отвечает за вместимость модели. Memory bandwidth влияет на то, насколько быстро GPU может читать веса и выполнять последовательную генерацию. Эти параметры связаны, но не заменяют друг друга.

Почему bandwidth важнее, чем просто число CUDA-ядер

При генерации токенов GPU многократно обращается к весам модели. Для небольшого batch size скорость часто ограничивается перемещением данных в памяти и задержками отдельных операций. Увеличение числа CUDA-ядер само по себе не гарантирует пропорциональный рост tok/s.

RTX 3090 относится к более производительному классу и имеет более широкую подсистему памяти, чем RTX 3060. Две RTX 3060 могут увеличить общий объём доступных ресурсов, но каждая карта сохраняет собственную пропускную способность. Между устройствами добавляется обмен данными, поэтому суммарная производительность не складывается линейно.

Реальный тест нужно проводить с одинаковыми условиями:

  • одна версия модели и одинаковый формат квантования;
  • одинаковая длина контекста;
  • одинаковые batch size и число параллельных запросов;
  • одинаковый режим CPU-offload;
  • одинаковая версия драйвера, CUDA и backend;
  • отдельная фиксация скорости prompt processing и token generation.

На длинном контексте поведение может измениться из-за роста KV-кэша. Влияние объёма VRAM, способа загрузки и контекста на скорость генерации подробно разобрано в материале о Qwen3.8-Flash-Next в llama.cpp: как VRAM и контекст меняют результат.

Что может ограничить две карты на одной материнской плате

Перед установкой двух RTX 3060 нужно проверить конкретную платформу, а не только список характеристик GPU.

  • Слоты. Нужны два механически подходящих слота. Между ними должно остаться место для забора воздуха.
  • PCIe-линии CPU. Материнская плата может переключать верхние слоты в режимы x16/x8, x8/x8 или использовать часть линий чипсета.
  • Режимы PCIe. Для одной и той же сборки встречаются PCIe 3.0 и PCIe 4.0. PCIe 4.0 x8 и PCIe 3.0 x4 дают разную полосу обмена.
  • BIOS. При двух устройcтвах могут потребоваться настройки Above 4G Decoding, Resizable BAR или выбор первичного адаптера, если это требуется конкретной платформе и драйвером.
  • Питание. Нужно проверить число разъёмов, отдельные кабели и запас блока питания с учётом CPU, накопителей и вентиляторов.
  • Обмен GPU-to-GPU. Peer-to-peer доступ может зависеть от материнской платы, драйвера, топологии PCIe и настроек backend. При отсутствии подходящего пути данные могут идти через хост.

Схема x16/x8 выглядит хорошо на бумаге, но для LLM важен фактический путь данных между устройствами. Слот x4 через чипсет может ограничить распределённый запуск сильнее, чем ожидалось по сумме VRAM.

27B dense, MoE и 32 ГБ системной RAM: разбор сценариев

Сценарий 1: квантованная 27B dense-модель

В dense-модели все параметры участвуют в обработке каждого токена. Значит, нужно разместить весь набор весов с учётом формата, а затем оставить память под KV-кэш и служебные операции.

  1. Сначала сравните размер файла весов со свободной VRAM.
  2. Затем добавьте память для нужной длины контекста.
  3. Проверьте запас под runtime overhead и временные буферы.
  4. Если используется две RTX 3060, убедитесь, что backend умеет разделить модель с учётом двух границ по 12 ГБ.
  5. Проверьте запуск с реальным контекстом, а не только загрузку файла.

У RTX 3090 24 ГБ модель получает единое пространство памяти. Для низкоразрядной 27B dense-версии это обычно удобнее с точки зрения размещения слоёв и KV-кэша. У двух RTX 3060 появляется шанс использовать суммарную память, но любое неравномерное распределение снижает запас: одна карта может заполниться раньше второй.

Короткий контекст и один запрос создают более мягкие условия. Длинный контекст, RAG и несколько одновременных пользователей быстро увеличивают KV-кэш. Поэтому тест «модель загрузилась» не подтверждает готовность сервера к рабочей нагрузке.

Сценарий 2: MoE-модель

В MoE нужно разделять три понятия: общее число параметров, активные параметры на токен и фактический объём весов, который требуется хранить.

  • Общие параметры описывают весь набор экспертов и общих слоёв.
  • Активные параметры показывают, какая часть вычислений используется для конкретного токена.
  • Размещение весов определяет, сколько VRAM и RAM нужно для загрузки модели.

Низкое число активных параметров может уменьшить вычислительную нагрузку, но не освобождает автоматически память под неактивные эксперты. Часть экспертных весов может загружаться в RAM или подкачиваться по мере необходимости, если это поддерживает конкретная реализация. Такой режим меняет задержки и требования к PCIe.

Для MoE на двух RTX 3060 нужно заранее выяснить, как backend распределяет экспертов и KV-кэш. Если он делит только отдельные слои, свободная память карт может использоваться иначе, чем ожидается по описанию модели.

Что означает 32 ГБ системной RAM на практике

32 ГБ RAM не равны дополнительным 32 ГБ быстрой видеопамяти. Часть памяти занимает операционная система, драйверы, рантайм, кэш файлов, база RAG и другие сервисы. Под offload остаётся только свободный остаток.

Если веса частично переносятся в RAM, GPU обращается к данным через CPU и PCIe. Модель может запуститься, но задержка генерации способна вырасти, а стабильность будет зависеть от режима подкачки и пропускной способности платформы. Swap на накопителе помогает пережить пик выделения памяти, но не превращает сервер в полноценную VRAM-конфигурацию.

Для домашней системы с 32 ГБ RAM нужно заранее решить, какие процессы будут работать рядом с LLM. RAG, векторная база, веб-интерфейс, прокси и мониторинг конкурируют за память. Если сервер предназначен для одной модели без фоновых сервисов, 32 ГБ использовать проще. При нескольких процессах запас быстро сокращается.

Сервер 24/7: питание, охлаждение и стабильность

Почему две RTX 3060 сложнее разместить и охладить

Две карты занимают два слота и создают два источника тепла. Верхняя карта может ограничить доступ воздуха к нижней, особенно если между слотами мало свободного пространства. Толщина конкретных исполнений RTX 3060 различается, поэтому проверять нужно размеры выбранных моделей.

  • Сверьте расстояние между PCIe-слотами и толщину обеих карт.
  • Проверьте, куда направлены вентиляторы и где находится вход воздуха.
  • Оставьте свободное пространство возле кожухов и разъёмов питания.
  • Убедитесь, что передняя и задняя вентиляция корпуса не перекрыта кабелями.
  • Проверьте температуру обеих карт под одинаковой длительной нагрузкой.

Одна RTX 3090 упрощает воздушный поток, но сама карта может концентрировать много тепла в одном месте. У двух RTX 3060 тепло распределено по двум устройствам, зато общий воздушный поток внутри корпуса становится сложнее. В обоих случаях результат зависит от исполнения GPU, корпуса, оборотов вентиляторов и температуры помещения.

Что учитывать при круглосуточной нагрузке

Сервер 24/7 нужно оценивать по длительной работе, а не по успешному запуску на несколько минут. В мониторинге полезно сохранять:

  • температуру GPU и памяти;
  • загрузку GPU, VRAM и системной RAM;
  • потребление и частоты;
  • ошибки CUDA и сообщения драйвера;
  • время ответа и скорость генерации;
  • перезапуски процесса и причины остановки.

Сервису пригодятся журналирование, автоматический запуск после перезагрузки и контролируемый restart при зависании. Для Linux это может быть systemd, контейнер с политикой перезапуска или отдельный supervisor. Настройка не должна скрывать ошибки: автоматический перезапуск полезен только вместе с журналом причин.

Шум тоже входит в цену владения. Две карты могут работать тише по отдельности, но корпусу придётся удалять суммарное тепло. RTX 3090 проще обслуживать как одну GPU, зато её вентиляторы и память могут сильнее влиять на акустический комфорт. Пыль, высохшая термопаста и забитые радиаторы особенно быстро проявляют себя при постоянной генерации.

Итоговый выбор: кому подходит каждая конфигурация

Выбирайте RTX 3090, если приоритет - запуск крупной модели без лишних условий

RTX 3090 подходит пользователю, которому нужен один локальный LLM-сервер с крупной моделью, единым объёмом VRAM и понятной диагностикой. Она предпочтительнее, когда нет желания подбирать распределение слоёв, разбираться с топологией PCIe и устранять несовместимость двух GPU.

  • Нужен один процесс с моделью, которая близка к лимиту памяти.
  • Планируется длинный контекст, RAG или несколько последовательностей.
  • Важны простая установка и минимальное число программных условий.
  • Корпус рассчитан на одну крупную видеокарту.
  • Есть подходящий блок питания и подтверждена стабильность конкретного экземпляра.

При покупке бывшей в употреблении RTX 3090 проверяйте память и охлаждение под длительной нагрузкой. Единый пул VRAM упрощает запуск, но не исправляет аппаратные проблемы карты.

Выбирайте две RTX 3060, если готовы проверять multi-GPU ради гибкости

Две RTX 3060 разумны, когда карты уже есть, их цена заметно выгоднее альтернативы, а программный стек заранее выбран и протестирован. Конфигурация особенно интересна для двух независимых задач: например, отдельный процесс для генерации и отдельный процесс для эмбеддингов или второй модели, если требования каждого процесса помещаются в 12 ГБ.

  • Материнская плата физически размещает обе карты.
  • Процессор и чипсет предоставляют подходящие PCIe-линии.
  • Backend подтверждает распределение модели между GPU.
  • Блок питания и корпус рассчитаны на суммарную нагрузку.
  • Есть время на диагностику драйверов, CUDA, охлаждения и баланса памяти.

Две RTX 3060 становятся невыгодными, когда ради них приходится менять всю платформу, покупать дорогой корпус, усиливать охлаждение и мириться с низкой скоростью из-за CPU-offload. Экономьте на видеокартах только после расчёта полной цены владения.

Чек-лист перед покупкой

  1. Запишите точную модель каждой GPU и подтвердите объём VRAM, тип охлаждения и число разъёмов питания.
  2. Проверьте материнскую плату: размеры слотов, режимы x16/x8/x4, поколения PCIe и зависимость линий от чипсета.
  3. Сверьте корпус с длиной и толщиной карт, расстоянием между слотами и расположением вентиляторов.
  4. Рассчитайте блок питания по всей системе и проверьте отдельные кабели для GPU.
  5. Уточните версию драйвера, CUDA и backend, который будет обслуживать модель.
  6. Проверьте формат весов, размер файла, контекст, batch size, KV-кэш и возможность offload.
  7. Оставьте свободную системную RAM после загрузки ОС, рантайма, RAG и прочих сервисов.
  8. Для двух GPU найдите в документации описание multi-GPU, layer offload, tensor parallelism или device mapping.
  9. Запустите тестовую модель с рабочим контекстом и измерьте prompt processing, token generation, потребление памяти и стабильность.
Критерий1 x RTX 3090 24 ГБ2 x RTX 3060 12 ГБ
Единый объём VRAMДа, 24 ГБ на одном устройствеНет, 12 ГБ на каждой карте
Одна крупная модельПроще разместить и диагностироватьНужна поддержка распределения между GPU
Независимые задачиМожно запускать процессы с разделением ресурсов, но одна карта обслуживает их совместноУдобно назначить разные процессы на разные карты
PCIeМеньше требований к слотамНужно проверить два слота, линии и топологию
ОхлаждениеПроще организовать поток воздуха вокруг одной картыСложнее из-за расстояния между картами и дополнительного источника тепла
НастройкаОбычно короче путь до рабочего запускаБольше зависимостей от версии ПО и схемы распределения
АпгрейдПроще заменить карту на более вместительнуюВторую карту можно добавить постепенно, если платформа это допускает
24/7Меньше компонентов, но высокие требования к охлаждению конкретной картыБольше компонентов, кабелей и точек для мониторинга

Для одной крупной модели и минимального обслуживания выбирайте RTX 3090 24 ГБ, если конкретная карта исправна и система выдерживает её тепловую нагрузку. Две RTX 3060 выбирайте при подтверждённой поддержке multi-GPU, подходящей платформе и сценарии с несколькими независимыми задачами или выгодной покупкой уже доступных карт.

Перед окончательным решением подставьте в чек-лист точное название модели, формат квантования, нужный контекст и выбранный рантайм. Такой расчёт показывает, даст ли конфигурация реальный запас памяти и приемлемую скорость, или сумма 12 + 12 ГБ останется только красивой цифрой в спецификации.

Подписаться на канал