Почему две RTX 3080 20GB вместо одной RTX 3090: предпосылки и экономика
Прямой ответ: экономически выгодно. Две модифицированные RTX 3080 с 20 ГБ видеопамяти каждая обходятся дешевле одной RTX 3090, давая при этом 40 ГБ суммарной VRAM против 24 ГБ у флагмана. Разница в 16 ГБ критична для инференса больших языковых моделей, которые на одной 3090 просто не запускаются. Плата за это - отсутствие NVLink и ограничения пропускной способности PCIe, но для большинства сценариев инференса это не узкое место.
Решение родилось из практической потребности: цены на RTX 3090 продолжают расти, а доступность падает. Модифицированные RTX 3080 20GB с Alibaba заполнили нишу бюджетного доступа к большому объёму видеопамяти. Разберём экономику, технические ограничения и реальную производительность этой конфигурации.
Рыночный контекст: почему RTX 3090 стала недосягаемой
RTX 3090 с 24 ГБ VRAM долгое время оставалась стандартом для AI-энтузиастов. Однако к середине 2026 года ситуация изменилась. Рост спроса на GPU со стороны локальных AI-проектов, дефицит чипов и переориентация производителей на профессиональные ускорители привели к тому, что цены на новые и б/у RTX 3090 закрепились выше отметки в $1200–1500. На Alibaba и eBay исправные экземпляры редко опускаются ниже $1100 без учёта доставки.
Одновременно вырос запрос на запуск моделей класса Llama 3 70B и Mixtral 8x22B, требующих более 24 ГБ даже в 4-битном квантовании. Одна RTX 3090 перестала справляться с этой задачей. Рынок начал искать альтернативы - и нашёл их в модифицированных картах с увеличенным объёмом памяти.
RTX 3080 20GB с Alibaba: что это за карты и сколько они стоят
RTX 3080 20GB - это стандартные карты архитектуры Ampere (GA102), прошедшие модификацию: заводская память объёмом 10 ГБ распаивается и заменяется на чипы по 2 ГБ каждый, что даёт итоговые 20 ГБ на карту. Процедура выполняется специализированными мастерскими в Китае, после чего карты проходят тестирование и выставляются на Alibaba.
Средняя цена одной такой карты на платформе составляет $550–650. Доставка в Россию обходится в $80–120 за штуку. Таможенные пошлины при превышении порога в 200 евро добавляют 15% к сумме превышения. При заказе двух карт итоговый расчёт выглядит так:
- Стоимость карт: 2 × $600 = $1200
- Доставка: 2 × $100 = $200
- Таможенная пошлина (15% от суммы свыше €200): примерно $150
- Итого: около $1550 за комплект из двух карт
Одна RTX 3090 в аналогичных условиях обойдётся в $1200–1400 с доставкой и пошлиной. Разница в $150–350 при двукратном преимуществе по памяти - весомый аргумент.
Сравнение затрат: 2x RTX 3080 20GB vs 1x RTX 3090
| Параметр | 2x RTX 3080 20GB | 1x RTX 3090 |
|---|---|---|
| Суммарная VRAM | 40 ГБ | 24 ГБ |
| Цена карт (Alibaba) | ~$1200 | ~$1200–1400 |
| Доставка + пошлина | ~$350 | ~$200–250 |
| Итоговая стоимость | ~$1550 | ~$1400–1650 |
| Цена за 1 ГБ VRAM | ~$39 | ~$58–69 |
| NVLink | Нет | Есть (но редко используется в инференсе) |
Даже при консервативном подсчёте две RTX 3080 20GB дают на 67% больше видеопамяти при сопоставимой или меньшей стоимости. Для задач, где объём памяти критичен, выбор очевиден.
40 ГБ видеопамяти: какие возможности это открывает для инференса LLM
Объём видеопамяти - главный ограничитель при локальном запуске больших моделей. Процессор может быть медленным, шина - узкой, но если модель не помещается в VRAM, инференс либо невозможен, либо деградирует до скорости в 1–2 токена в секунду из-за офлоадинга на системную память.
40 ГБ суммарной VRAM снимают это ограничение для широкого класса моделей. Конфигурация позволяет загружать модели, которые не помещаются в 24 ГБ, и открывает сценарии одновременной работы с несколькими нейросетями.
Запуск Llama 3 70B и других гигантов на 40 ГБ
Llama 3 70B в 4-битном квантовании (Q4_K_M) требует около 40 ГБ видеопамяти. На одной RTX 3090 с 24 ГБ модель не запускается даже с агрессивным квантованием - часть слоёв неизбежно уходит в системную RAM, скорость падает до 0.5–1 токена в секунду. Две RTX 3080 20GB вмещают модель целиком, обеспечивая 8–12 токенов в секунду на генерации при распределении слоёв через pipeline parallelism.
Mixtral 8x22B в 4-битном квантовании занимает около 44 ГБ - также за пределами возможностей одной 3090. С двумя 3080 модель запускается с небольшим офлоадингом или полностью помещается при использовании квантования IQ3_M. Команда для запуска через llama.cpp с разделением по GPU:
./llama-cli -m mixtral-8x22b-Q4_K_M.gguf -ngl 999 -ts 10,11
Параметр -ts 10,11 задаёт разделение тензоров между двумя картами, позволяя эффективно использовать суммарные 40 ГБ.
Одновременная работа с несколькими моделями
40 ГБ видеопамяти открывают сценарий, недоступный на одной 3090: параллельный запуск двух разных моделей. Практический пример - связка LLM для генерации текста и Stable Diffusion для создания изображений. Llama 3 8B в Q4 занимает около 6 ГБ, SDXL - около 8 ГБ. На двух картах это распределяется естественным образом: одна карта держит языковую модель, вторая - диффузионную.
Другой сценарий - сравнение двух LLM в реальном времени. Например, Llama 3 8B и Qwen 2.5 14B можно загрузить на разные GPU и подавать одинаковые промпты, анализируя разницу в ответах. Технически это реализуется через переменную окружения CUDA_VISIBLE_DEVICES:
CUDA_VISIBLE_DEVICES=0 ./llama-server -m llama3-8b.gguf --port 8080
CUDA_VISIBLE_DEVICES=1 ./llama-server -m qwen2.5-14b.gguf --port 8081
Технические ограничения: PCIe, межпроцессорное взаимодействие и узкие места
Две карты без NVLink общаются через шину PCIe. Это накладывает ограничения, которые нужно понимать до покупки. Главный вопрос: насколько пропускная способность PCIe влияет на скорость инференса?
Пропускная способность PCIe и её влияние на инференс
PCIe 4.0 x16 обеспечивает пропускную способность около 32 ГБ/с в одну сторону. При инференсе с pipeline parallelism данные между картами передаются один раз за проход: активации одного набора слоёв пересылаются на следующую карту. Объём передаваемых данных измеряется мегабайтами, а не гигабайтами. Для Llama 3 70B размер активаций между слоями составляет порядка 16–32 МБ на токен. При скорости генерации 10 токенов в секунду это 160–320 МБ/с - менее 1% пропускной способности PCIe 4.0.
Узким местом PCIe становится при тензорном параллелизме, где карты обмениваются данными на каждом шагу вычислений внутри одного слоя. Однако для домашнего AI-сервера тензорный параллелизм редко оправдан: pipeline parallelism даёт сопоставимую скорость генерации при значительно меньших требованиях к межсоединению. Подробнее о распределении моделей по GPU мы писали в разборе memory-bound архитектуры и сплитинга.
Отсутствие NVLink: когда это становится проблемой
NVLink у RTX 3090 обеспечивает прямое соединение карт со скоростью 112.5 ГБ/с - примерно в 3.5 раза быстрее PCIe 4.0 x16. Это преимущество раскрывается в трёх сценариях:
- Тренировка моделей с большими батчами, где градиенты синхронизируются на каждом шаге
- Инференс с тензорным параллелизмом при высоких частотах запросов (batching > 16)
- Задачи, требующие частого обмена большими объёмами данных между картами
Для инференса одной модели с малым батчом (1–4 параллельных запроса) отсутствие NVLink практически незаметно. Pipeline parallelism передаёт данные между картами один раз за прямой проход, и задержка PCIe тонет в общем времени вычислений. Если ваша задача - запустить большую модель и получать ответы с приемлемой скоростью, две RTX 3080 20GB справляются.
Для каких задач сборка оправдана, а для каких - нет
Чёткое разделение сценариев помогает принять решение без иллюзий. Конфигурация с двумя RTX 3080 20GB - узкоспециализированный инструмент, а не универсальное решение.
Сценарии-победители: когда 2x3080 20GB лучше 1x3090
- Инференс Llama 3 70B и аналогичных моделей. Единственный способ запустить модель целиком в VRAM без офлоадинга на CPU. Скорость генерации 8–12 токенов/с - достаточно для диалогового взаимодействия.
- Одновременный запуск LLM и Stable Diffusion. Одна карта держит языковую модель, вторая генерирует изображения. Полезно для пайплайнов «текст → описание → картинка».
- Обработка видео и рендеринг. 40 ГБ позволяют работать с видео высокого разрешения без фрагментации кадров. Blender и DaVinci Resolve эффективно утилизируют две карты.
- Эксперименты с несколькими моделями. Запуск двух разных LLM для сравнения ответов или A/B-тестирования промптов.
Сценарии-проигравшие: когда лучше взять одну 3090
- Тренировка моделей. Отсутствие NVLink и необходимость частой синхронизации градиентов делают две 3080 медленнее одной 3090 при обучении.
- Игры. SLI мёртв, две карты не дают прироста в современных играх. Одна RTX 3090 быстрее и стабильнее.
- Инференс с большими батчами. При одновременной обработке 16+ запросов тензорный параллелизм на 3090 с NVLink выигрывает у pipeline parallelism на двух 3080.
- Задачи с жёсткими требованиями к latency. Межкарточная задержка в 10–50 микросекунд критична для real-time приложений вроде голосовых ассистентов.
Выбор сводится к простому вопросу: что важнее - объём памяти или пиковая производительность на модель? Если первое - две RTX 3080 20GB. Если второе - одна RTX 3090. О других конфигурациях для локального инференса читайте в материале про AI-налог на железо и реальные бюджеты на GPU.
Практическое руководство: сборка и настройка сервера с двумя RTX 3080 20GB
Сборка двухкарточного AI-сервера требует внимания к трём компонентам: материнская плата, блок питания и охлаждение. Ошибка в любом из них приводит к нестабильной работе или выходу оборудования из строя.
Выбор комплектующих: материнская плата, БП, охлаждение
Материнская плата. Нужны два слота PCIe x16, работающих одновременно на скорости не ниже PCIe 3.0 x8 каждый. Подходящие чипсеты: X570/B550 (AMD), Z690/Z790 (Intel). Конкретные модели:
- MSI MAG X570S Tomahawk Max WiFi - два PCIe 4.0 x16 (x16/x4 или x8/x8)
- ASUS ProArt Z790-Creator WiFi - два PCIe 5.0 x16 (x16/x8)
- ASRock X570 Taichi - три слота, конфигурация x8/x8/x8
Проверьте схему линий PCIe в документации: некоторые платы заявляют два x16 слота, но второй работает через чипсет на скорости x4, что станет узким местом.
Блок питания. Каждая RTX 3080 потребляет до 320 Вт под нагрузкой. С учётом процессора (150–200 Вт) и запаса в 20% итоговая мощность: (320 × 2) + 200 = 840 Вт × 1.2 = 1000 Вт минимум. Рекомендуемые модели:
- Corsair RM1000x - 1000 Вт, полностью модульный, тихий
- be quiet! Dark Power 13 1000W - 80 Plus Titanium, для требовательных сборок
- Seasonic Prime TX-1000 - 12 лет гарантии, японские конденсаторы
Проверьте количество разъёмов PCIe 8-pin: каждая RTX 3080 требует два разъёма, итого четыре. Используйте отдельные кабели для каждой карты, а не разветвители.
Охлаждение. Две карты в корпусе выделяют до 640 Вт тепла. Карты с турбинным охлаждением (blower-style) предпочтительнее: они выбрасывают горячий воздух наружу, а не в корпус. Если карты с открытым охлаждением - обязателен корпус с хорошей вентиляцией и зазор между картами не менее одного слота. Корпуса:
- Fractal Design Meshify 2 - просторный, с mesh-передней панелью
- Lian Li O11 Dynamic - для кастомного водяного охлаждения
- Phanteks Enthoo Pro 2 - поддержка двух блоков питания, до 15 вентиляторов
Настройка ПО: драйверы, CUDA, тестирование
После физической сборки порядок настройки:
- Установите драйверы NVIDIA версии 550 или новее. Команда для Ubuntu:
sudo apt install nvidia-driver-550
sudo reboot
- Проверьте, что обе карты видны:
nvidia-smi
Вывод должен показать два GPU с 20 ГБ памяти каждый.
- Установите CUDA toolkit:
sudo apt install nvidia-cuda-toolkit
- Для работы с llama.cpp соберите его с поддержкой CUDA:
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make LLAMA_CUDA=1 -j
- Запустите модель с разделением по двум картам. Для Llama 3 70B Q4_K_M:
./llama-cli -m llama3-70b-Q4_K_M.gguf -ngl 999 -ts 10,11 -p "Привет, как дела?"
Параметр -ts 10,11 задаёт соотношение слоёв между GPU. Для 70B модели с 80 слоями это означает 40 слоёв на первой карте и 40 на второй. Подберите значения под свою модель: главное, чтобы суммарное потребление VRAM на каждой карте не превышало 20 ГБ.
Реальные тесты производительности: 2x RTX 3080 20GB vs RTX 3090
Цифры получены на тестовом стенде: Ryzen 9 7900X, 64 ГБ DDR5-6000, Ubuntu 24.04, драйвер NVIDIA 555, llama.cpp с поддержкой CUDA 12.5.
Инференс Llama 3 70B: 40 ГБ против 24 ГБ
| Конфигурация | Загрузка модели | Скорость генерации | Prefill (512 токенов) |
|---|---|---|---|
| 1x RTX 3090 (24 ГБ) | Не помещается, офлоадинг на CPU | 0.8 токенов/с | 45 секунд |
| 2x RTX 3080 20GB (40 ГБ) | Полностью в VRAM | 10.2 токенов/с | 3.2 секунды |
Результат однозначен: на одной 3090 Llama 3 70B практически непригодна для использования. Две 3080 дают комфортную скорость диалога.
Сравнение скорости на моделях, помещающихся в 24 ГБ
| Модель | 1x RTX 3090 | 2x RTX 3080 20GB | Разница |
|---|---|---|---|
| Llama 3 8B Q4_K_M | 98 токенов/с | 92 токенов/с | -6% |
| Llama 3 8B Q8_0 | 62 токенов/с | 58 токенов/с | -6.5% |
| Mixtral 8x7B Q4_K_M | 45 токенов/с | 41 токенов/с | -9% |
На моделях, помещающихся в 24 ГБ, одна RTX 3090 быстрее на 6–9%. Причина - отсутствие межкарточного обмена и чуть более высокие частоты ядра у 3090. Однако проигрыш в 6–9% по скорости компенсируется возможностью запуска моделей, которые на 3090 не работают вовсе. Для тех, кто ищет альтернативные конфигурации с большим объёмом VRAM, интересен опыт сборки на AMD Instinct V620 с 96 ГБ за $1050.
Риски и подводные камни при заказе RTX 3080 20GB с Alibaba
Покупка модифицированных карт - это компромисс между ценой и рисками. Понимание этих рисков и стратегия их минимизации - обязательная часть расчёта.
Как выбрать надёжного продавца и не получить брак
Критерии отбора продавца на Alibaba:
- Рейтинг не ниже 4.8 звёзд при количестве отзывов более 100
- Наличие реальных фотографий карт, а не рендеров
- Готовность предоставить скриншоты GPU-Z с объёмом памяти 20 ГБ до отправки
- Продавец зарегистрирован более двух лет назад
- Есть возможность оплаты через Alibaba Trade Assurance
Рекомендуется заказывать одну карту для тестирования перед покупкой второй. При получении проверьте:
- Фактический объём памяти через nvidia-smi или GPU-Z
- Отсутствие артефактов под нагрузкой (прогоните FurMark на 30 минут)
- Температуры памяти и ядра - не должны превышать 95°C и 85°C соответственно
- Стабильность работы на частотах, близких к референсным
Основные риски: некачественная пайка памяти, приводящая к деградации контактов через 3–6 месяцев; использование чипов памяти с повышенным износом; некорректный BIOS с нестабильной работой на штатных частотах.
Таможенные пошлины и доставка: считаем реальную цену
При заказе в Россию действуют правила: пошлина 15% от суммы превышения порога в 200 евро. Пример расчёта для двух карт по $600 каждая:
- Стоимость товара: $1200 (около €1100)
- Превышение порога: €1100 - €200 = €900
- Пошлина 15%: €900 × 0.15 = €135 (около $150)
- Доставка: $160–200 за две карты
- Итого сверх цены карт: $310–350
Сроки доставки: 15–30 дней стандартной почтой, 7–14 дней экспресс-доставкой (дороже на $50–80). Учитывайте возможные задержки на таможне - до двух недель в пиковые периоды. Гарантийный возврат при браке практически невозможен: стоимость обратной пересылки и пошлины делают эту операцию экономически бессмысленной. Покупка модифицированных карт - это осознанный риск в обмен на 40 ГБ видеопамяти по цене ниже рыночной.