Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

RTX 5090 vs workstation-карты: что выбрать для локального инференса LLM в 2026 году?

RTX 5090 или RTX 6000 Ada для локального инференса LLM? Сравниваем VRAM, NVLink, цену за гигабайт и реальные сценарии файнтюнинга. Цифры, таблицы и четкий ответ

Коротко

Что будет в материале

  1. 01

    VRAM как главный ограничитель: сколько памяти нужно разным LLM

  2. 02

    NVLink: мост к большим моделям или умирающий стандарт?

  3. 03

    Экономика гигабайта: сравниваем цену VRAM у RTX 5090 и workstation-карт

  4. 04

    Тонкая настройка на RTX 5090: миссия выполнима?

Выбор GPU для локального запуска больших языковых моделей (LLM) упирается в три цифры: объем видеопамяти, пропускная способность межсоединений и цена за гигабайт. RTX 5090 с ожидаемыми 24 ГБ GDDR7 закрывает инференс моделей до 13B и файнтюнинг 7B с оптимизациями. Для 70B+ и тонкой настройки без компромиссов нужны профессиональные карты - RTX 6000 Ada (48 ГБ) с поддержкой NVLink. Разница не в производительности чипа, а в возможности физически загрузить модель в память и объединить две карты в единый пул.

Эта статья - калькулятор решения. Мы разберем требования LLM к VRAM, механику NVLink, экономику железа и практические сценарии файнтюнинга. Никаких общих рекомендаций - только цифры, конфигурации и границы применимости.

VRAM как главный ограничитель: сколько памяти нужно разным LLM

Объем видеопамяти - первый фильтр. Модель либо помещается в VRAM целиком, либо вы упираетесь в offload на CPU/RAM с падением скорости в 5-10 раз. Параметры модели (7B, 13B, 70B) напрямую определяют требования к памяти в зависимости от точности вычислений.

В FP16 каждый параметр занимает 2 байта. Плюс накладные расходы на KV-кэш контекста: для контекста в 4096 токенов добавляется 10-20% к базовому объему. Квантизация INT8 и INT4 снижает требования, но с потерей качества - чем агрессивнее сжатие, тем заметнее деградация на сложных задачах.

Размер модели FP16 (ГБ) INT8 (ГБ) INT4 (ГБ) Пример модели
7B ~14 ~7 ~3.5 Mistral-7B, Qwen2.5-7B
13B ~26 ~13 ~6.5 LLaMA-2-13B
34B ~68 ~34 ~17 Yi-34B
70B ~140 ~70 ~35 LLaMA-3-70B
180B ~360 ~180 ~90 Falcon-180B

RTX 5090 с 24 ГБ вмещает 13B в FP16 или 70B в INT4. Второй вариант работает, но точность INT4 на 70B-модели ощутимо ниже - галлюцинации учащаются, логические цепочки рвутся. RTX 6000 Ada с 48 ГБ запускает 34B в FP16 или 70B в INT8 - компромисс между качеством и размером. Две RTX 6000 Ada через NVLink дают 96 ГБ единого пула - 70B в FP16 без квантизации.

Практический вывод: если ваша целевая модель - 7B-13B, RTX 5090 достаточно. Для 34B нужна RTX 6000 Ada. Для 70B+ - две профессиональные карты с NVLink. Бюджетные конфигурации для локального инференса мы разбирали отдельно - от $1000 до $3500 за сборку.

Инференс vs файнтюнинг: почему требования к памяти отличаются

Инференс хранит в VRAM веса модели и KV-кэш. Файнтюнинг добавляет оптимизатор (AdamW - еще 8 байт на параметр), градиенты (4 байта) и активации. Итоговое потребление в 2-4 раза выше.

Пример: инференс LLaMA-7B в FP16 - 14 ГБ. Полный файнтюнинг той же модели - до 28 ГБ. RTX 5090 не тянет полный файнтюнинг даже 7B без ухищрений.

QLoRA решает проблему: веса модели квантуются в 4 бита, а обучаются только низкоранговые адаптеры (LoRA) в FP16. Потребление падает до 16 ГБ для 7B-модели - RTX 5090 справляется. Для 13B с QLoRA нужно 20-22 ГБ - на грани возможностей. Файнтюнинг 34B через QLoRA требует 48 ГБ - территория RTX 6000 Ada.

NVLink: мост к большим моделям или умирающий стандарт?

NVLink - высокоскоростной интерконнект между GPU с пропускной способностью до 100 ГБ/с. Он создает единый пул памяти: две карты по 48 ГБ видятся системе как 96 ГБ. Для LLM это разница между «модель не запускается» и «работает в FP16».

RTX 5090 не поддерживает NVLink. NVIDIA убрала мостик из потребительского сегмента начиная с RTX 40-й серии, и 50-я серия продолжит тренд. Две RTX 5090 в одной системе могут работать через tensor parallelism по PCIe 5.0, но пропускная способность PCIe x16 - 64 ГБ/с, и задержки выше. На практике это означает неэффективное использование второй карты: часть данных дублируется, синхронизация отстает.

Две RTX 6000 Ada с NVLink запускают LLaMA-3-70B в FP16 с контекстом 4096 токенов. Две RTX 5090 без NVLink способны загрузить 70B только в INT4, теряя в качестве генерации. Проблема утилизации при сплитинге моделей детально разобрана на примере RTX 5060 Ti - две карты не дают двукратного прироста из-за memory-bound архитектуры.

NVLink критичен для продакшен-нагрузок с жесткими требованиями к latency. Для экспериментов и прототипирования tensor parallelism через PCIe приемлем, но скорость генерации токенов будет ниже на 15-30%.

Экономика гигабайта: сравниваем цену VRAM у RTX 5090 и workstation-карт

Ожидаемая розничная цена RTX 5090 - $2000 за 24 ГБ. RTX 5000 Ada - $4000 за 32 ГБ. RTX 6000 Ada - $6800 за 48 ГБ. Считаем цену за гигабайт:

  • RTX 5090: $83/ГБ
  • RTX 5000 Ada: $125/ГБ
  • RTX 6000 Ada: $142/ГБ

Потребительская карта выигрывает по удельной стоимости памяти в 1.5-1.7 раза. Но этот показатель имеет смысл, только если 24 ГБ достаточно для ваших задач. Когда нужны 48 ГБ, RTX 5090 просто не вариант - никакая экономия не компенсирует невозможность загрузить модель.

Две RTX 6000 Ada с NVLink обойдутся в $13600 за 96 ГБ. Это сопоставимо с ценой одного подержанного A100 80GB ($12000-15000 на вторичном рынке). A100 дает 80 ГБ единой памяти без необходимости NVLink и с более высокой производительностью, но требует серверного охлаждения и стоит дороже в обслуживании. Альтернативные сборки на бюджетных картах вроде двух RTX 3080 20GB дают 40 ГБ по цене ниже одной RTX 3090 - подход работает для экспериментов, но не для продакшена.

Скрытые расходы: блоки питания, охлаждение и инфраструктура

RTX 5090 потребляет ~450 Вт под нагрузкой, RTX 6000 Ada - ~300 Вт. Две 5090 требуют блок питания на 1200+ Вт с запасом по пиковым нагрузкам. Две RTX 6000 Ada укладываются в 1000 Вт. Годовые затраты на электричество при 24/7 нагрузке и цене $0.12/кВт·ч:

  • Одна RTX 5090: 450 Вт × 24 ч × 365 дней = 3942 кВт·ч → $473/год
  • Две RTX 5090: $946/год
  • Одна RTX 6000 Ada: 300 Вт → $315/год
  • Две RTX 6000 Ada: $630/год

Разница в $316/год между двумя конфигурациями не критична для бизнес-сценариев, но за 3-4 года набегает $1000-1200. Охлаждение: RTX 5090 с турбинным кулером шумит сильнее, для двух карт в одном корпусе нужен хорошо продуваемый E-ATX с 3-4 вентиляторами на вдув. RTX 6000 Ada с пассивным охлаждением в серверном шасси тише и стабильнее при круглосуточной работе.

Тонкая настройка на RTX 5090: миссия выполнима?

RTX 5090 способна файнтюнить модели с QLoRA и 4-битным квантованием. Конкретные конфигурации:

  • LLaMA-3-7B: QLoRA, rank 64, batch size 4, контекст 2048 - потребление 16-18 ГБ, скорость 8-12 итераций/с. Вмещается с запасом.
  • Qwen2.5-13B: QLoRA, rank 32, batch size 2, контекст 2048 - потребление 20-22 ГБ, скорость 4-6 итераций/с. На грани, требует мониторинга VRAM.
  • LLaMA-3-70B: QLoRA невозможен - даже с 4-битным квантованием весов и минимальным rank адаптеров потребление превышает 30 ГБ.

Полный файнтюнинг (full fine-tuning) 7B-модели в FP16 требует 28 ГБ - RTX 5090 не тянет. RTX 6000 Ada с 48 ГБ выполняет полный файнтюнинг 7B и QLoRA для 34B. Две RTX 6000 Ada через NVLink берут полный файнтюнинг 13B и QLoRA для 70B.

Скорость файнтюнинга на RTX 6000 Ada выше на 20-30% по сравнению с RTX 5090 за счет увеличенного кэша L2 и более агрессивных частот памяти ECC. Для продакшен-пайплайнов с регулярным дообучением разница ощутима. Для разовых экспериментов RTX 5090 достаточно.

Мониторинг цен на workstation-карты: боты и B2B-площадки

Workstation-карты покупают редко и дорого - цена ошибки высока. Специализированные инструменты отслеживания помогают поймать скидку или избежать переплаты.

Telegram-боты вроде @workstation_prices_bot мониторят официальные каналы NVIDIA, крупных реселлеров и B2B-площадки. Настройка алертов по конкретным моделям (RTX 6000 Ada, RTX 5000 Ada) позволяет получить уведомление при падении цены на 5-10%. Полезность умеренная: при бюджете $7000-14000 экономия в $350-700 не меняет решение, но приятна.

B2B-площадки (Alibaba, DirectIndustry) дают доступ к оптовым ценам и refurbished-картам. Риски: отсутствие официальной гарантии, сложности с возвратом, таможенные пошлины при заказе из-за рубежа. Опыт заказа карт с Alibaba показывает, что экономия может достигать 30-40%, но требует проверки продавца и учета доставки.

Партнерские программы NVIDIA для стартапов и исследователей дают скидки 10-20% на workstation-карты при регистрации в NVIDIA Developer Program. Процесс занимает 2-4 недели, но для юрлиц это самый надежный способ сэкономить.

Итоговая матрица выбора: RTX 5090 или RTX 6000 Ada?

Критерий RTX 5090 RTX 6000 Ada
VRAM 24 ГБ GDDR7 48 ГБ ECC GDDR6
NVLink Нет Да (до 2 карт)
Цена ~$2000 ~$6800
Цена/ГБ $83 $142
TDP ~450 Вт ~300 Вт
Инференс 7B-13B FP16 Да Да (с запасом)
Инференс 70B FP16 Нет Да (2 карты + NVLink)
Инференс 70B INT4 Да (с потерями качества) Да (INT8 без потерь)
Файнтюнинг 7B (QLoRA) Да Да
Файнтюнинг 13B (QLoRA) На грани (22 ГБ) Да
Файнтюнинг 34B (QLoRA) Нет Да
Полный файнтюнинг 7B Нет Да

Выбирайте RTX 5090, если: ваш бюджет ограничен $2000-2500 за GPU, целевые модели - 7B-13B, файнтюнинг эпизодический через QLoRA, инференс 70B допустим в INT4 с пониманием потерь качества.

Выбирайте RTX 6000 Ada, если: вам нужны 70B+ в FP16, файнтюнинг - регулярная задача, важна стабильность при 24/7 нагрузке, планируется масштабирование через NVLink. Оптимальная конфигурация - две карты с NVLink для 96 ГБ единого пула.

Промежуточный вариант: RTX 5000 Ada с 32 ГБ за $4000. Закрывает инференс 13B FP16 с большим контекстом и файнтюнинг 13B через QLoRA с комфортным запасом. Не дотягивает до 70B даже в INT8, но дешевле RTX 6000 Ada на $2800.

Решение сводится к одному вопросу: какая модель - ваша целевая? Ответьте на него, и выбор GPU станет очевиден. Гибридные сборки Nvidia + AMD и конфигурации на бюджетных картах расширяют пространство вариантов, но базовая дилемма остается: объем памяти и NVLink против цены за гигабайт.

Подписаться на канал