Выбор GPU для локального запуска больших языковых моделей (LLM) упирается в три цифры: объем видеопамяти, пропускная способность межсоединений и цена за гигабайт. RTX 5090 с ожидаемыми 24 ГБ GDDR7 закрывает инференс моделей до 13B и файнтюнинг 7B с оптимизациями. Для 70B+ и тонкой настройки без компромиссов нужны профессиональные карты - RTX 6000 Ada (48 ГБ) с поддержкой NVLink. Разница не в производительности чипа, а в возможности физически загрузить модель в память и объединить две карты в единый пул.
Эта статья - калькулятор решения. Мы разберем требования LLM к VRAM, механику NVLink, экономику железа и практические сценарии файнтюнинга. Никаких общих рекомендаций - только цифры, конфигурации и границы применимости.
VRAM как главный ограничитель: сколько памяти нужно разным LLM
Объем видеопамяти - первый фильтр. Модель либо помещается в VRAM целиком, либо вы упираетесь в offload на CPU/RAM с падением скорости в 5-10 раз. Параметры модели (7B, 13B, 70B) напрямую определяют требования к памяти в зависимости от точности вычислений.
В FP16 каждый параметр занимает 2 байта. Плюс накладные расходы на KV-кэш контекста: для контекста в 4096 токенов добавляется 10-20% к базовому объему. Квантизация INT8 и INT4 снижает требования, но с потерей качества - чем агрессивнее сжатие, тем заметнее деградация на сложных задачах.
| Размер модели | FP16 (ГБ) | INT8 (ГБ) | INT4 (ГБ) | Пример модели |
|---|---|---|---|---|
| 7B | ~14 | ~7 | ~3.5 | Mistral-7B, Qwen2.5-7B |
| 13B | ~26 | ~13 | ~6.5 | LLaMA-2-13B |
| 34B | ~68 | ~34 | ~17 | Yi-34B |
| 70B | ~140 | ~70 | ~35 | LLaMA-3-70B |
| 180B | ~360 | ~180 | ~90 | Falcon-180B |
RTX 5090 с 24 ГБ вмещает 13B в FP16 или 70B в INT4. Второй вариант работает, но точность INT4 на 70B-модели ощутимо ниже - галлюцинации учащаются, логические цепочки рвутся. RTX 6000 Ada с 48 ГБ запускает 34B в FP16 или 70B в INT8 - компромисс между качеством и размером. Две RTX 6000 Ada через NVLink дают 96 ГБ единого пула - 70B в FP16 без квантизации.
Практический вывод: если ваша целевая модель - 7B-13B, RTX 5090 достаточно. Для 34B нужна RTX 6000 Ada. Для 70B+ - две профессиональные карты с NVLink. Бюджетные конфигурации для локального инференса мы разбирали отдельно - от $1000 до $3500 за сборку.
Инференс vs файнтюнинг: почему требования к памяти отличаются
Инференс хранит в VRAM веса модели и KV-кэш. Файнтюнинг добавляет оптимизатор (AdamW - еще 8 байт на параметр), градиенты (4 байта) и активации. Итоговое потребление в 2-4 раза выше.
Пример: инференс LLaMA-7B в FP16 - 14 ГБ. Полный файнтюнинг той же модели - до 28 ГБ. RTX 5090 не тянет полный файнтюнинг даже 7B без ухищрений.
QLoRA решает проблему: веса модели квантуются в 4 бита, а обучаются только низкоранговые адаптеры (LoRA) в FP16. Потребление падает до 16 ГБ для 7B-модели - RTX 5090 справляется. Для 13B с QLoRA нужно 20-22 ГБ - на грани возможностей. Файнтюнинг 34B через QLoRA требует 48 ГБ - территория RTX 6000 Ada.
NVLink: мост к большим моделям или умирающий стандарт?
NVLink - высокоскоростной интерконнект между GPU с пропускной способностью до 100 ГБ/с. Он создает единый пул памяти: две карты по 48 ГБ видятся системе как 96 ГБ. Для LLM это разница между «модель не запускается» и «работает в FP16».
RTX 5090 не поддерживает NVLink. NVIDIA убрала мостик из потребительского сегмента начиная с RTX 40-й серии, и 50-я серия продолжит тренд. Две RTX 5090 в одной системе могут работать через tensor parallelism по PCIe 5.0, но пропускная способность PCIe x16 - 64 ГБ/с, и задержки выше. На практике это означает неэффективное использование второй карты: часть данных дублируется, синхронизация отстает.
Две RTX 6000 Ada с NVLink запускают LLaMA-3-70B в FP16 с контекстом 4096 токенов. Две RTX 5090 без NVLink способны загрузить 70B только в INT4, теряя в качестве генерации. Проблема утилизации при сплитинге моделей детально разобрана на примере RTX 5060 Ti - две карты не дают двукратного прироста из-за memory-bound архитектуры.
NVLink критичен для продакшен-нагрузок с жесткими требованиями к latency. Для экспериментов и прототипирования tensor parallelism через PCIe приемлем, но скорость генерации токенов будет ниже на 15-30%.
Экономика гигабайта: сравниваем цену VRAM у RTX 5090 и workstation-карт
Ожидаемая розничная цена RTX 5090 - $2000 за 24 ГБ. RTX 5000 Ada - $4000 за 32 ГБ. RTX 6000 Ada - $6800 за 48 ГБ. Считаем цену за гигабайт:
- RTX 5090: $83/ГБ
- RTX 5000 Ada: $125/ГБ
- RTX 6000 Ada: $142/ГБ
Потребительская карта выигрывает по удельной стоимости памяти в 1.5-1.7 раза. Но этот показатель имеет смысл, только если 24 ГБ достаточно для ваших задач. Когда нужны 48 ГБ, RTX 5090 просто не вариант - никакая экономия не компенсирует невозможность загрузить модель.
Две RTX 6000 Ada с NVLink обойдутся в $13600 за 96 ГБ. Это сопоставимо с ценой одного подержанного A100 80GB ($12000-15000 на вторичном рынке). A100 дает 80 ГБ единой памяти без необходимости NVLink и с более высокой производительностью, но требует серверного охлаждения и стоит дороже в обслуживании. Альтернативные сборки на бюджетных картах вроде двух RTX 3080 20GB дают 40 ГБ по цене ниже одной RTX 3090 - подход работает для экспериментов, но не для продакшена.
Скрытые расходы: блоки питания, охлаждение и инфраструктура
RTX 5090 потребляет ~450 Вт под нагрузкой, RTX 6000 Ada - ~300 Вт. Две 5090 требуют блок питания на 1200+ Вт с запасом по пиковым нагрузкам. Две RTX 6000 Ada укладываются в 1000 Вт. Годовые затраты на электричество при 24/7 нагрузке и цене $0.12/кВт·ч:
- Одна RTX 5090: 450 Вт × 24 ч × 365 дней = 3942 кВт·ч → $473/год
- Две RTX 5090: $946/год
- Одна RTX 6000 Ada: 300 Вт → $315/год
- Две RTX 6000 Ada: $630/год
Разница в $316/год между двумя конфигурациями не критична для бизнес-сценариев, но за 3-4 года набегает $1000-1200. Охлаждение: RTX 5090 с турбинным кулером шумит сильнее, для двух карт в одном корпусе нужен хорошо продуваемый E-ATX с 3-4 вентиляторами на вдув. RTX 6000 Ada с пассивным охлаждением в серверном шасси тише и стабильнее при круглосуточной работе.
Тонкая настройка на RTX 5090: миссия выполнима?
RTX 5090 способна файнтюнить модели с QLoRA и 4-битным квантованием. Конкретные конфигурации:
- LLaMA-3-7B: QLoRA, rank 64, batch size 4, контекст 2048 - потребление 16-18 ГБ, скорость 8-12 итераций/с. Вмещается с запасом.
- Qwen2.5-13B: QLoRA, rank 32, batch size 2, контекст 2048 - потребление 20-22 ГБ, скорость 4-6 итераций/с. На грани, требует мониторинга VRAM.
- LLaMA-3-70B: QLoRA невозможен - даже с 4-битным квантованием весов и минимальным rank адаптеров потребление превышает 30 ГБ.
Полный файнтюнинг (full fine-tuning) 7B-модели в FP16 требует 28 ГБ - RTX 5090 не тянет. RTX 6000 Ada с 48 ГБ выполняет полный файнтюнинг 7B и QLoRA для 34B. Две RTX 6000 Ada через NVLink берут полный файнтюнинг 13B и QLoRA для 70B.
Скорость файнтюнинга на RTX 6000 Ada выше на 20-30% по сравнению с RTX 5090 за счет увеличенного кэша L2 и более агрессивных частот памяти ECC. Для продакшен-пайплайнов с регулярным дообучением разница ощутима. Для разовых экспериментов RTX 5090 достаточно.
Мониторинг цен на workstation-карты: боты и B2B-площадки
Workstation-карты покупают редко и дорого - цена ошибки высока. Специализированные инструменты отслеживания помогают поймать скидку или избежать переплаты.
Telegram-боты вроде @workstation_prices_bot мониторят официальные каналы NVIDIA, крупных реселлеров и B2B-площадки. Настройка алертов по конкретным моделям (RTX 6000 Ada, RTX 5000 Ada) позволяет получить уведомление при падении цены на 5-10%. Полезность умеренная: при бюджете $7000-14000 экономия в $350-700 не меняет решение, но приятна.
B2B-площадки (Alibaba, DirectIndustry) дают доступ к оптовым ценам и refurbished-картам. Риски: отсутствие официальной гарантии, сложности с возвратом, таможенные пошлины при заказе из-за рубежа. Опыт заказа карт с Alibaba показывает, что экономия может достигать 30-40%, но требует проверки продавца и учета доставки.
Партнерские программы NVIDIA для стартапов и исследователей дают скидки 10-20% на workstation-карты при регистрации в NVIDIA Developer Program. Процесс занимает 2-4 недели, но для юрлиц это самый надежный способ сэкономить.
Итоговая матрица выбора: RTX 5090 или RTX 6000 Ada?
| Критерий | RTX 5090 | RTX 6000 Ada |
|---|---|---|
| VRAM | 24 ГБ GDDR7 | 48 ГБ ECC GDDR6 |
| NVLink | Нет | Да (до 2 карт) |
| Цена | ~$2000 | ~$6800 |
| Цена/ГБ | $83 | $142 |
| TDP | ~450 Вт | ~300 Вт |
| Инференс 7B-13B FP16 | Да | Да (с запасом) |
| Инференс 70B FP16 | Нет | Да (2 карты + NVLink) |
| Инференс 70B INT4 | Да (с потерями качества) | Да (INT8 без потерь) |
| Файнтюнинг 7B (QLoRA) | Да | Да |
| Файнтюнинг 13B (QLoRA) | На грани (22 ГБ) | Да |
| Файнтюнинг 34B (QLoRA) | Нет | Да |
| Полный файнтюнинг 7B | Нет | Да |
Выбирайте RTX 5090, если: ваш бюджет ограничен $2000-2500 за GPU, целевые модели - 7B-13B, файнтюнинг эпизодический через QLoRA, инференс 70B допустим в INT4 с пониманием потерь качества.
Выбирайте RTX 6000 Ada, если: вам нужны 70B+ в FP16, файнтюнинг - регулярная задача, важна стабильность при 24/7 нагрузке, планируется масштабирование через NVLink. Оптимальная конфигурация - две карты с NVLink для 96 ГБ единого пула.
Промежуточный вариант: RTX 5000 Ada с 32 ГБ за $4000. Закрывает инференс 13B FP16 с большим контекстом и файнтюнинг 13B через QLoRA с комфортным запасом. Не дотягивает до 70B даже в INT8, но дешевле RTX 6000 Ada на $2800.
Решение сводится к одному вопросу: какая модель - ваша целевая? Ответьте на него, и выбор GPU станет очевиден. Гибридные сборки Nvidia + AMD и конфигурации на бюджетных картах расширяют пространство вариантов, но базовая дилемма остается: объем памяти и NVLink против цены за гигабайт.