Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Сборка для AI-инференса на AMD Instinct V620: 96 ГБ VRAM за $1050 — тесты, подводные камни и сравнение с NVIDIA

Три AMD Instinct V620 в Dell PowerEdge R740 выдают 400–600 токенов/с на префилле и 16–20 токенов/с на генерации за $1050. Разбираем реальную производительность

Коротко

Что будет в материале

  1. 01

    Ключевые результаты: что выдает сборка на V620 в реальных тестах

  2. 02

    Экономика сборки: $350 за 32 ГБ VRAM - насколько это выгодно?

  3. 03

    Совместимость и софт: что нужно знать перед покупкой AMD Instinct V620

  4. 04

    Dell PowerEdge R740 как платформа: охлаждение, питание и нюансы установки

Ключевые результаты: что выдает сборка на V620 в реальных тестах

Три AMD Instinct V620 в сервере Dell PowerEdge R740 выдают 400–600 токенов/с на стадии префилла и 16–20 токенов/с на генерации для модели Laguna S 2.1. Эти цифры получены без dflash - техники сжатия KV-кеша, которая могла бы поднять скорость ещё выше. Для практического использования 16–20 токенов/с - комфортная скорость чтения: ответы появляются плавно, без раздражающей задержки. 400–600 токенов/с на обработке промпта означают, что даже длинный контекст в 10–20 тысяч токенов проглатывается за секунды.

Суммарный объём памяти - 96 ГБ HBM2e - позволяет загружать модели, которые не влезают в одиночные потребительские карты. Laguna S 2.1 в тесте использовалась без квантизации, но запас в 96 ГБ открывает дорогу к 70B-моделям в FP16 или к параллельному запуску нескольких моделей поменьше. Это не стендовый бенчмарк - это реальная рабочая конфигурация, собранная энтузиастом за $1050 только за ускорители.

Экономика сборки: $350 за 32 ГБ VRAM - насколько это выгодно?

Каждая AMD Instinct V620 обошлась в $350. Три карты - $1050. Добавим сервер Dell PowerEdge R740: на вторичном рынке такие машины стоят $400–800 в зависимости от конфигурации процессоров, памяти и БП. Итоговая цена системы - $1500–1900. За эти деньги вы получаете 96 ГБ VRAM с пропускной способностью HBM2e и три ускорителя, способных работать параллельно.

Для сравнения: сборка на двух RTX 3090 с 48 ГБ VRAM обойдётся в $1400–1600 только за карты, плюс платформа - и вы уже за $2000 с вдвое меньшим объёмом памяти. Новая RTX 4090 с 24 ГБ стоит $1600–1800. A4000 на вторичке - $500–600 за 16 ГБ. Разрыв в цене за гигабайт колоссальный, но есть нюансы в софтовой экосистеме, о которых поговорим дальше.

Сравнение цены за гигабайт VRAM: V620 против NVIDIA

Приведём прямые цифры по цене за гигабайт памяти на вторичном рынке на июль 2026 года:

  • AMD Instinct V620 32 ГБ - $350, ~$10.9/ГБ
  • NVIDIA RTX 3090 24 ГБ - $700, ~$29.2/ГБ
  • NVIDIA RTX 4090 24 ГБ - $1700, ~$70.8/ГБ
  • NVIDIA A4000 16 ГБ - $550, ~$34.4/ГБ
  • NVIDIA Tesla P40 24 ГБ - $200, ~$8.3/ГБ (но без FP16-ускорения и с устаревшей архитектурой Pascal)

V620 выигрывает у всего, кроме P40, по цене за гигабайт. Но P40 лишена тензорных ядер и показывает смехотворную производительность на современных моделях - это вариант только для совсем бюджетных экспериментов. V620 на архитектуре CDNA2 даёт полноценный FP16 и BF16, что критично для инференса трансформеров.

Если считать производительность на доллар, ориентир такой: 16–20 токенов/с генерации на модели уровня Laguna S 2.1 за $1050. Ближайший аналог на NVIDIA - две RTX 3090 - даст сопоставимую скорость на модели поменьше, но с 48 ГБ памяти вы просто не загрузите 70B-модель без агрессивной квантизации. V620 выигрывает по объёму памяти, проигрывая в сырой производительности одного чипа, но для инференса больших моделей объём памяти часто важнее пиковой скорости.

Совместимость и софт: что нужно знать перед покупкой AMD Instinct V620

Карты работают через стек ROCm - открытую платформу AMD для вычислений. Никакого CUDA, никаких проприетарных библиотек NVIDIA. Это главный водораздел: если ваш проект плотно завязан на экосистему NVIDIA (кастомные CUDA-ядра, специфические библиотеки), миграция потребует усилий. Если вы используете PyTorch или TensorFlow на стандартных операциях - запуск пройдёт гладко.

Проверенные фреймворки: PyTorch 2.1+ с бэкендом ROCm, TensorFlow 2.13+, llama.cpp с поддержкой HIP, vLLM в режиме ROCm. Модели, которые точно работают: LLaMA 2 и 3, Mistral, Mixtral, Qwen, DeepSeek, Falcon, Laguna S. Проблемы возникают с экзотическими архитектурами и свежими фичами - например, FlashAttention для ROCm отстаёт от CUDA-версии на полшага.

Типичные грабли: версия ROCm должна совпадать с версией ядра Linux, иначе модуль amdgpu не соберётся. Docker-образы с ROCm работают, но требуют проброса устройств через --device=/dev/kfd и --device=/dev/dri. Некоторые разработчики жалуются на нестабильность ROCm 6.0–6.1 - рекомендуется 6.2 или новее. Официальная документация на docs.amd.com покрывает базовые сценарии, комьюнити-решения ищите в репозиториях на GitHub по запросу «rocm v620 inference».

Настройка ROCm для инференса: минимум действий для запуска

Чек-лист для старта на Ubuntu 22.04:

  1. Установите драйвер: sudo apt install amdgpu-dkms rocm-libs
  2. Добавьте пользователя в группу render: sudo usermod -a -G render $USER
  3. Перезагрузитесь и проверьте: rocm-smi должен показать три карты
  4. Поставьте PyTorch для ROCm: pip install torch --index-url https://download.pytorch.org/whl/rocm6.2
  5. Запустите модель: python -c "import torch; print(torch.cuda.device_count())" - должно вывести 3

Это демонстрация простоты, а не полноценный гайд. На практике могут потребоваться переменные окружения HSA_OVERRIDE_GFX_VERSION=9.4.2 для совместимости с некоторыми версиями ROCm. V620 основана на чипе Aldebaran (gfx942), и большинство современных библиотек поддерживают её из коробки.

Dell PowerEdge R740 как платформа: охлаждение, питание и нюансы установки

R740 - сервер 2U с поддержкой до трёх двухслотовых GPU. В тестовой конфигурации использовались три райзера: два x16 и один x8 (через коммутатор). Карты V620 - пассивные, без собственных вентиляторов. Охлаждение полностью зависит от корпусных вентиляторов сервера. Штатные вентиляторы R740 обеспечивают достаточный поток для трёх карт с TDP по 300 Вт каждая, но при одном условии: сервер должен быть в помещении с температурой не выше 25°C.

Блок питания: минимальная конфигурация - два БП по 1100 Вт. Три V620 потребляют до 900 Вт в пике, плюс процессоры и память - ещё 200–300 Вт. Запас по мощности есть, но при выходе одного БП из строя система уйдёт в троттлинг. Рекомендуется конфигурация с двумя БП по 1600 Вт.

Физическая установка: карты вставляются в райзеры без модификаций. Длина V620 - 267 мм, стандартный двухслотовый форм-фактор. Никаких дополнительных креплений не потребовалось. Единственный нюанс - кабели питания GPU: в R740 используются проприетарные разъёмы, убедитесь, что у продавца сервера есть полный комплект кабелей.

Температуры и троттлинг: выдержит ли R740 три карты?

Под длительной нагрузкой (30+ минут инференса) температуры GPU держатся в диапазоне 78–85°C, память HBM2e - 82–90°C. Порог троттлинга для V620 - 95°C на GPU и 100°C на памяти. В тестах троттлинг не наблюдался. Уровень шума - 65–70 дБА на расстоянии метра, что типично для серверного оборудования 2U. В жилой комнате такой сервер держать некомфортно, в серверной или подвале - приемлемо.

Сравните с проблемами охлаждения потребительских карт в серверных корпусах: RTX 3090 с турбинным охлаждением в 2U греются до 85–90°C и требуют модификации корпуса для дополнительного продува. V620 в R740 работают в штатном тепловом режиме без колхозинга.

Сценарии использования: для каких задач хватит 96 ГБ VRAM

96 ГБ - достаточный объём для инференса большинства открытых моделей в FP16 без квантизации. Что помещается:

  • LLaMA 3 70B - 140 ГБ в FP16, нужна 4-битная квантизация (35 ГБ), помещается с запасом
  • Mixtral 8x7B - 47 ГБ в FP16, можно запустить две копии параллельно
  • Qwen 2.5 72B - 144 ГБ в FP16, 4-битная квантизация - 36 ГБ
  • DeepSeek-V2 236B MoE - 21 ГБ активных параметров в 4-бит, помещается, но с оговорками по скорости
  • Command R+ 104B - 52 ГБ в 4-бит, комфортная работа

Параллельный запуск нескольких моделей - рабочий сценарий. Например, одна карта держит embedding-модель для RAG, две других - генеративную модель. Или три экземпляра одной модели для масштабирования пропускной способности. Ограничение: обучение моделей на этой сборке нецелесообразно. 96 ГБ хватит для файнтюнинга 7B-модели с LoRA, но для полноценного обучения 70B-моделей нужны сотни гигабайт VRAM и межсоединения Infinity Fabric, которых у V620 нет.

Если вы присматриваетесь к альтернативным конфигурациям, посмотрите наш разбор AI-налога на железо - там детально разобраны бюджеты от $1000 до $3500 для локального инференса. Для понимания роли процессора в AI-сборках рекомендуем тесты Xeon Gold против EPYC Rome с цифрами по AVX-512 и пропускной способности памяти.

Сборка шаг за шагом: от заказа карт до первого токена

Дорожная карта для повторения конфигурации:

  1. Поиск карт. AMD Instinct V620 продаются на вторичном рынке: eBay, r/homelabsales, китайские площадки. Цена $350 - реальная при покупке лотом из трёх штук. Проверяйте продавца: карты часто снимают с дата-центров после апгрейда, пробег может быть 1–2 года.
  2. Покупка сервера. Dell PowerEdge R740 с райзерами GPU - $400–800. Убедитесь, что в комплекте три райзера (два x16, один x8) и кабели питания GPU. Процессоры Xeon Scalable 2-го поколения, 64–128 ГБ DDR4 - достаточно.
  3. Физическая установка. Карты вставляются в райзеры, кабели питания подключаются к БП через штатные разъёмы. Никаких модификаций корпуса.
  4. Настройка ОС. Ubuntu 22.04 LTS, установка ROCm по инструкции выше. Проверка через rocm-smi.
  5. Запуск тестовой модели. Скрипт на PyTorch с загрузкой Laguna S 2.1 через HuggingFace Transformers. Первый токен должен появиться через 5–10 секунд после запуска.

Это не исчерпывающее руководство - каждый шаг может потребовать отладки под конкретную конфигурацию. Но принципиальных препятствий нет: сборка повторяема.

Выводы: стоит ли связываться с AMD Instinct V620 в 2026 году

Плюсы: $10.9 за гигабайт HBM2e, 96 ГБ суммарно, работа в штатном серверном шасси без модификаций, достаточная для комфортного инференса скорость. Минусы: экосистема ROCm требует привыкания, некоторые фичи PyTorch работают с задержкой относительно CUDA, карты б/у без гарантии, шум сервера 2U не для жилых помещений.

Сборка идеальна для небольших команд и независимых разработчиков, которые гонятся за объёмом памяти, а не за пиковой скоростью. Если вам нужно запускать 70B-модели с приемлемой скоростью и вы готовы потратить вечер на настройку ROCm - это лучшее предложение на рынке. Если ваш проект требует максимальной производительности одного чипа, CUDA-специфичных библиотек или тихой работы - смотрите в сторону NVIDIA, но будьте готовы к бюджету от $3000 за сопоставимый объём памяти.

Для тех, кто изучает альтернативные подходы к инференсу, у нас есть разбор запуска DeepSeek-V4-Flash на одном B300 и тесты GLM-5.2 на 8× GB10 - оба материала с конкретными цифрами и конфигурациями.

Подписаться на канал