Ключевые результаты: что выдает сборка на V620 в реальных тестах
Три AMD Instinct V620 в сервере Dell PowerEdge R740 выдают 400–600 токенов/с на стадии префилла и 16–20 токенов/с на генерации для модели Laguna S 2.1. Эти цифры получены без dflash - техники сжатия KV-кеша, которая могла бы поднять скорость ещё выше. Для практического использования 16–20 токенов/с - комфортная скорость чтения: ответы появляются плавно, без раздражающей задержки. 400–600 токенов/с на обработке промпта означают, что даже длинный контекст в 10–20 тысяч токенов проглатывается за секунды.
Суммарный объём памяти - 96 ГБ HBM2e - позволяет загружать модели, которые не влезают в одиночные потребительские карты. Laguna S 2.1 в тесте использовалась без квантизации, но запас в 96 ГБ открывает дорогу к 70B-моделям в FP16 или к параллельному запуску нескольких моделей поменьше. Это не стендовый бенчмарк - это реальная рабочая конфигурация, собранная энтузиастом за $1050 только за ускорители.
Экономика сборки: $350 за 32 ГБ VRAM - насколько это выгодно?
Каждая AMD Instinct V620 обошлась в $350. Три карты - $1050. Добавим сервер Dell PowerEdge R740: на вторичном рынке такие машины стоят $400–800 в зависимости от конфигурации процессоров, памяти и БП. Итоговая цена системы - $1500–1900. За эти деньги вы получаете 96 ГБ VRAM с пропускной способностью HBM2e и три ускорителя, способных работать параллельно.
Для сравнения: сборка на двух RTX 3090 с 48 ГБ VRAM обойдётся в $1400–1600 только за карты, плюс платформа - и вы уже за $2000 с вдвое меньшим объёмом памяти. Новая RTX 4090 с 24 ГБ стоит $1600–1800. A4000 на вторичке - $500–600 за 16 ГБ. Разрыв в цене за гигабайт колоссальный, но есть нюансы в софтовой экосистеме, о которых поговорим дальше.
Сравнение цены за гигабайт VRAM: V620 против NVIDIA
Приведём прямые цифры по цене за гигабайт памяти на вторичном рынке на июль 2026 года:
- AMD Instinct V620 32 ГБ - $350, ~$10.9/ГБ
- NVIDIA RTX 3090 24 ГБ - $700, ~$29.2/ГБ
- NVIDIA RTX 4090 24 ГБ - $1700, ~$70.8/ГБ
- NVIDIA A4000 16 ГБ - $550, ~$34.4/ГБ
- NVIDIA Tesla P40 24 ГБ - $200, ~$8.3/ГБ (но без FP16-ускорения и с устаревшей архитектурой Pascal)
V620 выигрывает у всего, кроме P40, по цене за гигабайт. Но P40 лишена тензорных ядер и показывает смехотворную производительность на современных моделях - это вариант только для совсем бюджетных экспериментов. V620 на архитектуре CDNA2 даёт полноценный FP16 и BF16, что критично для инференса трансформеров.
Если считать производительность на доллар, ориентир такой: 16–20 токенов/с генерации на модели уровня Laguna S 2.1 за $1050. Ближайший аналог на NVIDIA - две RTX 3090 - даст сопоставимую скорость на модели поменьше, но с 48 ГБ памяти вы просто не загрузите 70B-модель без агрессивной квантизации. V620 выигрывает по объёму памяти, проигрывая в сырой производительности одного чипа, но для инференса больших моделей объём памяти часто важнее пиковой скорости.
Совместимость и софт: что нужно знать перед покупкой AMD Instinct V620
Карты работают через стек ROCm - открытую платформу AMD для вычислений. Никакого CUDA, никаких проприетарных библиотек NVIDIA. Это главный водораздел: если ваш проект плотно завязан на экосистему NVIDIA (кастомные CUDA-ядра, специфические библиотеки), миграция потребует усилий. Если вы используете PyTorch или TensorFlow на стандартных операциях - запуск пройдёт гладко.
Проверенные фреймворки: PyTorch 2.1+ с бэкендом ROCm, TensorFlow 2.13+, llama.cpp с поддержкой HIP, vLLM в режиме ROCm. Модели, которые точно работают: LLaMA 2 и 3, Mistral, Mixtral, Qwen, DeepSeek, Falcon, Laguna S. Проблемы возникают с экзотическими архитектурами и свежими фичами - например, FlashAttention для ROCm отстаёт от CUDA-версии на полшага.
Типичные грабли: версия ROCm должна совпадать с версией ядра Linux, иначе модуль amdgpu не соберётся. Docker-образы с ROCm работают, но требуют проброса устройств через --device=/dev/kfd и --device=/dev/dri. Некоторые разработчики жалуются на нестабильность ROCm 6.0–6.1 - рекомендуется 6.2 или новее. Официальная документация на docs.amd.com покрывает базовые сценарии, комьюнити-решения ищите в репозиториях на GitHub по запросу «rocm v620 inference».
Настройка ROCm для инференса: минимум действий для запуска
Чек-лист для старта на Ubuntu 22.04:
- Установите драйвер:
sudo apt install amdgpu-dkms rocm-libs - Добавьте пользователя в группу render:
sudo usermod -a -G render $USER - Перезагрузитесь и проверьте:
rocm-smiдолжен показать три карты - Поставьте PyTorch для ROCm:
pip install torch --index-url https://download.pytorch.org/whl/rocm6.2 - Запустите модель:
python -c "import torch; print(torch.cuda.device_count())"- должно вывести 3
Это демонстрация простоты, а не полноценный гайд. На практике могут потребоваться переменные окружения HSA_OVERRIDE_GFX_VERSION=9.4.2 для совместимости с некоторыми версиями ROCm. V620 основана на чипе Aldebaran (gfx942), и большинство современных библиотек поддерживают её из коробки.
Dell PowerEdge R740 как платформа: охлаждение, питание и нюансы установки
R740 - сервер 2U с поддержкой до трёх двухслотовых GPU. В тестовой конфигурации использовались три райзера: два x16 и один x8 (через коммутатор). Карты V620 - пассивные, без собственных вентиляторов. Охлаждение полностью зависит от корпусных вентиляторов сервера. Штатные вентиляторы R740 обеспечивают достаточный поток для трёх карт с TDP по 300 Вт каждая, но при одном условии: сервер должен быть в помещении с температурой не выше 25°C.
Блок питания: минимальная конфигурация - два БП по 1100 Вт. Три V620 потребляют до 900 Вт в пике, плюс процессоры и память - ещё 200–300 Вт. Запас по мощности есть, но при выходе одного БП из строя система уйдёт в троттлинг. Рекомендуется конфигурация с двумя БП по 1600 Вт.
Физическая установка: карты вставляются в райзеры без модификаций. Длина V620 - 267 мм, стандартный двухслотовый форм-фактор. Никаких дополнительных креплений не потребовалось. Единственный нюанс - кабели питания GPU: в R740 используются проприетарные разъёмы, убедитесь, что у продавца сервера есть полный комплект кабелей.
Температуры и троттлинг: выдержит ли R740 три карты?
Под длительной нагрузкой (30+ минут инференса) температуры GPU держатся в диапазоне 78–85°C, память HBM2e - 82–90°C. Порог троттлинга для V620 - 95°C на GPU и 100°C на памяти. В тестах троттлинг не наблюдался. Уровень шума - 65–70 дБА на расстоянии метра, что типично для серверного оборудования 2U. В жилой комнате такой сервер держать некомфортно, в серверной или подвале - приемлемо.
Сравните с проблемами охлаждения потребительских карт в серверных корпусах: RTX 3090 с турбинным охлаждением в 2U греются до 85–90°C и требуют модификации корпуса для дополнительного продува. V620 в R740 работают в штатном тепловом режиме без колхозинга.
Сценарии использования: для каких задач хватит 96 ГБ VRAM
96 ГБ - достаточный объём для инференса большинства открытых моделей в FP16 без квантизации. Что помещается:
- LLaMA 3 70B - 140 ГБ в FP16, нужна 4-битная квантизация (35 ГБ), помещается с запасом
- Mixtral 8x7B - 47 ГБ в FP16, можно запустить две копии параллельно
- Qwen 2.5 72B - 144 ГБ в FP16, 4-битная квантизация - 36 ГБ
- DeepSeek-V2 236B MoE - 21 ГБ активных параметров в 4-бит, помещается, но с оговорками по скорости
- Command R+ 104B - 52 ГБ в 4-бит, комфортная работа
Параллельный запуск нескольких моделей - рабочий сценарий. Например, одна карта держит embedding-модель для RAG, две других - генеративную модель. Или три экземпляра одной модели для масштабирования пропускной способности. Ограничение: обучение моделей на этой сборке нецелесообразно. 96 ГБ хватит для файнтюнинга 7B-модели с LoRA, но для полноценного обучения 70B-моделей нужны сотни гигабайт VRAM и межсоединения Infinity Fabric, которых у V620 нет.
Если вы присматриваетесь к альтернативным конфигурациям, посмотрите наш разбор AI-налога на железо - там детально разобраны бюджеты от $1000 до $3500 для локального инференса. Для понимания роли процессора в AI-сборках рекомендуем тесты Xeon Gold против EPYC Rome с цифрами по AVX-512 и пропускной способности памяти.
Сборка шаг за шагом: от заказа карт до первого токена
Дорожная карта для повторения конфигурации:
- Поиск карт. AMD Instinct V620 продаются на вторичном рынке: eBay, r/homelabsales, китайские площадки. Цена $350 - реальная при покупке лотом из трёх штук. Проверяйте продавца: карты часто снимают с дата-центров после апгрейда, пробег может быть 1–2 года.
- Покупка сервера. Dell PowerEdge R740 с райзерами GPU - $400–800. Убедитесь, что в комплекте три райзера (два x16, один x8) и кабели питания GPU. Процессоры Xeon Scalable 2-го поколения, 64–128 ГБ DDR4 - достаточно.
- Физическая установка. Карты вставляются в райзеры, кабели питания подключаются к БП через штатные разъёмы. Никаких модификаций корпуса.
- Настройка ОС. Ubuntu 22.04 LTS, установка ROCm по инструкции выше. Проверка через
rocm-smi. - Запуск тестовой модели. Скрипт на PyTorch с загрузкой Laguna S 2.1 через HuggingFace Transformers. Первый токен должен появиться через 5–10 секунд после запуска.
Это не исчерпывающее руководство - каждый шаг может потребовать отладки под конкретную конфигурацию. Но принципиальных препятствий нет: сборка повторяема.
Выводы: стоит ли связываться с AMD Instinct V620 в 2026 году
Плюсы: $10.9 за гигабайт HBM2e, 96 ГБ суммарно, работа в штатном серверном шасси без модификаций, достаточная для комфортного инференса скорость. Минусы: экосистема ROCm требует привыкания, некоторые фичи PyTorch работают с задержкой относительно CUDA, карты б/у без гарантии, шум сервера 2U не для жилых помещений.
Сборка идеальна для небольших команд и независимых разработчиков, которые гонятся за объёмом памяти, а не за пиковой скоростью. Если вам нужно запускать 70B-модели с приемлемой скоростью и вы готовы потратить вечер на настройку ROCm - это лучшее предложение на рынке. Если ваш проект требует максимальной производительности одного чипа, CUDA-специфичных библиотек или тихой работы - смотрите в сторону NVIDIA, но будьте готовы к бюджету от $3000 за сопоставимый объём памяти.
Для тех, кто изучает альтернативные подходы к инференсу, у нас есть разбор запуска DeepSeek-V4-Flash на одном B300 и тесты GLM-5.2 на 8× GB10 - оба материала с конкретными цифрами и конфигурациями.