Короткий ответ: кому в 2026 году V100 SXM2 всё ещё выгодна
Списанная Tesla V100 SXM2 оправдана ровно в одном сценарии: вам нужен большой объём HBM2 (до 128 ГБ на четырёх модулях) и NVLink за бюджет, сопоставимый с одной современной потребительской видеокартой, а трассировка лучей и Frame Generation вас не интересуют. Если же нужен тихий ПК, свежий PyTorch без пересборки и предсказуемая гарантия, экономия обернётся неделями возни.
Опорные цифры. Модули V100 SXM2 на 16 ГБ встречаются на маркетплейсах примерно от $100-150 за штуку, цена сильно зависит от состояния и года выпуска. Версия на 32 ГБ несёт 32 ГБ HBM2 с пропускной способностью 900 ГБ/с, заявленные 125 TFLOPS на Tensor-операциях и TDP 300 Вт. Связка модулей между собой идёт через NVLink до 300 ГБ/с. Разбор сборки на Habr приводит те же характеристики и отдельно отмечает: в инференсе LLM результат определяют объём и пропускная способность памяти, а не поколение Tensor-ядер.
Материал пригодится тем, кто уже упёрся в 12-24 ГБ VRAM и хочет запускать локально модели, которым этой памяти мало. Как объём видеопамяти задаёт потолок для локальных LLM, разбираем в статье про выход из категории «GPU poor».
Что такое V100 SXM2 и почему она вообще всплыла в 2026 году
Tesla V100 построена на архитектуре Volta 2017 года: 5120 CUDA-ядер и 640 Tensor-ядер. Дата-центры переходят на A100, H100 и L40S, поэтому списанные ускорители массово уходят на вторичный рынок. Модули V100 SXM2 на 16 ГБ продаются там как рабочие карты под ИИ-инференс, GPU-вычисления, компьютерное зрение, 3D-моделирование, медицинскую симуляцию, ComfyUI, Stable Diffusion, LLM и генерацию видео: объявления такого рода попадаются, например, на Авито.
Самая интересная версия для локального инференса - SXM2 на 32 ГБ HBM2 с 900 ГБ/с. Она позволяет держать в памяти модели, которые не помещаются в 12-24 ГБ потребительских карт, и обходится заметно дешевле нескольких современных GPU с сопоставимым суммарным объёмом.
Чем SXM2 отличается от PCIe и почему для дома берут именно SXM2
У V100 было две основные версии: PCIe и SXM2. PCIe вставляется в обычный слот напрямую, SXM2 - серверный форм-фактор, которому нужен переходник на PCIe. Взамен SXM2 даёт NVLink между модулями с пропускной способностью до 300 ГБ/с, поэтому для multi-GPU сборки под LLM источники советуют смотреть именно на неё.
Переходник SXM2 на PCIe для V100 - обязательный элемент сборки. Адаптеры различаются по питанию, охлаждению и поддержке NVLink-моста. Точных моделей и цен на переходники в разобранных источниках нет, поэтому этот пункт бюджета считайте отдельно по актуальным объявлениям.
Сколько VRAM и какой реальный FLOPS вы получаете
Один модуль V100 SXM2 бывает на 16 и 32 ГБ HBM2. Версия на 32 ГБ даёт 900 ГБ/с пропускной способности памяти, до 125 TFLOPS на Tensor-операциях и TDP 300 Вт. Рядом с потребительскими картами картина такая:
- RTX 3090: 24 ГБ GDDR6X, около 936 ГБ/с;
- RTX 5070: 12 ГБ GDDR7, 672 ГБ/с;
- RTX 4070 Ti: 12 ГБ GDDR6X.
По пропускной способности HBM2 держится в одном классе с RTX 3090, а по объёму на модуль её обходит: 32 ГБ против 24 ГБ. В локальном инференсе LLM это весит больше возраста архитектуры, поэтому в ряде задач V100 SXM2 остаётся на уровне RTX 3090 Ti. Примеры от источника: Qwen3.8-27B полностью помещается в 32 ГБ VRAM одного модуля, а конфигурация из четырёх модулей по 32 ГБ даёт 128 ГБ HBM2 и открывает модели, которые на одной потребительской карте не запускаются.
NVLink: зачем он нужен дома и когда без него можно обойтись
NVLink даёт до 300 ГБ/с между модулями. Когда модель разрезана на несколько GPU (tensor parallelism в vLLM, распределение слоёв в llama.cpp), активации постоянно ходят через интерконнект, и NVLink снижает накладные расходы по сравнению с PCIe. Если модель целиком помещается в один модуль, NVLink не даёт ничего, и платить за него смысла нет.
Практическая деталь: поддержка NVLink зависит от переходника, а сам мост - отдельный элемент сборки, который подбирают под конкретную конфигурацию. Проверяйте это до покупки модулей, а не после.
Сборка: адаптеры SXM2→PCIe, охлаждение и питание
Покупка модулей - только начало. Дальше понадобятся переходники, платформа, корпус и решение по охлаждению, а это отдельные деньги и время.
Питание. TDP одного модуля - 300 Вт, четыре карты забирают до 1,2 кВт только на GPU, а вся система с процессором и обвязкой доходит до 1,5 кВт. Блок питания берут с запасом, а часть переходников требует несколько разъёмов 8-pin. Бытовой проводке тоже стоит уделить внимание.
Охлаждение. SXM2-платформы рассчитаны на серверные шасси с мощным продувом. В обычный ATX-корпус такая сборка влезает с трудом, а турбины, отводящие по 300 Вт с каждой карты, слышно в соседней комнате. Реальные варианты - серверные турбины или кастомные водоблоки, и оба требуют места и бюджета.
Какие адаптеры искать и на что смотреть при покупке
- поддержка именно SXM2, а не другого серверного форм-фактора;
- наличие NVLink-разъёмов, если планируете два модуля и больше;
- тип питания: PCIe 8-pin против серверных разъёмов;
- активное охлаждение или посадочные места под него;
- совместимость с ревизией конкретного модуля V100.
Дешёвый переходник без охлаждения под 300 Вт на карту - плохая идея: без активного отвода тепла модуль не выйдет на рабочий режим. Конкретных брендов и цен в разобранных источниках нет, поэтому уточняйте комплектацию у продавца и выясняйте, идёт ли в комплекте мост NVLink.
Программная совместимость: PyTorch, CUDA и sm_70 в 2026 году
Главный подводный камень всей затеи. Свежие сборки PyTorch с CUDA 12.8 и 12.9 больше не поддерживают архитектуру Volta. Habr формулирует это прямо: для V100 нужны CUDA 12.6 либо самостоятельная сборка под sm_70.
Рабочих путей два. Первый - зафиксировать CUDA 12.6 и не обновлять стек: проще, но ограничивает доступные версии библиотек. Второй - собрать PyTorch из исходников под sm_70: дольше, зато можно держать актуальные версии фреймворка при условии, что все зависимости собираются.
Дальше начинаются зависимости. Часть новых оптимизированных ядер под Volta не собирается или требует патчей, а готовые wheel-сборки под sm_70 могут отсутствовать. vLLM и llama.cpp в целом работают на Volta, но поддержку sm_70 в конкретной версии проверяют до покупки железа: обновление рантайма способно сломать рабочую конфигурацию.
Как собрать PyTorch под sm_70: общий план
- Зафиксировать версию CUDA (12.6) и драйвера, не обновлять их автоматически.
- Собрать PyTorch из исходников с TORCH_CUDA_ARCH_LIST=7.0.
- Проверить, собираются ли нужные расширения: transformers, bitsandbytes, квантизационные ядра.
- Отдельно протестировать vLLM или llama.cpp на поддержку sm_70 в вашей версии.
- Закрепить стек в контейнере или виртуальном окружении, чтобы обновление не сломало сборку.
Точные команды здесь не приводятся: они зависят от версии фреймворка и дистрибутива, а в разобранных источниках их нет. Вывод простой: это сборка для тех, кто готов возиться. Работы «из коробки» на Volta в 2026 году не будет.
Что реально запускается: Qwen, Gemma и другие локальные LLM
Пример из источников: Qwen3.8-27B полностью помещается в 32 ГБ VRAM модуля V100 SXM2 и работает на нём эффективно. Для моделей, которым 32 ГБ мало, остаётся multi-GPU: два модуля по 32 ГБ дают 64 ГБ, четыре - 128 ГБ HBM2 с NVLink между ними.
Gemma на Tesla V100 - рабочий сценарий, но поддержку sm_70 в конкретной версии рантайма проверяют отдельно: не все свежие ядра собираются под Volta. То же касается любой модели, требующей новых операторов.
Квантизация в форматах GPTQ, AWQ и GGUF снижает требования к памяти, но не все квантизационные ядра оптимизированы под Volta, поэтому выигрыш по скорости может оказаться меньше ожидаемого. Конкретных токенов в секунду для V100 источники не приводят: скорость зависит от модели, уровня квантизации, длины контекста и фреймворка. Ориентируйтесь на собственные замеры после сборки. Разницу между 1×32 ГБ, 2×16 ГБ V100 и современной 16-гиговой картой на Qwen 3.8 разбираем в материале про V100 против RTX 5060 Ti.
Сравнение конфигураций: 2×V100, 4×V100, RTX 3090, 4070 Ti, 5070
Сводка по конфигурациям, которые чаще всего рассматривают для домашнего инференса:
| Конфигурация | VRAM | Пропускная способность | NVLink | Свежий PyTorch (CUDA 12.8/12.9) | Ориентир по цене |
|---|---|---|---|---|---|
| 2×V100 SXM2 16 ГБ | 32 ГБ HBM2 | в источниках не указана | Да, до 300 ГБ/с | Нет, нужна CUDA 12.6 или сборка под sm_70 | примерно $100-150 за модуль |
| 2×V100 SXM2 32 ГБ | 64 ГБ HBM2 | 900 ГБ/с на модуль | Да, до 300 ГБ/с | Нет, аналогично | цена 32-гиговых модулей в источниках не указана |
| 4×V100 SXM2 32 ГБ | 128 ГБ HBM2 | 900 ГБ/с на модуль | Да, до 300 ГБ/с | Нет, аналогично | стоимость сборки «кусается» |
| RTX 3090 | 24 ГБ GDDR6X | около 936 ГБ/с | в источниках не указан | Да | в источниках не указана |
| RTX 5070 | 12 ГБ GDDR7 | 672 ГБ/с | в источниках не указан | Да | в источниках не указана |
| RTX 4070 Ti | 12 ГБ GDDR6X | в источниках не указана | в источниках не указан | Да | в источниках не указана |
Что из этого следует:
- 2×V100 32 ГБ дают 64 ГБ HBM2 и NVLink, то есть почти втрое больше памяти, чем RTX 3090;
- 4×V100 32 ГБ дают 128 ГБ HBM2, но требуют до 1,5 кВт питания, четырёх переходников и серьёзного охлаждения;
- RTX 3090 даёт 24 ГБ GDDR6X и около 936 ГБ/с, работает со свежим стеком и не требует переходников;
- RTX 5070 и 4070 Ti дают по 12 ГБ, чего мало для моделей, ради которых затевается сборка;
- V100 проигрывает по удобству и выигрывает по объёму доступной VRAM за те же деньги.
Когда 2×V100 выгоднее одной RTX 3090
Критерий простой. Если нужная модель не помещается в 24 ГБ, а бюджет не растягивается на несколько современных карт, пара V100 SXM2 по 32 ГБ даёт 64 ГБ HBM2 и NVLink, и tensor parallelism по NVLink работает эффективнее, чем через PCIe. Плата за это: переходники, охлаждение, БП на 1 кВт и больше, CUDA 12.6 или сборка PyTorch под sm_70.
Если 24 ГБ хватает, RTX 3090 остаётся рациональным выбором: свежий стек, никаких переходников, предсказуемая гарантия. Похожие компромиссы разобраны в материале про две RTX 3080 20 ГБ против RTX 3090, где 40 ГБ видеопамяти собираются дешевле одной 24-гиговой карты.
Риски покупки б/у железа 2017-2018 годов
- гарантии нет: модуль приходит как есть, а возврат зависит от продавца;
- износ HBM2 и VRM: карты работали в дата-центрах под круглосуточной нагрузкой, часть ресурса уже израсходована;
- ревизии и прошивки: возможна несовместимость с конкретным переходником;
- ремонтопригодность: HBM2 распаяна рядом с кристаллом, замену памяти или чипа в бытовых условиях не делают;
- срок жизни платформы: Volta уже выпала из свежих сборок PyTorch, дальше поддержка будет только сокращаться.
Цена $100-150 за модуль - это фактически цена риска. При покупке проверяйте все банки памяти, прогоняйте стресс-тест и отдельно тестируйте NVLink между модулями, если продавец даёт такую возможность. Восстановить HBM2 после выхода из строя не получится, поэтому диагностика до оплаты важнее скидки в двадцать долларов.
Альтернативы: когда лучше не экономить
- Одна современная карта с 24 ГБ и больше. RTX 3090 или 5090 не требуют переходников, работают со свежим PyTorch и тише. Сравнение топовых решений для инференса разобрано в статье RTX 5090 против workstation-карт.
- Apple Silicon с объединённой памятью: пропускная способность ниже, зато памяти много, а шума и переходников нет.
- Аренда GPU в облаке: разумна для разовых задач и экспериментов, когда домашний сервер не нужен постоянно.
- Серверные карты прошлых поколений от AMD, например Instinct V620 с 96 ГБ VRAM на карту. Вариант с тремя такими картами за $1050 разбирается в отдельном материале, но там своя специфика по ROCm и охлаждению в 2U-корпусе.
Критерий выбора простой. Разовая задача - аренда. Тихий постоянный сервер под модели до 24 ГБ - современная потребительская карта. Максимум VRAM за минимум денег и готовность возиться со стеком - V100 SXM2.
Итог: кому стоит, а кому не стоит брать V100 SXM2 в 2026
V100 SXM2 стоит брать, если вы готовы жить на CUDA 12.6 или собирать PyTorch под sm_70, можете организовать отвод 300 Вт с каждой карты и питание до 1,5 кВт, а models вам нужен именно объём HBM2 и NVLink за небольшие деньги. Не стоит, если нужен тихий ПК, свежий PyTorch без возни, современные графические функции или если модели хватает 24 ГБ.
Чек-лист перед покупкой:
- Убедитесь, что нужная модель не помещается в 24 ГБ. Если помещается, V100 не нужна.
- Посчитайте бюджет на переходники, охлаждение, корпус и блок питания: сами модули - не главная статья расходов.
- Проверьте, что сможете отвести 300 Вт с карты и до 1,5 кВт со всей системы, включая шум.
- Заранее решите, идёте вы на CUDA 12.6 или собираете PyTorch под sm_70.
- Проверьте поддержку sm_70 в вашей версии vLLM или llama.cpp до оплаты модулей.
- При покупке протестируйте память и NVLink, оцените ревизию модуля и комплект переходников.
- Оставьте запас на одну вышедшую из строя карту: гарантии на железо 2017-2018 годов нет.
Если все семь пунктов закрываются без напряжения, V100 SXM2 в 2026 году остаётся одним из самых дешёвых способов получить десятки гигабайт HBM2 и NVLink дома. Если вопросы вызывает половина списка, берите одну современную карту и не тратьте недели на пересборку фреймворка.