Перейти к содержанию
Публикация AiManual

Домашний сервер для LLM на списанных NVIDIA Tesla V100 SXM2: стоит ли экономить в 2026 году

Списанные Tesla V100 SXM2 дают до 128 ГБ HBM2 и NVLink за бюджет одной современной видеокарты, но требуют переходников SXM2→PCIe, охлаждения на 300 Вт и CUDA 12

Коротко

Что будет в материале

  1. 01

    Короткий ответ: кому в 2026 году V100 SXM2 всё ещё выгодна

  2. 02

    Что такое V100 SXM2 и почему она вообще всплыла в 2026 году

  3. 03

    Сколько VRAM и какой реальный FLOPS вы получаете

  4. 04

    Сборка: адаптеры SXM2→PCIe, охлаждение и питание

Короткий ответ: кому в 2026 году V100 SXM2 всё ещё выгодна

Списанная Tesla V100 SXM2 оправдана ровно в одном сценарии: вам нужен большой объём HBM2 (до 128 ГБ на четырёх модулях) и NVLink за бюджет, сопоставимый с одной современной потребительской видеокартой, а трассировка лучей и Frame Generation вас не интересуют. Если же нужен тихий ПК, свежий PyTorch без пересборки и предсказуемая гарантия, экономия обернётся неделями возни.

Опорные цифры. Модули V100 SXM2 на 16 ГБ встречаются на маркетплейсах примерно от $100-150 за штуку, цена сильно зависит от состояния и года выпуска. Версия на 32 ГБ несёт 32 ГБ HBM2 с пропускной способностью 900 ГБ/с, заявленные 125 TFLOPS на Tensor-операциях и TDP 300 Вт. Связка модулей между собой идёт через NVLink до 300 ГБ/с. Разбор сборки на Habr приводит те же характеристики и отдельно отмечает: в инференсе LLM результат определяют объём и пропускная способность памяти, а не поколение Tensor-ядер.

Материал пригодится тем, кто уже упёрся в 12-24 ГБ VRAM и хочет запускать локально модели, которым этой памяти мало. Как объём видеопамяти задаёт потолок для локальных LLM, разбираем в статье про выход из категории «GPU poor».

Что такое V100 SXM2 и почему она вообще всплыла в 2026 году

Tesla V100 построена на архитектуре Volta 2017 года: 5120 CUDA-ядер и 640 Tensor-ядер. Дата-центры переходят на A100, H100 и L40S, поэтому списанные ускорители массово уходят на вторичный рынок. Модули V100 SXM2 на 16 ГБ продаются там как рабочие карты под ИИ-инференс, GPU-вычисления, компьютерное зрение, 3D-моделирование, медицинскую симуляцию, ComfyUI, Stable Diffusion, LLM и генерацию видео: объявления такого рода попадаются, например, на Авито.

Самая интересная версия для локального инференса - SXM2 на 32 ГБ HBM2 с 900 ГБ/с. Она позволяет держать в памяти модели, которые не помещаются в 12-24 ГБ потребительских карт, и обходится заметно дешевле нескольких современных GPU с сопоставимым суммарным объёмом.

Чем SXM2 отличается от PCIe и почему для дома берут именно SXM2

У V100 было две основные версии: PCIe и SXM2. PCIe вставляется в обычный слот напрямую, SXM2 - серверный форм-фактор, которому нужен переходник на PCIe. Взамен SXM2 даёт NVLink между модулями с пропускной способностью до 300 ГБ/с, поэтому для multi-GPU сборки под LLM источники советуют смотреть именно на неё.

Переходник SXM2 на PCIe для V100 - обязательный элемент сборки. Адаптеры различаются по питанию, охлаждению и поддержке NVLink-моста. Точных моделей и цен на переходники в разобранных источниках нет, поэтому этот пункт бюджета считайте отдельно по актуальным объявлениям.

Сколько VRAM и какой реальный FLOPS вы получаете

Один модуль V100 SXM2 бывает на 16 и 32 ГБ HBM2. Версия на 32 ГБ даёт 900 ГБ/с пропускной способности памяти, до 125 TFLOPS на Tensor-операциях и TDP 300 Вт. Рядом с потребительскими картами картина такая:

  • RTX 3090: 24 ГБ GDDR6X, около 936 ГБ/с;
  • RTX 5070: 12 ГБ GDDR7, 672 ГБ/с;
  • RTX 4070 Ti: 12 ГБ GDDR6X.

По пропускной способности HBM2 держится в одном классе с RTX 3090, а по объёму на модуль её обходит: 32 ГБ против 24 ГБ. В локальном инференсе LLM это весит больше возраста архитектуры, поэтому в ряде задач V100 SXM2 остаётся на уровне RTX 3090 Ti. Примеры от источника: Qwen3.8-27B полностью помещается в 32 ГБ VRAM одного модуля, а конфигурация из четырёх модулей по 32 ГБ даёт 128 ГБ HBM2 и открывает модели, которые на одной потребительской карте не запускаются.

NVLink: зачем он нужен дома и когда без него можно обойтись

NVLink даёт до 300 ГБ/с между модулями. Когда модель разрезана на несколько GPU (tensor parallelism в vLLM, распределение слоёв в llama.cpp), активации постоянно ходят через интерконнект, и NVLink снижает накладные расходы по сравнению с PCIe. Если модель целиком помещается в один модуль, NVLink не даёт ничего, и платить за него смысла нет.

Практическая деталь: поддержка NVLink зависит от переходника, а сам мост - отдельный элемент сборки, который подбирают под конкретную конфигурацию. Проверяйте это до покупки модулей, а не после.

Сборка: адаптеры SXM2→PCIe, охлаждение и питание

Покупка модулей - только начало. Дальше понадобятся переходники, платформа, корпус и решение по охлаждению, а это отдельные деньги и время.

Питание. TDP одного модуля - 300 Вт, четыре карты забирают до 1,2 кВт только на GPU, а вся система с процессором и обвязкой доходит до 1,5 кВт. Блок питания берут с запасом, а часть переходников требует несколько разъёмов 8-pin. Бытовой проводке тоже стоит уделить внимание.

Охлаждение. SXM2-платформы рассчитаны на серверные шасси с мощным продувом. В обычный ATX-корпус такая сборка влезает с трудом, а турбины, отводящие по 300 Вт с каждой карты, слышно в соседней комнате. Реальные варианты - серверные турбины или кастомные водоблоки, и оба требуют места и бюджета.

Какие адаптеры искать и на что смотреть при покупке

  • поддержка именно SXM2, а не другого серверного форм-фактора;
  • наличие NVLink-разъёмов, если планируете два модуля и больше;
  • тип питания: PCIe 8-pin против серверных разъёмов;
  • активное охлаждение или посадочные места под него;
  • совместимость с ревизией конкретного модуля V100.

Дешёвый переходник без охлаждения под 300 Вт на карту - плохая идея: без активного отвода тепла модуль не выйдет на рабочий режим. Конкретных брендов и цен в разобранных источниках нет, поэтому уточняйте комплектацию у продавца и выясняйте, идёт ли в комплекте мост NVLink.

Программная совместимость: PyTorch, CUDA и sm_70 в 2026 году

Главный подводный камень всей затеи. Свежие сборки PyTorch с CUDA 12.8 и 12.9 больше не поддерживают архитектуру Volta. Habr формулирует это прямо: для V100 нужны CUDA 12.6 либо самостоятельная сборка под sm_70.

Рабочих путей два. Первый - зафиксировать CUDA 12.6 и не обновлять стек: проще, но ограничивает доступные версии библиотек. Второй - собрать PyTorch из исходников под sm_70: дольше, зато можно держать актуальные версии фреймворка при условии, что все зависимости собираются.

Дальше начинаются зависимости. Часть новых оптимизированных ядер под Volta не собирается или требует патчей, а готовые wheel-сборки под sm_70 могут отсутствовать. vLLM и llama.cpp в целом работают на Volta, но поддержку sm_70 в конкретной версии проверяют до покупки железа: обновление рантайма способно сломать рабочую конфигурацию.

Как собрать PyTorch под sm_70: общий план

  1. Зафиксировать версию CUDA (12.6) и драйвера, не обновлять их автоматически.
  2. Собрать PyTorch из исходников с TORCH_CUDA_ARCH_LIST=7.0.
  3. Проверить, собираются ли нужные расширения: transformers, bitsandbytes, квантизационные ядра.
  4. Отдельно протестировать vLLM или llama.cpp на поддержку sm_70 в вашей версии.
  5. Закрепить стек в контейнере или виртуальном окружении, чтобы обновление не сломало сборку.

Точные команды здесь не приводятся: они зависят от версии фреймворка и дистрибутива, а в разобранных источниках их нет. Вывод простой: это сборка для тех, кто готов возиться. Работы «из коробки» на Volta в 2026 году не будет.

Что реально запускается: Qwen, Gemma и другие локальные LLM

Пример из источников: Qwen3.8-27B полностью помещается в 32 ГБ VRAM модуля V100 SXM2 и работает на нём эффективно. Для моделей, которым 32 ГБ мало, остаётся multi-GPU: два модуля по 32 ГБ дают 64 ГБ, четыре - 128 ГБ HBM2 с NVLink между ними.

Gemma на Tesla V100 - рабочий сценарий, но поддержку sm_70 в конкретной версии рантайма проверяют отдельно: не все свежие ядра собираются под Volta. То же касается любой модели, требующей новых операторов.

Квантизация в форматах GPTQ, AWQ и GGUF снижает требования к памяти, но не все квантизационные ядра оптимизированы под Volta, поэтому выигрыш по скорости может оказаться меньше ожидаемого. Конкретных токенов в секунду для V100 источники не приводят: скорость зависит от модели, уровня квантизации, длины контекста и фреймворка. Ориентируйтесь на собственные замеры после сборки. Разницу между 1×32 ГБ, 2×16 ГБ V100 и современной 16-гиговой картой на Qwen 3.8 разбираем в материале про V100 против RTX 5060 Ti.

Сравнение конфигураций: 2×V100, 4×V100, RTX 3090, 4070 Ti, 5070

Сводка по конфигурациям, которые чаще всего рассматривают для домашнего инференса:

КонфигурацияVRAMПропускная способностьNVLinkСвежий PyTorch (CUDA 12.8/12.9)Ориентир по цене
2×V100 SXM2 16 ГБ32 ГБ HBM2в источниках не указанаДа, до 300 ГБ/сНет, нужна CUDA 12.6 или сборка под sm_70примерно $100-150 за модуль
2×V100 SXM2 32 ГБ64 ГБ HBM2900 ГБ/с на модульДа, до 300 ГБ/сНет, аналогичноцена 32-гиговых модулей в источниках не указана
4×V100 SXM2 32 ГБ128 ГБ HBM2900 ГБ/с на модульДа, до 300 ГБ/сНет, аналогичностоимость сборки «кусается»
RTX 309024 ГБ GDDR6Xоколо 936 ГБ/св источниках не указанДав источниках не указана
RTX 507012 ГБ GDDR7672 ГБ/св источниках не указанДав источниках не указана
RTX 4070 Ti12 ГБ GDDR6Xв источниках не указанав источниках не указанДав источниках не указана

Что из этого следует:

  • 2×V100 32 ГБ дают 64 ГБ HBM2 и NVLink, то есть почти втрое больше памяти, чем RTX 3090;
  • 4×V100 32 ГБ дают 128 ГБ HBM2, но требуют до 1,5 кВт питания, четырёх переходников и серьёзного охлаждения;
  • RTX 3090 даёт 24 ГБ GDDR6X и около 936 ГБ/с, работает со свежим стеком и не требует переходников;
  • RTX 5070 и 4070 Ti дают по 12 ГБ, чего мало для моделей, ради которых затевается сборка;
  • V100 проигрывает по удобству и выигрывает по объёму доступной VRAM за те же деньги.

Когда 2×V100 выгоднее одной RTX 3090

Критерий простой. Если нужная модель не помещается в 24 ГБ, а бюджет не растягивается на несколько современных карт, пара V100 SXM2 по 32 ГБ даёт 64 ГБ HBM2 и NVLink, и tensor parallelism по NVLink работает эффективнее, чем через PCIe. Плата за это: переходники, охлаждение, БП на 1 кВт и больше, CUDA 12.6 или сборка PyTorch под sm_70.

Если 24 ГБ хватает, RTX 3090 остаётся рациональным выбором: свежий стек, никаких переходников, предсказуемая гарантия. Похожие компромиссы разобраны в материале про две RTX 3080 20 ГБ против RTX 3090, где 40 ГБ видеопамяти собираются дешевле одной 24-гиговой карты.

Риски покупки б/у железа 2017-2018 годов

  • гарантии нет: модуль приходит как есть, а возврат зависит от продавца;
  • износ HBM2 и VRM: карты работали в дата-центрах под круглосуточной нагрузкой, часть ресурса уже израсходована;
  • ревизии и прошивки: возможна несовместимость с конкретным переходником;
  • ремонтопригодность: HBM2 распаяна рядом с кристаллом, замену памяти или чипа в бытовых условиях не делают;
  • срок жизни платформы: Volta уже выпала из свежих сборок PyTorch, дальше поддержка будет только сокращаться.

Цена $100-150 за модуль - это фактически цена риска. При покупке проверяйте все банки памяти, прогоняйте стресс-тест и отдельно тестируйте NVLink между модулями, если продавец даёт такую возможность. Восстановить HBM2 после выхода из строя не получится, поэтому диагностика до оплаты важнее скидки в двадцать долларов.

Альтернативы: когда лучше не экономить

  • Одна современная карта с 24 ГБ и больше. RTX 3090 или 5090 не требуют переходников, работают со свежим PyTorch и тише. Сравнение топовых решений для инференса разобрано в статье RTX 5090 против workstation-карт.
  • Apple Silicon с объединённой памятью: пропускная способность ниже, зато памяти много, а шума и переходников нет.
  • Аренда GPU в облаке: разумна для разовых задач и экспериментов, когда домашний сервер не нужен постоянно.
  • Серверные карты прошлых поколений от AMD, например Instinct V620 с 96 ГБ VRAM на карту. Вариант с тремя такими картами за $1050 разбирается в отдельном материале, но там своя специфика по ROCm и охлаждению в 2U-корпусе.

Критерий выбора простой. Разовая задача - аренда. Тихий постоянный сервер под модели до 24 ГБ - современная потребительская карта. Максимум VRAM за минимум денег и готовность возиться со стеком - V100 SXM2.

Итог: кому стоит, а кому не стоит брать V100 SXM2 в 2026

V100 SXM2 стоит брать, если вы готовы жить на CUDA 12.6 или собирать PyTorch под sm_70, можете организовать отвод 300 Вт с каждой карты и питание до 1,5 кВт, а models вам нужен именно объём HBM2 и NVLink за небольшие деньги. Не стоит, если нужен тихий ПК, свежий PyTorch без возни, современные графические функции или если модели хватает 24 ГБ.

Чек-лист перед покупкой:

  1. Убедитесь, что нужная модель не помещается в 24 ГБ. Если помещается, V100 не нужна.
  2. Посчитайте бюджет на переходники, охлаждение, корпус и блок питания: сами модули - не главная статья расходов.
  3. Проверьте, что сможете отвести 300 Вт с карты и до 1,5 кВт со всей системы, включая шум.
  4. Заранее решите, идёте вы на CUDA 12.6 или собираете PyTorch под sm_70.
  5. Проверьте поддержку sm_70 в вашей версии vLLM или llama.cpp до оплаты модулей.
  6. При покупке протестируйте память и NVLink, оцените ревизию модуля и комплект переходников.
  7. Оставьте запас на одну вышедшую из строя карту: гарантии на железо 2017-2018 годов нет.

Если все семь пунктов закрываются без напряжения, V100 SXM2 в 2026 году остаётся одним из самых дешёвых способов получить десятки гигабайт HBM2 и NVLink дома. Если вопросы вызывает половина списка, берите одну современную карту и не тратьте недели на пересборку фреймворка.

Подписаться на канал