Перейти к содержанию
Публикация AiManual

Домашний инференс-сервер на двух RTX 3090 и материнской плате ThinkPad: разбор нестандартной сборки 2400cc Inference Racer

TooManyPascals собрал 2400cc Inference Racer: две б/у RTX 3090 через NVLink, материнская плата ThinkPad с Ryzen 7 7840U, радиатор от VW Golf за €24 и патченый B

Коротко

Что будет в материале

  1. 01

    Что такое 2400cc Inference Racer и зачем понадобилась такая сборка

  2. 02

    Конфигурация железа: две RTX 3090, NVLink и мобильная платформа ThinkPad

  3. 03

    Нестандартное подключение GPU: WWAN, SSD и патчи BIOS

  4. 04

    Охлаждение: радиатор от VW Golf и самодельный водоблок

Что такое 2400cc Inference Racer и зачем понадобилась такая сборка

2400cc Inference Racer - домашний сервер для локального инференса LLM, который пользователь под ником TooManyPascals собрал в самодельном корпусе из ДСП. Вычислениями занимают две б/у видеокарты AORUS RTX 3090 XTREME WATERFORCE, объединённые через NVLink. Управляет всем отдельно запитанная материнская плата Lenovo ThinkPad с Ryzen 7 7840U и 64 ГБ оперативной памяти.

Задача, которую решает система, простая: получить 48 ГБ VRAM на двух картах и запускать LLM локально, не покупая серверное железо. Название 2400cc появилось из объёма контура охлаждения. В него залито около 2,4 литра coolant, отсюда аналогия с литражом автомобильного двигателя. Радиатор тоже автомобильный: деталь от VW Golf за €24.

Сборка интересна набором компромиссов. Рекордной производительности здесь нет. Мобильная платформа вместо серверной, слоты ноутбука вместо полноценных PCIe x16, патченый BIOS, контур, который приходится доливать. Ниже разберём каждый узел и посмотрим, где эти компромиссы бьют по практике.

Коротко о ролях компонентов:

  • две RTX 3090 по 24 ГБ каждая дают 48 ГБ VRAM суммарно;
  • NVLink соединяет карты напрямую, минуя медленный PCIe;
  • Ryzen 7 7840U с 64 ГБ RAM работает как хост-система и как аварийный режим без дискретных GPU;
  • Ubuntu и vLLM обслуживают модель Qwen3.8-27B.

Конфигурация железа: две RTX 3090, NVLink и мобильная платформа ThinkPad

Основа сборки собрана из трёх частей, которые обычно не встречаются вместе: две настольные видеокарты, ноутбучная материнская плата и внешний контур жидкостного охлаждения. Каждая часть выбрана под конкретное ограничение, и вместе они дают работающий инференс-сервер.

Почему RTX 3090, а не более новые карты

Ключевой аргумент - 24 ГБ видеопамяти на карту. Для локального инференса объём VRAM часто важнее вычислительной мощности: модель должна целиком помещаться в память, иначе начинается выгрузка на CPU и скорость падает. Две 3090 дают 48 ГБ, чего хватает для моделей уровня 27B и для более крупных квантованных вариантов.

Второй аргумент - NVLink. NVIDIA поддерживает его на RTX 3090, а на потребительских картах следующих поколений убрала, в том числе на RTX 4090. Для домашнего сервера это значит, что связка из двух 3090 умеет обмениваться данными напрямую, без оглядки на пропускную способность слотов.

Третий фактор - исполнение WATERFORCE. У AORUS RTX 3090 XTREME WATERFORCE охлаждение водяное с завода, поэтому подключить их к кастомному контуру проще, чем переделывать воздушные карты. Плюс вторичный рынок: карты прошлого поколения обходятся дешевле новых, хотя состояние и остаточный ресурс приходится оценивать на свой риск.

Роль NVLink в инференсе LLM

NVLink создаёт между GPU отдельный высокоскоростной канал. Когда модель не помещается в одну карту, её распределяют по нескольким GPU, и при тензорном параллелизме веса и промежуточные результаты постоянно ходят между картами. Чем быстрее этот обмен, тем меньше карты простаивают в ожидании данных.

В этой сборке NVLink ценен особенно. Обе карты подключены к материнской плате ноутбука по медленным линиям PCIe, и без прямого канала обмен шёл бы через слабое звено. NVLink снимает значительную часть нагрузки с PCIe, оставляя ему в основном загрузку модели и обмен с хостом.

Нестандартное подключение GPU: WWAN, SSD и патчи BIOS

Материнская плата ThinkPad не рассчитана на две дискретные видеокарты, поэтому слотов PCIe x16 на ней нет. Автор использовал то, что было: одна RTX 3090 подключена через WWAN-слот на PCIe Gen4 x1, вторая через SSD-слот на Gen2 x4. Первый слот изначально предназначен для модуля мобильной связи, второй для накопителя, и оба не проектировались под постоянную нагрузку от GPU.

Отдельная деталь: SSD-слот технически способен работать на Gen4 x4, но стабильность на такой скорости не подтвердилась. Автор описывает разницу между «технически способен» и «стабильно работает» как два разных понятия. На практике карта осталась на Gen2 x4.

Какие именно патчи BIOS потребовались

Штатная прошивка отказывалась работать с такой конфигурацией, и её пришлось править. Изменений три:

  1. удаление whitelist, то есть списка разрешённых устройств, который блокирует незнакомое железо;
  2. правка последовательности инициализации PCIe (power-up sequence), от которой зависит, увидит ли система карты при старте;
  3. отключение PCIe power-saving states, чтобы энергосбережение не сбрасывало медленные подключения.

Каждый пункт решает конкретную проблему, и без любого из них сборка не запустится. В описании проекта автор перечисляет все три правки. Работа с BIOS требует понимания того, что делаешь: неудачная модификация прошивки может превратить плату в кирпич.

Ограничения пропускной способности PCIe и их влияние

По спецификации PCIe 4.0 x1 даёт около 2 ГБ/с, PCIe 2.0 x4 примерно столько же. Обычный слот x16 в разы быстрее. Для инференса это не приговор: веса модели лежат в VRAM, и вычисления идут на GPU. Узкое место проявляется в другом: загрузка модели с диска по такому каналу занимает больше времени, а обмен активациями и выгрузка данных на CPU идут медленно.

NVLink частично закрывает вопрос обмена между картами, но не убирает ограничения на стороне хоста. Для Qwen3.8-27B этого хватает. Если поднимать модель крупнее или гонять несколько параллельных запросов с большим контекстом, именно PCIe станет первым местом, где система начнёт упираться.

Ещё одно ограничение: hot swap автору включить не удалось. Замена карты или другого компонента на ходу недоступна.

Охлаждение: радиатор от VW Golf и самодельный водоблок

Контур собран вокруг автомобильного радиатора от VW Golf за €24 и вмещает около 2,4 литра coolant. Отсюда и число в названии сборки. Материнская плата охлаждается отдельно: на неё поставили кастомный алюминиевый водоблок, слой термопасты Arctic и самодельное крепление, которое автор называет зажимом.

По словам автора сборки, надёжность охлаждения сейчас высокая, но утечка составляет менее 100 мл в день, особенно пока система не перегревается.

Плюсы и минусы автомобильного радиатора в ПК-контуре

Плюсы очевидны: цена, площадь рассеивания и доступность. Автомобильный радиатор рассчитан на отвод тепла от двигателя, поэтому по площади он обычно крупнее ПК-аналогов за те же деньги. Минусы тоже конкретные: фитинги и посадочные места не совпадают с ПК-стандартами, деталь приходится адаптировать, гарантии на неё нет, а материалы контура не всегда совместимы между собой.

Утечка меньше 100 мл в день означает регулярный контроль уровня. Если не следить за контуром, coolant может добраться до электроники, а это уже выход из строя карт или платы. Для лабораторного стенда такое допустимо, для сервера, который работает без присмотра, риск слишком высок.

Охлаждение материнской платы: самодельный водоблок

Материнская плата ThinkPad работает без корпуса, экрана, клавиатуры и батареи. Штатные радиаторы рассчитаны на воздушный поток внутри ноутбука, которого в открытой сборке нет. Водоблок на голой плате отводит тепло от VRM и чипсета, а зажим вместо крепёжных отверстий держит конструкцию вместе.

Такое решение работает, но требует аккуратности: давление на плату распределено неравномерно, а термопаста наносится в количестве, которое в обычной сборке показалось бы избыточным.

Программная часть: Ubuntu, vLLM и запуск Qwen3.8-27B

Система работает под Ubuntu. Основной сценарий: обслуживание модели Qwen3.8-27B через vLLM. Две RTX 3090 дают 48 ГБ VRAM, чего для модели такого размера достаточно, а NVLink ускоряет обмен при распределении по двум картам.

Как запускается Qwen3.8-27B через vLLM

vLLM - серверный движок для инференса LLM. Он держит несколько запросов одновременно, эффективно распределяет память через PagedAttention и разбивает модель по нескольким GPU при тензорном параллелизме. Для связки из двух карт это ровно тот сценарий, под который движок проектировался.

Настройка vLLM под Qwen и подбор параметров контекста - отдельная тема. Практический разбор запуска Qwen 3.8 27B на llama.cpp с квантизацией Q4_XS, кэшем KV и диагностикой нехватки VRAM есть в материале о локальном стеке для Qwen 3.8 27B на Debian. Там используется другой движок, но логика подбора контекста и контроля памяти переносится.

Режим без GPU: llama.cpp и Vulkan на Ryzen 7 7840U

Сборка умеет загружаться вообще без 3090. В таком режиме она превращается в маломощный сервер: меньшие модели запускаются на Ryzen 7 7840U через Vulkan и llama.cpp, используя 64 ГБ общей системной памяти. Производительность несопоставима с двумя дискретными картами, зато потребление в простое падает до уровня обычного мини-ПК.

Похожие сценарии на интегрированной графике разбирались в статье про инференс на Ryzen AI Max+ 395 с объединённой памятью: там тоже приходится считаться с пропускной способностью памяти и настройкой API, а не с объёмом VRAM.

Компромиссы и ограничения сборки: что нужно знать перед повторением

Всё описанное основано на публикации автора: независимых замеров производительности и проверки характеристик в источнике нет. Сборка держится на компромиссах, и они взаимосвязаны.

  • PCIe Gen4 x1 и Gen2 x4 вместо x16: медленная загрузка модели и узкий канал обмена с хостом.
  • Патченый BIOS: без трёх правок система не стартует с двумя картами, а ошибка в прошивке приводит к нерабочей плате.
  • Утечка контура менее 100 мл в день: нужен регулярный контроль уровня coolant.
  • Нет hot swap: поменять компонент на работающей системе нельзя.
  • Б/у карты и кустарное охлаждение платы: ресурс и надёжность никто не гарантирует.

Проблема утечки coolant и её последствия

Меньше 100 мл в день звучит терпимо, пока не посчитать объём: 2,4 литра контура при такой утечке теоретически уходят за несколько недель. Автор считает надёжность приемлемой, но это субъективная оценка, привязанная к тому, что система работает в контролируемых условиях. Проверка уровня жидкости и сухих следов под фитингами здесь обязательна.

Отсутствие hot swap и другие нерешённые задачи

Hot swap позволил бы менять карты или накопители без выключения. В домашнем сервере без него можно жить: перезагрузка занимает минуты. Для системы, к которой обращаются пользователи в локальной сети, это уже неудобно.

Помимо hot swap автор упоминает, что настройка производительности ещё не завершена. Другие нерешённые задачи в описании сборки не перечислены, так что потенциал дальнейших доработок можно оценивать только по текущему состоянию системы.

Можно ли повторить сборку и какие есть альтернативы

Повторить технически можно, но порог входа высокий. Нужны б/у RTX 3090 (на вторичном рынке они есть), отдельно купленная или снятая материнская плата ThinkPad с Ryzen 7 7840U, навыки работы с BIOS, опыт сборки СЖО и готовность к пайке и адаптации нестандартных фитингов. Детали контура и корпус придётся проектировать под себя: готового набора не существует.

Альтернативы зависят от того, что важнее.

  • Обычная ATX-платформа с несколькими слотами PCIe x16: дороже по плате и корпусу, зато без патчей BIOS и с нормальной пропускной способностью. Пример такой логики разобран в материале про домашний инференс-сервер на 128 ГБ VRAM, где упор сделан на серверные GPU и большой объём памяти.
  • Готовый б/у сервер: предсказуемое питание и охлаждение, но шум, габариты и проприетарные решения вендора.
  • Облачные GPU: нулевые затраты на железо и обслуживание, зато почасовая оплата и зависимость от провайдера.
  • Мини-ПК с объединённой памятью: компактно и тихо, но пропускная способность памяти заметно ниже, чем у дискретных карт.

Ещё один ограничитель связан с VRAM. Если модель выходит за пределы 48 ГБ, приходится либо сильно её квантовать, либо выгружать часть слоёв на CPU. Как это выглядит на практике при жёстком лимите памяти, разбирается в материале про запуск Qwen3.8-Flash на 12 ГБ VRAM.

Кому подходит такой подход и стоит ли вдохновляться

2400cc Inference Racer - рабочий пример того, что домашний инференс-сервер можно собрать из б/у карт, мобильной платы и автомобильного радиатора. Проект показывает, где именно возникают узкие места, когда экономишь на платформе: пропускная способность PCIe, питание, охлаждение, прошивка.

Подход подойдёт техническим энтузиастам, у которых есть время на эксперименты, навыки работы с железом и BIOS, а также терпимость к обслуживанию контура. Тем, кому нужен сервер для работы без постоянного вмешательства, лучше смотреть на стандартные платформы: там меньше переменных, которые могут отказать одновременно.

Практический вывод простой. NVLink действительно компенсирует слабый PCIe, а утечка coolant и отсутствие hot swap остаются нерешёнными задачами, которые придётся принять как есть. Если планируете свой стенд, начинайте с расчёта тепла и пропускной способности, а не с выбора карт. Карты поменять проще, чем платформу.

Подписаться на канал