Что такое 2400cc Inference Racer и зачем понадобилась такая сборка
2400cc Inference Racer - домашний сервер для локального инференса LLM, который пользователь под ником TooManyPascals собрал в самодельном корпусе из ДСП. Вычислениями занимают две б/у видеокарты AORUS RTX 3090 XTREME WATERFORCE, объединённые через NVLink. Управляет всем отдельно запитанная материнская плата Lenovo ThinkPad с Ryzen 7 7840U и 64 ГБ оперативной памяти.
Задача, которую решает система, простая: получить 48 ГБ VRAM на двух картах и запускать LLM локально, не покупая серверное железо. Название 2400cc появилось из объёма контура охлаждения. В него залито около 2,4 литра coolant, отсюда аналогия с литражом автомобильного двигателя. Радиатор тоже автомобильный: деталь от VW Golf за €24.
Сборка интересна набором компромиссов. Рекордной производительности здесь нет. Мобильная платформа вместо серверной, слоты ноутбука вместо полноценных PCIe x16, патченый BIOS, контур, который приходится доливать. Ниже разберём каждый узел и посмотрим, где эти компромиссы бьют по практике.
Коротко о ролях компонентов:
- две RTX 3090 по 24 ГБ каждая дают 48 ГБ VRAM суммарно;
- NVLink соединяет карты напрямую, минуя медленный PCIe;
- Ryzen 7 7840U с 64 ГБ RAM работает как хост-система и как аварийный режим без дискретных GPU;
- Ubuntu и vLLM обслуживают модель Qwen3.8-27B.
Конфигурация железа: две RTX 3090, NVLink и мобильная платформа ThinkPad
Основа сборки собрана из трёх частей, которые обычно не встречаются вместе: две настольные видеокарты, ноутбучная материнская плата и внешний контур жидкостного охлаждения. Каждая часть выбрана под конкретное ограничение, и вместе они дают работающий инференс-сервер.
Почему RTX 3090, а не более новые карты
Ключевой аргумент - 24 ГБ видеопамяти на карту. Для локального инференса объём VRAM часто важнее вычислительной мощности: модель должна целиком помещаться в память, иначе начинается выгрузка на CPU и скорость падает. Две 3090 дают 48 ГБ, чего хватает для моделей уровня 27B и для более крупных квантованных вариантов.
Второй аргумент - NVLink. NVIDIA поддерживает его на RTX 3090, а на потребительских картах следующих поколений убрала, в том числе на RTX 4090. Для домашнего сервера это значит, что связка из двух 3090 умеет обмениваться данными напрямую, без оглядки на пропускную способность слотов.
Третий фактор - исполнение WATERFORCE. У AORUS RTX 3090 XTREME WATERFORCE охлаждение водяное с завода, поэтому подключить их к кастомному контуру проще, чем переделывать воздушные карты. Плюс вторичный рынок: карты прошлого поколения обходятся дешевле новых, хотя состояние и остаточный ресурс приходится оценивать на свой риск.
Роль NVLink в инференсе LLM
NVLink создаёт между GPU отдельный высокоскоростной канал. Когда модель не помещается в одну карту, её распределяют по нескольким GPU, и при тензорном параллелизме веса и промежуточные результаты постоянно ходят между картами. Чем быстрее этот обмен, тем меньше карты простаивают в ожидании данных.
В этой сборке NVLink ценен особенно. Обе карты подключены к материнской плате ноутбука по медленным линиям PCIe, и без прямого канала обмен шёл бы через слабое звено. NVLink снимает значительную часть нагрузки с PCIe, оставляя ему в основном загрузку модели и обмен с хостом.
Нестандартное подключение GPU: WWAN, SSD и патчи BIOS
Материнская плата ThinkPad не рассчитана на две дискретные видеокарты, поэтому слотов PCIe x16 на ней нет. Автор использовал то, что было: одна RTX 3090 подключена через WWAN-слот на PCIe Gen4 x1, вторая через SSD-слот на Gen2 x4. Первый слот изначально предназначен для модуля мобильной связи, второй для накопителя, и оба не проектировались под постоянную нагрузку от GPU.
Отдельная деталь: SSD-слот технически способен работать на Gen4 x4, но стабильность на такой скорости не подтвердилась. Автор описывает разницу между «технически способен» и «стабильно работает» как два разных понятия. На практике карта осталась на Gen2 x4.
Какие именно патчи BIOS потребовались
Штатная прошивка отказывалась работать с такой конфигурацией, и её пришлось править. Изменений три:
- удаление whitelist, то есть списка разрешённых устройств, который блокирует незнакомое железо;
- правка последовательности инициализации PCIe (power-up sequence), от которой зависит, увидит ли система карты при старте;
- отключение PCIe power-saving states, чтобы энергосбережение не сбрасывало медленные подключения.
Каждый пункт решает конкретную проблему, и без любого из них сборка не запустится. В описании проекта автор перечисляет все три правки. Работа с BIOS требует понимания того, что делаешь: неудачная модификация прошивки может превратить плату в кирпич.
Ограничения пропускной способности PCIe и их влияние
По спецификации PCIe 4.0 x1 даёт около 2 ГБ/с, PCIe 2.0 x4 примерно столько же. Обычный слот x16 в разы быстрее. Для инференса это не приговор: веса модели лежат в VRAM, и вычисления идут на GPU. Узкое место проявляется в другом: загрузка модели с диска по такому каналу занимает больше времени, а обмен активациями и выгрузка данных на CPU идут медленно.
NVLink частично закрывает вопрос обмена между картами, но не убирает ограничения на стороне хоста. Для Qwen3.8-27B этого хватает. Если поднимать модель крупнее или гонять несколько параллельных запросов с большим контекстом, именно PCIe станет первым местом, где система начнёт упираться.
Ещё одно ограничение: hot swap автору включить не удалось. Замена карты или другого компонента на ходу недоступна.
Охлаждение: радиатор от VW Golf и самодельный водоблок
Контур собран вокруг автомобильного радиатора от VW Golf за €24 и вмещает около 2,4 литра coolant. Отсюда и число в названии сборки. Материнская плата охлаждается отдельно: на неё поставили кастомный алюминиевый водоблок, слой термопасты Arctic и самодельное крепление, которое автор называет зажимом.
По словам автора сборки, надёжность охлаждения сейчас высокая, но утечка составляет менее 100 мл в день, особенно пока система не перегревается.
Плюсы и минусы автомобильного радиатора в ПК-контуре
Плюсы очевидны: цена, площадь рассеивания и доступность. Автомобильный радиатор рассчитан на отвод тепла от двигателя, поэтому по площади он обычно крупнее ПК-аналогов за те же деньги. Минусы тоже конкретные: фитинги и посадочные места не совпадают с ПК-стандартами, деталь приходится адаптировать, гарантии на неё нет, а материалы контура не всегда совместимы между собой.
Утечка меньше 100 мл в день означает регулярный контроль уровня. Если не следить за контуром, coolant может добраться до электроники, а это уже выход из строя карт или платы. Для лабораторного стенда такое допустимо, для сервера, который работает без присмотра, риск слишком высок.
Охлаждение материнской платы: самодельный водоблок
Материнская плата ThinkPad работает без корпуса, экрана, клавиатуры и батареи. Штатные радиаторы рассчитаны на воздушный поток внутри ноутбука, которого в открытой сборке нет. Водоблок на голой плате отводит тепло от VRM и чипсета, а зажим вместо крепёжных отверстий держит конструкцию вместе.
Такое решение работает, но требует аккуратности: давление на плату распределено неравномерно, а термопаста наносится в количестве, которое в обычной сборке показалось бы избыточным.
Программная часть: Ubuntu, vLLM и запуск Qwen3.8-27B
Система работает под Ubuntu. Основной сценарий: обслуживание модели Qwen3.8-27B через vLLM. Две RTX 3090 дают 48 ГБ VRAM, чего для модели такого размера достаточно, а NVLink ускоряет обмен при распределении по двум картам.
Как запускается Qwen3.8-27B через vLLM
vLLM - серверный движок для инференса LLM. Он держит несколько запросов одновременно, эффективно распределяет память через PagedAttention и разбивает модель по нескольким GPU при тензорном параллелизме. Для связки из двух карт это ровно тот сценарий, под который движок проектировался.
Настройка vLLM под Qwen и подбор параметров контекста - отдельная тема. Практический разбор запуска Qwen 3.8 27B на llama.cpp с квантизацией Q4_XS, кэшем KV и диагностикой нехватки VRAM есть в материале о локальном стеке для Qwen 3.8 27B на Debian. Там используется другой движок, но логика подбора контекста и контроля памяти переносится.
Режим без GPU: llama.cpp и Vulkan на Ryzen 7 7840U
Сборка умеет загружаться вообще без 3090. В таком режиме она превращается в маломощный сервер: меньшие модели запускаются на Ryzen 7 7840U через Vulkan и llama.cpp, используя 64 ГБ общей системной памяти. Производительность несопоставима с двумя дискретными картами, зато потребление в простое падает до уровня обычного мини-ПК.
Похожие сценарии на интегрированной графике разбирались в статье про инференс на Ryzen AI Max+ 395 с объединённой памятью: там тоже приходится считаться с пропускной способностью памяти и настройкой API, а не с объёмом VRAM.
Компромиссы и ограничения сборки: что нужно знать перед повторением
Всё описанное основано на публикации автора: независимых замеров производительности и проверки характеристик в источнике нет. Сборка держится на компромиссах, и они взаимосвязаны.
- PCIe Gen4 x1 и Gen2 x4 вместо x16: медленная загрузка модели и узкий канал обмена с хостом.
- Патченый BIOS: без трёх правок система не стартует с двумя картами, а ошибка в прошивке приводит к нерабочей плате.
- Утечка контура менее 100 мл в день: нужен регулярный контроль уровня coolant.
- Нет hot swap: поменять компонент на работающей системе нельзя.
- Б/у карты и кустарное охлаждение платы: ресурс и надёжность никто не гарантирует.
Проблема утечки coolant и её последствия
Меньше 100 мл в день звучит терпимо, пока не посчитать объём: 2,4 литра контура при такой утечке теоретически уходят за несколько недель. Автор считает надёжность приемлемой, но это субъективная оценка, привязанная к тому, что система работает в контролируемых условиях. Проверка уровня жидкости и сухих следов под фитингами здесь обязательна.
Отсутствие hot swap и другие нерешённые задачи
Hot swap позволил бы менять карты или накопители без выключения. В домашнем сервере без него можно жить: перезагрузка занимает минуты. Для системы, к которой обращаются пользователи в локальной сети, это уже неудобно.
Помимо hot swap автор упоминает, что настройка производительности ещё не завершена. Другие нерешённые задачи в описании сборки не перечислены, так что потенциал дальнейших доработок можно оценивать только по текущему состоянию системы.
Можно ли повторить сборку и какие есть альтернативы
Повторить технически можно, но порог входа высокий. Нужны б/у RTX 3090 (на вторичном рынке они есть), отдельно купленная или снятая материнская плата ThinkPad с Ryzen 7 7840U, навыки работы с BIOS, опыт сборки СЖО и готовность к пайке и адаптации нестандартных фитингов. Детали контура и корпус придётся проектировать под себя: готового набора не существует.
Альтернативы зависят от того, что важнее.
- Обычная ATX-платформа с несколькими слотами PCIe x16: дороже по плате и корпусу, зато без патчей BIOS и с нормальной пропускной способностью. Пример такой логики разобран в материале про домашний инференс-сервер на 128 ГБ VRAM, где упор сделан на серверные GPU и большой объём памяти.
- Готовый б/у сервер: предсказуемое питание и охлаждение, но шум, габариты и проприетарные решения вендора.
- Облачные GPU: нулевые затраты на железо и обслуживание, зато почасовая оплата и зависимость от провайдера.
- Мини-ПК с объединённой памятью: компактно и тихо, но пропускная способность памяти заметно ниже, чем у дискретных карт.
Ещё один ограничитель связан с VRAM. Если модель выходит за пределы 48 ГБ, приходится либо сильно её квантовать, либо выгружать часть слоёв на CPU. Как это выглядит на практике при жёстком лимите памяти, разбирается в материале про запуск Qwen3.8-Flash на 12 ГБ VRAM.
Кому подходит такой подход и стоит ли вдохновляться
2400cc Inference Racer - рабочий пример того, что домашний инференс-сервер можно собрать из б/у карт, мобильной платы и автомобильного радиатора. Проект показывает, где именно возникают узкие места, когда экономишь на платформе: пропускная способность PCIe, питание, охлаждение, прошивка.
Подход подойдёт техническим энтузиастам, у которых есть время на эксперименты, навыки работы с железом и BIOS, а также терпимость к обслуживанию контура. Тем, кому нужен сервер для работы без постоянного вмешательства, лучше смотреть на стандартные платформы: там меньше переменных, которые могут отказать одновременно.
Практический вывод простой. NVLink действительно компенсирует слабый PCIe, а утечка coolant и отсутствие hot swap остаются нерешёнными задачами, которые придётся принять как есть. Если планируете свой стенд, начинайте с расчёта тепла и пропускной способности, а не с выбора карт. Карты поменять проще, чем платформу.