Апгрейд домашнего AI-сервера упёрся в слоты расширения. Четвёртая Tesla T4 не помещалась на плате Dell R640: слотов PCIe 16x не хватало, трёх штук. Процессор и объём памяти тут ни при чём, в исходной конфигурации стояли два Xeon 8268, три Tesla T4 и 1.5 ТБ RAM 2666 МГц. Новая платформа Supermicro X11SPA-T в версии с 10GbE даёт семь слотов 16x, поэтому в сборке теперь четыре T4, а в перспективе может быть до семи.
Остальные компоненты новой конфигурации: Xeon W-3225, который шёл в комплекте с платой, 768 ГБ ECC-памяти на 2666 МГц, блок питания Corsair RM1000x Gold и четыре SATA-накопителя Samsung EVO 870 по 1 ТБ. Для пассивных Tesla T4 заказаны кастомные турбины (blowers) и SATA-хаб питания на четыре вентилятора. Автор описывает свою сборку в обсуждении на r/LocalLLaMA.
Контекст, без которого цифры вводят в заблуждение: сборка не завершена. Часть деталей в пути, Xeon W-3275M не получен, конфигурация на семь GPU заявлена как перспектива, а не как работающая система. Деньги тоже ориентировочные: 64 ГБ VRAM на четырёх картах есть, добавить ещё 48 ГБ можно примерно за $1500, сама Tesla T4 на вторичном рынке стоит около $450.
Зачем менять Dell R640: три T4 упираются в слоты PCIe 16x
Что было в исходной сборке на R640
Стартовая конфигурация: Dell R640, два Xeon 8268, три Tesla T4 и 1.5 ТБ памяти 2666 МГц на enterprise-дисках. Это рабочая машина, с которой автор запускал локальные модели. Объём RAM здесь нетипичный для домашних сборок: 1.5 ТБ нужны в первую очередь под то, что не влезло в VRAM, например под экспертные слои MoE-моделей или крупные кэши.
Почему трёх слотов 16x не хватило
Четвёртая Tesla T4 у автора уже была, он её не докупал. Поставить карту оказалось некуда: на плате R640 не хватало слотов PCIe 16x. Ограничение узкое и физическое, оно касается количества и раскладки слотов, а не мощности блока питания и не охлаждения. Карта есть, места под неё нет.
R640 при этом остаётся работоспособным сервером со своим сценарием: плотное рэк-шасси, рассчитанное на ограниченный набор полноразмерных карт. Как только задача выходит за три пассивных GPU, платформа упирается в геометрию. Апгрейда внутри этой же платы нет.
Новая платформа: Supermicro X11SPA-T и Xeon W-3225
Семь слотов 16x как главный аргумент
Сравнение простое: три слота PCIe 16x на R640 против семи на X11SPA-T. Это снимает ограничение, из-за которого четвёртая карта лежала без дела, и оставляет запас на будущее: автор держит в уме конфигурацию до семи Tesla T4. Плата взята в версии с 10GbE, что практичнее для сервера, к которому обращаются другие машины в сети.
Семь слотов в спецификации и семь одновременно работающих пассивных карт, которые не мешают друг другу, это разные вещи. Пассивные GPU выделяют тепло, каждая карта занимает место по высоте корпуса, а питание на семь ускорителей нужно считать отдельно. Сейчас в сборке четыре T4.
Xeon W-3225 сейчас и W-3275M в перспективе
Плата пришла с процессором Xeon W-3225, он и стоит в конфигурации. Более мощный Xeon W-3275M автор ожидает получить, на момент публикации его нет. Менять CPU сразу не обязательно: при инференсе LLM узкое место обычно в VRAM и пропускной способности памяти GPU, а не в ядрах.
Процессор начинает влиять, когда часть весов живёт в системной памяти: тогда скорость упирается в CPU и RAM, а не в ускоритель. Разбор такого сценария есть в статье про апгрейд на EPYC 7551 и двух RTX 3090: третья видеокарта или новый CPU. Там же видно, как параллельные запросы просаживают конфигурацию, у которой часть модели вынесена в RAM.
Память, питание и накопители в новой сборке
768 ГБ ECC 2666 МГц: почему это максимум платы
768 ГБ ECC на 2666 МГц - не произвольное число, а максимум для X11SPA-T. Память автор отделил от исходной машины, то есть в новую сборку она переехала из старой. Для тех, кто считает бюджет перехода, это важная деталь: менять платформу не всегда значит покупать RAM заново.
Большой объём памяти полезен, когда модель не влезает в 64 ГБ VRAM и часть весов приходится держать в RAM. Ускорения генерации это не даёт: в таком режиме скорость определяют память и процессор. Потолок в 768 ГБ означает, что запас есть только под те задачи, которые упираются в объём.
Corsair RM1000x Gold и четыре Samsung EVO 870
Блок питания новой сборки - Corsair RM1000x Gold. Накопители - четыре SATA SSD Samsung EVO 870 по 1 ТБ, суммарно 4 ТБ под модели, датасеты и кэши. Скорость SATA заметна при загрузке весов, а во время самого инференса основные данные ходят внутри VRAM.
Хватает ли 1000 Вт на четыре Tesla T4 и что потребуется при семи картах, автор не измерял и не заявлял. Это открытый вопрос, который придётся решать отдельно, если сборка дорастёт до семи GPU.
Охлаждение пассивных Tesla T4: кастомные турбины и SATA-хаб
Почему T4 нельзя оставить без обдува
Tesla T4 - пассивная карта: собственных вентиляторов у неё нет, поток воздуха создаёт серверное шасси. В обычном корпусе этого потока не будет, поэтому карте нужен организованный обдув. Решение автора - кастомные турбины (blowers) под каждую карту. Без активного обдува пассивные ускорители в открытой сборке работать штатно не смогут: это условие запуска, а не вопрос комфорта.
Модели турбин, обороты и температуры автор не приводит, так что сравнивать конкретные варианты охлаждения пока не с чем.
Как питаются вентиляторы: SATA-хаб на 4 вентилятора
Для питания обдува куплен SATA-хаб на четыре вентилятора: он берёт питание с SATA-разъёма блока питания и раздаёт его на несколько вентиляторов. Схема типовая для кастомных сборок, где вентиляторов больше, чем разъёмов на плате. Турбины и SATA-кабели на момент публикации ещё в пути, поэтому связка не проверена в работе, и утверждать, что она справится с четырьмя картами, нельзя.
Экономика апгрейда: 64 ГБ VRAM сейчас и +48 ГБ за $1500
Почему 4×T4 - дешёвый способ набрать VRAM
Четыре Tesla T4 дают 64 ГБ VRAM, а на вторичном рынке такая карта стоит около $450. Логика выбора: собрать большой суммарный объём из нескольких дешёвых карт вместо одной дорогой с сопоставимой памятью. Цена за гигабайт выходит ниже, платить приходится другим. Скорость на карту меньше, чем у современных ускорителей, FP8 Turing не поддерживает, а охлаждение нескольких пассивных карт превращается в отдельный проект. Цену в $450 за карту автор называет по своему опыту вторичного рынка.
Что даёт +48 ГБ VRAM и когда это оправдано
Ещё 48 ГБ обойдутся примерно в $1500: это три дополнительных T4 по текущим ценам вторичного рынка плюс расходы на охлаждение и питание. Смысл появляется тогда, когда модель или контекст перестают влезать в 64 ГБ. Если задача решается в существующем объёме, дополнительные карты сами по себе генерацию не ускорят.
Что именно определяет, хватает ли VRAM под нужную модель, и какие параметры GPU решают, разобрано в статье про выход из категории «GPU poor». Цены на T4 и на дополнительные 48 ГБ - ориентиры, они меняются.
Что реально запускать на 4×Tesla T4 и 64 ГБ VRAM
Инференс LLM: где 64 ГБ VRAM реально помогают
64 ГБ суммарной памяти снимают главное ограничение домашних сборок: модель перестаёт зависеть от одной карты. Практических сценариев три: модели, которые не помещаются в 16 или 24 ГБ на одной карте; длинный контекст, который сам съедает память; несколько параллельных запросов, когда веса уже загружены и делятся между ними. Квантизация остаётся нужной, но выбор уровней становится шире, потому что часть весов можно держать на GPU, а не вытеснять в RAM.
Где сборка упрётся: обучение, FP8 и пропускная способность
Tesla T4 построена на архитектуре Turing и имеет 16 ГБ памяти на карту. FP8 она не поддерживает, пропускная способность памяти ниже, чем у современных ускорителей. Для инференса квантизованных открытых моделей этого достаточно, для обучения и тонкой настройки крупных моделей сборка не предназначена.
Второе ограничение - программное. При нескольких GPU многое зависит от того, как конкретный рантайм раскладывает модель по картам. Открытых измерений для этой конфигурации нет: первые результаты появятся после сборки.
Стоит ли повторять этот путь: кому подходит апгрейд
Когда X11SPA-T + 4×T4 - разумный выбор
Апгрейд оправдан в четырёх случаях. Если у вас уже лежат Tesla T4 или вы готовы брать их на вторичном рынке по цене около $450. Если приоритет - объём VRAM, а не скорость отдельной карты. Если вы готовы возиться с кастомной сборкой: турбины, хабы питания, подбор корпуса, контроль обдува. Если память и часть железа переезжают из старой машины, как получилось с 768 ГБ ECC.
Дополнительный аргумент - запас по слотам. Плата на семь слотов 16x позволяет наращивать VRAM постепенно, докупая карты по одной, а не меняя всю платформу.
Когда лучше смотреть в другую сторону
Если нужна высокая скорость на одной карте, поддержка FP8 или обучение моделей, четыре T4 не тот путь. Похожая логика «много дешёвой VRAM за небольшие деньги» на других картах разобрана в материалах про три AMD Instinct V620 на 96 ГБ VRAM и про домашний сервер за $3k на четырёх Radeon V620. Там свои компромиссы: ROCm вместо CUDA, охлаждение в 2U, энергопотребление 500-900 Вт в зависимости от фазы работы. Выбор между этими путями стоит делать по тому, какой софт вы собираетесь запускать и сколько готовы потратить времени на настройку.
Что осталось сделать и чего ждать от сборки
Статус на момент публикации: сборка не завершена. SATA-кабели и турбины ещё в пути, Xeon W-3275M не получен, в работе остаётся W-3225. Конфигурация на семь Tesla T4 существует как перспектива: сейчас карт четыре, и даже они не запущены в финальном виде.
После сборки предстоит проверить три вещи: держат ли турбины четыре пассивные карты под нагрузкой; хватает ли RM1000x Gold и что потребуется при семи GPU; как выбранный рантайм раскладывает модели по четырём картам. Всё описанное - опыт одного пользователя из обсуждения на r/LocalLLaMA, независимыми тестами эти данные не подтверждены.
Практический вывод простой. Если у вас есть Tesla T4 и вы упираетесь в объём VRAM, плата на семь слотов 16x решает проблему дешевле, чем покупка новой карты. Если нужны скорость, FP8 или обучение моделей, бюджет лучше считать под другую платформу.