Перейти к содержанию
Публикация AiManual

Домашний AI-сервер на 12×CMP 170HX: 768 ГБ VRAM дешевле одной RTX 6000 Pro - разбор сборки segmond

Пользователь segmond собрал сервер из 12 видеокарт Nvidia CMP 170HX по 64 ГБ и утверждает, что 768 ГБ VRAM обошлись дешевле одной RTX 6000 Pro. Разбираем, какие

Коротко

Что будет в материале

  1. 01

    Что собрал segmond: 12×CMP 170HX и 768 ГБ VRAM

  2. 02

    Что такое Nvidia CMP 170HX и почему она привлекает для LLM

  3. 03

    Сколько реально стоит сборка на 12×CMP 170HX

  4. 04

    Совместимость CMP 170HX с vllm и llama.cpp: что нужно проверить

Пользователь под ником segmond показал домашний сервер из 12 видеокарт Nvidia CMP 170HX по 64 ГБ каждая. Суммарно это 768 ГБ видеопамяти в одной машине, и, по словам автора, сборка обошлась дешевле одной RTX 6000 Pro (пост в r/LocalLLaMA).

Экономика здесь строится не на новых картах. CMP 170HX, майнинговое железо Nvidia на чипе GA100 с памятью HBM2e и без видеовыходов, продаётся на вторичном рынке за сумму, которая на новом рынке не даёт и десятой доли такого объёма. Отсюда и результат: 768 ГБ там, где один современный ускоритель даёт десятки гигабайт.

Важная оговорка: всё изложенное дальше основано на посте автора. Независимых тестов нет, конкретных цифр по стоимости, энергопотреблению, шуму и окупаемости segmond не приводит. Ниже разбираем, что подтверждено, что требует проверки и с чем столкнётся тот, кто захочет повторить конфигурацию.

Что собрал segmond: 12×CMP 170HX и 768 ГБ VRAM

Состав железа простой: 12 карт Nvidia CMP 170HX по 64 ГБ, итого 768 ГБ VRAM. Стоимость автор описывает одной фразой: меньше, чем стоит одна RTX 6000 Pro. Производительность он тоже оценивает без цифр, утверждая, что одиночная RTX 6000 или M3 Mac Studio могут только позавидовать.

Система не работает в одиночку. segmond подключил её оптикой к другой машине и использует RPC, когда нужно больше памяти. Это типовой приём распределённого инференса: часть слоёв живёт на втором хосте, и сеть должна выдерживать перекачку активаций и KV-кэша. Оптика нужна, чтобы задержка не съела выигрыш от добавленной памяти.

Список моделей, которые, по словам автора, на этом запускаются: GLM5.3, DSv4.1Flash, Qwen3.8Flash, Qwen3.8-2.4T, KimiK3 и MiniMaxM3. Движки - vllm или llama.cpp (источник). Ни по одной модели не указано, в какой квантизации она работает, с какой длиной контекста и с какой скоростью генерации. Это принципиально: 768 ГБ решают вопрос «влезет ли модель», но ничего не говорят о том, насколько быстро она будет отвечать.

Итог по фактам: подтверждён состав сборки, заявленная цена относительно RTX 6000 Pro, оптическое подключение для RPC и список моделей. Всё остальное - производительность, стабильность, энергопотребление - остаётся утверждениями без подтверждения.

Что такое Nvidia CMP 170HX и почему она привлекает для LLM

CMP 170HX - карта из линейки Nvidia CMP (Cryptocurrency Mining Processor), созданной для майнинга и лишённой видеовыходов. Внутри стоит чип GA100, тот же, что и в ускорителях A100, но с урезанной конфигурацией и другой ценой. Подробный разбор этой карты и её модификации есть в отдельном материале на AI-Manual.

Интерес для локального инференса создаёт не скорость, а объём памяти на одной плате: 64 ГБ HBM2e. Для сравнения, 70-миллиардная модель в 4-битной квантизации требует примерно 35-40 ГБ только под веса, и такая карта держит её целиком, без выгрузки на CPU.

Ключевые характеристики CMP 170HX: 64 ГБ HBM2e и отсутствие видеовыходов

Отсутствие видеовыходов означает, что карту нельзя использовать для вывода картинки, но вычислениям это не мешает: cuBLAS и CUDA-ядра работают с памятью и вычислительными блоками. В сообществе вокруг CMP 170HX ходят цифры пропускной способности около 1,49 ТБ/с и пониженного энергопотребления около 180 Вт на карту. Эти значения стоит проверять на конкретном экземпляре: модификацию памяти с 8 ГБ до 64 ГБ выполняют сторонние мастерские, а не Nvidia, и партии между собой различаются.

Почему майнинговые карты стали интересны для AI-серверов

После спада майнинга на вторичный рынок вышли тысячи GPU с большим объёмом памяти. Логика для LLM отличается от игровой: объём VRAM часто важнее пиковой вычислительной мощности, потому что веса модели должны физически поместиться в память. Если не помещаются, часть слоёв уезжает на CPU, и скорость падает кратно. Карта с 64 ГБ, купленная за сотни долларов, закрывает задачу, которая на новом рынке стоит несопоставимо дороже.

Обратная сторона: это сценарий без поддержки вендора. Гарантии нет, драйверы могут не знать о конкретной модификации, охлаждение придётся организовывать самостоятельно.

Сколько реально стоит сборка на 12×CMP 170HX

Точных сумм segmond не называет. Единственная привязка - формулировка «меньше, чем стоит одна RTX 6000 Pro» (пост). Проверить это нечем: цены на вторичке зависят от партии, состояния карт, продавца и наличия доставки.

Ориентир даёт разбор четырёх CMP170HX на AI-Manual: там фигурирует цена около $200 за карту с 64 ГБ. Если взять её как отправную точку, 12 карт - это примерно $2 400 только за GPU. Дальше начинаются расходы, которых в посте нет вообще.

Сравнение с RTX 6000 Pro: что именно дешевле

Автор сравнивает 12 карт с одной профессиональной картой текущего поколения. По объёму памяти сравнение в пользу сборки: 768 ГБ против десятков гигабайт у одного ускорителя. По всему остальному выигрыша нет. Энергоэффективность, гарантия, поддержка драйверов, предсказуемость поведения и инженерная простота остаются на стороне новой карты, и в посте это никак не опровергается.

Скрытые расходы: материнская плата, БП, охлаждение

12 карт - это не «купил карты и поставил». Понадобится платформа с большим числом PCIe-слотов либо райзеры с компромиссом по ширине шины, блок питания или несколько блоков, продуманный продув корпуса и отдельная электрическая линия. Отдельная статья расходов - KV-кэш и рантайм: планировать бюджет только по цене карт и размеру весов модели нельзя, о чём подробно сказано в гайде по выбору GPU для локальных LLM.

  • Платформа: серверная материнская плата или набор райзеров, часто x4 на карту.
  • Питание: если карта удерживается около 180 Вт, 12 штук дают порядка 2,2 кВт только на GPU, плюс процессор, накопители и вентиляторы. Бытовая розетка 16 А при 220 В даёт около 3,5 кВт, то есть работа идёт у самого предела, а длительная нагрузка на пределе - плохая идея.
  • Охлаждение: 2,2 кВт тепла нужно куда-то девать, и это сопоставимо с мощным обогревателем, работающим круглосуточно.
  • Электрика: проводка, автоматы, возможно отдельная линия и отдельное помещение.

Плюс карты без гарантии: одна выходит из строя, и заменить её по RMA нельзя. Итоговый бюджет вполне может оказаться заметно выше арифметики «цена карты × 12».

Совместимость CMP 170HX с vllm и llama.cpp: что нужно проверить

segmond пишет про vllm и llama.cpp, но не приводит версий, флагов запуска и логов. Проверить это утверждение со стороны нельзя, поэтому остаётся разобрать типовые точки отказа.

Драйверы и CUDA: поддержка CMP 170HX

CMP-карты работают на драйверах Nvidia и CUDA-стеке. Отсутствие видеовыходов вычислениям не мешает: библиотеки вроде cuBLAS обращаются к памяти и вычислительным блокам напрямую. Практический риск в другом: после сторонней модификации карта может определяться как устройство с другим идентификатором, и часть библиотек откажется с ней работать. Второй фактор - архитектура GA100 из поколения Ampere: чем новее версия фреймворка, тем выше шанс, что часть оптимизаций для старых чипов уже не поддерживается.

Ограничения vllm и llama.cpp на нестандартном железе

vllm рассчитан на современные GPU и активно использует paged attention, кастомные ядра и определённые форматы данных. Если карта не проходит проверки по compute capability или не поддерживает нужные типы, движок либо не запустится, либо уйдёт на медленный запасной путь. llama.cpp терпимее к железу и умеет частичную выгрузку на CPU, но за гибкость приходится платить скоростью.

Практический ориентир есть: в разборе практических тестов CMP170HX описаны конфигурации от одной до четырёх карт, работа в llama.cpp, скорость до 120 токенов/с на 20B-моделях и полный контекст 1M для одной из моделей при квантизации Q4. Там же отмечено, что производительность соответствует поколению Ampere, а узкие места лежат в prefill и в однослотовых запросах.

Чек-лист проверки до масштабирования на 12 карт:

  1. Купить одну карту и убедиться, что драйвер видит её и определяет полный объём памяти.
  2. Прогнать llama.cpp с моделью, которая точно должна влезать.
  3. Повторить то же на vllm и посмотреть, нет ли откатов на медленные ядра.
  4. Замерить энергопотребление и температуру конкретного экземпляра под длительной нагрузкой.
  5. Только после этого принимать решение о закупке остальных карт.

Пропускная способность памяти и питание: главные ограничения сборки

Скорость инференса: что важнее объёма VRAM

Объём памяти решает, поместится ли модель. Скорость генерации решает пропускная способность: на каждый новый токен нужно прочитать веса активных параметров, и чем быстрее память, тем быстрее ответ. 768 ГБ позволяют запустить модель, которую иначе не запустить на локальном железе, но сами по себе не ускоряют её.

Второй фактор - параллелизм. 12 карт превращаются в единый пул только тогда, когда софт умеет раскладывать модель по устройствам. llama.cpp распределяет слои, vllm использует tensor parallel внутри хоста. Чем больше карт, тем дороже коммуникации между ними, и на 12 устройствах накладные расходы становятся заметными. На шине x4 ситуация дополнительно усложняется.

Энергопотребление и охлаждение 12 карт

segmond иронизирует над возражениями про шум и электричество, но цифр не даёт, так что считать приходится самостоятельно. При 180 Вт на карту получается около 2,2 кВт под нагрузкой, и это только GPU. Тепло нужно удалять из помещения, шум от продува такого количества плат будет слышен за пределами комнаты. Из этого следует простой вывод: сборка плохо совместима с жилой комнатой и хорошо совместима с отдельной кладовкой, гаражом или серверной.

Какие модели реально запускаются на 768 ГБ VRAM

Список из поста: GLM5.3, DSv4.1Flash, Qwen3.8Flash, Qwen3.8-2.4T, KimiK3, MiniMaxM3. Ни по одной из них автор не указывает размер, квантизацию, длину контекста и скорость.

GLM5.3, DSv4.1Flash, Qwen3.8Flash: что это за модели

Суффикс Flash у части названий обычно означает облегчённый или ускоренный вариант модели: меньше параметров, выше скорость, иногда короче контекст. По названию точные размеры не определяются, и выдумывать их не стоит. Для 768 ГБ такие модели не предел: они помещаются с большим запасом, а ограничение смещается со стороны объёма на сторону скорости и длины контекста.

Qwen3.8-2.4T, KimiK3, MiniMaxM3: крупные модели и их требования

Название Qwen3.8-2.4T намекает на 2,4 трлн параметров. Если речь о полном числе параметров, в 4-битной квантизации только веса займут порядка 1,2 ТБ, и в 768 ГБ такая модель целиком не поместится без более агрессивного сжатия, выгрузки части слоёв на CPU или подключения второй машины по RPC. Если это MoE-модель с небольшим числом активных экспертов, скорость на токен будет определяться именно активной частью, а не общим размером. Проверить оба варианта по посту нельзя: деталей там нет.

Про KimiK3 и MiniMaxM3 в посте нет вообще ничего, кроме названий. Утверждать, что они работают с приемлемой скоростью и полным контекстом, оснований нет.

Альтернативы: RTX 6000 Pro, M3 Mac Studio и облачные API

Сравнивать имеет смысл по трём осям: сколько VRAM, сколько ватт на эту VRAM и сколько времени уйдёт на настройку. По первой оси сборка segmond выигрывает у всего, кроме других многоGPU-конфигураций. По двум другим проигрывает почти всегда.

Когда сборка на CMP 170HX оправдана

  • Нужен большой объём VRAM для экспериментов с крупными моделями, и результат важнее удобства.
  • Есть возможность поставить шумный стенд вне жилого помещения.
  • Есть запас по электрике и готовность провести отдельную линию.
  • Данные не должны уходить во внешние сервисы.
  • Настройка драйверов и охлаждения не пугает.

Когда лучше выбрать RTX 6000 Pro или API

Если важны предсказуемость, гарантия, энергоэффективность и тишина, 12 майнинговых карт - плохой выбор. Одна современная профессиональная карта даст меньше VRAM, зато заработает из коробки и не потребует отдельной комнаты. Почему такие ускорители дорожают и кому действительно нужен большой объём памяти, разобрано в материале про ажиотаж вокруг RTX 6000.

Облачные API закрывают задачу иначе: вы платите за токены и не занимаетесь железом. segmond иронизирует над этим аргументом, но расчётов не приводит. Аргумент про API работает при неравномерной нагрузке: если крупная модель нужна раз в неделю, простой собственного сервера легко перевесит счёт за токены. Третий вариант - умеренная сборка из нескольких б/у карт, как в кейсе сервера на четырёх Radeon V620 за примерно $3000, где 128 ГБ VRAM даются ценой 500-900 Вт под нагрузкой.

Стоит ли повторять проект: риски и чек-лист

Технические риски: драйверы, совместимость, надёжность

  • Износ после майнинга: карты работали круглосуточно, ресурс памяти и вентиляторов неизвестен.
  • Модификация памяти выполняется сторонними мастерскими, поэтому партии и прошивки могут вести себя по-разному.
  • Гарантии нет, возврат возможен только через продавца вторичного рынка.
  • Поддержка старых архитектур в свежих версиях CUDA и фреймворков со временем сужается.
  • Питание и охлаждение 12 карт - инженерная задача, а не установка в корпус.

Финансовые и бытовые риски: электричество, шум, место

При 2,2 кВт под нагрузкой круглосуточная работа означает серьёзный счёт за электричество, который легко посчитать заранее: умножьте потребление на местный тариф и на количество часов. Шум и тепло делают размещение в квартире некомфортным, а вес и габариты стенда требуют отдельного места. Затраты на блоки питания, райзеры и охлаждение вполне могут догнать стоимость самих карт.

Итог: кому подходит домашний AI-сервер на CMP 170HX

Сборка segmond - пример того, как вторичный рынок даёт объём VRAM, недоступный за те же деньги на новом. 768 ГБ в одном хосте позволяют держать модели, которые иначе требуют аренды многоGPU-инстанса. Для энтузиаста с отдельным помещением, запасом по электрике и готовностью отлаживать драйверы это рабочий вариант, а не курьёз.

Для всех остальных картина другая. Если нужна предсказуемость, гарантия, тишина и низкое энергопотребление, разумнее смотреть на одну современную профессиональную карту, компактную сборку вроде сервера на Radeon V620 или облачные API при неравномерной нагрузке. Утверждения segmond о производительности и стоимости ничем не подтверждены, кроме его собственных слов, и воспринимать их стоит именно так.

Если тема интересна, начните с одной карты: проверьте, что драйвер видит полный объём памяти, запустите на ней llama.cpp, затем vllm, замерьте ваттметром реальное потребление под нагрузкой. Решение о закупке остальных 11 карт логично принимать только после этих трёх шагов.

Подписаться на канал