Ключевые результаты: что показали тесты CMP170HX
Четыре карты CMP170HX по 64 ГБ VRAM каждая дают 256 ГБ видеопамяти за $800. На этой сборке llama.cpp выдаёт до 120 токенов в секунду на 20B моделях. Модель DeepSeek V4-Flash 0731 работает с полным контекстом в 1 миллион токенов при квантизации Q4. Это реальность, а не синтетический тест. Ограничение - шина PCIe x4 на каждой карте. Она режет скорость prefill, но не мешает генерации токенов. Если ваша задача - бюджетный инференс больших моделей в одно пользовательское окно, связка из CMP170HX работает. Если нужна низкая задержка на несколько одновременных запросов - нет.
Что такое CMP170HX и почему о ней заговорили
CMP170HX - майнинговая карта NVIDIA на чипе GA100. Это урезанная версия A100, лишённая части тензорных ядер и работающая на пониженных частотах. После краха майнинга Ethereum карты оказались на вторичном рынке по цене около $200 за штуку. Аппаратно CMP170HX имеет 64 ГБ памяти HBM2e в 8-гигабайтной версии и 40 ГБ в 10-гигабайтной. Шина памяти - 4096 бит, пропускная способность - около 1.5 ТБ/с. Интерфейс подключения - PCIe 4.0 x4, что вчетверо уже стандартного x16.
Энтузиасты разблокировали полный объём памяти через кастомные драйверы. Подробный процесс описан в инструкции по разблокировке CMP 170HX. После установки пропатченных модулей ядра карта определяется как устройство с 64 ГБ HBM2e и выдаёт до 173 TFLOPS в BF16. Это превращает её из майнингового инструмента в бюджетный AI-ускоритель.
Технические характеристики и отличия от A100
Чип GA100 на CMP170HX - тот же кристалл, что и в A100, но с аппаратными ограничениями. Сравнение ключевых параметров:
| Параметр | CMP170HX (64 ГБ) | NVIDIA A100 80 ГБ |
|---|---|---|
| Архитектура | Ampere (GA100) | Ampere (GA100) |
| CUDA-ядра | 6912 | 6912 |
| Тензорные ядра | 432 (ограничены) | 432 |
| Объём памяти | 64 ГБ HBM2e | 80 ГБ HBM2e |
| Пропускная способность | ~1.5 ТБ/с | ~2.0 ТБ/с |
| Интерфейс | PCIe 4.0 x4 | PCIe 4.0 x16 |
| TDP | 250 Вт | 400 Вт |
| Поддержка FP8 | Нет | Да |
Для инференса LLM критичны три отличия: урезанная шина PCIe, отсутствие FP8 и пониженный TDP. Шина x4 замедляет загрузку модели и prefill, но не влияет на скорость генерации токенов - данные уже находятся в VRAM. Отсутствие FP8 означает работу только с FP16/BF16 и целочисленными квантизациями. Пониженный TDP в 250 Вт упрощает охлаждение, но ограничивает пиковую производительность.
Тестовый стенд и методология
Тестирование проводилось на сборке с четырьмя CMP170HX 64 ГБ. Материнская плата - ASUS Pro WS WRX80E-SAGE SE WIFI с процессором AMD Threadripper PRO 3955WX, 128 ГБ оперативной памяти DDR4-3200. Карты подключались через райзеры PCIe 4.0 x4, каждая запитывалась от одного 8-pin разъёма. Блок питания - Corsair AX1600i на 1600 Вт. Охлаждение - стоковые турбины, размещённые в открытом корпусе с дополнительным вентилятором на обдув.
Программный стек: Ubuntu 22.04, драйвер NVIDIA 550.54.14 с пропатченными модулями ядра, llama.cpp версии b4500, собранный с поддержкой CUDA. Для всех тестов использовалась квантизация Q4_K_M, если не указано иное. Параметры запуска: --tensor-split 64,64,64,64 --main-gpu 0 --ctx-size 131072. Для моделей с контекстом 1M параметр --ctx-size увеличивался до 1048576.
Конфигурация с 4 картами: как объединить 256 ГБ VRAM
Llama.cpp распределяет слои модели по GPU автоматически при указании --tensor-split. Каждая карта получает пропорциональную часть тензоров. При 256 ГБ суммарной VRAM модель весом 120 ГБ в Q4 размещается с запасом под KV-кэш. Ключевой параметр - --main-gpu 0 назначает первую карту ответственной за выходной слой и эмбеддинги. Остальные карты обрабатывают промежуточные слои.
Шина PCIe x4 не становится узким местом при генерации: данные между картами передаются редко, только при переходе от слоя к слою. Объём передачи - несколько мегабайт на токен. Prefill страдает сильнее: модель загружается через ту же шину, и начальный обсчёт промпта идёт медленнее, чем на x16. Практический компромисс: prefill длится дольше, генерация идёт на полной скорости.
Производительность на реальных моделях
Тесты охватили модели от 20B до 120B параметров. Для каждой замерялась скорость генерации токенов (t/s), время prefill для промпта в 4096 токенов и пиковое использование VRAM. Результаты сведены в таблицу:
| Модель | Параметры | Квантизация | Контекст | Генерация (t/s) | Prefill (сек) | VRAM (ГБ) |
|---|---|---|---|---|---|---|
| gemma-4-31B | 31B | Q4_K_M | 128K | 78.3 | 12.4 | 24.1 |
| Qwen3.6-35B-A3B | 35B | Q4_K_M | 128K | 82.7 | 14.1 | 27.8 |
| 20B-тестовая модель | 20B | Q4_K_M | 128K | 118.5 | 8.2 | 17.3 |
| gpt-oss-120B | 120B | Q4_K_M | 32K | 18.2 | 45.7 | 98.6 |
| DeepSeek V4-Flash 0731 | 285B MoE | Q4_K_M | 1M | 12.8 | 183.2 | 212.4 |
Модель gpt-oss-120B занимает почти 100 ГБ VRAM и оставляет около 156 ГБ под KV-кэш на четырёх картах. При контексте 32K этого достаточно для стабильной работы. Увеличение контекста до 128K приводит к деградации скорости из-за фрагментации кэша.
DeepSeek V4-Flash с контекстом 1M: миф или реальность?
DeepSeek V4-Flash 0731 - модель с архитектурой Mixture of Experts на 285B параметров, где активны около 20B на токен. В квантизации Q4 она занимает 212 ГБ VRAM с учётом KV-кэша на 1M токенов. Оставшихся 44 ГБ хватает для служебных структур llama.cpp. Генерация идёт на скорости 12.8 t/s - достаточно для чтения результата в реальном времени.
Prefill промпта в 4096 токенов занимает 183 секунды. Это плата за шину x4 и отсутствие оптимизаций под FlashAttention второго поколения. После заполнения кэша модель генерирует стабильно, без падений скорости. Контекст в 1M токенов действительно работает: модель удерживает информацию по всей длине диалога. Это подтверждает тест на извлечение факта из середины 800-тысячного документа - точность 94%.
Модели 20B: 120 t/s на практике
Пиковая скорость в 118.5 t/s достигнута на 20B модели с квантизацией Q4_K_M. При масштабировании с одной до четырёх карт прирост почти линейный: 32 t/s на одной карте, 62 t/s на двух, 91 t/s на трёх, 118 t/s на четырёх. Дальнейшее добавление карт не тестировалось - материнская плата ограничена четырьмя слотами PCIe x16, работающими в режиме x4 из-за конструкции CMP170HX.
Модели Qwen3.6-35B-A3B и gemma-4-31B показывают сравнимые результаты: 78-83 t/s. Этого достаточно для интерактивной работы - ответ формируется быстрее, чем читается. Узкое место - prefill: 12-14 секунд на промпт в 4096 токенов ощущается как заметная пауза перед началом генерации.
Узкие места и ограничения: что нужно знать перед покупкой
CMP170HX - компромиссное решение. Три главных ограничения: медленный prefill, single-stream инференс и архитектура Ampere без поддержки FP8. Prefill на 4096 токенов занимает от 8 до 183 секунд в зависимости от модели. Для сравнения: RTX 4090 с шиной x16 делает тот же prefill за 2-4 секунды. Если сценарий требует частой смены контекста, задержка становится критичной.
Single-stream означает, что llama.cpp обрабатывает один запрос за раз. Батчинг невозможен - карты заняты обслуживанием единственного пользователя. Для персонального инференса это приемлемо. Для сервера с несколькими клиентами - нет. Альтернативы вроде vLLM требуют более широкой шины и полноценной поддержки тензорных ядер.
Prefill и single-stream: где CMP170HX проигрывает
Сценарий чат-бота с быстрыми ответами - худший для CMP170HX. Каждый новый запрос пользователя запускает prefill заново. При 12-14 секундах на prefill для 30B модели диалог превращается в ожидание. Генерация ответа занимает ещё 3-5 секунд. Суммарная задержка в 15-20 секунд неприемлема для коммерческого продукта. Для сравнения: один B300 выдаёт 770 токенов/с на DeepSeek V4-Flash с минимальной задержкой prefill.
Другой проблемный сценарий - агентные задачи с частой сменой контекста. Каждый вызов инструмента сбрасывает KV-кэш и требует нового prefill. На CMP170HX цикл «вызов-ответ-вызов» растягивается до минуты. Для таких задач лучше подходят сборки на RTX 3080 20 ГБ, дающие 69 токенов/с на Qwen3.6-27B с контекстом 256K при более быстром prefill.
Экономика: $200 за 64 ГБ VRAM - лотерейный выигрыш или нет?
Стоимость гигабайта VRAM на CMP170HX - $3.13. У ближайшего конкурента, подержанной RTX 3090 с 24 ГБ, этот показатель - $25-33. У новой RTX 4090 - $66. У H100 80 ГБ - $375. Разница в 10-100 раз делает CMP170HX безальтернативным вариантом для бюджетного инференса больших моделей.
Риски покупки: карты снимались с майнинга и могли работать годами под полной нагрузкой. Память HBM2e деградирует при высоких температурах. Вентиляторы турбин - расходник, замена стоит $15-30. Драйверы неофициальные, обновление ядра Linux может сломать совместимость. Гарантии нет. Проверка при покупке обязательна: прогон memtest на весь объём VRAM, замер температур под нагрузкой, визуальный осмотр на предмет вздутых конденсаторов.
Сравнение с Hopper и Blackwell: стоит ли копить на новое?
H100 80 ГБ стоит около $30000. За эти деньги можно купить 150 карт CMP170HX и получить 9.6 ТБ VRAM. Но H100 даёт поддержку FP8, Transformer Engine, MIG и полосу пропускания 3.35 ТБ/с. Для обучения моделей H100 вне конкуренции. Для инференса в production с несколькими пользователями - тоже. CMP170HX выигрывает только в одном сценарии: инференс больших моделей одним пользователем с терпимостью к задержкам.
B200 ещё не вышел на вторичный рынок, но его ориентировочная цена - $40000+. Сравнение по производительности: один B200 заменяет 8-10 CMP170HX в задачах инференса при сопоставимом объёме памяти. Но 8 CMP170HX стоят $1600, а B200 - $40000. Разница в 25 раз. Вывод: если бюджет ограничен, а задача - эксперименты с большими моделями, CMP170HX оправдана. Если нужна скорость и многопользовательский режим - копите на H100 или ждите B200 на вторичке.
Практические рекомендации: как выжать максимум из CMP170HX
Выбор версии: 64 ГБ предпочтительнее 40 ГБ. Разница в цене - $30-50, прирост VRAM - 60%. Для моделей уровня 70B в Q4 нужно минимум 48 ГБ, 40 ГБ версия не вместит. Покупайте 64 ГБ, даже если текущие задачи укладываются в 40 ГБ - запас под KV-кэш никогда не лишний.
Настройка llama.cpp: флаг --tensor-split должен точно соответствовать объёму VRAM на каждой карте. Для четырёх карт по 64 ГБ: --tensor-split 64,64,64,64. Флаг --main-gpu 0 обязателен - он назначает GPU для выходного слоя. Квантизация Q4_K_M оптимальна по соотношению скорость/качество. Q5 даёт +2% точности ценой +15% VRAM. Q8 используйте только если модель критична к точности и помещается в память.
Охлаждение: турбины CMP170HX шумные, 55-60 дБ под нагрузкой. В жилом помещении это некомфортно. Решения: водоблоки (дорого, $100+ на карту), размещение в отдельном помещении, андервольтинг через nvidia-smi -pl 200. Снижение TDP с 250 до 200 Вт уменьшает производительность на 10-15%, но температура падает на 15-20 градусов.
Питание: одна карта потребляет до 250 Вт, четыре - до 1000 Вт только на GPU. Добавьте процессор (280 Вт), память, материнскую плату - итого около 1400 Вт под нагрузкой. Блок питания на 1600 Вт с запасом в 15% - минимум. Используйте отдельные кабели на каждый 8-pin разъём, никаких разветвителей.
Заключение: для кого CMP170HX в 2026 году
CMP170HX - способ получить много VRAM за малые деньги с оговорками. Четыре карты дают 256 ГБ за $800 и запускают DeepSeek V4-Flash с контекстом 1M на скорости 12.8 t/s. Этого достаточно для персонального инференса, экспериментов с большими моделями и офлайн-обработки документов. Модели 20-35B работают на 78-120 t/s - быстрее скорости чтения.
Карта не подходит для production-нагрузок с требованиями к latency и параллелизму. Prefill медленный, single-stream ограничивает масштабирование, архитектура Ampere не поддерживает FP8. Для коммерческого использования выбирайте H100 или B200, для бюджетных сборок с быстрым prefill - RTX 3090 или 4090. Сравнение моделей на 192 ГБ VRAM даёт ориентиры по выбору GPU под агентные задачи.
Покупка CMP170HX - лотерея с высокими шансами на выигрыш при правильном подходе. Проверяйте карты при покупке, настраивайте охлаждение, используйте проверенные драйверы. При цене $200 за 64 ГБ HBM2e альтернатив на рынке нет. Если готовы мириться с шумом, медленным prefill и отсутствием официальной поддержки - CMP170HX отработает каждую копейку.