Перейти к содержанию
Публикация AiManual

Разгон CMP 170HX: как поднять пропускную способность памяти до 1,89 ТБ/с и ускорить генерацию LLM почти вдвое

Пользователь Feralzi разогнал память CMP 170HX 40GB: пропускная способность выросла с 1 386,2 до 1 890,1 ГБ/с, а генерация в Qwen 3.8 27B - с 110 до 202 токенов

Коротко

Что будет в материале

  1. 01

    Что случилось: разгон CMP 170HX дал +36,4% к пропускной способности памяти

  2. 02

    Почему разгон памяти ускоряет генерацию LLM почти линейно

  3. 03

    Что такое CMP 170HX и почему её потенциал изначально урезан

  4. 04

    Риски и ограничения разгона CMP 170HX: что нужно знать до повторения

Что случилось: разгон CMP 170HX дал +36,4% к пропускной способности памяти

Пользователь Feralzi опубликовал в r/LocalLLaMA отчёт о разгоне памяти CMP 170HX 40GB. Пропускная способность выросла с 1 386,2 ГБ/с до 1 890,1 ГБ/с, прирост составил 36,4%. Поднимали частоты памяти, остальная конфигурация осталась прежней.

Практический результат интереснее процентов: скорость генерации токенов в Qwen 3.8 27B поднялась с 110 до 202 токенов в секунду. Это рост почти вдвое на том же железе, с той же моделью и теми же настройками запуска.

Дополнительные детали из сообщения: карта потребляет около 300 Вт, температуры GPU после разгона немного снизились. Feralzi считает, что потенциал CMP 170HX изначально урезан, поэтому работать с частотами памяти на этой карте имеет смысл.

Дальше начинаются оговорки, без которых цифры читать нельзя. Есть одно сообщение одного пользователя. Независимого подтверждения нет. Параметры разгона, частоты, напряжения, версия драйвера, модель охлаждения и методика замеров в отчёте не раскрыты. Ниже разбираем, что из этих данных следует с высокой вероятностью, а что пока остаётся открытым вопросом.

Почему разгон памяти ускоряет генерацию LLM почти линейно

Скачок с 110 до 202 токенов в секунду выглядит неожиданно, но механика за ним простая: генерация токенов в LLM упирается в пропускную способность памяти, а не в вычислительные блоки GPU.

Что такое memory-bound инференс и при чём тут пропускная способность

Модель выдаёт текст токен за токеном. На каждом шаге нужно прочитать из памяти веса (или их активную часть) и весь KV-кэш, а затем выполнить относительно немного операций над каждым прочитанным байтом. Такой режим называют memory-bound: время шага определяется тем, как быстро данные доезжают из памяти до вычислительных блоков, а не тем, сколько операций в секунду умеет ядро. Вычислительные блоки в этом сценарии значительную часть времени ждут данные.

Отсюда практическое следствие: для генерации токенов широкая шина памяти важнее высоких TFLOPS. Именно поэтому CMP 170HX после разгона до 1 890,1 ГБ/с выдаёт 202 токена в секунду на модели Qwen 3.8 27B: узкое место сдвинули в сторону памяти. Аналогия грубая, но наглядная: расширить горлышко бутылки полезнее, чем ускорить руки, которые её держат.

Второй эффект разгона памяти затрагивает KV-кэш. При длинном контексте его объём растёт, и чтение кэша на каждом шаге съедает заметную долю пропускной способности. Чем выше частота памяти, тем дешевле обходится длинный контекст.

Почему прирост в токенах оказался выше прироста bandwidth

Считаем: пропускная способность выросла на 36,4% (1 386,2 → 1 890,1 ГБ/с), а скорость генерации - примерно на 84% (110 → 202 токена в секунду). Пропорции не совпадают, и объяснения этому в отчёте нет.

Всё, что можно назвать причинами, остаётся предположениями: снижение задержек доступа к памяти, изменение таймингов, неравномерная нагрузка на разные банки памяти, разная методика замера до и после разгона. Помечаем честно: это гипотезы, а не факты из источника.

Отдельный повод для осторожности: 110 токенов в секунду для 27B-модели на исходных настройках выглядят высоко по сравнению с типичными пользовательскими замерами на потребительских картах. Неизвестно, какая квантизация, какая длина контекста, какой runtime и как именно считались токены.

Чтобы разница объяснилась, нужны частоты памяти, тайминги, напряжения, версия драйвера, длина контекста, формат квантизации и способ замера. Пока этого нет, корректно говорить о факте прироста, а не о его точной причине.

Что такое CMP 170HX и почему её потенциал изначально урезан

CMP 170HX - майнинговая карта Nvidia на архитектуре Ampere с 40 ГБ памяти. Серия CMP создавалась под добычу криптовалют, и такие карты не проектировали под графику или инференс: видеовыходов нет, часть возможностей отключена, частоты и питание ограничены. Карта построена на чипе GA100 и использует память HBM2e, а цены и цифры вокруг неё разбирались в отдельном материале о том, что реально стоит за модификацией CMP 170HX с 8 до 64 ГБ и откуда взялись 1,49 ТБ/с и 180 Вт.

Автор отчёта прямо говорит: потенциал карты сильно урезан, и разгон выглядит логичным шагом. Точные характеристики (число CUDA-ядер, частоты, TDP) в сообщении не приводятся, поэтому здесь их нет - придумывать их не станем.

40 ГБ VRAM: главный аргумент для локальных LLM

40 ГБ памяти на одной карте - редкая конфигурация в потребительском сегменте, где стандартом остаются 8-24 ГБ. Такой объём позволяет держать в VRAM модель уровня 27B вместе с KV-кэшом под длинный контекст, тогда как в 24 ГБ она помещается с оговорками по квантизации и длине контекста. Именно на этой карте в отчёте работала Qwen 3.8 27B со скоростью 202 токена в секунду.

Обратная сторона: чем больше VRAM, тем выше соблазн взять модель крупнее, а её скорость всё сильнее зависит от пропускной способности памяти. Разгон в этом сценарии становится способом вернуть карте часть отрезанной производительности.

Риски и ограничения разгона CMP 170HX: что нужно знать до повторения

Перечислим без смягчения.

  1. Один источник. Все цифры взяты из единственного сообщения Feralzi. Независимых повторов нет, результат нельзя считать воспроизводимым.
  2. Параметры разгона закрыты. Нет частот памяти, напряжений, таймингов, версии драйвера и описания охлаждения. Без них повторить сценарий нельзя.
  3. Стабильность не проверена. Нет данных о длительной нагрузке, артефактах, отвалах драйвера и поведении карты после нескольких часов работы.
  4. Методика замеров не описана. Непонятно, чем измеряли пропускную способность, какая длина контекста и квантизация использовались при замере токенов.
  5. Базовые риски разгона остаются. Рост частот памяти при неизменном питании повышает вероятность ошибок, артефактов и постепенной деградации. На картах, которые уже отработали в майнинге под нагрузкой круглосуточно, этот риск выше.

Почему температуры могли снизиться, а не вырасти

Разгон обычно добавляет тепла, но в отчёте температуры GPU немного снизились. Причина не объяснена, и выдавать гипотезу за факт нельзя. Что могло повлиять: изменённая кривая вентиляторов, более холодный воздух в помещении, другая нагрузка во время замера, погрешность датчиков, особенности конкретного экземпляра карты. Любой из этих факторов способен перевесить добавку тепла от памяти, особенно если частоты ядра не поднимались.

Вывод практический: на снижение температур как на воспроизводимый эффект рассчитывать не стоит. Следите за температурой памяти, а не только за температурой GPU, и проверяйте карту под длительной нагрузкой.

Что осталось за кадром отчёта

  • частоты памяти и тайминги;
  • напряжение и лимит мощности (известно только потребление около 300 Вт);
  • версия драйвера и способ выставления частот;
  • система охлаждения, корпус, температура в помещении;
  • квантизация модели и длина контекста при замере;
  • длительность теста стабильности;
  • сравнение с другими картами на той же модели.

Каждый пункт из списка влияет на итог. Пока их нет, цифры 1 890,1 ГБ/с и 202 токена в секунду стоит воспринимать как отчёт об одном удачном эксперименте, а не как гарантированный ориентир для повторения.

Стоит ли покупать CMP 170HX для локальных LLM: практический разбор

Решение сводится к двум вопросам: нужен ли вам большой объём VRAM за небольшие деньги и готовы ли вы к возне с настройками и возможной нестабильности. Универсального ответа нет, многое зависит от задач.

Кому CMP 170HX имеет смысл, а кому - нет

Карта подходит энтузиастам, которым интересно выжимать производительность: есть время на тесты, есть готовность к сюрпризам с драйверами, есть понимание, что за скорость придётся платить временем и риском. Для домашней лаборатории, где простой сервера никого не подводит, такой компромисс часто оправдан.

Карта не подходит тем, кому нужна предсказуемая рабочая лошадка: продакшен, ежедневные задачи, жёсткие сроки, минимум обслуживания. Здесь важнее стабильность, поддержка драйверов и возможность вернуть железо.

Если бюджет ограничен, а VRAM нужно много, начните с практических замеров: тестирование четырёх CMP170HX на 256 ГБ VRAM показывает, какие модели реально работают и где находятся узкие места. Более широкий взгляд на бюджетный сегмент, включая требования к KV-кэшу, runtime и условиям доставки, собран в разборе выбора недорогой видеокарты для локальных LLM.

На что смотреть при выборе б/у CMP 170HX

  • История эксплуатации: майнинг круглосуточно в течение нескольких лет - обычная биография таких карт. Это влияет на износ памяти и системы питания.
  • Тест под нагрузкой: прогоните модель, которая загружает всю VRAM, и следите за стабильностью не десять минут, а хотя бы час.
  • Температуры и шум: проверьте температуру памяти и GPU под нагрузкой, оцените шум охлаждения в вашем корпусе.
  • Модификации: часть таких карт попадает на рынок переделанной, например с увеличенным объёмом памяти. Это отдельный фактор риска, о котором стоит спрашивать продавца напрямую.
  • Совместимость: убедитесь, что карта корректно определяется вашим драйвером, runtime и операционной системой.
  • Возврат: договоритесь о проверке и возврате до оплаты. Без этого риск купить нерабочее железо слишком высок.

Что это значит для локального запуска LLM в целом

Кейс с CMP 170HX подтверждает простое правило: там, где инференс упирается в память, разгон памяти даёт больше, чем разгон ядра. Рост с 110 до 202 токенов в секунду на Qwen 3.8 27B - это разница между "работать можно, но некомфортно" и "интерактив без заметных задержек".

Эффект зависит от модели. Маленькие модели, которые не успевают насытить пропускную способность памяти, реагируют слабее. Для крупных memory-bound моделей с длинным контекстом отдача от частоты памяти выше, потому что KV-кэш добавляет чтение на каждом шаге. Конкретных чисел для других моделей не приводим: замеров нет.

Если CMP 170HX у вас уже есть, разумная последовательность такая: сначала убедиться в стабильности карты на стоковых настройках, затем поднимать частоту памяти небольшими шагами, после каждого шага прогонять один и тот же тест и записывать результат. Так появятся собственные цифры, а не чужие. Опыт сборок из нескольких таких карт, например сервер на 12 CMP 170HX с 768 ГБ VRAM, показывает, что главные ограничения лежат в питании, охлаждении и совместимости со стеком, а не в самих чипах.

Подписаться на канал