Перейти к содержанию
Публикация AiManual

CPU-инструкции и offload в LLM: Intel vs AMD — что действительно влияет на скорость?

Узнайте, что действительно влияет на скорость offload в LLM: наборы инструкций CPU или пропускная способность шины и памяти. Сравниваем Intel и AMD для локально

Коротко

Что будет в материале

  1. 01

    Коротко: что важнее для offload - инструкции CPU или пропускная способность?

  2. 02

    Как работает offload в LLM и почему CPU вообще участвует в вычислениях

  3. 03

    AVX-512 у AMD против AVX2 у Intel: есть ли реальная разница для LLM?

  4. 04

    Thunderbolt и eGPU: почему пропускная способность шины решает всё

Коротко: что важнее для offload - инструкции CPU или пропускная способность?

При offload-вычислениях в LLM, когда часть модели выгружается на CPU, пропускная способность памяти и шины чаще всего становится узким местом, а не набор инструкций процессора. Особенно это заметно при использовании внешней GPU через Thunderbolt: интерфейс ограничивает скорость передачи данных, и даже мощный CPU с AVX-512 не сможет полностью раскрыться. AVX-512 может дать преимущество в prefill, где много параллельных вычислений, но в decode разница между AVX-512 и AVX2 минимальна, потому что генерация токенов упирается в скорость доступа к памяти. Выбор оперативной памяти (LPCAMM2 у Intel против DDR5 у AMD) тоже влияет, но вторично: если данные не успевают поступать через шину, быстрая память не поможет.

Для большинства сценариев с RTX 5080 и eGPU разница между Intel и AMD по CPU-инструкциям незначительна. Важнее общая производительность ядер, энергопотребление и цена платформы. Если вы используете дискретную GPU с offload на CPU, тогда пропускная способность памяти выходит на первый план, и Intel с LPCAMM2 может дать преимущество в decode. Но такие конфигурации встречаются реже.

В этой статье разберём, как работает offload, почему prefill и decode нагружают CPU по-разному, и дадим практические рекомендации по выбору процессора для сборок с внешней видеокартой.

Как работает offload в LLM и почему CPU вообще участвует в вычислениях

Локальный запуск больших языковых моделей требует видеопамяти. Если модель не помещается в VRAM, часть слоёв выгружается на CPU и системную память. Этот процесс называется offload. Например, модель на 70 миллиардов параметров в 4-битном квантовании занимает около 40 ГБ, а у RTX 5080 всего 16 ГБ VRAM. Остальные 24 ГБ размещаются в оперативной памяти, и CPU обрабатывает их во время инференса.

Работа LLM делится на две фазы: prefill и decode. Prefill обрабатывает весь входной промпт параллельно, задействуя все ядра CPU и векторные инструкции. Decode генерирует токены последовательно, по одному за шаг, и здесь скорость ограничена пропускной способностью памяти, потому что нужно постоянно читать веса модели.

Prefill и decode: почему нагрузка на CPU разная

Prefill - это обработка промпта. Если вы отправляете запрос из 1000 токенов, все они обрабатываются одновременно. Эта фаза вычислительно интенсивная: матричные умножения могут использовать SIMD-инструкции, такие как AVX-512, для ускорения. На CPU с поддержкой AVX-512 prefill может выполняться быстрее, чем на CPU с AVX2, при прочих равных.

Decode - это генерация ответа. Каждый новый токен зависит от предыдущих, поэтому вычисления идут последовательно. Основная операция - умножение матрицы на вектор, и здесь данные нужно быстро подгружать из памяти. Пропускная способность памяти становится критичной, а набор инструкций отходит на второй план. Даже если CPU умеет быстро считать, он будет простаивать в ожидании данных.

При offload через Thunderbolt обе фазы страдают от задержек шины, но decode особенно чувствителен, потому что каждый шаг требует обмена данными между CPU и eGPU.

AVX-512 у AMD против AVX2 у Intel: есть ли реальная разница для LLM?

AVX-512 - это набор инструкций, который позволяет обрабатывать 512 бит данных за одну операцию, вдвое больше, чем AVX2 (256 бит). Теоретически это даёт двукратное ускорение в векторных вычислениях. На практике для LLM прирост меньше из-за ограничений памяти и тепловыделения.

AMD поддерживает AVX-512 в процессорах Ryzen 7000 и новее. Intel долгое время отключала AVX-512 в потребительских чипах, оставляя его только для серверных Xeon. В новых процессорах Intel Core Ultra (Meteor Lake, Lunar Lake) AVX-512 снова появился, но с оговорками: он работает на E-ядрах и может вызывать троттлинг.

Почему AVX-512 не всегда дает прирост в реальных сценариях

Узкое место - память. Даже с быстрыми инструкциями CPU простаивает, ожидая данные из оперативной памяти. В decode, где каждый токен требует чтения гигабайтов весов, пропускная способность памяти определяет скорость, а не вычислительная мощность. AVX-512 может ускорить prefill на 20-30% по данным некоторых тестов, но в decode разница почти незаметна.

Ещё одна проблема - троттлинг. AVX-512 потребляет много энергии и выделяет тепло, из-за чего процессор снижает частоту. В результате прирост от широких инструкций может нивелироваться падением тактовой частоты. Это особенно актуально для ноутбуков и компактных систем с eGPU.

Для offload через Thunderbolt разница между AVX-512 и AVX2 практически исчезает, потому что данные не успевают поступать через узкий интерфейс. CPU с любым набором инструкций будет ограничен скоростью шины.

Thunderbolt и eGPU: почему пропускная способность шины решает всё

Внешняя видеокарта подключается через Thunderbolt, который имеет ограниченную пропускную способность. Thunderbolt 4 обеспечивает до 40 Гбит/с, Thunderbolt 5 - до 80 Гбит/с. Для сравнения, внутренняя шина PCIe 4.0 x16 даёт около 256 Гбит/с, а оперативная память DDR5-5600 - около 90 ГБ/с (720 Гбит/с). Даже память быстрее Thunderbolt в несколько раз.

Сравнение пропускной способности: Thunderbolt vs PCIe vs память

ИнтерфейсПропускная способность
Thunderbolt 4~40 Гбит/с
Thunderbolt 5~80 Гбит/с
PCIe 4.0 x16~256 Гбит/с
DDR5-5600 (двухканальная)~90 ГБ/с (720 Гбит/с)

При offload части модели на CPU данные должны передаваться между CPU и eGPU через Thunderbolt. Этот канал становится узким местом: даже если CPU быстро обрабатывает данные, они не успевают поступать. В результате производительность упирается в шину, а не в вычислительные возможности процессора.

Особенно это заметно в decode, где каждый шаг требует обмена небольшими порциями данных, но с высокой частотой. Задержки Thunderbolt добавляют ощутимое время к каждому токену, снижая общую скорость генерации.

Если вы используете eGPU, то выбор CPU с AVX-512 или без него не даст значительного прироста. Важнее, чтобы процессор имел достаточное количество ядер для параллельной обработки prefill и не создавал дополнительных узких мест.

Память: LPCAMM2 у Intel против DDR5 у AMD - насколько это важно?

LPCAMM2 - новый тип оперативной памяти, который Intel продвигает в платформах Lunar Lake. Он обеспечивает более высокую пропускную способность при меньшем энергопотреблении по сравнению с обычными модулями DDR5. AMD в своих системах использует стандартную DDR5, которая может иметь более низкую пропускную способность, но разница в реальных задачах LLM часто невелика.

Когда выбор памяти действительно имеет значение

Если используется дискретная GPU с прямым подключением PCIe и offload на CPU, то пропускная способность памяти становится критичной для decode. В таких случаях LPCAMM2 может дать преимущество, потому что данные быстрее поступают к CPU. Но такие конфигурации редки: обычно offload применяют именно с eGPU, где узким местом является Thunderbolt, а не память.

При использовании eGPU через Thunderbolt скорость оперативной памяти не так важна, потому что данные всё равно проходят через медленный интерфейс. Даже если память быстрая, она не сможет передать данные быстрее, чем позволяет шина.

Тем не менее, для prefill на CPU, когда обрабатывается большой промпт, пропускная способность памяти может влиять на скорость, но опять же, если данные уже находятся в памяти, а не передаются через Thunderbolt.

Практические рекомендации: какой CPU выбрать для сборки с RTX 5080 и eGPU

Теперь перейдём к конкретным советам. Рассмотрим два основных сценария.

Сценарий 1: eGPU через Thunderbolt - что выбрать?

В этом случае CPU не является узким местом. Любой современный процессор с 8 и более ядрами справится с offload, потому что скорость будет ограничена Thunderbolt. AVX-512 не даст заметного прироста из-за ограничений шины. Рекомендуем обратить внимание на энергоэффективность и охлаждение, особенно если система компактная. Подойдут как Intel Core Ultra, так и AMD Ryzen 7000/9000. Выбирайте по цене и доступности платформы.

Сценарий 2: дискретная GPU с offload на CPU - что выбрать?

Если видеокарта установлена внутри корпуса и подключена через PCIe, то пропускная способность памяти важнее. Intel с LPCAMM2 может быть предпочтительнее для decode, потому что быстрая память ускоряет последовательную генерацию токенов. Однако AMD с AVX-512 может ускорить prefill, если вы часто обрабатываете длинные промпты. Оцените, какая фаза доминирует в ваших задачах: если вы отправляете большие запросы и ждёте ответа, prefill может быть значимым, но обычно decode занимает больше времени при генерации длинных текстов.

Для большинства пользователей с RTX 5080 и eGPU разница между Intel и AMD по CPU-инструкциям несущественна. Важнее общая производительность системы. Рекомендуем выбирать процессор с достаточным количеством ядер (8 и более), хорошей однопоточной производительностью для общих задач и поддержкой нужных интерфейсов.

Если вы собираете систему с нуля, обратите внимание на материнские платы: у Intel они часто дешевле, но процессоры AMD могут быть более доступными. Также учитывайте, что LPCAMM2 пока доступен только в новых платформах Intel, и модули могут быть дороже обычной DDR5.

Выводы: что действительно влияет на скорость offload в LLM

Набор инструкций CPU имеет ограниченное влияние на скорость offload-вычислений в LLM, особенно при использовании eGPU через Thunderbolt. Главные факторы - пропускная способность шины и памяти. AVX-512 может ускорить prefill на CPU, но в decode разница минимальна, а троттлинг может свести на нет преимущество. Выбор между Intel и AMD должен основываться на конкретном сценарии использования, а не на наличии AVX-512.

Для большинства пользователей с внешней видеокартой разница несущественна: важнее общая производительность системы, энергопотребление и цена. Если вы планируете использовать дискретную GPU с offload, тогда стоит обратить внимание на память: Intel с LPCAMM2 может дать преимущество в decode, но такие конфигурации редки.

Практический совет: перед покупкой определите, как часто вы будете использовать offload и в каком режиме. Если eGPU через Thunderbolt - выбирайте любой современный 8-ядерный процессор. Если дискретная GPU - смотрите на пропускную способность памяти и поддержку AVX-512 для prefill.

Подписаться на канал