Перейти к содержанию
Публикация AiManual

Апгрейд железа под локальные LLM: когда переход с Qwen3 27B на MoE-модели действительно оправдан

Разбираем, когда апгрейд VRAM под локальные MoE-модели окупается, а когда дешевле подождать Qwen4 27B. Сравниваем 2×CMP 170HX 64 ГБ и 4×V100 32 ГБ по цене, скор

Коротко

Что будет в материале

  1. 01

    Что вы получите от перехода на MoE-модели: разбираем реальные выгоды и риски

  2. 02

    Сколько VRAM нужно для MoE-моделей и почему 176 ГБ может быть недостаточно

  3. 03

    CMP 170HX 64 ГБ: дешёвая VRAM с серьёзными оговорками

  4. 04

    4×V100 32 ГБ: дешевле, но медленнее и прожорливее

Короткий ответ: переход с Qwen3 27B на MoE-модели вроде Qwen3 Flash Next, DeepSeek V4 Flash или GLM 5.3 Flash не гарантирует, что за 6-7 тысяч долларов вы получите заметно более умного помощника. Эти модели требуют существенно больше VRAM, и апгрейд оправдан только тогда, когда вы измерили, чего именно не хватает текущему сетапу.

Отправная точка: Qwen3 27B в fp8-квантовании, с нежатым кэшем и контекстом 129k на двух RTX 3090, то есть 48 ГБ видеопамяти. Так описывает конфигурацию автор обсуждения на r/LocalLLaMA, он же отмечает большой скачок по VRAM и стоимости у новых моделей. Рассматриваемый апгрейд: две CMP 170HX по 64 ГБ, суммарно 176 ГБ памяти вместе с имеющимися картами, либо четыре V100 по 32 ГБ.

Практический вопрос звучит так: даст ли рост памяти под 3-4-битные кванты MoE-моделей выигрыш, который вы почувствуете в работе, или это будет прирост только по формальным характеристикам.

Что вы получите от перехода на MoE-модели: разбираем реальные выгоды и риски

MoE (mixture of experts) хранит в памяти все параметры, но на каждом токене задействует лишь часть экспертов. Отсюда главный эффект: скорость декодирования может быть выше, чем у плотной модели с сопоставимым числом активных параметров, потому что вычислений на токен меньше. Плата за это - память: она нужна под полный набор весов, а не под активную часть.

Качество MoE-модели определяют обучение, данные и архитектура, а не сама схема смеси экспертов. Новая модель может оказаться быстрее и при этом не умнее текущей на ваших задачах. Публичных замеров под конкретный сценарий «fp8 на 48 ГБ против 3-4-битных квантов на 176 ГБ» в доступных источниках нет, так что цифры из анонсов стоит проверять на своём наборе промптов.

Отдельный риск - квантование. Переход с fp8 на 3-4 бита экономит память, но добавляет ошибку в веса. Если новая модель в Q4 выдаёт качество на уровне Qwen3 27B в fp8, апгрейд покупает вам только скорость. Бывает и хуже: агрессивный 3-битный квант просаживает качество так, что преимущества архитектуры не видно.

Сравнивать имеет смысл четыре измеримые вещи:

  • prefill: сколько секунд уходит на обработку промпта при контексте 129k;
  • декодирование: токенов в секунду на типичной для вас длине ответа;
  • качество на ваших задачах: генерация кода, рассуждения, вопросы по длинному документу, RAG;
  • стабильность: держит ли модель качество к середине длинной сессии.

Что известно про Qwen 3.8 Flash Next и её связь с архитектурой Qwen 4, а также про то, реально ли уместить резидентный набор весов в 24 ГБ, мы разбирали в отдельном материале: Qwen 3.8 Flash Next на архитектуре Qwen 4: реально ли запустить на одной RTX 3090.

Сколько VRAM нужно для MoE-моделей и почему 176 ГБ может быть недостаточно

Считаем от параметров. В 4-битном кванте один параметр занимает около 0.5 байта, плюс служебные данные на масштабы, поэтому на практике выходит ближе к 0.55-0.6 байта. Модель на 100 млрд параметров заберёт примерно 55-60 ГБ, на 200 млрд - около 110-120 ГБ. В 3-битном кванте цифры ниже, но и потери качества выше.

веса ≈ число параметров × байт на параметр
4 бита ≈ 0.5 байта на параметр + служебные данные
3 бита ≈ 0.375 байта на параметр + служебные данные

Вторая статья расходов - KV-кэш, который растёт линейно с контекстом. Формула для прикидки: два (ключи и значения) × число слоёв × число KV-голов × размерность головы × длина контекста × байт на элемент. У вас контекст 129k и нежатый кэш, то есть самый прожорливый вариант. Кэш в fp8 сокращает эту статью примерно вдвое, но конкретный выигрыш зависит от модели и сборки, его надо замерять.

По железу расклад такой: 2 × 64 ГБ CMP 170HX дают 128 ГБ, две RTX 3090 добавляют 48 ГБ, суммарно 176 ГБ. Если модель в 4-битном кванте занимает около 80 ГБ, а кэш под 129k - десятки гигабайт, свободными остаются порядка 50-60 ГБ. Этого хватает на запуск, но запас на параллельные запросы, RAG и рост контекста получается небольшим. Цифры здесь оценочные: считать надо под конкретную модель, иначе легко купить память под задачу, которая упирается в пропускную способность, а не в объём.

Отдельный технический момент для multi-GPU. Если между картами нет прямого обмена P2P, данные идут окольным путём: блок читается из видеопамяти первой карты, уходит через её контроллер PCIe и шину в корневой комплекс процессора, записывается в обычную RAM, а затем тем же маршрутом едет во вторую карту. Так описывает путь без P2P автор разбора CMP-карт на Хабре. Каждый лишний переход стоит времени, и на длинном контексте это заметно.

CMP 170HX 64 ГБ: дешёвая VRAM с серьёзными оговорками

Две CMP 170HX по 64 ГБ оценивают примерно в 6-7 тысяч долларов суммарно за проверенные карты в Европе. Те же 4 × V100 32 ГБ выходят примерно вдвое дешевле, но требуют больше возни с настройкой, потребляют больше энергии и работают медленнее. Это оценки из обсуждения на r/LocalLLaMA, они привязаны к конкретному рынку и ревизиям карт, поэтому в другом регионе цифры будут другими.

CMP-серия - это майнинговые карты, и их история показательна. В разборе на Хабре описан CMP 90HX: внутри полноценный чип GA102, но программно ограниченный, а интерфейс PCIe физически урезан. Автору удалось включить на этой карте прямой обмен P2P между двумя экземплярами, и это потребовало глубокого вмешательства в настройки. Для CMP 170HX ситуация может отличаться в деталях, но общий класс проблем тот же.

Что проверять до покупки:

  • число линий PCIe. Урезанный интерфейс бьёт по скорости загрузки весов и по обмену между картами;
  • охлаждение. Смотрите, идёт ли карта со штатным вентилятором или рассчитана на продув в стойке, пассивные варианты потребуют кастомного охлаждения;
  • драйверы и поддержка. Официальной поддержки может не быть, совместимость с новыми сборками llama.cpp и обновлениями системы придётся проверять самому;
  • питание, райзеры и материнская плата. Две карты по 64 ГБ требуют блока питания с запасом и достаточного числа слотов;
  • ревизия и прошивка. Разные лоты ведут себя по-разному, поэтому проверенная карта стоит дороже, и это нормально.

Пропускная способность памяти при этом важнее, чем кажется. Если карта отдаёт много VRAM, но медленно ей оперирует, на больших MoE-моделях вы получите низкий tok/s при красивых цифрах в спецификации.

4×V100 32 ГБ: дешевле, но медленнее и прожорливее

Четыре V100 по 32 ГБ дают 128 ГБ видеопамяти, то есть меньше, чем связка двух CMP 170HX с двумя RTX 3090. Покупка обойдётся дешевле, но эксплуатация сложнее: больше карт, больше точек отказа, больше тепла и шума. Оценки по деньгам и характеру компромиссов относятся именно к этому варианту.

Технические особенности Volta стоит держать в голове. Инструкций fp8 в этой архитектуре нет, поэтому выигрыш от fp8-квантования, которое вы сейчас используете на RTX 3090, здесь не появится. Придётся выбирать между более низкими битами квантов и скоростью.

Четыре карты означают четыре потребителя питания. Точный TDP смотрите в спецификации конкретной ревизии, вместе с лимитами блока питания и возможностями охлаждения корпуса. Скорость обмена между картами тоже зависит от топологии: если соединить их NVLink-мостами, обмен идёт быстрее, чем через PCIe и системную RAM. Наличие мостов и совместимость с материнской платой проверяйте до покупки.

Перед выбором сравните поддержку драйверов для обеих серий: у серверных карт она обычно предсказуемее, чем у майнинговых лотов. Если для вас важнее стабильность, а не максимум VRAM, вариант с V100 заслуживает рассмотрения.

Бесплатный путь: дождаться Qwen4 27B и выжать максимум из текущих RTX 3090

Вариант, который не стоит денег: дождаться Qwen4 27B и скачать под неё более агрессивные IQ-кванты. Именно так формулирует бесплатную альтернативу автор обсуждения на r/LocalLLaMA. Это ожидание, а не гарантия: модель ещё не вышла, её требования к памяти и качество квантов пока неизвестны.

Пока ждёте, текущий сетап можно разгрузить без покупок:

  • кэш KV в fp8 вместо нежатого. Экономия памяти на длинном контексте, цена - небольшая потеря точности;
  • снижение контекста. Если 129k нужны не постоянно, 32k освободят заметный объём;
  • более агрессивный квант самой модели, если ваши задачи это выдерживают;
  • спекулятивное декодирование и MTP, если ваша сборка их поддерживает: они ускоряют генерацию без роста VRAM.

Чем отличаются MTP и DFlash и как это влияет на скорость при 32 ГБ памяти, разбирали отдельно: Qwen 3.8 27B: MTP или DFlash для локального запуска. Насколько агрессивное квантование бьёт по качеству, видно на примере Qwen3.8 27B в Q2 и Q3 на 12 ГБ: тесты Q2 и Q3 против MoE.

Важная оговорка: эти меры освобождают память в рамках 48 ГБ, но не позволяют запустить тяжёлую MoE-модель. Если нужна именно она, экономия настроек проблему не решит.

Как принять решение: пошаговый фреймворк оценки апгрейда

  1. Зафиксируйте, что именно не работает. Упираетесь в скорость - сначала пробуйте настройки. Упираетесь в качество на конкретных задачах - сформулируйте, каких ответов не хватает.
  2. Посчитайте требования. Возьмите карточки нужных MoE-моделей, прикиньте веса для 4 и 3 бит плюс KV-кэш под ваш контекст по формулам выше.
  3. Соберите полную стоимость владения: карты, охлаждение, блок питания, райзеры, возможная замена материнской платы, электричество за год, ваше время на отладку. Цена карт - только часть счёта. Как оценивать карты с ограниченным бюджетом и что проверять в лоте с китайской площадки, разбирали здесь: выбор бюджетной GPU для локальных LLM в 2026.
  4. Сравните с альтернативами: ожидание Qwen4 27B, аренда GPU в облаке на нужные часы, API. Иногда платить за час дешевле, чем покупать карту.
  5. Проведите пилот. Если есть доступ к одной CMP 170HX или V100, прогоните свои задачи и получите реальные tok/s и качество. Одна карта покажет порядок цифр.
  6. Решайте по метрикам. Пример: если текущая модель ошибается в 30% случаев, а новая в 25%, и каждая ошибка стоит вам десяти минут, экономия времени должна покрыть 6-7 тысяч долларов в обозримый срок. Если новая модель втрое быстрее при том же качестве, считать надо иначе.

Итог: когда апгрейд оправдан, а когда лучше подождать

Апгрейд имеет смысл, если выполняются несколько условий сразу:

  • скорость генерации критична, и MoE-модель даёт кратный рост tok/s на ваших задачах;
  • качество новых моделей заметно выше, и вы это измерили на своём наборе промптов;
  • вы готовы возиться с охлаждением, драйверами и настройкой multi-GPU;
  • 6-7 тысяч долларов не ломают бюджет.

Подождать разумнее, если:

  • непонятно, чем именно новая модель лучше на ваших задачах;
  • текущая Qwen3 27B закрывает большинство запросов, а проблемы возникают в отдельных кейсах;
  • нет времени на отладку двух CMP или четырёх V100;
  • вы готовы ждать выхода Qwen4 27B или снижения цен на GPU с большой VRAM.

Практический шаг перед покупкой: арендуйте железо с нужной моделью на несколько часов и прогоните свои задачи. Это дешевле, чем покупать карты, которые потом придётся продавать.

Подписаться на канал