Что даёт апгрейд с 3x RTX 3090 на 2x RTX 5090: короткий ответ
Переход с трёх RTX 3090 (две 3090 и одна 3090 Ti) на две RTX 5090 ускорил инференс в llama.cpp сборки b11216 на модели Qwen3.8-27B в квантовании Q8_0. Это главный вывод кейса, опубликованного в r/LocalLLaMA: обсуждение апгрейда.
Второй источник прироста лежит не в железе, а в софте. После перехода на NVFP4 в связке со speculative decoding те же две 5090 дали ещё один скачок скорости. Это третий замер в сравнении, и он показывает отдельный вклад формата квантования и изменённой схемы генерации поверх новой архитектуры GPU.
Оговорка, которая меняет чтение результатов «до»: в старой конфигурации одна из трёх 3090 стояла в более медленном слоте PCIe. Сборка 3x 3090 работала ниже того уровня, который показали бы три карты на равных слотах, поэтому сравнивать два стенда как безупречный A/B нельзя.
По деньгам апгрейд вышел дорогим. Две готовые сборки обошлись по $6,4 тыс. каждая в момент, когда цена 5090 поднялась до $7,5 тыс. Продажа 3090 примерно по $2 тыс. за штуку и оставшихся компонентов сборок в лучшем случае сокращает стоимость GPU до ~$6 тыс. после налогов, что всё равно выше MSRP 5090.
Конфигурация до и после: что именно менялось
Старый стенд: две RTX 3090 и одна RTX 3090 Ti, три карты в одном пуле VRAM. Новый стенд: две RTX 5090. Движок остался тем же, llama.cpp сборки b11216, а модель на замерах одна и та же, Qwen3.8-27B в варианте abliterated с квантованием Q8_0. Именно совпадение модели и движка делает сравнение осмысленным: менялось железо, а базовая нагрузка нет. Что известно про саму Qwen 3.8 и её требования к памяти, мы разбирали в отдельном материале о запуске Qwen 3.8 на одной RTX 3090.
Три карты против двух меняют не только суммарный объём памяти. Другая раскладка слоёв по GPU означает другой объём обмена данными между картами и другую нагрузку на шину. Поэтому вывод «5090 быстрее 3090» сам по себе из этого кейса не следует: корректная формулировка звучит как «на этой модели, в этом квантовании и этой сборке llama.cpp переход дал заметный прирост».
Почему одна 3090 в медленном слоте искажает сравнение
Когда модель разложена по нескольким GPU, карты постоянно обмениваются активациями и синхронизируются на каждом шаге генерации. Слот PCIe с меньшей пропускной способностью ограничивает этот обмен, и одна медленная карта тянет вниз всю сборку: остальные простаивают в ожидании данных. В кейсе так и вышло, одна из трёх 3090 стояла в более медленном слоте, а значит результаты 3x 3090 занижены относительно ровной конфигурации.
Практический вывод для своих замеров: перед сравнением конфигураций проверьте, что карты стоят в слотах с одинаковой шириной и что платформа не режет линии при заполнении всех слотов. Если карт больше, чем полноскоростных слотов, фиксируйте это в описании стенда. Как это выглядит на практике, хорошо видно в разборе переезда с Dell R640 на Supermicro X11SPA-T из-за нехватки слотов PCIe 16x: там четвёртая карта просто не влезла в корпус и платформу, и вся сборка переехала на другое шасси.
Точную величину потери производительности в этом кейсе никто не измерял, поэтому любые проценты «на сколько именно медленнее» будут догадкой. Достаточно того, что автор сам обозначил эту поправку.
Три замера: как менялась скорость инференса
В сравнении три точки, и логика у них последовательная. Первый замер, старый стенд 3x 3090. Второй, две 5090 на той же модели в том же квантовании Q8_0. Третий, те же две 5090 после перехода на NVFP4 в сочетании со speculative decoding. Порядок исключает путаницу: третий замер отличается от второго только софтом, а не железом. Автор отдельно уточнил эту последовательность, чтобы сравнение читалось однозначно (источник замеров).
Что из этого следует практически. Первый шаг (новые карты) показывает, сколько даёт смена поколения GPU и рост вычислительной мощности и пропускной способности памяти. Второй шаг (NVFP4 + speculative decoding) показывает, сколько можно выжать из уже купленного железа настройками, без дополнительных трат.
Абсолютных значений токенов в секунду источник не приводит, поэтому в тексте нет и не может быть конкретных цифр по каждому замеру. Формулировки «заметный прирост» и «дополнительный прирост» здесь не украшение, а честная передача того, что есть в данных. Если вам нужны точные числа для своего стенда, их придётся снимать самому: разница в драйверах, сборке llama.cpp и раскладке слоёв меняет результат сильнее, чем кажется.
NVFP4: что это и почему ради него стоило менять GPU
NVFP4 это формат квантования с 4-битным представлением чисел, поддержка которого появилась на GPU поколения Blackwell. Автор кейса прямо говорит, что хотел перейти на 5090 именно ради поддержки NVFP4, то есть формат был целью апгрейда, а не приятным побочным эффектом. На старых картах этот путь недоступен: поддержка формата привязана к новому железу.
В кейсе переход на NVFP4 шёл в паре со speculative decoding, и в источнике эти два изменения объединены в один третий замер. Разделить их вклад по опубликованным данным нельзя: неизвестно, какая доля прироста пришлась на формат, а какая на спекулятивную генерацию. Если для вашей задачи важно понять, что именно даёт NVFP4 в одиночку, придётся включать изменения по одному и мерить каждый шаг отдельно.
Второе важное ограничение: качество ответов в кейсе не оценивалось. Источник говорит только о скорости. Утверждать, что NVFP4 всегда лучше Q8 по точности, нельзя, и обратное тоже нельзя. Это разные форматы с разной разрядностью, и разница в качестве ответов зависит от модели и задачи.
NVFP4 vs Q8_0: что меняется на практике
Q8_0 в этом сравнении выступает базой: на нём сняты первый и второй замеры, то есть модель и её веса не менялись при смене железа. NVFP4 появляется только на третьем шаге, вместе со speculative decoding, и даёт дополнительный прирост скорости.
Практический смысл такой связки в том, что она позволяет выжимать скорость из 5090 без смены карт. Но переносить результат на свой стенд без проверки не стоит: эффект зависит от модели, длины контекста, характера генерации (код и структурированный вывод ведут себя иначе, чем свободный текст) и настроек запуска. В источнике параметры запуска не приводятся, поэтому воспроизвести конфигурацию «бит в бит» по этому кейсу невозможно, можно только повторить общую схему.
Speculative decoding в llama.cpp: как он ускоряет генерацию
Идея speculative decoding простая. Небольшая вспомогательная модель предсказывает несколько следующих токенов сразу, а основная модель проверяет этот пакет за один проход. Если предсказания совпали с тем, что выбрала бы большая модель, пакет принимается целиком, и генерация продвигается на несколько шагов вперёд за то же время.
Эффект держится на двух условиях. Вспомогательная модель должна попадать в распределение основной достаточно часто, иначе отклонённые токены только добавят накладных расходов. И сама задача должна допускать предсказуемые продолжения: в шаблонном коде или повторяющейся разметке попаданий больше, чем в свободном рассуждении. В кейсе speculative decoding использован вместе с NVFP4 и дал дополнительный прирост поверх перехода на 5090, но конкретных настроек и выбора черновой модели источник не раскрывает.
Если хотите повторить схему у себя, порядок действий такой:
- Зафиксируйте версию llama.cpp и модель с квантованием, чтобы база была воспроизводимой.
- Снимите замер на текущем железе на одной и той же задаче и с одинаковой длиной контекста.
- Перейдите на NVFP4 и повторите замер, ничего больше не меняя.
- Включите speculative decoding и замерьте ещё раз: так вы увидите вклад каждого шага, а не общий эффект.
- Проверьте, что все карты стоят в равных слотах, иначе результат будет смещён.
Конкретный набор флагов запуска зависит от сборки и версии, его нужно сверять с документацией той сборки, которую вы ставите.
Сколько стоит апгрейд: честный расчёт
Цифры из источника выглядят так:
| Статья | Сумма |
|---|---|
| Две готовые сборки с RTX 5090 | $6,4 тыс. каждая |
| Цена RTX 5090 отдельно в момент покупки | поднялась до $7,5 тыс. |
| Планируемая продажа RTX 3090 | около $2 тыс. за карту |
| Ожидаемый возврат: 3090 плюс остатки сборок | около $9 тыс. в лучшем случае |
| Итоговая стоимость GPU после налогов | около $6 тыс. |
Считать надо именно по полной стоимости владения, а не по цене одной карты. Готовая сборка берётся целиком, вместе с корпусом, платой, памятью и блоком питания, а не только как носитель GPU. Часть этих компонентов потом продаётся, и именно из их продажи вместе с продажей старых 3090 складывается возврат около $9 тыс. в лучшем сценарии.
Сроки тоже важны: продажа 3090 ожидается через 2–3 месяца, а не сразу. То есть из оборота на этот период выпадает сумма, которую вы рассчитываете вернуть, а цены на вторичном рынке за это время могут уйти в любую сторону (детали по расходам).
Почему итоговая стоимость всё равно выше MSRP
Даже в лучшем случае, когда продаются и старые карты, и остатки сборок, итог по GPU выходит около $6 тыс. после налогов. Это выше MSRP 5090, и причины понятны: покупка шла готовыми сборками, а не отдельными картами; момент покупки пришёлся на рост цены 5090 до $7,5 тыс.; возврат денег растянут на месяцы и не гарантирован.
Отсюда простой вывод для планирования: ориентируйтесь на цену сборки и на реальный, а не мгновенный возврат от продажи старого железа. Если такой расчёт не сходится, апгрейд стоит отложить или рассмотреть более скромный вариант, например одну новую карту вместо двух.
Подводные камни и ограничения кейса
Ограничения здесь не косметические, их стоит держать в голове целиком:
- Разные слоты PCIe в старой конфигурации: одна из трёх 3090 стояла в более медленном слоте, поэтому результаты 3x 3090 занижены.
- Сравнение не идеальное по построению: конфигурации отличаются и по числу карт, и по поколению, и по раскладке слоёв.
- Третий замер объединяет два изменения сразу, NVFP4 и speculative decoding, поэтому вклад каждого по отдельности неизвестен.
- Стоимость около $6 тыс. после налогов это лучший сценарий с учётом продажи 3090 и остатков сборок, а не гарантированный итог.
- Продажа 3090 ожидается через 2–3 месяца, деньги возвращаются не сразу.
- Все цифры получены на конкретной сборке llama.cpp b11216 и модели Qwen3.8-27B в квантовании Q8_0, abliterated. Переносить их на другие модели, другие квантования и другие версии движка без своей проверки нельзя.
- Качество ответов при переходе на NVFP4 в кейсе не измерялось, выводы касаются только скорости.
Отдельно про сборку llama.cpp: b11216 это конкретный срез кодовой базы. Поддержка форматов и параметры спекулятивной генерации в llama.cpp развиваются быстро, поэтому номера версий и поведение флагов могут отличаться. Если вы воспроизводите замеры, фиксируйте версию в своих записях, иначе сравнение потеряет смысл.
Кому подходит такой апгрейд, а кому нет
Апгрейд с 3x 3090 на 2x 5090 имеет смысл, если вы уже упёрлись в скорость на старых картах, готовы заплатить выше MSRP за готовые сборки и рассчитываете использовать NVFP4 вместе со speculative decoding в llama.cpp. Второй сценарий, где переход оправдан, это когда вам важна поддержка нового формата квантования сама по себе: на 3090 её нет, и никакие настройки этого не изменят.
Не стоит идти этим путём, если главный критерий это минимальная стоимость инференса. Итог около $6 тыс. после налогов за пару GPU это осознанная переплата за свежее поколение, а не экономия. Не стоит рассчитывать на такой апгрейд и тем, кто не готов ждать продажи старых карт: возврат денег растянут на месяцы, и он не гарантирован.
Есть и промежуточные варианты, которые в этом кейсе не проверялись. Остаться на трёх 3090 и выжать больше из софта: speculative decoding работает и на старых картах, а часть прироста в кейсе пришлась именно на него. Либо собрать стенд на нескольких картах среднего класса, где суммарный объём VRAM решает больше, чем пиковая скорость одной карты, как в разборе сборки на четырёх RTX 3060 Ti с tensor parallel. Сравнение 3090 и 5090 на конкретной нагрузке тоже разбиралось отдельно: в кейсе с ExllamaV3 и квантом exl3 3bpw три 3090 обошли одну 5090 по prefill.
Перед покупкой имеет смысл сделать три вещи: замерить свой текущий стенд на своей рабочей задаче, проверить, поддержит ли ваш софт NVFP4 и speculative decoding в той версии, которую вы ставите, и посчитать полную стоимость с учётом реального срока продажи старых карт. Если после этого прирост в скорости окупает разницу в цене именно для вас, апгрейд оправдан.