Перейти к содержанию
Публикация AiManual

ExllamaV3 и exl3 3bpw для Flash Next: реальный опыт запуска на 3x3090 и одной 5090

Один пользователь запустил Flash Next через ExllamaV3 с квантом exl3 3bpw и получил около 1500 токенов prefill при контексте 262k: 80 токенов/с на трёх RTX 3090

Коротко

Что будет в материале

  1. 01

    Что такое ExllamaV3 и exl3 3bpw и почему о них говорят

  2. 02

    Реальные цифры: 3x RTX 3090 против одной RTX 5090

  3. 03

    Как читать prefill и decode: что эти цифры значат на практике

  4. 04

    ExllamaV3 против vllm и llama.cpp: что выбрать

Пользователь опубликовал отчёт о запуске модели Flash Next через ExllamaV3 с квантом exl3 3bpw. На трёх RTX 3090 с 128 ГБ DDR4 он получил около 1500 токенов prefill и 80 токенов/с на декодинге, на одной RTX 5090 с теми же 128 ГБ DDR4 - те же 1500 prefill и 29 токенов/с. Оба запуска шли при контексте 262k, с включёнными vision и speculative decoding. Исходный отчёт опубликован на r/LocalLLaMA.

Короткий ответ на главный вопрос: 3-битный квант exl3 в этой связке запускается, а ExllamaV3 держит 262k контекста на потребительских картах. Декодинг на одной RTX 5090 отстаёт от трёх RTX 3090 примерно в 2,7 раза, а prefill не отличается вообще. По словам автора, на этой модели ExllamaV3 заменяет ему vllm и llama.cpp.

Оговорка, без которой цифры читать нельзя: это данные одного человека, без независимой проверки. Версии ExllamaV3 и точных флагов запуска в отчёте нет. Качество 3bpw оценено предварительно, сравнение с 4bpw автор только планирует.

Что такое ExllamaV3 и exl3 3bpw и почему о них говорят

Интерес к связке вырос после нескольких постов в сообществе LocalLLaMA. Автор отчёта пишет, что решил попробовать ExllamaV3 и exl3 3bpw после того, как наткнулся на такие публикации.

ExllamaV3 в двух словах: что это и чем отличается от других движков

ExllamaV3 - движок локального инференса, рассчитанный на квантованные веса. В этом отчёте он держит Flash Next с квантом exl3, контекст 262k, включённые vision и speculative decoding. Собрать такой набор на потребительских GPU сложнее, и именно поэтому о связке говорят.

Универсальным победителем ExllamaV3 из этого отчёта не становится. Автор сравнивал один сценарий на одной модели, и его вывод звучит так: на Flash Next движок заменяет ему vllm и llama.cpp. Про другие модели в отчёте ничего нет.

exl3 3bpw: что даёт квантование в 3 бита на вес

3bpw читается буквально: около 3 бит на вес. Ориентир для прикидки бюджета памяти: при том же числе параметров 4-битный квант занимает примерно на треть больше места, чем 3-битный. Экономия идёт на веса, а на длинном контексте основную память съедает KV-cache, поэтому каждый освобождённый гигабайт расширяет доступный контекст.

Цена экономии - качество. Автор отчёта оценивает его как приемлемое на своих задачах, но сравнение с 4bpw ещё впереди. На точных задачах (математика, код, длинные рассуждения) деградация на 3 битах обычно проявляется заметнее, чем на диалогах, и проверять её нужно на своих промптах, а не на чужих впечатлениях.

Сама модель требует отдельного разбора: что известно о Flash Next, её архитектуре и требованиях к памяти.

Реальные цифры: 3x RTX 3090 против одной RTX 5090

Все числа ниже взяты из одного отчёта: одна модель, один квант, разное железо. Порядок цифр запоминается легко - prefill совпал, decode разошёлся.

КонфигурацияPrefillDecodeКонтекст
3x RTX 3090, 128 ГБ DDR4~1500 токенов/с80 токенов/с262k
1x RTX 5090, 128 ГБ DDR4~1500 токенов/с29 токенов/с262k

Конфигурация на трёх RTX 3090: 1500 prefill и 80 токенов/с

Три RTX 3090 дают 72 ГБ видеопамяти суммарно, к ним добавлены 128 ГБ системной DDR4. На этой сборке обработка промпта идёт со скоростью около 1500 токенов/с, генерация - 80 токенов/с, при контексте 262k, с vision и speculative decoding.

80 токенов/с быстрее, чем читает человек, причём с большим запасом. На такой скорости узким местом становится не GPU, а скорость восприятия текста: ответ на 1000 токенов появляется примерно за 12 секунд.

Одна RTX 5090: те же 1500 prefill, но 29 токенов/с на декодинге

Конфигурация: одна RTX 5090, 128 ГБ DDR4, те же 262k контекста, vision и speculative decoding. Prefill остаётся на уровне 1500 токенов/с, decode падает до 29 токенов/с. Разница с трёхкарточной сборкой - примерно в 2,7 раза.

Практический смысл: 29 токенов/с всё ещё опережают чтение, но при длинных ответах разница ощущается. Тот же ответ на 1000 токенов генерируется около 12 секунд на трёх 3090 и около 34 секунд на одной 5090. Для диалога это терпимо, для циклов, где модель делает десятки вызовов подряд, накапливается в минуты.

Как читать prefill и decode: что эти цифры значат на практике

Prefill - скорость обработки входного текста, decode - скорость появления новых токенов. Для пользователя prefill определяет время до первого ответа, decode - скорость самого ответа. При контексте 262k ожидание растягивает именно prefill.

Арифметика простая: 262 000 токенов при 1500 токенов/с обрабатываются примерно за 175 секунд. Почти три минуты ожидания, если подавать полный контекст одним куском. При коротком промпте prefill не проблема вообще. Как правильно снимать эти метрики и не путать их с пропускной способностью, разобрано в материале про prefill и decode на одной RTX 5090.

Почему prefill одинаковый на обеих конфигурациях

Совпадение 1500 токенов/с на трёх 3090 и одной 5090 выглядит странно, и по одному отчёту причину не установить. Правдоподобные объяснения: prefill упирается в пропускную способность памяти или в CPU, а не в число GPU; настройки батча в обеих сборках совпали; 128 ГБ DDR4 и пересылка данных через PCIe тоже способны ограничить поток. Это гипотезы, потому что точных параметров запуска в отчёте нет.

Что даёт speculative decoding и vision в этом сетапе

Speculative decoding ускоряет генерацию так: небольшая черновая модель предлагает несколько токенов вперёд, основная проверяет их за один проход и принимает подходящие. Выигрыш зависит от того, как часто черновая модель угадывает, и от накладных расходов на проверку. Замеров отдельно с этой функцией и без неё в отчёте нет, поэтому приписывать ей конкретный прирост нельзя.

Vision даёт модели работу с изображениями. Здесь важно другое: обе функции включены одновременно с контекстом 262k, и это уже говорит о запасе памяти у сетапа. Сколько занимает vision-часть и черновая модель, в отчёте не сказано.

ExllamaV3 против vllm и llama.cpp: что выбрать

Формулировка автора звучит категоричнее, чем позволяет контекст: на Flash Next ExllamaV3 заменяет ему и vllm, и llama.cpp. Это оценка для одной модели и одной задачи, не приговор остальным движкам.

Когда ExllamaV3 может выиграть

Сценарий, в котором он выиграл в отчёте: одна большая модель, квант около 3 бит, контекст 262k, нужны vision и speculative decoding, железо - потребительские GPU. Если ваш случай похож, попробовать стоит: результат получен именно на такой сборке.

Когда vllm или llama.cpp остаются лучше

vllm силён там, где важны серверные сценарии: конкурентные запросы, высокая пропускная способность, готовые интеграции. llama.cpp выигрывает там, где нужна широкая поддержка архитектур, гибкая раскладка по CPU и GPU и работа на разном железе, включая слабое. Где именно llama.cpp упирается в производительность и какие патчи дают реальный прирост, разобрано отдельно: ускорение MoE-инференса в llama.cpp на RTX 4080.

Качество квантования exl3 3bpw: первые впечатления и что ещё проверить

Автор отчёта пишет, что качество выглядит приемлемым, и собирается позже взять 4bpw для сравнения. Формулировка честная, но означает она ровно одно: проверка ещё не сделана.

Почему 3bpw может быть достаточно

Три бита на вес позволяют запустить модель, которая в 4-6 битах в доступную память не поместится. Если задача терпит небольшую потерю точности, выигрыш от более крупной модели перекрывает потери от кванта. Пример из отчёта: Flash Next с контекстом 262k на трёх 3090 или на одной 5090.

Когда стоит дождаться 4bpw или использовать другие кванты

Если результат критичен к точности, 3bpw - не тот случай, чтобы экономить. 4bpw даст больше бит на вес, но потребует больше VRAM, а на одной 5090 это может обернуться уменьшением контекста. Гарантий, что 4bpw окажется заметно лучше, никто пока не дал: сравнение не проводилось. Как планировать бюджет памяти под веса и KV-cache, разобрано в материале про Q4_K_M на 16 ГБ VRAM.

Ограничения и риски такого сетапа

Почему цифры могут отличаться на вашей конфигурации

На prefill и decode влияют версия драйвера, версия ExllamaV3, параметры кванта, размер батча, пропускная способность памяти, скорость CPU и шины PCIe, температура и троттлинг. В отчёте нет ни одного из этих параметров, кроме модели GPU и объёма DDR4. Повторить цифры один в один не получится, рассчитывать можно только на порядок величины.

Что осталось за кадром: версии, настройки, стабильность

Не раскрыты версия ExllamaV3, точные флаги запуска, размер черновой модели для speculative decoding, длительность теста. Про стабильность долгой работы под нагрузкой тоже ничего не сказано, а для постоянного использования это важнее пиковых цифр. Контекст 262k требует большого запаса VRAM, и на одной карте этот запас заведомо тоньше, чем на трёх.

Практические выводы: кому подходит ExllamaV3 + exl3 3bpw для Flash Next

  • Если у вас несколько GPU уровня RTX 3090 или одна RTX 5090 и задача - запустить Flash Next с длинным контекстом, связка ExllamaV3 + exl3 3bpw выглядит рабочим вариантом: 262k, vision и speculative decoding в отчёте включены одновременно.
  • Если вы работаете на vllm или llama.cpp и результат устраивает, менять стек только из-за чужого отчёта смысла мало.
  • Если качество критично, сначала протестируйте 3bpw на своих промптах, а сравнение с 4bpw ждите от автора отчёта или делайте сами.
  • Свои замеры снимайте на своём контексте: цифры prefill и decode из чужих сборок переносятся плохо.

Единственный вывод, который держится на фактах: 3-битный квант на Flash Next в ExllamaV3 запускается и даёт приемлемую скорость на потребительских GPU, а разница между тремя 3090 и одной 5090 проявляется в генерации, а не в обработке промпта. План автора отчёта - сравнить 3bpw с 4bpw - стоит держать в закладках, если вы выбираете квант для своей сборки.

Подписаться на канал