Пользователь опубликовал отчёт о запуске модели Flash Next через ExllamaV3 с квантом exl3 3bpw. На трёх RTX 3090 с 128 ГБ DDR4 он получил около 1500 токенов prefill и 80 токенов/с на декодинге, на одной RTX 5090 с теми же 128 ГБ DDR4 - те же 1500 prefill и 29 токенов/с. Оба запуска шли при контексте 262k, с включёнными vision и speculative decoding. Исходный отчёт опубликован на r/LocalLLaMA.
Короткий ответ на главный вопрос: 3-битный квант exl3 в этой связке запускается, а ExllamaV3 держит 262k контекста на потребительских картах. Декодинг на одной RTX 5090 отстаёт от трёх RTX 3090 примерно в 2,7 раза, а prefill не отличается вообще. По словам автора, на этой модели ExllamaV3 заменяет ему vllm и llama.cpp.
Оговорка, без которой цифры читать нельзя: это данные одного человека, без независимой проверки. Версии ExllamaV3 и точных флагов запуска в отчёте нет. Качество 3bpw оценено предварительно, сравнение с 4bpw автор только планирует.
Что такое ExllamaV3 и exl3 3bpw и почему о них говорят
Интерес к связке вырос после нескольких постов в сообществе LocalLLaMA. Автор отчёта пишет, что решил попробовать ExllamaV3 и exl3 3bpw после того, как наткнулся на такие публикации.
ExllamaV3 в двух словах: что это и чем отличается от других движков
ExllamaV3 - движок локального инференса, рассчитанный на квантованные веса. В этом отчёте он держит Flash Next с квантом exl3, контекст 262k, включённые vision и speculative decoding. Собрать такой набор на потребительских GPU сложнее, и именно поэтому о связке говорят.
Универсальным победителем ExllamaV3 из этого отчёта не становится. Автор сравнивал один сценарий на одной модели, и его вывод звучит так: на Flash Next движок заменяет ему vllm и llama.cpp. Про другие модели в отчёте ничего нет.
exl3 3bpw: что даёт квантование в 3 бита на вес
3bpw читается буквально: около 3 бит на вес. Ориентир для прикидки бюджета памяти: при том же числе параметров 4-битный квант занимает примерно на треть больше места, чем 3-битный. Экономия идёт на веса, а на длинном контексте основную память съедает KV-cache, поэтому каждый освобождённый гигабайт расширяет доступный контекст.
Цена экономии - качество. Автор отчёта оценивает его как приемлемое на своих задачах, но сравнение с 4bpw ещё впереди. На точных задачах (математика, код, длинные рассуждения) деградация на 3 битах обычно проявляется заметнее, чем на диалогах, и проверять её нужно на своих промптах, а не на чужих впечатлениях.
Сама модель требует отдельного разбора: что известно о Flash Next, её архитектуре и требованиях к памяти.
Реальные цифры: 3x RTX 3090 против одной RTX 5090
Все числа ниже взяты из одного отчёта: одна модель, один квант, разное железо. Порядок цифр запоминается легко - prefill совпал, decode разошёлся.
| Конфигурация | Prefill | Decode | Контекст |
|---|---|---|---|
| 3x RTX 3090, 128 ГБ DDR4 | ~1500 токенов/с | 80 токенов/с | 262k |
| 1x RTX 5090, 128 ГБ DDR4 | ~1500 токенов/с | 29 токенов/с | 262k |
Конфигурация на трёх RTX 3090: 1500 prefill и 80 токенов/с
Три RTX 3090 дают 72 ГБ видеопамяти суммарно, к ним добавлены 128 ГБ системной DDR4. На этой сборке обработка промпта идёт со скоростью около 1500 токенов/с, генерация - 80 токенов/с, при контексте 262k, с vision и speculative decoding.
80 токенов/с быстрее, чем читает человек, причём с большим запасом. На такой скорости узким местом становится не GPU, а скорость восприятия текста: ответ на 1000 токенов появляется примерно за 12 секунд.
Одна RTX 5090: те же 1500 prefill, но 29 токенов/с на декодинге
Конфигурация: одна RTX 5090, 128 ГБ DDR4, те же 262k контекста, vision и speculative decoding. Prefill остаётся на уровне 1500 токенов/с, decode падает до 29 токенов/с. Разница с трёхкарточной сборкой - примерно в 2,7 раза.
Практический смысл: 29 токенов/с всё ещё опережают чтение, но при длинных ответах разница ощущается. Тот же ответ на 1000 токенов генерируется около 12 секунд на трёх 3090 и около 34 секунд на одной 5090. Для диалога это терпимо, для циклов, где модель делает десятки вызовов подряд, накапливается в минуты.
Как читать prefill и decode: что эти цифры значат на практике
Prefill - скорость обработки входного текста, decode - скорость появления новых токенов. Для пользователя prefill определяет время до первого ответа, decode - скорость самого ответа. При контексте 262k ожидание растягивает именно prefill.
Арифметика простая: 262 000 токенов при 1500 токенов/с обрабатываются примерно за 175 секунд. Почти три минуты ожидания, если подавать полный контекст одним куском. При коротком промпте prefill не проблема вообще. Как правильно снимать эти метрики и не путать их с пропускной способностью, разобрано в материале про prefill и decode на одной RTX 5090.
Почему prefill одинаковый на обеих конфигурациях
Совпадение 1500 токенов/с на трёх 3090 и одной 5090 выглядит странно, и по одному отчёту причину не установить. Правдоподобные объяснения: prefill упирается в пропускную способность памяти или в CPU, а не в число GPU; настройки батча в обеих сборках совпали; 128 ГБ DDR4 и пересылка данных через PCIe тоже способны ограничить поток. Это гипотезы, потому что точных параметров запуска в отчёте нет.
Что даёт speculative decoding и vision в этом сетапе
Speculative decoding ускоряет генерацию так: небольшая черновая модель предлагает несколько токенов вперёд, основная проверяет их за один проход и принимает подходящие. Выигрыш зависит от того, как часто черновая модель угадывает, и от накладных расходов на проверку. Замеров отдельно с этой функцией и без неё в отчёте нет, поэтому приписывать ей конкретный прирост нельзя.
Vision даёт модели работу с изображениями. Здесь важно другое: обе функции включены одновременно с контекстом 262k, и это уже говорит о запасе памяти у сетапа. Сколько занимает vision-часть и черновая модель, в отчёте не сказано.
ExllamaV3 против vllm и llama.cpp: что выбрать
Формулировка автора звучит категоричнее, чем позволяет контекст: на Flash Next ExllamaV3 заменяет ему и vllm, и llama.cpp. Это оценка для одной модели и одной задачи, не приговор остальным движкам.
Когда ExllamaV3 может выиграть
Сценарий, в котором он выиграл в отчёте: одна большая модель, квант около 3 бит, контекст 262k, нужны vision и speculative decoding, железо - потребительские GPU. Если ваш случай похож, попробовать стоит: результат получен именно на такой сборке.
Когда vllm или llama.cpp остаются лучше
vllm силён там, где важны серверные сценарии: конкурентные запросы, высокая пропускная способность, готовые интеграции. llama.cpp выигрывает там, где нужна широкая поддержка архитектур, гибкая раскладка по CPU и GPU и работа на разном железе, включая слабое. Где именно llama.cpp упирается в производительность и какие патчи дают реальный прирост, разобрано отдельно: ускорение MoE-инференса в llama.cpp на RTX 4080.
Качество квантования exl3 3bpw: первые впечатления и что ещё проверить
Автор отчёта пишет, что качество выглядит приемлемым, и собирается позже взять 4bpw для сравнения. Формулировка честная, но означает она ровно одно: проверка ещё не сделана.
Почему 3bpw может быть достаточно
Три бита на вес позволяют запустить модель, которая в 4-6 битах в доступную память не поместится. Если задача терпит небольшую потерю точности, выигрыш от более крупной модели перекрывает потери от кванта. Пример из отчёта: Flash Next с контекстом 262k на трёх 3090 или на одной 5090.
Когда стоит дождаться 4bpw или использовать другие кванты
Если результат критичен к точности, 3bpw - не тот случай, чтобы экономить. 4bpw даст больше бит на вес, но потребует больше VRAM, а на одной 5090 это может обернуться уменьшением контекста. Гарантий, что 4bpw окажется заметно лучше, никто пока не дал: сравнение не проводилось. Как планировать бюджет памяти под веса и KV-cache, разобрано в материале про Q4_K_M на 16 ГБ VRAM.
Ограничения и риски такого сетапа
Почему цифры могут отличаться на вашей конфигурации
На prefill и decode влияют версия драйвера, версия ExllamaV3, параметры кванта, размер батча, пропускная способность памяти, скорость CPU и шины PCIe, температура и троттлинг. В отчёте нет ни одного из этих параметров, кроме модели GPU и объёма DDR4. Повторить цифры один в один не получится, рассчитывать можно только на порядок величины.
Что осталось за кадром: версии, настройки, стабильность
Не раскрыты версия ExllamaV3, точные флаги запуска, размер черновой модели для speculative decoding, длительность теста. Про стабильность долгой работы под нагрузкой тоже ничего не сказано, а для постоянного использования это важнее пиковых цифр. Контекст 262k требует большого запаса VRAM, и на одной карте этот запас заведомо тоньше, чем на трёх.
Практические выводы: кому подходит ExllamaV3 + exl3 3bpw для Flash Next
- Если у вас несколько GPU уровня RTX 3090 или одна RTX 5090 и задача - запустить Flash Next с длинным контекстом, связка ExllamaV3 + exl3 3bpw выглядит рабочим вариантом: 262k, vision и speculative decoding в отчёте включены одновременно.
- Если вы работаете на vllm или llama.cpp и результат устраивает, менять стек только из-за чужого отчёта смысла мало.
- Если качество критично, сначала протестируйте 3bpw на своих промптах, а сравнение с 4bpw ждите от автора отчёта или делайте сами.
- Свои замеры снимайте на своём контексте: цифры prefill и decode из чужих сборок переносятся плохо.
Единственный вывод, который держится на фактах: 3-битный квант на Flash Next в ExllamaV3 запускается и даёт приемлемую скорость на потребительских GPU, а разница между тремя 3090 и одной 5090 проявляется в генерации, а не в обработке промпта. План автора отчёта - сравнить 3bpw с 4bpw - стоит держать в закладках, если вы выбираете квант для своей сборки.