Перейти к содержанию
Публикация AiManual

GSQ против ByteShape: сравнение низкобитных квантов Qwen 3.8 27B на RTX 3060 12GB

Пользователь сравнил два ультранизкобитных кванта Qwen 3.8 27B на RTX 3060 12GB в llama.cpp: GSQ-RCO-IQ3-XXS и ByteShape IQ3-XXS. GSQ собрал 3D-воксельную диора

Коротко

Что будет в материале

  1. 01

    Короткий ответ: какой квант Qwen 3.8 27B лучше на RTX 3060 12GB

  2. 02

    Что такое GSQ-RCO-IQ3-XXS и ByteShape IQ3-XXS

  3. 03

    Почему KL-divergence не гарантирует практическую производительность

  4. 04

    Тест на RTX 3060 12GB: конфигурация и условия

Короткий ответ: какой квант Qwen 3.8 27B лучше на RTX 3060 12GB

Для Qwen 3.8 27B на RTX 3060 12GB в llama.cpp практичнее оказался ISTA-DASLab GSQ-RCO-IQ3-XXS: около 10.4GB весов, примерно 2.5 BPW. ByteShape IQ3-XXS меньше примерно на 500MB и заявлялся как квант с очень высокой близостью к BF16-модели по KL-divergence. Ожидание было простое: меньший размер плюс лучшая метрика сходства равны как минимум сопоставимому качеству. В отчёте пользователя в r/LocalLLaMA вышло наоборот. GSQ сгенерировал 3D-воксельную диораму с первого прохода и уложился в 55k токенов. ByteShape потребовал примерно трёх попыток, израсходовал больше 98K токенов и задачу так и не завершил.

Веб-разработка дала тот же сигнал: результат ByteShape автор теста описал как невпечатляющий на фоне заявленного в карточке модели.

Рамка, без которой вывод читается неверно. Это опыт одного пользователя на одной системе, а не воспроизводимый бенчмарк. Другая сборка llama.cpp, другой объём RAM или другая ОС могут дать иной расклад, поэтому переносить результат на своё железо без проверки не стоит.

Что такое GSQ-RCO-IQ3-XXS и ByteShape IQ3-XXS

Оба кванта собраны из одной базовой модели Qwen 3.8 27B и распространяются в формате GGUF. GSQ-RCO-IQ3-XXS от ISTA-DASLab занимает около 10.4GB и держится в районе 2.5 бита на вес (BPW). ByteShape IQ3-XXS примерно на 500MB меньше и относится к тому же ультранизкобитному диапазону. Оба файла помечены как IQ3-XXS, то есть это предельно агрессивное сжатие для 27B-модели.

ByteShape продвигался с акцентом на метрику: чрезвычайно высокая близость к исходной BF16-модели по измерениям KL-divergence. Это заявление из карточки модели, независимой проверки в открытых источниках по нему нет, и относиться к нему стоит как к рекламной характеристике, а не как к измеренному факту.

Внутренние детали алгоритмов GSQ и ByteShape в исходном отчёте не раскрыты. Известны размер, диапазон BPW, принадлежность к семейству IQ3-XXS и заявленная метрика сходства. Этого хватает, чтобы выбирать между двумя файлами, но не хватает, чтобы объяснить расхождение на уровне математики квантования.

Почему 27B-модель вообще запускают в ~2.5 BPW

Арифметика простая. 27 млрд параметров в BF16 занимают порядка 54 ГБ только под веса, если считать по 2 байта на параметр. На карте с 12GB VRAM такой файл не помещается, поэтому остаются либо выгрузка части слоёв в системную память, либо ультранизкобитный квант.

Файл на ~10.4GB оставляет на 12GB карте запас под KV-кэш и служебные буферы llama.cpp. Вариант на ~500MB меньше оставляет чуть больше свободы: это может дать лишние тысячи токенов контекста или возможность поднять размер KV-кэша. Для карт на 12GB такой запас имеет значение, поэтому ByteShape и выглядел привлекательно до практического прогона.

Почему KL-divergence не гарантирует практическую производительность

ByteShape заявлялся как квант с очень высокой близостью к BF16, и логика «метрика лучше, значит и работать будет лучше» выглядит разумной. Тест её не подтвердил. Это не значит, что KL-divergence бесполезна, но её границы стоит понимать до того, как выбирать файл по одной цифре.

Что именно измеряет KL-divergence и чего она не видит

KL-divergence между квантом и BF16-эталоном сравнивает распределения вероятностей по следующему токену на наборе текстов. Метрика агрегирует расхождение по множеству позиций и выдаёт усреднённую картину: насколько вероятностная картина кванта отличается от эталонной.

Чего в этой усреднённой картине нет: накопления ошибок на длинных цепочках, способности удержать структуру вывода на десятках тысяч токенов, следования инструкциям на многошаговой задаче. Короткий текстовый прогон и задача на 55 тысяч токенов с промежуточными результатами предъявляют к модели разные требования.

Контраст из теста показателен: GSQ закрыл 3D-воксельную диораму меньше чем за 55k токенов с первого прохода, ByteShape израсходовал больше 98K токенов и не завершил работу. Если смотреть только на метрику сходства, такой разрыв трудно предсказать. Практический прогон на собственной задаче показывает то, что усреднённая метрика скрывает.

Тест на RTX 3060 12GB: конфигурация и условия

Конфигурация известна из исходного отчёта: RTX 3060 12GB, 16GB DDR4 в одноканальном режиме, CachyOS / Arch Linux, llama.cpp, модель Qwen 3.8 27B, MTP и speculative decoding там, где они применимы.

Одноканальная память тут важна. Часть слоёв при таком объёме VRAM может уходить в системную память, а одноканальный режим режет пропускную способность RAM. Поэтому цифры скорости на этой сборке чувствительны к настройкам оффлоада и не переносятся напрямую на машины с двухканальной памятью или с большим объёмом VRAM.

Роль MTP/speculative decoding в тесте

На GSQ MTP был включён. Скорость составила около 29 tok/s у полного контекста и 34-40 tok/s при меньшем контексте. MTP ускоряет декодирование за счёт спекулятивного предсказания нескольких токенов вперёд и проверки их основным проходом модели.

По ByteShape аналогичных замеров в отчёте нет. Это не значит, что он работает медленнее или быстрее, данных для такого сравнения просто не хватает. Сравнение скорости между двумя квантами в этом тесте получилось неполным.

3D-воксельная диорама: GSQ за 55k токенов против ByteShape за 98K+

Ключевой кейс теста. GSQ (ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF) собрал 3D-воксельную диораму с первого прохода, уложившись меньше чем в 55 тысяч токенов. ByteShape 3.8 27B потребовал около трёх попыток, израсходовал более 98 тысяч токенов и работу не завершил.

Разница не в единицах процентов, а в характере поведения. Один квант довёл задачу до результата с первой попытки. Второй не довёл даже после нескольких заходов и двукратного расхода токенов. Для длинной структурной генерации это принципиальный признак: имеет значение не то, как модель отвечает на короткий вопрос, а то, удерживает ли она план на протяжении десятков тысяч токенов.

Детали промпта, инструментов и формата вывода в отчёте не раскрыты, так что воспроизвести этот кейс один в один не получится. Перед нами единичный случай, а не статистика. Похожий эффект уже фиксировался в других тестах квантизаций: одинаковый итоговый результат при кратном расхождении в расходе токенов меняет практическую ценность модели. Разбор такого случая есть в материале про IQ3_XXS и Bonsai Ternary PQ2 на 16 ГБ VRAM, где разница в токенах и времени дошла до трёх раз.

Веб-разработка: где ByteShape не дотянул до заявленного

Вторая задача дала тот же вывод в более сжатой форме: в веб-разработке результат ByteShape оказался невпечатляющим по сравнению с заявленным. Конкретных примеров, фреймворков и метрик в отчёте нет, поэтому этот пункт стоит читать как подтверждающий сигнал, а не как отдельный бенчмарк.

Связь с предыдущим разделом прямая. Рекламируемая близость к BF16 по KL-divergence не конвертируется автоматически в качество на задачах, где нужно удержать структуру и довести работу до конца. Два разных сценария показали один и тот же паттерн, и это уже повод отнестись к кванту настороженно, хотя и не повод объявлять его нерабочим.

Скорость и поведение на RTX 3060: что известно, а что нет

Из замеров есть только цифры GSQ: около 29 tok/s у полного контекста и 34-40 tok/s при меньшем контексте, с включённым MTP. По ByteShape замеров скорости в отчёте нет вообще.

Отсюда практическое следствие. Утверждать, что ByteShape медленнее по tok/s, нельзя, данных нет. Зафиксирован другой измеримый факт: он потратил больше 98K токенов и не завершил задачу, тогда как GSQ закрыл её меньше чем за 55K. Расход токенов и факт завершения оказались информативнее, чем скорость декодирования.

Второе следствие касается переносимости. 16GB DDR4 в одноканальном режиме ограничивают пропускную способность системы, а часть модели может уходить в RAM. На другой машине узким местом станет иной компонент, и картина скорости изменится. Замеры скорости без описания конфигурации мало о чём говорят.

Как выбрать квант Qwen 3.8 27B под свою систему: практический чек-лист

  1. Посчитайте бюджет памяти. GSQ-RCO-IQ3-XXS занимает около 10.4GB, ByteShape IQ3-XXS примерно на 500MB меньше. Оставшееся место на карте уйдёт под KV-кэш и служебные буферы llama.cpp.
  2. Заложите запас. На 12GB карте разница в 500MB может дать лишний контекст, но не гарантирует этого: итог зависит от длины контекста и настроек KV-кэша.
  3. Проверьте, поддерживается ли MTP или speculative decoding для выбранного кванта. В тесте MTP был включён на GSQ, и это заметно влияет на скорость.
  4. Прогоните свою типовую задачу. Не короткий чат, а то, чем вы реально пользуетесь: длинную генерацию, структурный вывод, многошаговую задачу. Зафиксируйте, сколько токенов ушло до завершения.
  5. Сравнивайте по поведению, а не по одной метрике. KL-divergence из карточки модели полезна, но не заменяет проверку на длинной задаче.
  6. Помните про конфигурацию. Результаты получены на RTX 3060 12GB, 16GB DDR4 single channel и CachyOS, так что на другой системе расклад может отличаться.

Для подбора вариантов под разный объём памяти и контекст пригодится разбор про запуск Qwen3.8-27B в Q4_K_M и бюджет памяти: там разобраны KV-кэш, выбор между Q4_K_M и IQ3 и порядок замеров. А если сравниваете кванты на том же железе, что и в этом тесте, полезна сводка девяти моделей на одном промпте на RTX 3060 12GB, где GSQ-RCO-IQ3-XXS дал лучший баланс качества и скорости.

Какие метрики фиксировать при собственном тесте

  • Число попыток до завершения задачи.
  • Общее количество потраченных токенов.
  • Факт завершения: задача закрыта или нет.
  • Скорость tok/s у полного контекста и при меньшем контексте.
  • Наличие MTP или speculative decoding и факт их включения.
  • Конфигурацию железа, объём RAM, канал памяти и версию ОС.

Именно связка «факт завершения плюс расход токенов» развела GSQ и ByteShape в этом тесте: меньше 55K токенов с первого прохода против более 98K без результата. Скорость в такой картине вторична, потому что быстрый, но не доводящий задачу до конца квант экономит время только на бумаге.

Итог: кому подходит GSQ, а кому - ByteShape

В описанном тесте GSQ-RCO-IQ3-XXS оказался практичнее ByteShape IQ3-XXS на RTX 3060 12GB в llama.cpp. Меньший размер и рекламируемая близость к BF16 по KL-divergence не превратились в преимущество на длинной задаче: ByteShape потратил вдвое больше токенов и работу не закончил.

Это не приговор ByteShape навсегда. Речь о том, что конкретный кейс не подтвердил заявленный уровень, а данных для общего вывода мало: один пользователь, одна конфигурация, нет замеров скорости по второму кванту. Если ваши задачи короткие и упираются в лишние 500MB на карте, ByteShape может подойти, но проверять это стоит на своих сценариях.

Практический вывод простой: если задача длинная и многошаговая, не выбирайте квант по одной метрике из карточки. Скачайте оба файла, прогоните свою задачу и посмотрите на две цифры, число потраченных токенов до завершения и сам факт завершения.

Подписаться на канал