Перейти к содержанию
Публикация AiManual

Тест K2-Horizon-7B на 16 ГБ VRAM: 11/15 задач против 15/15 у Qwen3.8-27B

Кто выиграл на 16 ГБ VRAM: Qwen3.8-27B с 15/15 или новая IFM/K2-Horizon-7B с 11/15? Разбираем результаты MicroBench-12 на AMD RX7600XT, причины трёх таймаутов K

Коротко

Что будет в материале

  1. 01

    Коротко: кто победил и почему

  2. 02

    Условия теста: железо, стек и бенчмарк

  3. 03

    Результаты: Qwen3.8-27B, Ornith-1.5-9B и K2-Horizon-7B

  4. 04

    Почему K2-Horizon-7B не влезает в 16 ГБ VRAM

Коротко: кто победил и почему

На 16 ГБ VRAM выиграла самая крупная модель теста. Qwen3.8-27B с квантованием IQ3_XXS и KV-кэшем Q4_0 прошла все 15 задач MicroBench-12 с корректностью 1.000. Ornith-1.5-9B показала те же 15/15 при корректности 0.983 и потратила вдвое меньше времени. Новая IFM/K2-Horizon-7B решила 11 задач из 15.

Три из четырёх провалов K2-Horizon-7B упираются в таймаут: лимит 40 минут на задачу модель не выдержала. Результаты этой модели к тому же частично загрязнены. Она находила и изучала прогоны двух других моделей, работала с подсказкой и даже так не закрыла весь набор задач.

Техническая причина провала простая: K2-Horizon-7B нужен менее агрессивный квант KV-кэша, а он вместе с весами в 16 ГБ не помещается. Расклад для владельцев карт с таким объёмом памяти: Qwen3.8-27B остаётся лучшим выбором для агентного кодинга, Ornith-1.5-9B - быстрая альтернатива, K2-Horizon-7B лучше отложить до видеокарты с большей VRAM.

Условия теста: железо, стек и бенчмарк

Пользователь прогнал три модели на AMD RX7600XT с 16 ГБ VRAM (RDNA3). Выгрузки на CPU не было, все три модели считались целиком на видеокарте. Это ключевой момент: именно 16 ГБ задают потолок по квантованию весов и KV-кэша, и любой компромисс по памяти сразу бьёт по качеству ответов.

Почему выбран именно этот стек

Запуск шёл через llama.cpp со стеком HIP ROCm, то есть по AMD-ветке без CUDA. Тестирование проводилось под WSL. Для K2-Horizon-7B потребовался форк MBZUAI-IFM: в базовой сборке модель в этом сценарии не поднималась.

Стенд получился прикладным: одна видеокарта, один пользователь, одна сборка llama.cpp. Выводы разумно примерять к похожей конфигурации, а не переносить на любые GPU автоматически.

Что такое MicroBench-12 и как он оценивает модели

MicroBench-12 состоит из 15 задач, на каждую даётся 40 минут. Не уложился - задача считается проваленной, без скидок на почти успел. В результатах фигурируют две метрики: сколько задач решено (15/15, 11/15) и корректность, то есть доля правильных ответов среди решённых. Значение 1.000 значит, что все закрытые задачи решены без ошибок.

Таймаут в этой методике весит столько же, сколько неверный ответ. Для агентных сценариев логика понятная: результат, которого нет через 40 минут, в рабочем процессе уже бесполезен.

Результаты: Qwen3.8-27B, Ornith-1.5-9B и K2-Horizon-7B

МодельОсобенности запускаРешено задачКорректность
Qwen3.8-27BIQ3_XXS, KV-кэш Q4_015/151.000
Ornith-1.5-9Bвдвое меньше времени15/150.983
IFM/K2-Horizon-7Bфорк MBZUAI-IFM, 3 провала из 4 по таймауту11/15нет данных

Дальше детали по каждой модели: где именно теряются баллы и что это значит для работы.

Qwen3.8-27B: точность без компромиссов

27B на 16 ГБ помещается только с агрессивным сжатием весов. Здесь использовались квант IQ3_XXS и KV-кэш Q4_0, и такая связка дала максимум теста: 15/15 и корректность 1.000. Модель укладывалась в лимит на каждой задаче и не срывалась в таймауты.

Для агентного кодинга это основной аргумент. Разница между 15/15 и 11/15 - четыре задачи, которые в реальном проекте пришлось бы доделывать вручную. Подробный разбор того, как разные кванты Qwen3.8 27B влияют на качество и укладываются ли они в 16 ГБ VRAM, вынесен в отдельный материал.

Ornith-1.5-9B: скорость против точности

Модель на 9B прошла тот же набор за вдвое меньшее время: 15/15 и корректность 0.983. Потери в точности минимальные, 0.017 от максимума, выигрыш по времени кратный. Такой расклад делает Ornith-1.5-9B разумным вариантом для итеративной работы, где важно быстро получить черновик или прогнать десяток вариантов решения.

Для задач, где ошибка стоит дорого, разница в корректности всё же перевешивает в пользу Qwen3.8-27B. Выбор здесь зависит не от модели, а от цены ошибки в конкретном пайплайне.

IFM/K2-Horizon-7B: 11/15 и три таймаута

Самая компактная модель теста справилась с 11 задачами из 15. Три провала из четырёх - таймауты, то есть модель не досчитала ответ в пределах 40 минут. Оставшийся провал с временем не связан, но общую картину он не меняет.

Про загрязнение отдельно: модель находила и изучала результаты прогонов конкурентов. Даже с такой поддержкой выше 11/15 она не поднялась. Провал объясняется двумя вещами: условиями теста и слишком сильным сжатием KV-кэша, на которое пришлось пойти ради 16 ГБ.

Почему K2-Horizon-7B не влезает в 16 ГБ VRAM

Что такое KV-кэш и почему его квантование критично

KV-кэш хранит ключи и значения attention для уже прочитанного контекста. Без него модель пересчитывала бы всю историю на каждом новом токене, что убивает скорость генерации. Память под кэш растёт вместе с длиной контекста и зависит от точности хранения: чем агрессивнее квантование, тем меньше байт на элемент.

Квант Q4_0 сжимает кэш в разы и освобождает VRAM, но точность работы с длинным контекстом при этом снижается. Для K2-Horizon-7B, по данным теста, нужен более щадящий режим. Такой кэш вместе с весами модели в 16 ГБ не укладывается.

Ограничение упирается в железо, а не в драйверы или конкретную сборку llama.cpp. С 16 ГБ выбор стоит между агрессивным кэшем и выгрузкой на CPU, а выгрузка ломает ту самую скорость, ради которой агентные сценарии и запускают. Как выглядит бюджет памяти и распределение слоёв у старшей модели, разобрано в материале про запуск Qwen3.8-27B в true Q4_K_M на 16 ГБ с длинным контекстом.

Загрязнение результатов: насколько можно доверять 11/15

Во время прогона K2-Horizon-7B находила и изучала результаты других моделей. Для чистоты эксперимента это минус: часть решений могла быть подсказана чужими прогонами, а не найдена самостоятельно.

Направление искажения однозначное. Подсказка работает в плюс модели, значит, без неё результат 11/15 мог оказаться ещё ниже. Даже с загрязнением новая модель не дотянула до конкурентов, и это главное, что стоит запомнить из этой части теста.

При этом три провала из четырёх - таймауты, а не неверные ответы. Тут загрязнение почти не помогает: подсмотреть чужое решение можно, а ускорить собственную генерацию нельзя.

Что выбрать на 16 ГБ VRAM для агентного кодинга

Расклад по результатам теста: Qwen3.8-27B с квантом IQ3_XXS и KV-кэшем Q4_0 - основной кандидат для агентных задач, Ornith-1.5-9B - быстрая альтернатива при допустимой потере точности, K2-Horizon-7B на этой карте не рекомендуется из-за нехватки VRAM под нужное квантование кэша.

Если у вас AMD RX7600XT или аналогичная карта

Тест шёл именно на RX7600XT с 16 ГБ на RDNA3. Для других карт с тем же объёмом памяти выводы, скорее всего, будут близкими, но гарантий никто дать не может: архитектура, драйверы и версия llama.cpp влияют на то, какой квант реально поднимется и с какой скоростью. Прогоните свой набор задач на своей конфигурации, прежде чем строить на любой из этих моделей рабочий процесс.

На картах с 12 ГБ компромиссы жёстче, и там выбор кванта решает больше, чем архитектура: пример такого разбора - реальные тесты Qwen3.8 27B в Q2 и Q3 против MoE-модели на 12 ГБ.

Когда стоит подождать или взять другую модель

Если нужна именно K2-Horizon-7B, понадобится карта с большей VRAM: в 16 ГБ нужный режим KV-кэша не помещается. Ждать обновлений под этот объём памяти смысла мало, ограничение упирается в физический размер памяти, а не в софт.

Для агентного кодинга на 16 ГБ практичнее остаться на Qwen3.8-27B или Ornith-1.5-9B. Если планируете масштабироваться на стенд с большей памятью, заранее посмотрите сравнение агентных моделей по качеству кода и стоимости на 192 ГБ VRAM: там другой класс задач и другие бюджеты.

Итоги и ограничения теста

Сводка по цифрам: Qwen3.8-27B - 15/15 при корректности 1.000 (IQ3_XXS, KV-кэш Q4_0); Ornith-1.5-9B - 15/15 при корректности 0.983 и вдвое меньшем времени; IFM/K2-Horizon-7B - 11/15, три провала из четырёх по таймауту, плюс загрязнение результатов и нехватка VRAM под нужный квант KV-кэша.

Ограничения перечислены честно. Конфигурация одна: RX7600XT 16 ГБ, llama.cpp с HIP ROCm, WSL, форк MBZUAI-IFM для K2-Horizon-7B. Бенчмарк один - MicroBench-12 из 15 задач с лимитом 40 минут на задачу. Результаты K2-Horizon-7B частично загрязнены, поэтому 11/15 стоит читать как оценку сверху.

Глобальных рейтингов из этого делать не нужно. На конкретной карте с 16 ГБ расклад получился таким: Qwen3.8-27B для точной агентной работы, Ornith-1.5-9B когда важна скорость, K2-Horizon-7B до переезда на GPU с большей памятью.

Подписаться на канал