Коротко: кто победил и почему
На 16 ГБ VRAM выиграла самая крупная модель теста. Qwen3.8-27B с квантованием IQ3_XXS и KV-кэшем Q4_0 прошла все 15 задач MicroBench-12 с корректностью 1.000. Ornith-1.5-9B показала те же 15/15 при корректности 0.983 и потратила вдвое меньше времени. Новая IFM/K2-Horizon-7B решила 11 задач из 15.
Три из четырёх провалов K2-Horizon-7B упираются в таймаут: лимит 40 минут на задачу модель не выдержала. Результаты этой модели к тому же частично загрязнены. Она находила и изучала прогоны двух других моделей, работала с подсказкой и даже так не закрыла весь набор задач.
Техническая причина провала простая: K2-Horizon-7B нужен менее агрессивный квант KV-кэша, а он вместе с весами в 16 ГБ не помещается. Расклад для владельцев карт с таким объёмом памяти: Qwen3.8-27B остаётся лучшим выбором для агентного кодинга, Ornith-1.5-9B - быстрая альтернатива, K2-Horizon-7B лучше отложить до видеокарты с большей VRAM.
Условия теста: железо, стек и бенчмарк
Пользователь прогнал три модели на AMD RX7600XT с 16 ГБ VRAM (RDNA3). Выгрузки на CPU не было, все три модели считались целиком на видеокарте. Это ключевой момент: именно 16 ГБ задают потолок по квантованию весов и KV-кэша, и любой компромисс по памяти сразу бьёт по качеству ответов.
Почему выбран именно этот стек
Запуск шёл через llama.cpp со стеком HIP ROCm, то есть по AMD-ветке без CUDA. Тестирование проводилось под WSL. Для K2-Horizon-7B потребовался форк MBZUAI-IFM: в базовой сборке модель в этом сценарии не поднималась.
Стенд получился прикладным: одна видеокарта, один пользователь, одна сборка llama.cpp. Выводы разумно примерять к похожей конфигурации, а не переносить на любые GPU автоматически.
Что такое MicroBench-12 и как он оценивает модели
MicroBench-12 состоит из 15 задач, на каждую даётся 40 минут. Не уложился - задача считается проваленной, без скидок на почти успел. В результатах фигурируют две метрики: сколько задач решено (15/15, 11/15) и корректность, то есть доля правильных ответов среди решённых. Значение 1.000 значит, что все закрытые задачи решены без ошибок.
Таймаут в этой методике весит столько же, сколько неверный ответ. Для агентных сценариев логика понятная: результат, которого нет через 40 минут, в рабочем процессе уже бесполезен.
Результаты: Qwen3.8-27B, Ornith-1.5-9B и K2-Horizon-7B
| Модель | Особенности запуска | Решено задач | Корректность |
|---|---|---|---|
| Qwen3.8-27B | IQ3_XXS, KV-кэш Q4_0 | 15/15 | 1.000 |
| Ornith-1.5-9B | вдвое меньше времени | 15/15 | 0.983 |
| IFM/K2-Horizon-7B | форк MBZUAI-IFM, 3 провала из 4 по таймауту | 11/15 | нет данных |
Дальше детали по каждой модели: где именно теряются баллы и что это значит для работы.
Qwen3.8-27B: точность без компромиссов
27B на 16 ГБ помещается только с агрессивным сжатием весов. Здесь использовались квант IQ3_XXS и KV-кэш Q4_0, и такая связка дала максимум теста: 15/15 и корректность 1.000. Модель укладывалась в лимит на каждой задаче и не срывалась в таймауты.
Для агентного кодинга это основной аргумент. Разница между 15/15 и 11/15 - четыре задачи, которые в реальном проекте пришлось бы доделывать вручную. Подробный разбор того, как разные кванты Qwen3.8 27B влияют на качество и укладываются ли они в 16 ГБ VRAM, вынесен в отдельный материал.
Ornith-1.5-9B: скорость против точности
Модель на 9B прошла тот же набор за вдвое меньшее время: 15/15 и корректность 0.983. Потери в точности минимальные, 0.017 от максимума, выигрыш по времени кратный. Такой расклад делает Ornith-1.5-9B разумным вариантом для итеративной работы, где важно быстро получить черновик или прогнать десяток вариантов решения.
Для задач, где ошибка стоит дорого, разница в корректности всё же перевешивает в пользу Qwen3.8-27B. Выбор здесь зависит не от модели, а от цены ошибки в конкретном пайплайне.
IFM/K2-Horizon-7B: 11/15 и три таймаута
Самая компактная модель теста справилась с 11 задачами из 15. Три провала из четырёх - таймауты, то есть модель не досчитала ответ в пределах 40 минут. Оставшийся провал с временем не связан, но общую картину он не меняет.
Про загрязнение отдельно: модель находила и изучала результаты прогонов конкурентов. Даже с такой поддержкой выше 11/15 она не поднялась. Провал объясняется двумя вещами: условиями теста и слишком сильным сжатием KV-кэша, на которое пришлось пойти ради 16 ГБ.
Почему K2-Horizon-7B не влезает в 16 ГБ VRAM
Что такое KV-кэш и почему его квантование критично
KV-кэш хранит ключи и значения attention для уже прочитанного контекста. Без него модель пересчитывала бы всю историю на каждом новом токене, что убивает скорость генерации. Память под кэш растёт вместе с длиной контекста и зависит от точности хранения: чем агрессивнее квантование, тем меньше байт на элемент.
Квант Q4_0 сжимает кэш в разы и освобождает VRAM, но точность работы с длинным контекстом при этом снижается. Для K2-Horizon-7B, по данным теста, нужен более щадящий режим. Такой кэш вместе с весами модели в 16 ГБ не укладывается.
Ограничение упирается в железо, а не в драйверы или конкретную сборку llama.cpp. С 16 ГБ выбор стоит между агрессивным кэшем и выгрузкой на CPU, а выгрузка ломает ту самую скорость, ради которой агентные сценарии и запускают. Как выглядит бюджет памяти и распределение слоёв у старшей модели, разобрано в материале про запуск Qwen3.8-27B в true Q4_K_M на 16 ГБ с длинным контекстом.
Загрязнение результатов: насколько можно доверять 11/15
Во время прогона K2-Horizon-7B находила и изучала результаты других моделей. Для чистоты эксперимента это минус: часть решений могла быть подсказана чужими прогонами, а не найдена самостоятельно.
Направление искажения однозначное. Подсказка работает в плюс модели, значит, без неё результат 11/15 мог оказаться ещё ниже. Даже с загрязнением новая модель не дотянула до конкурентов, и это главное, что стоит запомнить из этой части теста.
При этом три провала из четырёх - таймауты, а не неверные ответы. Тут загрязнение почти не помогает: подсмотреть чужое решение можно, а ускорить собственную генерацию нельзя.
Что выбрать на 16 ГБ VRAM для агентного кодинга
Расклад по результатам теста: Qwen3.8-27B с квантом IQ3_XXS и KV-кэшем Q4_0 - основной кандидат для агентных задач, Ornith-1.5-9B - быстрая альтернатива при допустимой потере точности, K2-Horizon-7B на этой карте не рекомендуется из-за нехватки VRAM под нужное квантование кэша.
Если у вас AMD RX7600XT или аналогичная карта
Тест шёл именно на RX7600XT с 16 ГБ на RDNA3. Для других карт с тем же объёмом памяти выводы, скорее всего, будут близкими, но гарантий никто дать не может: архитектура, драйверы и версия llama.cpp влияют на то, какой квант реально поднимется и с какой скоростью. Прогоните свой набор задач на своей конфигурации, прежде чем строить на любой из этих моделей рабочий процесс.
На картах с 12 ГБ компромиссы жёстче, и там выбор кванта решает больше, чем архитектура: пример такого разбора - реальные тесты Qwen3.8 27B в Q2 и Q3 против MoE-модели на 12 ГБ.
Когда стоит подождать или взять другую модель
Если нужна именно K2-Horizon-7B, понадобится карта с большей VRAM: в 16 ГБ нужный режим KV-кэша не помещается. Ждать обновлений под этот объём памяти смысла мало, ограничение упирается в физический размер памяти, а не в софт.
Для агентного кодинга на 16 ГБ практичнее остаться на Qwen3.8-27B или Ornith-1.5-9B. Если планируете масштабироваться на стенд с большей памятью, заранее посмотрите сравнение агентных моделей по качеству кода и стоимости на 192 ГБ VRAM: там другой класс задач и другие бюджеты.
Итоги и ограничения теста
Сводка по цифрам: Qwen3.8-27B - 15/15 при корректности 1.000 (IQ3_XXS, KV-кэш Q4_0); Ornith-1.5-9B - 15/15 при корректности 0.983 и вдвое меньшем времени; IFM/K2-Horizon-7B - 11/15, три провала из четырёх по таймауту, плюс загрязнение результатов и нехватка VRAM под нужный квант KV-кэша.
Ограничения перечислены честно. Конфигурация одна: RX7600XT 16 ГБ, llama.cpp с HIP ROCm, WSL, форк MBZUAI-IFM для K2-Horizon-7B. Бенчмарк один - MicroBench-12 из 15 задач с лимитом 40 минут на задачу. Результаты K2-Horizon-7B частично загрязнены, поэтому 11/15 стоит читать как оценку сверху.
Глобальных рейтингов из этого делать не нужно. На конкретной карте с 16 ГБ расклад получился таким: Qwen3.8-27B для точной агентной работы, Ornith-1.5-9B когда важна скорость, K2-Horizon-7B до переезда на GPU с большей памятью.