На связке 8 ГБ VRAM и 16 ГБ RAM предсказуемо работают плотные модели 7-8B в 4-битном квантовании и MoE-модели с малым числом активных параметров. Gemma 26B QAT помещается в такой бюджет только с частичной выгрузкой слоёв в оперативную память. Автор поста в сообществе r/LocalLLaMA сообщает о стабильных 26 токенах в секунду и ждёт выхода Qwen4 35B A3B или похожей модели.
Ориентир простой: 8 ГБ VRAM закрывают 7-8B в Q4 с контекстом 4-8K, всё крупнее упирается в 16 ГБ RAM и в пропускную способность памяти. Отдельно стоит держать в голове, что 26 токенов в секунду - результат конкретной сборки, а не гарантия для любого компьютера с теми же двумя цифрами в спецификации.
Что реально работает на 8 ГБ VRAM и 16 ГБ RAM
Бюджет памяти делится на две части: видеопамять под веса и KV-кэш, оперативная память под всё, что не влезло. Практический максимум для 8 ГБ VRAM - плотные модели 7-8B в 4-битном формате с контекстом 4-8K. Всё крупнее требует выгрузки слоёв в RAM, и скорость падает примерно пропорционально тому, какая доля вычислений уходит на CPU.
Какие классы моделей влезают в 8 ГБ VRAM
Объём весов считается из двух чисел: количество параметров и битность квантования. Формула простая: параметры умножить на байты на параметр. У 4-битных форматов с учётом служебных данных выходит около 0.55-0.6 байта на параметр. Ниже ориентир по объёму весов, без KV-кэша и буферов.
| Класс модели | Веса в Q4, ориентир | Помещается в 8 ГБ VRAM | Что уходит в RAM |
|---|---|---|---|
| 3B | около 1,7-2 ГБ | да, с большим запасом | ничего, контекст можно держать длинным |
| 7-8B | около 4-5 ГБ | да | KV-кэш при контексте от 8K |
| 13B | около 7-8 ГБ | впритык | часть слоёв и KV-кэш |
| 26B (Gemma QAT) | около 14 ГБ | нет | большая часть слоёв |
| 35B MoE A3B | около 20 ГБ | нет | основной объём экспертов |
Таблица показывает, где проходит граница. 7-8B в Q4 ещё оставляет место под KV-кэш и рабочие буферы, 13B уже требует осторожности с длиной контекста, а 26B и 35B в 8 ГБ VRAM не помещаются в принципе: их приходится раскладывать между GPU и RAM.
KV-кэш растёт линейно с длиной контекста, поэтому модель, которая спокойно стартовала на 8K, может упасть с ошибкой нехватки памяти на 32K при том же размере весов. Для MoE-моделей картина другая: общий объём параметров большой, но на каждый токен активируется лишь часть экспертов, и именно это делает архитектуру интересной для слабого железа.
Форматы квантования: что выбрать для 8 ГБ VRAM
GGUF, GPTQ и AWQ решают разные задачи. GGUF - формат llama.cpp и Ollama, он позволяет разложить слои между GPU и CPU через параметр -ngl, что критично при 8 ГБ VRAM. GPTQ и AWQ рассчитаны на загрузку целиком в видеопамять: при достатке VRAM они быстрее, но при нехватке памяти работать с ними неудобно.
Для пары 8 ГБ VRAM плюс 16 ГБ RAM практичнее GGUF с Q4_K_M или Q4_0. Q4_K_M даёт чуть лучшее качество при небольшом росте размера файла, Q4_0 быстрее и меньше. Как битность влияет на баланс скорости и качества, подробно разбирали в материале про Qwen 3.8 Flash Next на 6 ГБ VRAM: логика выбора там та же, меняются только абсолютные цифры.
Gemma 26B QAT: что это даёт и почему 26 токенов в секунду - реалистично
Автор поста держит 8 ГБ VRAM и 16 ГБ RAM, запускает Gemma 26B QAT и получает около 26 токенов в секунду. Цифра зависит от CPU, объёма и частоты RAM, версии движка и длины контекста, поэтому это единичный результат конкретной конфигурации, а не средний показатель модели.
QAT vs обычное квантование: в чём разница на практике
Квантование после обучения (PTQ) сжимает уже готовую модель: веса округляются до 4 бит, и на агрессивных режимах качество проседает заметнее. QAT (Quantization-Aware Training) учит модель с имитацией квантования, поэтому веса подстраиваются под низкую точность ещё в процессе обучения. На выходе 4-битная версия ближе к полной, чем та же модель после обычного сжатия.
Практический смысл для слабого железа в том, что QAT позволяет взять модель крупнее и остаться в приемлемом качестве. Пользователь с 8 ГБ VRAM скорее получит внятные ответы от 26B в Q4, чем от 7B в Q4, но заплатит за это выгрузкой слоёв в RAM и падением скорости. Конкретные проценты деградации качества по битностям требуют отдельных замеров, которых в исходных материалах нет.
Как получить похожую скорость на своём железе
Универсального рецепта нет, но есть рабочие ориентиры.
- Берите llama.cpp или Ollama с поддержкой QAT-сборок в GGUF: у них предсказуемое поведение при раскладке слоёв между GPU и CPU.
- Поднимайте
-nglдо максимума, при котором сервер ещё стартует, и останавливайтесь на шаг раньше: запас в 200-300 МБ спасает от падений при длинном ответе. - Начинайте с короткого контекста 2-4K и увеличивайте его, пока не упрётесь в лимит памяти.
- Следите за числом ядер CPU и каналами RAM: на 16 ГБ одноканальная память заметно тормозит генерацию.
26 токенов в секунду на Gemma 26B QAT - верхняя граница ожиданий для такой связки, и то при удачном сочетании процессора и памяти. На другом железе получится меньше, иногда в разы.
MoE-архитектуры вроде A3B: почему они интересны для слабых конфигураций
MoE (Mixture of Experts) делит слои модели на множество экспертов, и на каждый токен активируется лишь несколько из них. Это позволяет держать большой общий объём знаний при умеренных вычислениях на каждый шаг генерации.
Что означает A3B и как читать маркировку MoE-моделей
Суффикс A3B означает примерно 3 миллиарда активных параметров. Общий размер модели при этом может быть 35B. Для инференса важнее именно активные параметры: они определяют вычислительную нагрузку на токен и то, сколько данных реально проходит через GPU на каждом шаге. Модель с 35B общих и 3B активных по скорости генерации ближе к плотной 3B, но по объёму знаний может быть заметно сильнее.
Читать маркировку стоит слева направо: сначала общий размер, потом активные параметры. Как это выглядит на практике при выборе между MoE и плотной моделью под задачу, разбирали в сравнении Qwen3.8-27B IQ3_XXS и Qwen3.6-35B-A3B Q4_K_M.
Почему MoE может помочь на 8 ГБ VRAM
Разница между общим и активным объёмом здесь и работает. Модель с 35B параметров в Q4 весит около 20 ГБ, и в 8 ГБ VRAM она не поместится. Если часть экспертов остаётся в RAM, а в видеопамять попадают только те, что нужны чаще, запуск становится возможным, но загрузка экспертов по требованию замедляет генерацию.
Отсюда практический вывод: MoE на слабой связке имеет смысл только при достаточном объёме RAM и терпимости к низкой скорости. 16 ГБ здесь на грани, и рассчитывать на комфортную работу с 35B MoE-моделью не стоит.
Qwen4 35B A3B: что известно и чего ждать
Qwen4 35B A3B на момент публикации не выпущена. Это ожидаемая модель, которую обсуждают в сообществе локального запуска, и автор поста надеется на её появление или на аналогичное решение. Подтверждённой спецификации, даты релиза и замеров производительности нет, поэтому планировать под неё рабочие процессы пока нечем. Стоит отделять уже вышедшие модели Qwen от анонсов и ожиданий: что реально подтверждено, а что приписывают линейке, разбирали в статье про Qwen3.8-Flash-Next и её связь с Qwen4.
Идея n-грамм для расширения модели: что это значит
n-граммы - это последовательности из n токенов. В классических языковых моделях на них строили предсказание следующего слова, в статистическом переводе и поиске они используются до сих пор. Автор поста предполагает, что дополнительные n-граммы могли бы расширить модель с 35B до 70B+.
В исходных материалах это только предположение, а не подтверждённая техника. Механика, при которой n-граммы наращивают число параметров модели, не описана ни в одном из доступных источников, поэтому относиться к идее стоит как к гипотезе. Более проверенные пути повышения эффективности на слабом железе - QAT и MoE-архитектуры. Похожая логика вокруг гипотетических трюков с памятью разобрана в материале про KV-кэш и Engram, где отдельно отмечено, какие цифры остаются предположениями.
Практические ограничения 8 ГБ VRAM: что важно учитывать
Главный ограничитель - не размер файла модели, а сумма весов, KV-кэша и рабочих буферов. Ошибка нехватки памяти при загрузке обычно означает, что веса влезли, а контекст нет.
Как контекстное окно влияет на потребление VRAM
KV-кэш хранит ключи и значения для каждого токена контекста. Его размер растёт линейно с длиной окна и зависит от числа слоёв, числа KV-голов и размерности головы. Для 8 ГБ VRAM контекст 8K может быть предельным для 7B Q4, а для 26B QAT придётся ограничиться 2-4K. В llama.cpp помогает квантование самого кэша: ключи --cache-type-k q8_0 и значения --cache-type-v q8_0 экономят память, но добавляют небольшие накладные расходы.
Остальные ограничения выглядят так:
- Вес модели против контекста: чем больше параметров, тем короче окно при том же объёме VRAM.
- Offload в RAM роняет скорость, потому что вычисления уходят на CPU.
- Пропускная способность RAM (DDR4 против DDR5) прямо влияет на токены в секунду.
- Batch size больше единицы требует дополнительной памяти под параллельные запросы.
- Длинный ответ увеличивает кэш по ходу генерации, и стартовая конфигурация может не выдержать весь диалог.
Разумная последовательность действий: сначала 7B в Q4 и выяснить, хватает ли качества, потом 13B в Q4, и только затем пробовать 26B QAT с выгрузкой слоёв.
Стоит ли ждать Qwen4 35B A3B или использовать то, что есть
Если у вас 8 ГБ VRAM и 16 ГБ RAM, рабочее решение есть уже сейчас. Gemma 26B QAT запускается с выгрузкой части слоёв и даёт около 26 токенов в секунду в лучшем случае, но качество ответов выше, чем у 7B в Q4. Модели 7-8B в Q4 остаются вариантом для тех, кому важнее скорость и предсказуемость, а не объём знаний.
Ждать Qwen4 35B A3B имеет смысл в одной ситуации: вам нужна большая ёмкость модели и вы готовы мириться с медленной генерацией из-за обмена данными между RAM и GPU. Гарантий, что 35B MoE-модель уверенно пойдёт на 8 ГБ VRAM, нет, а при 16 ГБ системной памяти часть экспертов будет подгружаться постоянно.
Практичный план без ставки на слухи: настроить Gemma 26B QAT под свой процессор и память, замерить реальную скорость на своих промптах, а релиз Qwen4 встретить уже с готовым рабочим сетапом. Следить за новостями сообщества полезно, строить на ожиданиях рабочий процесс - нет.