Перейти к содержанию
Публикация AiManual

Что запускать на 8 ГБ VRAM и 16 ГБ RAM: опыт с Gemma 26B QAT и ожидания от Qwen4 35B A3B

На 8 ГБ VRAM и 16 ГБ RAM стабильно идут модели 7-8B в Q4, а Gemma 26B QAT тянет только с выгрузкой слоёв в RAM: автор поста в r/LocalLLaMA получает около 26 ток

Коротко

Что будет в материале

  1. 01

    Что реально работает на 8 ГБ VRAM и 16 ГБ RAM

  2. 02

    Gemma 26B QAT: что это даёт и почему 26 токенов в секунду - реалистично

  3. 03

    MoE-архитектуры вроде A3B: почему они интересны для слабых конфигураций

  4. 04

    Qwen4 35B A3B: что известно и чего ждать

На связке 8 ГБ VRAM и 16 ГБ RAM предсказуемо работают плотные модели 7-8B в 4-битном квантовании и MoE-модели с малым числом активных параметров. Gemma 26B QAT помещается в такой бюджет только с частичной выгрузкой слоёв в оперативную память. Автор поста в сообществе r/LocalLLaMA сообщает о стабильных 26 токенах в секунду и ждёт выхода Qwen4 35B A3B или похожей модели.

Ориентир простой: 8 ГБ VRAM закрывают 7-8B в Q4 с контекстом 4-8K, всё крупнее упирается в 16 ГБ RAM и в пропускную способность памяти. Отдельно стоит держать в голове, что 26 токенов в секунду - результат конкретной сборки, а не гарантия для любого компьютера с теми же двумя цифрами в спецификации.

Что реально работает на 8 ГБ VRAM и 16 ГБ RAM

Бюджет памяти делится на две части: видеопамять под веса и KV-кэш, оперативная память под всё, что не влезло. Практический максимум для 8 ГБ VRAM - плотные модели 7-8B в 4-битном формате с контекстом 4-8K. Всё крупнее требует выгрузки слоёв в RAM, и скорость падает примерно пропорционально тому, какая доля вычислений уходит на CPU.

Какие классы моделей влезают в 8 ГБ VRAM

Объём весов считается из двух чисел: количество параметров и битность квантования. Формула простая: параметры умножить на байты на параметр. У 4-битных форматов с учётом служебных данных выходит около 0.55-0.6 байта на параметр. Ниже ориентир по объёму весов, без KV-кэша и буферов.

Класс моделиВеса в Q4, ориентирПомещается в 8 ГБ VRAMЧто уходит в RAM
3Bоколо 1,7-2 ГБда, с большим запасомничего, контекст можно держать длинным
7-8Bоколо 4-5 ГБдаKV-кэш при контексте от 8K
13Bоколо 7-8 ГБвпритыкчасть слоёв и KV-кэш
26B (Gemma QAT)около 14 ГБнетбольшая часть слоёв
35B MoE A3Bоколо 20 ГБнетосновной объём экспертов

Таблица показывает, где проходит граница. 7-8B в Q4 ещё оставляет место под KV-кэш и рабочие буферы, 13B уже требует осторожности с длиной контекста, а 26B и 35B в 8 ГБ VRAM не помещаются в принципе: их приходится раскладывать между GPU и RAM.

KV-кэш растёт линейно с длиной контекста, поэтому модель, которая спокойно стартовала на 8K, может упасть с ошибкой нехватки памяти на 32K при том же размере весов. Для MoE-моделей картина другая: общий объём параметров большой, но на каждый токен активируется лишь часть экспертов, и именно это делает архитектуру интересной для слабого железа.

Форматы квантования: что выбрать для 8 ГБ VRAM

GGUF, GPTQ и AWQ решают разные задачи. GGUF - формат llama.cpp и Ollama, он позволяет разложить слои между GPU и CPU через параметр -ngl, что критично при 8 ГБ VRAM. GPTQ и AWQ рассчитаны на загрузку целиком в видеопамять: при достатке VRAM они быстрее, но при нехватке памяти работать с ними неудобно.

Для пары 8 ГБ VRAM плюс 16 ГБ RAM практичнее GGUF с Q4_K_M или Q4_0. Q4_K_M даёт чуть лучшее качество при небольшом росте размера файла, Q4_0 быстрее и меньше. Как битность влияет на баланс скорости и качества, подробно разбирали в материале про Qwen 3.8 Flash Next на 6 ГБ VRAM: логика выбора там та же, меняются только абсолютные цифры.

Gemma 26B QAT: что это даёт и почему 26 токенов в секунду - реалистично

Автор поста держит 8 ГБ VRAM и 16 ГБ RAM, запускает Gemma 26B QAT и получает около 26 токенов в секунду. Цифра зависит от CPU, объёма и частоты RAM, версии движка и длины контекста, поэтому это единичный результат конкретной конфигурации, а не средний показатель модели.

QAT vs обычное квантование: в чём разница на практике

Квантование после обучения (PTQ) сжимает уже готовую модель: веса округляются до 4 бит, и на агрессивных режимах качество проседает заметнее. QAT (Quantization-Aware Training) учит модель с имитацией квантования, поэтому веса подстраиваются под низкую точность ещё в процессе обучения. На выходе 4-битная версия ближе к полной, чем та же модель после обычного сжатия.

Практический смысл для слабого железа в том, что QAT позволяет взять модель крупнее и остаться в приемлемом качестве. Пользователь с 8 ГБ VRAM скорее получит внятные ответы от 26B в Q4, чем от 7B в Q4, но заплатит за это выгрузкой слоёв в RAM и падением скорости. Конкретные проценты деградации качества по битностям требуют отдельных замеров, которых в исходных материалах нет.

Как получить похожую скорость на своём железе

Универсального рецепта нет, но есть рабочие ориентиры.

  • Берите llama.cpp или Ollama с поддержкой QAT-сборок в GGUF: у них предсказуемое поведение при раскладке слоёв между GPU и CPU.
  • Поднимайте -ngl до максимума, при котором сервер ещё стартует, и останавливайтесь на шаг раньше: запас в 200-300 МБ спасает от падений при длинном ответе.
  • Начинайте с короткого контекста 2-4K и увеличивайте его, пока не упрётесь в лимит памяти.
  • Следите за числом ядер CPU и каналами RAM: на 16 ГБ одноканальная память заметно тормозит генерацию.

26 токенов в секунду на Gemma 26B QAT - верхняя граница ожиданий для такой связки, и то при удачном сочетании процессора и памяти. На другом железе получится меньше, иногда в разы.

MoE-архитектуры вроде A3B: почему они интересны для слабых конфигураций

MoE (Mixture of Experts) делит слои модели на множество экспертов, и на каждый токен активируется лишь несколько из них. Это позволяет держать большой общий объём знаний при умеренных вычислениях на каждый шаг генерации.

Что означает A3B и как читать маркировку MoE-моделей

Суффикс A3B означает примерно 3 миллиарда активных параметров. Общий размер модели при этом может быть 35B. Для инференса важнее именно активные параметры: они определяют вычислительную нагрузку на токен и то, сколько данных реально проходит через GPU на каждом шаге. Модель с 35B общих и 3B активных по скорости генерации ближе к плотной 3B, но по объёму знаний может быть заметно сильнее.

Читать маркировку стоит слева направо: сначала общий размер, потом активные параметры. Как это выглядит на практике при выборе между MoE и плотной моделью под задачу, разбирали в сравнении Qwen3.8-27B IQ3_XXS и Qwen3.6-35B-A3B Q4_K_M.

Почему MoE может помочь на 8 ГБ VRAM

Разница между общим и активным объёмом здесь и работает. Модель с 35B параметров в Q4 весит около 20 ГБ, и в 8 ГБ VRAM она не поместится. Если часть экспертов остаётся в RAM, а в видеопамять попадают только те, что нужны чаще, запуск становится возможным, но загрузка экспертов по требованию замедляет генерацию.

Отсюда практический вывод: MoE на слабой связке имеет смысл только при достаточном объёме RAM и терпимости к низкой скорости. 16 ГБ здесь на грани, и рассчитывать на комфортную работу с 35B MoE-моделью не стоит.

Qwen4 35B A3B: что известно и чего ждать

Qwen4 35B A3B на момент публикации не выпущена. Это ожидаемая модель, которую обсуждают в сообществе локального запуска, и автор поста надеется на её появление или на аналогичное решение. Подтверждённой спецификации, даты релиза и замеров производительности нет, поэтому планировать под неё рабочие процессы пока нечем. Стоит отделять уже вышедшие модели Qwen от анонсов и ожиданий: что реально подтверждено, а что приписывают линейке, разбирали в статье про Qwen3.8-Flash-Next и её связь с Qwen4.

Идея n-грамм для расширения модели: что это значит

n-граммы - это последовательности из n токенов. В классических языковых моделях на них строили предсказание следующего слова, в статистическом переводе и поиске они используются до сих пор. Автор поста предполагает, что дополнительные n-граммы могли бы расширить модель с 35B до 70B+.

В исходных материалах это только предположение, а не подтверждённая техника. Механика, при которой n-граммы наращивают число параметров модели, не описана ни в одном из доступных источников, поэтому относиться к идее стоит как к гипотезе. Более проверенные пути повышения эффективности на слабом железе - QAT и MoE-архитектуры. Похожая логика вокруг гипотетических трюков с памятью разобрана в материале про KV-кэш и Engram, где отдельно отмечено, какие цифры остаются предположениями.

Практические ограничения 8 ГБ VRAM: что важно учитывать

Главный ограничитель - не размер файла модели, а сумма весов, KV-кэша и рабочих буферов. Ошибка нехватки памяти при загрузке обычно означает, что веса влезли, а контекст нет.

Как контекстное окно влияет на потребление VRAM

KV-кэш хранит ключи и значения для каждого токена контекста. Его размер растёт линейно с длиной окна и зависит от числа слоёв, числа KV-голов и размерности головы. Для 8 ГБ VRAM контекст 8K может быть предельным для 7B Q4, а для 26B QAT придётся ограничиться 2-4K. В llama.cpp помогает квантование самого кэша: ключи --cache-type-k q8_0 и значения --cache-type-v q8_0 экономят память, но добавляют небольшие накладные расходы.

Остальные ограничения выглядят так:

  • Вес модели против контекста: чем больше параметров, тем короче окно при том же объёме VRAM.
  • Offload в RAM роняет скорость, потому что вычисления уходят на CPU.
  • Пропускная способность RAM (DDR4 против DDR5) прямо влияет на токены в секунду.
  • Batch size больше единицы требует дополнительной памяти под параллельные запросы.
  • Длинный ответ увеличивает кэш по ходу генерации, и стартовая конфигурация может не выдержать весь диалог.

Разумная последовательность действий: сначала 7B в Q4 и выяснить, хватает ли качества, потом 13B в Q4, и только затем пробовать 26B QAT с выгрузкой слоёв.

Стоит ли ждать Qwen4 35B A3B или использовать то, что есть

Если у вас 8 ГБ VRAM и 16 ГБ RAM, рабочее решение есть уже сейчас. Gemma 26B QAT запускается с выгрузкой части слоёв и даёт около 26 токенов в секунду в лучшем случае, но качество ответов выше, чем у 7B в Q4. Модели 7-8B в Q4 остаются вариантом для тех, кому важнее скорость и предсказуемость, а не объём знаний.

Ждать Qwen4 35B A3B имеет смысл в одной ситуации: вам нужна большая ёмкость модели и вы готовы мириться с медленной генерацией из-за обмена данными между RAM и GPU. Гарантий, что 35B MoE-модель уверенно пойдёт на 8 ГБ VRAM, нет, а при 16 ГБ системной памяти часть экспертов будет подгружаться постоянно.

Практичный план без ставки на слухи: настроить Gemma 26B QAT под свой процессор и память, замерить реальную скорость на своих промптах, а релиз Qwen4 встретить уже с готовым рабочим сетапом. Следить за новостями сообщества полезно, строить на ожиданиях рабочий процесс - нет.

Подписаться на канал