Перейти к содержанию
Публикация AiManual

Gem16: кастомный движок для Gemma4 12B и 26B на 16 ГБ VRAM - разбор проекта

Энтузиаст собрал Gem16 - движок, который умещает Gemma4 26B с контекстом до 220k токенов в 16 ГБ VRAM. Разбираем квантизацию в стиле EXL3, заявленные prefill и

Коротко

Что будет в материале

  1. 01

    Что такое Gem16 и для кого он сделан

  2. 02

    Как 26B-модель помещается в 16 ГБ VRAM

  3. 03

    Скорость: заявленные цифры и сравнение с vLLM

  4. 04

    Ограничения и подводные камни

Что такое Gem16 и для кого он сделан

Gem16 - кастомный инференс-движок для Gemma4 12B и Gemma4 26B, который умещает обе модели в 16 ГБ VRAM. Собрал его разработчик-энтузиаст под собственную мобильную RTX 5080 Laptop GPU. Изначально он рассчитывал, что в память влезет только 12B с приемлемым контекстом, но квантизация в стиле EXL3 изменила расклад: 26B-модель тоже поместилась, причём с контекстом до 220k токенов.

Описание проекта автор выложил на r/LocalLLaMA. Все цифры ниже - его собственные заявления, независимых замеров в открытых источниках нет.

Кто автор и как появился проект

Это личный проект, а не продукт компании или исследовательской лаборатории. Отправной точкой стал Ninfer: о нём автор прочитал за несколько месяцев до старта работ и решил сделать собственный движок под свою видеокарту.

Код полностью написан с помощью Codex. Автор оговаривает, что генерация кода не отменила ручной работы: доводка заняла много выходных. На выходе получился рабочий движок с нативным GUI, а не прототип на один вечер.

Для какого железа и сценария

Целевое железо - GPU с 16 ГБ VRAM, в первую очередь мобильная RTX 5080. Движок рассчитан на одного пользователя: две сессии поддерживает только 12B-модель. Для 26B такого запаса не заявлено. Это однопользовательский инструмент, а не серверная замена vLLM для команд и публичных API.

Как 26B-модель помещается в 16 ГБ VRAM

Ключ к размещению 26B - кастомная квантизация, которую автор описывает как похожую на EXL3. Именно она позволила уложить в 16 ГБ модель, для которой такой бюджет памяти обычно мал.

Что даёт квантизация в стиле EXL3

Формулировка автора: квантизация «EXL3 like», то есть похожая на EXL3, но не идентичная. Битность, коэффициент сжатия и потери качества в описании не раскрыты, поэтому судить о деградации точности по опубликованным данным нельзя. Значение имеет результат: 26B и 12B живут в одном и том же бюджете памяти.

Стандартные локальные форматы квантизации тоже сжимают веса, но на 16 ГБ не дают такой плотности упаковки. Как Gemma 4 26B ведёт себя в обычных сборках на llama.cpp и похожих движках, AI-Manual разбирал отдельно: обзор Gemma 4 26B A4b со скоростью prefill и генерации.

Контекст 220k токенов для 26B

Заявленный контекст для 26B - до 220k токенов. На практике это объём текста, который влезает в один промпт без нарезки на куски: длинная документация, крупный файл кода, расшифровка многочасовой встречи. Цифра идёт со слов автора; как именно она проверялась и на каких данных, не указано.

Скорость: заявленные цифры и сравнение с vLLM

МодельМодальностиprefilldecodeКонтекст
Gemma4 12Bаудио и зрениеоколо 5800 t/sоколо 87 t/sне указан
Gemma4 26Bзрениеоколо 5660 t/sоколо 182 t/sдо 220k токенов

Что означают prefill и decode в этих цифрах

prefill - скорость обработки входного промпта, decode - скорость генерации ответа. Высокий prefill определяет, как быстро модель «прочитает» длинный контекст: чем больше токенов на входе, тем заметнее разница. decode отвечает за отзывчивость: сколько токенов в секунду модель выдаёт после начала ответа.

Соотношение выглядит необычно: у 26B decode выше, чем у 12B, 182 против 87 t/s. Методология замеров не раскрыта, поэтому сравнивать модели между собой по этим числам рискованно. Внутри одной модели они полезны как ориентир, между моделями - нет.

Почему сравнение с vLLM корректно именно на 16 ГБ

Автор утверждает, что движок работает на уровне vLLM или быстрее. Причина в конкретном ограничении: vLLM не работал с MTP (multi-token prediction) на 16 ГБ VRAM. Речь о нише, где стандартный серверный движок не давал результата, а Gem16 его дал. Утверждать, что Gem16 быстрее vLLM в общем случае, эти данные не позволяют: на картах с большим объёмом памяти и в многопользовательских сценариях расклад будет другим. Заявления автора собраны в его публикации на Reddit.

Ограничения и подводные камни

Проблема с аудиотокенами после 8k контекста

Примерно после 8k контекста 12B-модель перестаёт распознавать аудиотокены. Это не редкий краевой случай, а прямое ограничение для голосовых сценариев: как только разговор перерастает несколько тысяч токенов истории, аудио часть ломается. Автор ссылается на обсуждение страницы модели на Hugging Face, где о том же сообщали другие пользователи, и делает вывод, что причина в самой модели, а не в движке. Окончательно это не доказано, исправления нет.

Если вы собираете голосовой ассистент на Gemma 4 12B, заранее прикиньте, укладывается ли ваш диалог в этот лимит. Пример работающей голосовой сборки на Gemma 4 12B и Jetson Orin разобран в отдельном материале: запуск Gemma 4 12B и E2B с лип-синком и открытым кодом.

Однопользовательский режим и 2 сессии

Движок спроектирован под одного человека. Две сессии - предел, и только для 12B. Очередей, изоляции запросов и гарантий под параллельной нагрузкой в описании нет. Для небольшой команды, внутреннего сервиса или публичного API такой вариант не подходит.

Что осталось за рамками описания

Открытых сведений о лицензии, процессе сборки и поддерживаемых версиях драйверов в источнике нет. Сам автор называет проект нишевым, а модели - немного устаревшими на текущий момент. Независимых тестов производительности тоже нет: все цифры идут от одного человека.

Как запустить: Linux, Windows и открытый код

Что понадобится для запуска

Из подтверждённого: GPU с 16 ГБ VRAM и операционная система Linux или Windows. По словам автора, движок одинаково хорошо работает на обеих. Требования к процессору, объёму RAM, версии драйверов и Python-окружению не раскрыты. Точные шаги установки нужно смотреть в репозитории проекта, который автор указал в своей публикации на Reddit.

GUI и фокус на движке

В комплекте идёт нативный GUI. Автор подчёркивает, что главное - движок, а интерфейс поставляется приложением к нему. Функции интерфейса, темы и расширения в описании не раскрыты, поэтому рассчитывать на что-то конкретное заранее не стоит.

Кому подходит Gem16, а кому - нет

Gem16 стоит попробовать, если у вас GPU с 16 ГБ VRAM, в первую очередь мобильная RTX 5080, и вы хотите локально запустить Gemma4 12B или 26B с длинным контекстом. Проект подойдёт и тем, кто готов работать в однопользовательском режиме, и тем, кому интересно посмотреть, как кастомная квантизация решает задачу, с которой не справились стандартные инструменты.

Проходить мимо стоит, если нужен многопользовательский сервер, стабильный аудиоканал на длинном контексте или проверенный индустриальный движок с документацией и поддержкой. Для командной работы и публичных API смотрите в сторону серверных решений. Если же вы выбираете модель под локальный запуск, полезно сравнить Gemma 4 26B-A4B с Qwen3.6-MoE: детальный разбор с цифрами и таблицами.

Проект нишевый, и ценность его скорее в демонстрации: один человек с Codex и кастомной квантизацией закрыл сценарий, который не закрывали стандартные инструменты на 16 ГБ VRAM. Проверять это стоит на своей задаче, помня, что все цифры пока идут только от автора.

Подписаться на канал