Что такое Gem16 и для кого он сделан
Gem16 - кастомный инференс-движок для Gemma4 12B и Gemma4 26B, который умещает обе модели в 16 ГБ VRAM. Собрал его разработчик-энтузиаст под собственную мобильную RTX 5080 Laptop GPU. Изначально он рассчитывал, что в память влезет только 12B с приемлемым контекстом, но квантизация в стиле EXL3 изменила расклад: 26B-модель тоже поместилась, причём с контекстом до 220k токенов.
Описание проекта автор выложил на r/LocalLLaMA. Все цифры ниже - его собственные заявления, независимых замеров в открытых источниках нет.
Кто автор и как появился проект
Это личный проект, а не продукт компании или исследовательской лаборатории. Отправной точкой стал Ninfer: о нём автор прочитал за несколько месяцев до старта работ и решил сделать собственный движок под свою видеокарту.
Код полностью написан с помощью Codex. Автор оговаривает, что генерация кода не отменила ручной работы: доводка заняла много выходных. На выходе получился рабочий движок с нативным GUI, а не прототип на один вечер.
Для какого железа и сценария
Целевое железо - GPU с 16 ГБ VRAM, в первую очередь мобильная RTX 5080. Движок рассчитан на одного пользователя: две сессии поддерживает только 12B-модель. Для 26B такого запаса не заявлено. Это однопользовательский инструмент, а не серверная замена vLLM для команд и публичных API.
Как 26B-модель помещается в 16 ГБ VRAM
Ключ к размещению 26B - кастомная квантизация, которую автор описывает как похожую на EXL3. Именно она позволила уложить в 16 ГБ модель, для которой такой бюджет памяти обычно мал.
Что даёт квантизация в стиле EXL3
Формулировка автора: квантизация «EXL3 like», то есть похожая на EXL3, но не идентичная. Битность, коэффициент сжатия и потери качества в описании не раскрыты, поэтому судить о деградации точности по опубликованным данным нельзя. Значение имеет результат: 26B и 12B живут в одном и том же бюджете памяти.
Стандартные локальные форматы квантизации тоже сжимают веса, но на 16 ГБ не дают такой плотности упаковки. Как Gemma 4 26B ведёт себя в обычных сборках на llama.cpp и похожих движках, AI-Manual разбирал отдельно: обзор Gemma 4 26B A4b со скоростью prefill и генерации.
Контекст 220k токенов для 26B
Заявленный контекст для 26B - до 220k токенов. На практике это объём текста, который влезает в один промпт без нарезки на куски: длинная документация, крупный файл кода, расшифровка многочасовой встречи. Цифра идёт со слов автора; как именно она проверялась и на каких данных, не указано.
Скорость: заявленные цифры и сравнение с vLLM
| Модель | Модальности | prefill | decode | Контекст |
|---|---|---|---|---|
| Gemma4 12B | аудио и зрение | около 5800 t/s | около 87 t/s | не указан |
| Gemma4 26B | зрение | около 5660 t/s | около 182 t/s | до 220k токенов |
Что означают prefill и decode в этих цифрах
prefill - скорость обработки входного промпта, decode - скорость генерации ответа. Высокий prefill определяет, как быстро модель «прочитает» длинный контекст: чем больше токенов на входе, тем заметнее разница. decode отвечает за отзывчивость: сколько токенов в секунду модель выдаёт после начала ответа.
Соотношение выглядит необычно: у 26B decode выше, чем у 12B, 182 против 87 t/s. Методология замеров не раскрыта, поэтому сравнивать модели между собой по этим числам рискованно. Внутри одной модели они полезны как ориентир, между моделями - нет.
Почему сравнение с vLLM корректно именно на 16 ГБ
Автор утверждает, что движок работает на уровне vLLM или быстрее. Причина в конкретном ограничении: vLLM не работал с MTP (multi-token prediction) на 16 ГБ VRAM. Речь о нише, где стандартный серверный движок не давал результата, а Gem16 его дал. Утверждать, что Gem16 быстрее vLLM в общем случае, эти данные не позволяют: на картах с большим объёмом памяти и в многопользовательских сценариях расклад будет другим. Заявления автора собраны в его публикации на Reddit.
Ограничения и подводные камни
Проблема с аудиотокенами после 8k контекста
Примерно после 8k контекста 12B-модель перестаёт распознавать аудиотокены. Это не редкий краевой случай, а прямое ограничение для голосовых сценариев: как только разговор перерастает несколько тысяч токенов истории, аудио часть ломается. Автор ссылается на обсуждение страницы модели на Hugging Face, где о том же сообщали другие пользователи, и делает вывод, что причина в самой модели, а не в движке. Окончательно это не доказано, исправления нет.
Если вы собираете голосовой ассистент на Gemma 4 12B, заранее прикиньте, укладывается ли ваш диалог в этот лимит. Пример работающей голосовой сборки на Gemma 4 12B и Jetson Orin разобран в отдельном материале: запуск Gemma 4 12B и E2B с лип-синком и открытым кодом.
Однопользовательский режим и 2 сессии
Движок спроектирован под одного человека. Две сессии - предел, и только для 12B. Очередей, изоляции запросов и гарантий под параллельной нагрузкой в описании нет. Для небольшой команды, внутреннего сервиса или публичного API такой вариант не подходит.
Что осталось за рамками описания
Открытых сведений о лицензии, процессе сборки и поддерживаемых версиях драйверов в источнике нет. Сам автор называет проект нишевым, а модели - немного устаревшими на текущий момент. Независимых тестов производительности тоже нет: все цифры идут от одного человека.
Как запустить: Linux, Windows и открытый код
Что понадобится для запуска
Из подтверждённого: GPU с 16 ГБ VRAM и операционная система Linux или Windows. По словам автора, движок одинаково хорошо работает на обеих. Требования к процессору, объёму RAM, версии драйверов и Python-окружению не раскрыты. Точные шаги установки нужно смотреть в репозитории проекта, который автор указал в своей публикации на Reddit.
GUI и фокус на движке
В комплекте идёт нативный GUI. Автор подчёркивает, что главное - движок, а интерфейс поставляется приложением к нему. Функции интерфейса, темы и расширения в описании не раскрыты, поэтому рассчитывать на что-то конкретное заранее не стоит.
Кому подходит Gem16, а кому - нет
Gem16 стоит попробовать, если у вас GPU с 16 ГБ VRAM, в первую очередь мобильная RTX 5080, и вы хотите локально запустить Gemma4 12B или 26B с длинным контекстом. Проект подойдёт и тем, кто готов работать в однопользовательском режиме, и тем, кому интересно посмотреть, как кастомная квантизация решает задачу, с которой не справились стандартные инструменты.
Проходить мимо стоит, если нужен многопользовательский сервер, стабильный аудиоканал на длинном контексте или проверенный индустриальный движок с документацией и поддержкой. Для командной работы и публичных API смотрите в сторону серверных решений. Если же вы выбираете модель под локальный запуск, полезно сравнить Gemma 4 26B-A4B с Qwen3.6-MoE: детальный разбор с цифрами и таблицами.
Проект нишевый, и ценность его скорее в демонстрации: один человек с Codex и кастомной квантизацией закрыл сценарий, который не закрывали стандартные инструменты на 16 ГБ VRAM. Проверять это стоит на своей задаче, помня, что все цифры пока идут только от автора.