Перейти к содержанию
Публикация AiManual

Strata: как собственный движок инференса разгоняет Qwen3.8-Flash-Next до 65 ток/с на 12 ГБ VRAM

Strata - движок инференса от пользователя KnownAd4832, заточенный под Qwen3.8-Flash-Next: на RTX 5070 с 12 ГБ VRAM тот же IQ3_XXS-квант выдаёт около 65 ток/с вм

Коротко

Что будет в материале

  1. 01

    Что такое Strata и почему это не «ещё один llama.cpp»

  2. 02

    Цифры: 15 ток/с в llama.cpp против 65 ток/с в Strata

  3. 03

    Сколько памяти нужно: требования RAM+VRAM по квантам

  4. 04

    Какой квант выбрать: Q2_0, IQ2_XS или IQ3_XXS

На RTX 5070 с 12 ГБ VRAM модель Qwen3.8-Flash-Next в кванте IQ3_XXS выдаёт около 65 токенов в секунду. Такой результат заявляет пользователь под ником KnownAd4832 для своего движка Strata: тот же квант, который в llama.cpp давал примерно 15 ток/с генерации и 100-120 ток/с обработки промпта, теперь работает вчетверо быстрее. Замеры и таблицы опубликованы в r/LocalLLaMA.

Strata - собственный движок инференса, написанный под одну модель и один класс железа. Установка заявлена как «в один клик», исходники лежат на GitHub, готовые GGUF-кванты модели - на Hugging Face. Собран движок только под CUDA.

Оговорка, без которой эти цифры читать нельзя: замеры сделал автор движка на одной конфигурации, независимо их никто не проверял. Конфигурация такая: RTX 5070 SFF от Gigabyte с 12 ГБ, 64 ГБ DDR5-5600, Ryzen 5 7600, Windows.

Что такое Strata и почему это не «ещё один llama.cpp»

Strata - движок для локального запуска LLM, написанный не командой и не компанией, а одним энтузиастом под одну задачу: быстро гонять Qwen3.8-Flash-Next на недорогой видеокарте. Автор формулирует цель прямо: движок собран под эту конкретную модель и под этот тип ПК.

Кто стоит за проектом и где лежат исходники

Автор публикации - пользователь под ником KnownAd4832, пост вышел 24 сентября 2026 года в r/LocalLLaMA. Это личный проект одного человека: без команды, плана поддержки и SLA. Исходники Strata автор разместил на GitHub, готовые GGUF-кванты Qwen3.8-Flash-Next - на Hugging Face. Независимых тестов на момент публикации нет, все данные о скорости взяты из сообщения автора. Первоисточник с цифрами.

Чем подход «движок под одну модель» отличается от универсальных решений

llama.cpp, Ollama, vLLM и LM Studio поддерживают десятки и сотни архитектур: разные типы внимания, RoPE, MoE и плотные модели, гибридные схемы, множество форматов квантования. Универсальность обходится дорого в буквальном смысле: движок держит обобщённые ядра, диспетчеризацию по бэкендам и ветвления на каждый особый случай. Часть вычислений идёт не оптимальным для конкретной модели путём, потому что движок не знает заранее, с чем имеет дело.

Когда движок пишется под одну модель, эти компромиссы исчезают. Размеры слоёв, число голов, схема attention, размерности KV-кэша известны на этапе сборки, и под них затачиваются ядра. Форматы квантов тоже фиксированы: поддерживать все существующие схемы не нужно, достаточно нескольких. Аналогия из мира железа: универсальная прошивка, которая кое-как заводит любой двигатель, против тюнинга под конкретный мотор.

Похожие попытки в сообществе уже были. Например, кастомный CPU-движок H128/Q4-G32-DOT4 для Qwen3.5 0.8B показал до 2,9x по prefill против llama.cpp на том же процессоре. Логика та же: меньше универсальности, больше скорости. Про саму модель есть отдельный разбор, что такое Qwen3.8-Flash-Next.

Цифры: 15 ток/с в llama.cpp против 65 ток/с в Strata

Сравнение, которое приводит автор, корректно по одной важной причине: это один и тот же квант, IQ3_XXS, на одной и той же машине. Меняется только движок.

Показательllama.cppStrata
Генерация~15 ток/с~65 ток/с
Обработка промпта100-120 ток/с~430 ток/с

По генерации рост примерно четырёхкратный, по обработке промпта - в 3,5-4 раза. Оговорка: замеры в llama.cpp автор делал раньше и в другой публикации, одновременного контролируемого теста не было. Версии драйверов и CUDA, температура GPU, фоновые процессы не указаны ни там, ни здесь. Прошлый отчёт с 15 ток/с на IQ3_XXS и новое сообщение стоит читать как один эксперимент, растянутый во времени: лабораторным сравнением это не назвать.

Замеры на контексте 128K: три кванта в одной таблице

Отдельный набор цифр автор приводит для контекста 128K. Значения - генерация и обработка промпта в токенах в секунду.

КвантГенерация, ток/сОбработка промпта, ток/сМинимум RAM+VRAMЭквивалент по автору
Q2_065,154337,6 ГБunsloth Q3
IQ2_XS52,047239,2 ГБunsloth Q4
IQ3_XXS44,841447 ГБunsloth Q5

Закономерность простая: чем выше битность, тем ниже скорость и тем больше памяти нужно. Одновременно видно, как контекст влияет на декодирование. Заглавные 65 ток/с относятся к IQ3_XXS на коротком контексте, а на 128K тот же квант показывает 44,8 ток/с. Обработка промпта держится в диапазоне 414-543 ток/с. Для сценариев, где основная нагрузка - заливка длинного документа в контекст, это важнее скорости генерации.

Что даёт RCO-GSQ-квантизация

Автор пишет, что 2-битные кванты в Strata работают быстрее благодаря RCO-GSQ-квантизации. Публичных деталей об этом методе в исходном сообщении нет: ни описания алгоритма, ни сравнения с классическими IQ-схемами, ни влияния на точность. Что видно из цифр: самые быстрые и самые лёгкие по памяти варианты - именно 2-битные, Q2_0 (65,1 ток/с, 37,6 ГБ) и IQ2_XS (52,0 ток/с, 39,2 ГБ). Механику лучше не додумывать: это заявленная особенность движка, проверять её придётся самостоятельно.

Сколько памяти нужно: требования RAM+VRAM по квантам

Требования автор приводит суммарно по оперативной и видеопамяти: 37,6 ГБ для Q2_0, 39,2 ГБ для IQ2_XS, 47 ГБ для IQ3_XXS. Если нужен режим с картинками, добавляется 0,91 ГБ на vision-энкодер. Это минимумы на 128K контексте, а не комфортные значения с запасом под ОС и браузер.

Почему 12 ГБ VRAM хватает, а 32 ГБ RAM - не всегда

Логика гибридного инференса: часть слоёв и KV-кэш живут в видеопамяти, остальное - в системной RAM, обмен идёт по PCIe. Отсюда требование к суммарному объёму: 12 ГБ на GPU сами по себе ничего не решают, модель целиком в них не помещается. 64 ГБ DDR5-5600 в тестовой конфигурации - необходимость: в системную память уходит большая часть весов.

Пропускная способность памяти при такой схеме ограничивает сильнее, чем вычислительная мощность GPU. Поэтому на 32 ГБ RAM картина меняется: IQ3_XXS с его 47 ГБ не влезет, а Q2_0 с 37,6 ГБ окажется на грани, как только к модели добавятся Windows, браузер и фоновые процессы. При нехватке памяти система уходит в своп, и скорость падает в разы.

Отдельная деталь: KV-кэш на 128K контексте занимает заметный объём сам по себе. Чем prefill отличается от decode и почему эти метрики надо мерить отдельно, разбирается на примере Qwen 3.8 27B и nInfer на RTX 5090.

Что меняет vision-энкодер

Мультимодальный режим добавляет 0,91 ГБ. На фоне 37-47 ГБ это немного, но когда система работает на грани, решает каждый гигабайт. Замеров скорости для режима с изображениями автор не приводит: неизвестно, как vision-энкодер влияет на генерацию и обработку промпта. Если картинки нужны, добавляйте память с запасом.

Какой квант выбрать: Q2_0, IQ2_XS или IQ3_XXS

Все три кванта запускаются на одной и той же машине, разница в скорости и памяти. Выбор упирается в то, насколько вы готовы рискнуть качеством ответов.

Скорость против качества: где проходит граница

2-битное квантование исторически просаживает сложные задачи: код, математику, многошаговые рассуждения, точное следование инструкциям. Для чата, пересказа и черновиков потеря часто терпима, для агентных сценариев с цепочками вызовов - нет. Автор сопоставляет свои кванты с известными сборками Unsloth: Q2_0 с Q3, IQ2_XS с Q4, IQ3_XXS с Q5. Это заявление автора. Замеров качества в публикации нет: ни perplexity, ни прогонов по бенчмаркам. Относиться к таким соответствиям стоит как к ориентиру, не как к гарантии.

Сценарии: чат, RAG, длинные документы, код

  • Чат и быстрые ответы. Q2_0: 65,1 ток/с генерации, 37,6 ГБ памяти. Самый отзывчивый вариант, если ответы не обязаны быть безупречными.
  • RAG и длинные документы. IQ2_XS или IQ3_XXS: 472 и 414 ток/с на обработке промпта. Когда в контекст заливаются десятки тысяч токенов, скорость prefill ощущается сильнее, чем скорость генерации.
  • Код и сложные рассуждения. IQ3_XXS: 44,8 ток/с и 47 ГБ. И то с поправкой: 3-битный квант не равен полной модели, ошибки в синтаксисе и логике возможны.
  • Пакетная обработка текста. Q2_0 или IQ2_XS, если важна пропускная способность, а не качество отдельного ответа.

Ограничения: что Strata не умеет и где может подвести

Strata - эксперимент с узкой областью применения, и ограничения у него структурные: они следуют из самого подхода.

  • Только CUDA. Владельцы AMD и Intel GPU мимо: движок под них не собран и не заявлен.
  • Только одна модель. Другие модели не поддерживаются, да и сама Qwen3.8-Flash-Next должна быть в подходящем кванте.
  • Только замеры автора. Независимых прогонов нет, методология не описана.
  • Один разработчик. Развитие и поддержка зависят от одного человека.
  • Тесты были на Windows. Поведение под Linux не описано.
  • Продакшен не проверен. Нет данных о параллельных запросах, стабильности под нагрузкой, утечках памяти при долгой работе.

Одна модель: в чём цена скорости

Узкая специализация и есть источник прироста. Движок собирается под конкретную архитектуру, и переход на другую модель обнуляет преимущество: придётся возвращаться к llama.cpp или ждать, пока автор добавит поддержку. Для инструмента на каждый день это серьёзное ограничение, потому что локальный стек обычно не ограничивается одной моделью.

Чего в заявлении автора не хватает

Список пробелов, который стоит держать в голове:

  • версии драйвера NVIDIA и CUDA, номер версии самого движка;
  • температуры GPU и наличие троттлинга под длительной нагрузкой;
  • любые метрики качества: perplexity, бенчмарки, сравнение ответов с llama.cpp на одинаковых промптах;
  • сравнение с чем-то кроме llama.cpp: vLLM, Ollama, другими кастомными движками;
  • потребление энергии и уровень шума на тестовой машине;
  • поведение на контекстах длиннее 128K.

Цифры остаются заявленными. Независимой проверки на момент публикации нет, и это стоит учитывать, прежде чем перестраивать свой стек.

Как установить и запустить: что нужно знать перед стартом

Установка заявлена как «в один клик» на недорогом железе. Что понадобится: NVIDIA GPU с поддержкой CUDA, Windows, достаточный объём RAM+VRAM под выбранный квант. Движок лежит на GitHub, GGUF-кванты Qwen3.8-Flash-Next - на Hugging Face. Конкретные команды и шаги в исходном сообщении не разбираются, поэтому ориентироваться стоит на документацию репозитория.

Минимальная конфигурация под каждый квант

КвантRAM+VRAM минимумС vision-энкодером
Q2_037,6 ГБ38,5 ГБ
IQ2_XS39,2 ГБ40,1 ГБ
IQ3_XXS47 ГБ47,9 ГБ

Суммы с vision-энкодером получены сложением заявленных значений с 0,91 ГБ: отдельной строки требований для мультимодального режима автор не приводит. Практический ориентир: 12 ГБ VRAM плюс 32 ГБ RAM дают около 44 ГБ суммарно, этого хватит для Q2_0 и IQ2_XS, но IQ3_XXS с его 47 ГБ не влезет. Часть видеопамяти всегда занята системой и рабочим столом, так что реальный запас окажется меньше расчётного.

На что смотреть в первые минуты после запуска

Четыре проверки, которые покажут, работает ли связка как надо:

  1. Загрузился ли выбранный квант и не подменяется ли он другим.
  2. Какая скорость генерации и обработки промпта на вашем железе: сравните с таблицей выше.
  3. Не уходит ли система в своп: скачки задержек и просадка до единиц ток/с намекают на нехватку RAM.
  4. Сколько памяти занято после прогрева: если вплотную к потолку, снижайте битность кванта или длину контекста.

Ориентир для сравнения держите с поправкой на железо: у автора RTX 5070, DDR5-5600 и Ryzen 5 7600. На более слабой связке цифры будут ниже, и это нормально.

Кому стоит попробовать Strata, а кому - пройти мимо

Если коротко: Strata имеет смысл там, где у вас уже есть Qwen3.8-Flash-Next, NVIDIA GPU и желание выжать из него больше скорости.

Стоит ли переходить с llama.cpp прямо сейчас

Попробовать имеет смысл, если совпадают три условия: NVIDIA GPU с 12 ГБ VRAM и больше, 48-64 ГБ системной памяти, работа именно с Qwen3.8-Flash-Next на длинном контексте. Установка в один клик снижает порог входа до получаса, а заявленный разрыв - 15 ток/с против 65 ток/с на одном и том же кванте - слишком велик, чтобы игнорировать его без проверки.

Переходить не стоит, если у вас AMD или Intel GPU, если вы работаете с несколькими моделями и переключаетесь между ними, если нужны продакшен-гарантии или меньше 32 ГБ RAM. Независимых подтверждений прироста пока нет: llama.cpp остаётся базовым вариантом, а Strata - надстройкой под конкретную задачу.

Что это говорит о будущем локального инференса

Узкоспециализированные движки под одну модель и конкретный класс железа - заметный тренд. llama.cpp удобен именно универсальностью, но на бюджетных GPU часть скорости теряется на обобщённых ядрах. Если результаты Strata подтвердят на другой конфигурации, логично ждать похожих проектов под другие популярные модели и под AMD. Похожая история уже была с замером DeepSeek V4.1 Flash на восьми A40 в TensorSharp: интересна и абсолютная скорость, и то, какие приёмы дают прирост на конкретном железе.

Пока Strata - единичный эксперимент одного автора, а не смена парадигмы. Практический вывод простой: если вам не хватает скорости на 12 ГБ VRAM, скачайте движок и квант, прогоните свои промпты на своём железе и сравните результат с llama.cpp. Разница в цифрах настолько велика, что проверка займёт меньше времени, чем спор о ней.

Подписаться на канал