Короткий ответ: подтверждений тому, что Qwen 3.8 Flash Next построена на архитектуре Qwen 4, в доступных источниках нет. Обсуждение на Reddit, из которого вырос вопрос, содержит гипотезу пользователя, а не анонс команды Qwen. Ни спецификаций Qwen 4, ни бенчмарков, ни официальных заявлений там не приводится. Разбираем, что подтверждено о Qwen 3.8 Flash Next, влезет ли она в 24 ГБ RTX 3090 и какие факторы реально определяют скорость инференса.
Запуск на одной видеокарте с 24 ГБ возможен только через сжатие весов и вынос части данных в оперативную память или на диск. Мгновенно быстрым такой вариант не будет: узким местом становится пропускная способность памяти GPU и шины PCIe. Дальше - цифры и ограничения.
Что вообще известно о Qwen 3.8 Flash Next и Qwen 4
Почему вопрос из Reddit - это не анонс
Пользователь Reddit предполагает: Qwen 3.8 Flash Next основана на архитектуре Qwen 4, а анонсированная Qwen 4 27B может использовать ту же схему с n-граммами. Отсюда вопрос: даст ли это быстрый инференс на одной RTX 3090 без серьёзной настройки. Ни один пункт гипотезы не подтверждён: нет релизных заметок, технического отчёта, замеров.
Практический вывод простой: не планируйте апгрейд железа под предполагаемые свойства Qwen 4. Опирайтесь на то, что можно скачать и измерить сегодня. Гипотеза о «той же архитектуре» легко превращается в обсуждениях в утверждение, хотя за ней стоит один вопрос без ответа. Про путаницу в названиях и границы между Flash-Next и полноценным Qwen4 подробно разобрано в материале Qwen3.8-Flash-Next: что это за модель и при чём здесь Qwen4.
Что подтверждено о Qwen 3.8 Flash Next
Qwen 3.8 Flash Next - модель со смесью экспертов: 512 экспертов на слой, 10 активных на токен, 48 слоёв, 176.9B параметров и 354 ГБ в BF16 (описание сборки на Hugging Face).
Для локального запуска интересна экспериментальная сжатая версия GSQ-RCO Coder (карточка модели). Половину маршрутизируемых экспертов из модели удалили, оставшиеся веса хранятся в 3.5 бита на вес, что в среднем даёт 1.89 бита на параметр исходной модели. Резидентный рабочий набор сжимается до 29.6 ГБ. Возможности при этом сохраняли в коде, агентном использовании инструментов, зрении и пространственном мышлении, а деградация вне этих областей - принятая цена метода. Замеры: LiveCodeBench v6 держится на 98.7% от базового результата, SWE-bench Verified - на 91.3%.
В каталоге YouRunAI упоминается модель Qwen3.8-27B с пакетами Q4, Q8 и FP16 и пометкой «Runs well or better» (каталог моделей). Ни конфигураций, ни бенчмарков, ни связи с Qwen 4 там нет, так что это не подтверждение, что анонсированная Qwen 4 27B повторит архитектуру Flash Next.
Влезет ли Qwen 3.8 Flash Next в 24 ГБ RTX 3090
Полная версия не влезет даже близко: 354 ГБ в BF16 против 24 ГБ у RTX 3090. Даже при 4-битном квантовании остаются десятки гигабайт, которые распределяют между несколькими GPU, оперативной памятью и диском. Как выглядит такой бюджет на четырёх RTX 3090, с отдельным разбором prefill и decode, есть в материале про сравнение Qwen 3.8 Flash Next и 27B на четырёх RTX 3090.
Почему 29.6 ГБ - это всё ещё проблема для RTX 3090
Сжатая сборка GSQ-RCO Coder уменьшает резидентный рабочий набор до 29.6 ГБ, и в источнике речь о размещении в одном 32-ГБ ускорителе (описание сборки). У RTX 3090 - 24 ГБ, то есть не хватает примерно 5.6 ГБ. Конфигурацию на 24 ГБ источник не рассматривает, поэтому гарантий запуска нет.
- Вынести часть слоёв в оперативную память хоста: минус нагрузка на VRAM, плюс постоянный обмен по PCIe.
- Держать n-граммовую часть на диске: память GPU она не занимает, но чтения во время декодирования добавляют задержку.
- Сжать сильнее, чем 3.5 бита на вес: экономия памяти ценой качества.
- Ограничить контекст и KV-cache: длинный контекст съедает VRAM быстрее, чем сами веса.
Каждый из этих шагов требует ручной настройки. Схемы, которая заработает из коробки, здесь нет.
Как n-граммы могут помочь с памятью
В сжатой сборке n-граммовая часть - таблица поиска, её можно обслуживать с диска, не занимая резидентную память ускорителя. Это заметно снижает требования к VRAM по сравнению с хранением всех весов на GPU. Основные веса модели всё равно нужно где-то разместить, и именно они задают минимальный порог в 24 или 32 ГБ. К гипотетической Qwen 4 27B это не относится: подтверждений, что в ней используется тот же механизм, нет.
Что реально влияет на скорость инференса LLM на одной GPU
Скорость декодирования упирается в четыре вещи: пропускную способность памяти GPU, число параметров, которые читаются на каждый токен, степень сжатия весов и то, где физически лежат данные. Для MoE-моделей важнее активные параметры, а не общее число.
Квантование и bpw: как сжатие влияет на скорость
3.5 бита на вес и эффективные 1.89 бита на параметр означают, что на каждый токен из памяти читается в разы меньше байт, чем в BF16. Меньше трафик - выше теоретический потолок скорости. Плата - деквантование весов на лету и потеря качества. Половина экспертов в сборке GSQ-RCO Coder удалена, поэтому за пределами кода, инструментов, зрения и пространственных задач результат просядет. Настройками это не лечится, деградация заложена в саму схему сжатия.
MoE и активные эксперты: почему это важно для RTX 3090
На каждый токен в Qwen 3.8 Flash Next работают 10 экспертов из 512. Вычисления небольшие, но все веса должны где-то храниться. Если часть экспертов лежит в RAM, каждый токен тянет данные по PCIe, и именно эта шина становится потолком. Проблема знакомая: в разборе запуска DeepSeek-V4-Flash на одном B300 без expert parallel MoE-ядро не заработало, а скорость оказалась на уровне 770 токенов/с вместо ожидаемых тысяч (опыт запуска DeepSeek-V4-Flash на B300). У RTX 3090 PCIe 4.0 x16 даёт порядка 32 ГБ/с в теории, и этого мало для моделей, чьи веса не помещаются в VRAM целиком.
Итог по скорости: наличие n-граммовой части само по себе быстрого инференса не гарантирует. Выигрыш даёт удачное сочетание квантования, раскладки по памяти и длины контекста, и всё это подбирается вручную.
Overthinking: компенсирует ли ускоренный инференс избыточные рассуждения
Подтверждённых данных о том, что ускоренный инференс компенсирует склонность модели к избыточным рассуждениям, в источниках нет. Арифметика при этом простая: время ответа = число сгенерированных токенов умножить на время одного токена. Ускорение улучшает второй множитель, overthinking раздувает первый.
Если модель пишет 3000 токенов рассуждений вместо 600, пятикратный рост объёма съедает почти любой выигрыш от быстрого декодирования. Сокращать reasoning-цепочки приходится на уровне промпта, настроек сэмплинга или выбора другой модели, а не за счёт более быстрой видеокарты.
Отдельный риск даёт сжатие. Сборка GSQ-RCO Coder сохраняет качество в коде и агентных сценариях, а деградацию вне этих доменов авторы считают приемлемой. Как поведёт себя урезанная модель в задачах с длинными цепочками рассуждений, в источниках не измерялось.
Qwen 4 27B: что известно и стоит ли ждать
Подтверждённых технических деталей о Qwen 4 27B нет. В каталоге YouRunAI упоминается Qwen3.8-27B с вариантами Q4, Q8 и FP16 и пометкой «Runs well or better» (каталог моделей). Но это витрина готовых пакетов, а не официальные замеры, и связь этой модели с Qwen 4 не подтверждена.
Предположение о той же архитектуре с n-граммами остаётся предположением. Ждать конкретную 27B-модель под RTX 3090 имеет смысл только после официального анонса с требованиями к памяти. Пока практичнее оценивать существующие 27B-сборки по бюджету памяти, как в разборе запуска Qwen3.8-27B в Q4_K_M на 16 ГБ VRAM.
Почему Qwen не публикует датасет и методику обучения
Причин, по которым Qwen не выкладывает датасет и методику для полного обучения, в предоставленных источниках нет. Это распространённая практика коммерческих AI-лабораторий: данные для претрейна остаются закрытыми, публикуются веса, отчёты и иногда детали посттренинга. Насколько такой подход оправдан, вопрос открытый. Воспроизвести обучение с нуля по открытым материалам нельзя.
Что доступно на практике: файнтюнинг готовых весов на своих данных, обучение на открытых датасетах, участие в open-source проектах по дистилляции и квантизации. Полное обучение модели уровня 176.9B параметров требует ресурсов, недоступных частному пользователю, независимо от того, открыт датасет или нет.
Практические шаги: что делать, если хотите попробовать запустить на RTX 3090
- Проверьте, доступна ли сжатая сборка GSQ-RCO Coder в GGUF и какой размер резидентной части заявлен в карточке модели. Ориентируйтесь на 29.6 ГБ как на минимум.
- Подготовьте инструмент с поддержкой offload, например llama.cpp или сборки на его основе, чтобы часть слоёв уходила в RAM.
- Заранее решите, где будет лежать n-граммовая часть: на NVMe или в памяти. Диск экономит VRAM, но добавляет задержку при чтении.
- Подбирайте квантование и число слоёв на GPU, начиная с короткого контекста и увеличивая его постепенно.
- Следите за температурой и энергопотреблением: длительная работа на пределе по памяти для таких схем обычное дело.
- Сравнивайте с более лёгкими вариантами. Отчёт о запуске на 12 ГБ VRAM показывает, что модель работает, но скорость проседает на длинном контексте (отчёт о запуске Qwen3.8-Flash-Next на 12 ГБ VRAM).
Перед тем как вкладываться в схему, измерьте два числа: скорость декодирования в токенах в секунду и объём памяти, который реально занимает резидентная часть. Если скорость не устраивает, а память упирается в 24 ГБ, разумнее остаться на модели меньшего размера, чем бороться с offload. И держите в уме: рассуждения про архитектуру Qwen 4 и n-граммы в Qwen 4 27B пока остаются вопросом из сообщества, а не техническим фактом.