EvilEnginer представил Qwen3.8-27B-Uncensored-Genesis-V1, экспериментальную GGUF-версию Qwen3.8-27B с обозначением Genesis-V1-MTP. Цель работы, сократить чрезмерно длинные рассуждения, из-за которых LLM может тратить тысячи токенов даже на простой вопрос или компактную задачу по коду.
Автор связывает проблему с накоплением случайного «тренировочного шума» и численной нестабильностью в матрицах весов. Для фильтрации он использует распределение Марченко-Пастура и принципы из научной работы. Пока это гипотеза, требующая независимой проверки: в доступных материалах нет подробностей об изменённых весах, результатах бенчмарков, сравнении с исходной моделью и влиянии обработки на качество ответов.
Проблема длинных ответов LLM хорошо знакома пользователям Qwen3.8-27B. Модель может уходить в затянутую фазу рассуждений, повторять план, откладывать итоговый ответ или исчерпывать лимит контекста. Причина иногда кроется в параметрах инференса, уровне reasoning effort, шаблоне чата, квантовании или speculative decoding. Эти случаи разобраны в материале о бесконечных рассуждениях Qwen 3.8-27B и настройке llama-server.
Что заявлено о Genesis-V1-MTP
- Базой выступает Qwen3.8-27B в формате GGUF для локального запуска.
- Автор пытается подавить компоненты матриц, которые интерпретирует как случайный тренировочный шум.
- Для анализа применяется распределение Марченко-Пастура, инструмент теории случайных матриц.
- Проверка модели зависит от сообщества: у EvilEnginer есть RTX 3060 с 12 ГБ VRAM, поэтому самостоятельно охватить широкий набор конфигураций он не может.
Распределение Марченко-Пастура описывает ожидаемое распределение собственных значений для некоторых классов случайных матриц. В задачах анализа нейросетевых весов такой подход может помогать отделять структурный сигнал от статистических компонентов. Однако математическая корректность фильтра не доказывает улучшение языковой модели. После вмешательства в веса требуется проверить, сохранились ли знания, способность следовать инструкциям, качество кода, многоязычность и устойчивость в длинном контексте.
Суффикс MTP в названии Genesis-V1-MTP сам по себе не раскрывает схему запуска. Для практического вывода нужны сведения о том, как подготовлен файл, какую квантизацию использует сборка, нужен ли отдельный draft-модуль и какие движки инференса поддерживают её без ограничений. До публикации таких данных не стоит переносить на Genesis-V1-MTP выводы о производительности обычной Qwen3.8-27B.
Что нужно проверить в первую очередь
- Сравнить Genesis-V1-MTP с исходной Qwen3.8-27B при одинаковых квантизации, движке, температуре, seed, контексте и шаблоне чата.
- Взять короткие задачи: извлечение факта из текста, классификация, преобразование данных, написание небольшой функции и ответ на однозначный вопрос.
- Провести отдельную серию на сложных задачах: отладка кода, многошаговая логика, работа с длинной инструкцией и редактирование текста.
- Зафиксировать число токенов до финального ответа, wall-clock время, полноту результата, ошибки, повторы и случаи остановки без ответа.
- Повторить каждый сценарий несколько раз. Одна удачная генерация не показывает стабильность модели.
Главная метрика здесь не минимальное число токенов. Короткий, но неверный ответ хуже длинного корректного разбора. Практическая ценность Genesis-V1-MTP появится, если модель будет заметно реже «залипать», при этом сохранит точность, способность завершать кодовые задачи и качество на запросах, где глубокое рассуждение действительно нужно.
Полезно разделять проблему весов и проблему конфигурации. Если исходная Qwen3.8-27B теряет нить диалога на длинной сессии, фильтрация матриц может не помочь: причина способна находиться в KV-кэше, настройках контекста, формате промпта или speculative decoding. Для таких сценариев пригодится чек-лист из статьи о потере инструкций Qwen в OpenCode и llama.cpp.
Требования к железу
Genesis-V1-MTP относится к классу 27B-моделей, поэтому её аппаратные требования следует оценивать осторожно и без привязки к пока не опубликованным измерениям именно этой сборки. Для Qwen 3.8 27B в Q4_K_M обычно требуется примерно 28-36 ГБ VRAM: итог зависит от длины контекста и объёма KV-кэша. Вариант уровня Q8 может занимать около 48 ГБ VRAM. Для локального запуска с выгрузкой части модели в оперативную память разумно иметь 64 ГБ RAM.
| Конфигурация | Практический ориентир | Ограничение |
|---|---|---|
| RTX 3060 12 ГБ | Подходит для тестов с частичной выгрузкой и более лёгкими квантами | Полная Q4-модель в VRAM не поместится |
| GPU с 32 ГБ VRAM | Ближе к запуску Q4_K_M при умеренном контексте | Запас быстро сокращается при росте KV-кэша |
| GPU с 48 ГБ VRAM | Подходит для тяжёлых квантов уровня Q8 | Длинный контекст всё равно требует расчёта памяти |
| 64 ГБ RAM | Полезны для CPU+GPU offload и крупных GGUF-файлов | Скорость зависит от процессора, памяти и объёма offload |
RTX 3060 на 12 ГБ объясняет запрос EvilEnginer к сообществу. На такой карте можно исследовать часть сценариев, но проверить модель под полной GPU-загрузкой, большим контекстом и разными квантами трудно. Владельцы 24-48 ГБ VRAM и систем с большим объёмом RAM могут дать наиболее полезную обратную связь, особенно если приложат точные параметры запуска и сырые результаты.
Кому имеет смысл следить за Genesis-V1-MTP
Эксперимент интересен пользователям локальных LLM, которым нужна предсказуемая длина ответов в агентных задачах, кодинге, RAG-сценариях и автоматизации. Лишние рассуждения повышают задержку, расходуют контекст и усложняют контроль результата. Для локального контура это влияет и на загрузку собственного GPU-сервера, и на пропускную способность системы, хотя сам по себе локальный запуск сохраняет данные внутри инфраструктуры и уменьшает зависимость от облачных лимитов и тарифов.
Пока Genesis-V1-MTP стоит воспринимать как тестовую ветку, а не как доказанную замену исходной Qwen3.8-27B. Рациональный подход, запустить одинаковые промпты на двух моделях, измерить длину и качество генерации, затем проверить выводы на задачах из реального рабочего процесса. Если фильтрация снизит расход токенов без деградации ответов, у сообщества появится интересный метод работы с весами. Если качество просядет, эксперимент всё равно даст полезный материал о границах такой обработки.