Перейти к содержанию
Публикация AiManual

Qwen3.8-27B-Uncensored-Genesis-V1: эксперимент с уменьшением «шума в матрицах»

Qwen3.8-27B-Uncensored-Genesis-V1 пытается сократить бесконечные рассуждения LLM через фильтрацию «шума в матрицах». Разбираем, что известно о методе EvilEngine

Коротко

Что будет в материале

  1. 01

    EvilEnginer представил Qwen3.8-27B-Uncensored-Genesis-V1, экспериментальную GGUF-версию Qwen3.8-27B с обозначением Genesis-V1-MTP. Цель работы, сократить чрезмерно...

  2. 02

    Автор связывает проблему с накоплением случайного «тренировочного шума» и численной нестабильностью в матрицах весов. Для фильтрации он использует распределение...

  3. 03

    Проблема длинных ответов LLM хорошо знакома пользователям Qwen3.8-27B. Модель может уходить в затянутую фазу рассуждений, повторять план, откладывать итоговый ответ...

  4. 04

    Распределение Марченко-Пастура описывает ожидаемое распределение собственных значений для некоторых классов случайных матриц. В задачах анализа нейросетевых весов...

EvilEnginer представил Qwen3.8-27B-Uncensored-Genesis-V1, экспериментальную GGUF-версию Qwen3.8-27B с обозначением Genesis-V1-MTP. Цель работы, сократить чрезмерно длинные рассуждения, из-за которых LLM может тратить тысячи токенов даже на простой вопрос или компактную задачу по коду.

Автор связывает проблему с накоплением случайного «тренировочного шума» и численной нестабильностью в матрицах весов. Для фильтрации он использует распределение Марченко-Пастура и принципы из научной работы. Пока это гипотеза, требующая независимой проверки: в доступных материалах нет подробностей об изменённых весах, результатах бенчмарков, сравнении с исходной моделью и влиянии обработки на качество ответов.

Проблема длинных ответов LLM хорошо знакома пользователям Qwen3.8-27B. Модель может уходить в затянутую фазу рассуждений, повторять план, откладывать итоговый ответ или исчерпывать лимит контекста. Причина иногда кроется в параметрах инференса, уровне reasoning effort, шаблоне чата, квантовании или speculative decoding. Эти случаи разобраны в материале о бесконечных рассуждениях Qwen 3.8-27B и настройке llama-server.

Что заявлено о Genesis-V1-MTP

  • Базой выступает Qwen3.8-27B в формате GGUF для локального запуска.
  • Автор пытается подавить компоненты матриц, которые интерпретирует как случайный тренировочный шум.
  • Для анализа применяется распределение Марченко-Пастура, инструмент теории случайных матриц.
  • Проверка модели зависит от сообщества: у EvilEnginer есть RTX 3060 с 12 ГБ VRAM, поэтому самостоятельно охватить широкий набор конфигураций он не может.

Распределение Марченко-Пастура описывает ожидаемое распределение собственных значений для некоторых классов случайных матриц. В задачах анализа нейросетевых весов такой подход может помогать отделять структурный сигнал от статистических компонентов. Однако математическая корректность фильтра не доказывает улучшение языковой модели. После вмешательства в веса требуется проверить, сохранились ли знания, способность следовать инструкциям, качество кода, многоязычность и устойчивость в длинном контексте.

Суффикс MTP в названии Genesis-V1-MTP сам по себе не раскрывает схему запуска. Для практического вывода нужны сведения о том, как подготовлен файл, какую квантизацию использует сборка, нужен ли отдельный draft-модуль и какие движки инференса поддерживают её без ограничений. До публикации таких данных не стоит переносить на Genesis-V1-MTP выводы о производительности обычной Qwen3.8-27B.

Что нужно проверить в первую очередь

  1. Сравнить Genesis-V1-MTP с исходной Qwen3.8-27B при одинаковых квантизации, движке, температуре, seed, контексте и шаблоне чата.
  2. Взять короткие задачи: извлечение факта из текста, классификация, преобразование данных, написание небольшой функции и ответ на однозначный вопрос.
  3. Провести отдельную серию на сложных задачах: отладка кода, многошаговая логика, работа с длинной инструкцией и редактирование текста.
  4. Зафиксировать число токенов до финального ответа, wall-clock время, полноту результата, ошибки, повторы и случаи остановки без ответа.
  5. Повторить каждый сценарий несколько раз. Одна удачная генерация не показывает стабильность модели.

Главная метрика здесь не минимальное число токенов. Короткий, но неверный ответ хуже длинного корректного разбора. Практическая ценность Genesis-V1-MTP появится, если модель будет заметно реже «залипать», при этом сохранит точность, способность завершать кодовые задачи и качество на запросах, где глубокое рассуждение действительно нужно.

Полезно разделять проблему весов и проблему конфигурации. Если исходная Qwen3.8-27B теряет нить диалога на длинной сессии, фильтрация матриц может не помочь: причина способна находиться в KV-кэше, настройках контекста, формате промпта или speculative decoding. Для таких сценариев пригодится чек-лист из статьи о потере инструкций Qwen в OpenCode и llama.cpp.

Требования к железу

Genesis-V1-MTP относится к классу 27B-моделей, поэтому её аппаратные требования следует оценивать осторожно и без привязки к пока не опубликованным измерениям именно этой сборки. Для Qwen 3.8 27B в Q4_K_M обычно требуется примерно 28-36 ГБ VRAM: итог зависит от длины контекста и объёма KV-кэша. Вариант уровня Q8 может занимать около 48 ГБ VRAM. Для локального запуска с выгрузкой части модели в оперативную память разумно иметь 64 ГБ RAM.

КонфигурацияПрактический ориентирОграничение
RTX 3060 12 ГБПодходит для тестов с частичной выгрузкой и более лёгкими квантамиПолная Q4-модель в VRAM не поместится
GPU с 32 ГБ VRAMБлиже к запуску Q4_K_M при умеренном контекстеЗапас быстро сокращается при росте KV-кэша
GPU с 48 ГБ VRAMПодходит для тяжёлых квантов уровня Q8Длинный контекст всё равно требует расчёта памяти
64 ГБ RAMПолезны для CPU+GPU offload и крупных GGUF-файловСкорость зависит от процессора, памяти и объёма offload

RTX 3060 на 12 ГБ объясняет запрос EvilEnginer к сообществу. На такой карте можно исследовать часть сценариев, но проверить модель под полной GPU-загрузкой, большим контекстом и разными квантами трудно. Владельцы 24-48 ГБ VRAM и систем с большим объёмом RAM могут дать наиболее полезную обратную связь, особенно если приложат точные параметры запуска и сырые результаты.

Кому имеет смысл следить за Genesis-V1-MTP

Эксперимент интересен пользователям локальных LLM, которым нужна предсказуемая длина ответов в агентных задачах, кодинге, RAG-сценариях и автоматизации. Лишние рассуждения повышают задержку, расходуют контекст и усложняют контроль результата. Для локального контура это влияет и на загрузку собственного GPU-сервера, и на пропускную способность системы, хотя сам по себе локальный запуск сохраняет данные внутри инфраструктуры и уменьшает зависимость от облачных лимитов и тарифов.

Пока Genesis-V1-MTP стоит воспринимать как тестовую ветку, а не как доказанную замену исходной Qwen3.8-27B. Рациональный подход, запустить одинаковые промпты на двух моделях, измерить длину и качество генерации, затем проверить выводы на задачах из реального рабочего процесса. Если фильтрация снизит расход токенов без деградации ответов, у сообщества появится интересный метод работы с весами. Если качество просядет, эксперимент всё равно даст полезный материал о границах такой обработки.

Подписаться на канал