Перейти к содержанию
Публикация AiManual

Qwen3.8-27B-Humanlike-Chat: как LoRA-дообучение убирает «ассистентский» стиль у LLM

Qwen3.8-27B-Humanlike-Chat - это rank-256 LoRA поверх Huihui-Qwen3.8-27B-abliterated (checkpoint 863), обученная на 125 217 человеческих сообщениях. Разбираем,

Коротко

Что будет в материале

  1. 01

    Что такое Qwen3.8-27B-Humanlike-Chat и зачем убирать «ассистентский» стиль

  2. 02

    Что именно меняет LoRA-дообучение в стиле общения модели

  3. 03

    Риски для instruction-following: что говорит IFEval и чего не хватает в данных

  4. 04

    Как проверить Qwen3.8-27B-Humanlike-Chat самостоятельно

Что такое Qwen3.8-27B-Humanlike-Chat и зачем убирать «ассистентский» стиль

Qwen3.8-27B-Humanlike-Chat - это Qwen3.8-27B с LoRA-адаптером ранга 256, обученным на живой переписке людей, а не на инструкциях. База - huihui-ai/Huihui-Qwen3.8-27B-abliterated, релизный артефакт - checkpoint 863. Датасет собран из 125 217 обезличенных сообщений в 1396 диалогах между людьми.

Цель релиза: сменить разговорные привычки модели. Рост бенчмарков в задачи не входил. По словам автора, ответы стали короче, менее «отполированными» и в целом человечнее, особенно в неформальных разговорах и даже без системного промпта.

Цена вопроса названа прямо: более ранняя итерация показала на 5 процентных пунктов худший результат по IFEval относительно родительской модели. На текущем checkpoint бенчмарк не перепрогонялся, производительность в коде не тестировалась. Значит, оценки стиля пока опираются на наблюдения автора, а не на измерения.

Чем Humanlike-Chat отличается от родительской Huihui-Qwen3.8-27B-abliterated

LoRA-адаптер не переписывает веса базы, а добавляет к ним небольшой набор обучаемых параметров. Знания, словарь, токенизатор и общая логика рассуждений остаются от Qwen3.8-27B. Суффикс abliterated в названии базы указывает на вариант со снятыми отказами, и Humanlike-Chat наследует эту особенность.

Разница между версиями лежит в разговорных привычках, а не в знаниях. Родительская модель отвечает как сервисный ассистент: длинно, вежливо, с обязательным предложением помощи в конце. Humanlike-Chat отвечает как человек в переписке: короче, иногда резче, без служебных преамбул.

Практический вопрос для тех, кто уже работает на Huihui-Qwen3.8-27B-abliterated, звучит так: раздражают ли длинные ответы, вежливые вступления и автоматическое «конечно, вот несколько вариантов». Если да, смысл попробовать есть. Если важнее предсказуемое следование формату и аккуратный код, выигрыш неочевиден, и автор сам об этом предупреждает.

Отдельно стоит держать в голове, что это не апгрейд качества и не новая версия Qwen. Это стилевая модификация с открыто заявленным компромиссом по instruction-following.

Что именно меняет LoRA-дообучение в стиле общения модели

Под «ассистентским» стилем здесь понимают набор привычек, знакомых каждому, кто долго работал с чат-моделями:

  • избыточные объяснения: на короткий вопрос приходит ответ на восемь абзацев с оговорками и дисклеймерами;
  • автоматическое согласие: любое предложение пользователя встречается одобрением, даже сомнительное;
  • поддержание беседы ради беседы: встречные вопросы и «чем ещё помочь», когда тема уже закрыта;
  • «отполированность»: ровные формулировки, симметричные списки, обязательное резюме в конце.

Что приходит на смену, по описанию автора: короткие ответы, меньшая «отполированность» и более человечный тон. Ярче всего эффект проявляется в неформальной переписке, а работает он и без системного промпта, то есть модель не нужно дополнительно просить «отвечай кратко».

Гипотетическая иллюстрация, показывающая суть изменений: на вопрос «стоит ли переписать мой парсер на Rust» ассистентская версия выдаст таблицу плюсов и минусов с выводом «зависит от ваших задач», а Humanlike-Chat по замыслу автора ответит короче и с прямой позицией. Это пример для наглядности, а не выдержка из репозитория.

Почему обучение на человеческих диалогах меняет разговорные привычки

Языковая модель предсказывает следующее слово. Если дообучать её на реальной переписке, веса адаптируются под то, как люди пишут друг другу, а не под то, как ассистент отвечает по инструкции.

В человеческом диалоге реплики короче, чем ответы ассистента. Люди перебивают, уточняют, отвечают «не знаю», возражают, молчат, пишут с ошибками и без структуры. Они не начинают сообщение с «Отличный вопрос!» и не заканчивают списком дальнейших шагов. Обучение на таком корпусе смещает распределение ответов в эту сторону.

Состав датасета это подтверждает по цифрам: 125 217 обезличенных сообщений в 1396 диалогах. Если поделить одно на другое, получается примерно 90 сообщений на диалог, то есть длинные живые переписки, а не синтетические пары «инструкция-ответ». Обезличивание означает, что персональные данные из переписок убрали перед обучением.

Что такое rank-256 LoRA и почему это важно для стилевой настройки

LoRA заменяет полное дообучение модели на дообучение небольшого адаптера. К весам базовой модели добавляются две матрицы низкого ранга, и обновляются только они. Базовые веса при этом не трогаются.

Ранг задаёт внутреннюю размерность этих матриц, то есть ёмкость адаптера: сколько изменений он способен в себя вместить. Rank-256 - довольно высокий ранг для стилевой задачи, он даёт адаптеру запас, чтобы перестроить манеру речи, а не только подкрутить тон. Считать этот выбор оптимальным нельзя: это просто заявленный параметр релиза.

В репозитории лежат два разных артефакта, и разница между ними практическая:

АртефактЧто этоКому подойдёт
Объединённые GGUFВеса базы с уже вшитым адаптером в формате GGUF, готовые к квантованию и запускуТем, кто хочет поднять модель в llama.cpp, LM Studio или другом GGUF-раннере без ручной сборки
Отдельный F32 LoRA-адаптерВеса адаптера в полной точности float32, которые накатываются на базу самостоятельноТем, кто экспериментирует: свои слияния, комбинирование с другими адаптерами, контроль над процессом

F32 здесь означает формат хранения весов адаптера, а не степень квантования. Для слияния с базой полная точность удобнее: меньше потерь на округлении.

Риски для instruction-following: что говорит IFEval и чего не хватает в данных

IFEval измеряет, насколько точно модель выполняет проверяемые инструкции: ответь ровно тремя пунктами, не используй определённое слово, закончи сообщение заданной фразой. Метрика считает долю выполненных требований, и она прямо показывает цену стилевой настройки.

Заявленный результат: более ранняя итерация Humanlike-Chat просела на 5 процентных пунктов относительно родительской модели. Процентные пункты и проценты здесь важно не путать: если база давала 80 пунктов, речь о 75. Без базового значения интерпретировать цифру сложно, и автор его не приводит.

Пять пунктов - заметный сигнал, но не приговор. Для чат-бота с человеческим тоном такая потеря может не значить ничего, а для пайплайна, где модель обязана отдавать строгий JSON, те же пять пунктов превращаются в регулярные поломки формата. Полезно заранее понимать, как читаются такие метрики и что о них пишут в карточках моделей: разбор того, как читать model card LLM и почему бенчмарки расходятся с реальностью.

Почему стилевая настройка может ухудшить следование инструкциям

Механизм простой и не связан с багом. Модель дообучают на данных, где формат ответа почти никого не волнует: люди пишут так, как удобно в моменте. Инструкции же требуют обратного - держать структуру, считать пункты, не выходить за рамки.

Когда распределение обучающих данных смещается в сторону свободной речи, модель чаще выбирает свободную форму и там, где нужна форма строгая. Аналогия бытовая: человек, натренированный на светской беседе, хуже проходит чек-лист по технике безопасности, хотя знает не меньше.

Утверждать, что именно так и произошло с checkpoint 863, оснований нет. Это вероятный механизм, о котором автор предупреждает сам, а не подтверждённый факт.

Что осталось непроверенным на checkpoint 863

Границы известного стоит зафиксировать списком, чтобы не строить ложных ожиданий:

  • IFEval на текущем checkpoint не перепрогонялся, свежих цифр нет ни по стилю, ни по следованиям инструкциям;
  • производительность в коде не тестировалась: ни генерация, ни отладка, ни работа с длинными файлами;
  • сравнения с другими моделями того же размера в релизе нет;
  • заявления про «человечность» ответов опираются на впечатления автора.

То есть цифра 5 п.п. относится к прошлой итерации, а не к тому, что лежит в репозитории сейчас. Может быть лучше, может быть так же. Проверять придётся самому.

Как проверить Qwen3.8-27B-Humanlike-Chat самостоятельно

Проверка не требует своей тестовой инфраструктуры: в релизе есть демо-пространство, бесплатный эндпоинт и файлы для локального запуска. Ниже - что смотреть в каждом случае.

Демо-пространство: какие режимы и системные промпты попробовать

В демо доступны разные системные промпты и режимы рассуждений. Этого хватает, чтобы увидеть разницу в стиле за десять минут, если сравнивать по одной переменной за раз:

  • один и тот же запрос с системным промптом вида «ты полезный ассистент» и без него: смотрите, насколько меняется длина и тон;
  • тот же запрос в режиме рассуждений и без него: здесь меняется не только стиль, но и поведение модели на сложных задачах, о чём есть отдельный разбор того, как Qwen 3.8 27B рассуждает при отладке кода;
  • неформальная реплика без конкретной задачи: именно на таких запросах «ассистентский» стиль заметнее всего;
  • запрос с жёстким форматом: например, ответ строго в три пункта или в виде JSON.

Смотреть стоит на три вещи: длину ответа, наличие автоматического согласия и склонность уходить в объяснения вместо прямого ответа.

Локальный запуск: GGUF или F32 LoRA-адаптер

Объединённые GGUF - самый быстрый путь. Файл уже содержит вшитый адаптер, его достаточно поднять в llama.cpp, LM Studio или похожем раннере. Требования к VRAM зависят от выбранного квантования и длины контекста: чем выше точность кванта и больше окно, тем больше памяти уйдёт под веса и KV-cache. Прикинуть бюджет помогает разбор факторов, которые определяют требования к железу и стоимость инференса.

F32 LoRA-адаптер берут те, кому нужен контроль: слить адаптер с базой самостоятельно, проверить поведение при разных настройках слияния или совместить с другим адаптером. Для обычного чата этот путь даёт больше возни и не гарантирует лучший результат.

Бесплатный OpenAI-совместимый эндпоинт и его ограничения

В релизе есть бесплатный эндпоинт, совместимый с OpenAI API, с ограничением по частоте запросов. Это удобно для быстрой проверки стиля стандартными клиентами, но лимиты накладывают рамки: массовые прогоны тестов через такой доступ не сделать, и под нагрузкой ответы могут ждать в очереди.

Практичный сценарий: через эндпоинт прогнать десяток своих запросов и понять, нравится ли тон. Если да, ставить модель локально и тестировать уже на своих задачах без лимитов. Адрес точки доступа и имя модели стоит брать из репозитория автора.

Кому подходит Humanlike-Chat, а кому - нет

Сценарии, где смена стиля даёт выигрыш:

  • неформальные диалоги и чат-боты, которым нужен человеческий тон без постоянных оговорок;
  • ролевые сценарии и персонажи, где «отполированность» ассистента ломает образ;
  • креативный текст, которому вредит симметричная структура и обязательные резюме;
  • эксперименты со стилем без системного промпта: модель не нужно уговаривать отвечать кратко.

Сценарии, где нужна проверка перед использованием:

  • строгий формат ответа: JSON, чек-листы, фиксированная структура отчёта;
  • код и длинные цепочки вызовов инструментов, где важна точность, а не манера речи;
  • пайплайны, где инструкция важнее тона, а ошибка в формате останавливает процесс;
  • продакшн без собственного набора тестов: падение IFEval на 5 п.п. в прошлой итерации стоит держать в голове.

Решать по обещаниям автора не стоит. Сравнение с родительской моделью на своих запросах занимает меньше времени, чем разбор последствий неудачного выбора модели.

Итог: что мы знаем и что предстоит проверить

Qwen3.8-27B-Humanlike-Chat - это rank-256 LoRA поверх huihui-ai/Huihui-Qwen3.8-27B-abliterated, релиз checkpoint 863, датасет из 125 217 обезличенных сообщений в 1396 диалогах между людьми. Заявленный эффект: ответы короче, менее «отполированные», меньше автоматического согласия и меньше поддержания беседы ради беседы, в том числе без системного промпта.

Риски названы автором открыто: прошлая итерация просела на 5 процентных пунктов по IFEval, текущий checkpoint не перепрогонялся, код не тестировался. Доступны объединённые GGUF, отдельный F32 LoRA-адаптер, демо-пространство с системными промптами и режимами рассуждений, а также бесплатный OpenAI-совместимый эндпоинт с лимитом по частоте запросов.

Чек-лист после прочтения:

  1. прогнать в демо один и тот же запрос с системным промптом и без него, сравнить длину и тон;
  2. проверить модель на своих типовых задачах: неформальный диалог, ответ по формату, запрос на код;
  3. сравнить результаты с родительской Huihui-Qwen3.8-27B-abliterated на тех же запросах;
  4. для локального запуска взять GGUF, если не нужен контроль над слиянием адаптера;
  5. не опираться на бенчмарки, которых для этого checkpoint нет.

Следить за такими релизами удобно через ленты новых публикаций и обсуждений сообщества: инструмент для отслеживания свежих AI-исследований и моделей экономит время на поиск того, что действительно стоит тестировать на своём железе.

Подписаться на канал