Перейти к содержанию
Публикация AiManual

Какие локальные модели меньше всего похожи на Claude: опыт пользователей и выбор стиля общения

Почему почти все локальные LLM звучат как Claude, есть ли подтверждения дистилляции на моделях Anthropic и какие модели дают другой тон. Критерии отбора, Gemma

Коротко

Что будет в материале

  1. 01

    Почему локальные модели так часто звучат как Claude

  2. 02

    Какие локальные модели меньше всего похожи на Claude: критерии и примеры

  3. 03

    Как оборудование Strix Halo с 128 ГБ влияет на выбор модели

  4. 04

    Настройка стиля общения через промпты и агентов-оркестраторы

Готового списка локальных моделей, которые не звучат как Claude, в открытых источниках нет. Обсуждение в r/LocalLLaMA, с которого началась тема, состоит из вопроса и личных наблюдений, а не из подборки. Пользователь с bosgame Strix Halo и 128 ГБ объединённой памяти сообщает, что запускает qwen3.8-27b и сильно квантованную версию deepseek v4, но общается с ними не напрямую, а через прокси-агентов, и считает их манеру слишком близкой к Claude. Сходство с Claude он называет одним из последних блокеров для полного перехода на локальный запуск. (обсуждение в r/LocalLLaMA)

Смотреть на проблему стоит с двух сторон. Первая: почему стиль локальных моделей сходится к одному образцу. Вторая: что реально можно сделать, если он не нравится. Короткий ответ: универсальной модели без стиля Claude не существует, но набор рычагов есть, и работает он лучше, чем поиск идеальных весов. Это выбор модели по происхождению датасетов и архитектуре, подбор квантизации, системный промпт и агент-посредник между вами и моделью.

Ниже разобраны механизмы формирования стиля, критерии отбора, конкретные модели, привязка к железу со 128 ГБ объединённой памяти и пошаговый план. Там, где данных нет, это отмечено прямо.

Почему локальные модели так часто звучат как Claude

Стиль Claude узнаётся по набору признаков: длинные ответы с оговорками, осторожные формулировки, отказ от резких оценок, извинения за неопределённость, аккуратная подача рисков. Пользователь, поднявший тему, описывает проблему так:

Большинство локальных моделей, которые я пробовал, по тону очень похожи на Claude. Он добавляет, что не выносит общение с Claude и проксирует все запросы через другие агенты. (источник)

Это наблюдение одного человека на своём наборе моделей, не замер и не сравнение по метрикам. При этом оно совпадает с тем, что видно по составу открытых датасетов и по устройству пайплайнов выравнивания у большинства производителей.

Дистилляция на Anthropic: гипотеза или реальность?

Пользователь предполагает, что его модели дистиллированы на моделях Anthropic. Прямых доказательств в открытых источниках нет: Qwen и DeepSeek не публикуют состав обучающих данных, а по весам нельзя установить, чьи ответы использовали при дообучении. Гипотеза остаётся гипотезой, и выдавать её за факт не стоит.

Косвенные каналы переноса стиля при этом существуют. Один из них - опубликованные Anthropic наборы данных предпочтений, которые попадали в открытые пайплайны выравнивания и в синтетику для дообучения. Второй - массовая генерация инструкций и ответов через API крупных моделей: если пайплайн собирает разметку с Claude, его манера уходит в датасет целиком, вместе с оговорками и структурой. Проверить это по конкретной модели без документации от разработчика нельзя, поэтому вывод всегда будет вероятностным.

Практический подход: оценивать происхождение модели косвенно, по карточке, по упомянутым датасетам и по собственному тесту на характерных промптах. Гарантий не даст ни один вендор.

Как обучающие данные и RLHF формируют стиль

Манера общения складывается на трёх этапах. Предобучение задаёт распределение текста: если в корпусе много диалогов определённого вида, модель воспроизводит их статистику. Инструктивное дообучение (SFT) фиксирует формат ответа: разметчики и синтетические генерации задают шаблон «сначала оговорка, потом структура, в конце предложение помощи». Выравнивание (RLHF, DPO и его варианты) закрепляет предпочтения: модели, получившие высокие оценки за осторожность и вежливость, начинают звучать осторожно и вежливо даже там, где вопрос допускает прямой ответ.

Отсюда типичный эффект: ответ по сути верный, но обёртка из оговорок съедает категоричность. Отменить этап выравнивания на инференсе нельзя, зато можно ослабить его влияние промптом. Инструкция вроде «отвечай коротко, без извинений, без списка оговорок, давай прямую оценку» заметно меняет подачу у моделей, где стиль не зашит слишком глубоко. Насколько глубоко он зашит, зависит от модели и версии квантизации.

Какие локальные модели меньше всего похожи на Claude: критерии и примеры

Готового рейтинга нет, поэтому отбор идёт по признакам. Смотреть стоит на четыре вещи.

  • Архитектура. Плотные модели стабильнее в тоне, у MoE поведение сильнее зависит от активации экспертов, и стиль может плавать между ответами.
  • Размер. Компактные модели на 3-12B реже воспроизводят длинные вежливые конструкции крупных ассистентов и чаще отвечают сухо.
  • Производитель и цели. Разные лаборатории по-разному строят выравнивание: одни целят в ассистента-помощника, другие в технического исполнителя.
  • Датасеты. Если карточка модели упоминает синтетику от крупных ассистентов, ждите переноса манеры.

Разница в стиле между семействами одного класса - отдельная тема: почему модели около 30B всё чаще звучат одинаково и чем Gemma отличается от Qwen, разобрано в материале про потерю индивидуальности локальных LLM. Для сравнения компактных вариантов есть разбор трёх компактных LLM 2026 года с требованиями к VRAM и оценкой русского языка.

Как ориентир обычно используют два противоположных полюса: Grok описывают как более прямого и склонного к сарказму, GPT - как нейтрального и структурного. Это репутационные обобщения, а не измеренная характеристика, поэтому годятся только как отправная точка для собственного теста.

Gemma 4 12B: альтернативный стиль от Google

Gemma 4 12B - плотная модель с 11,95 млрд параметров и унифицированной бескодировочной архитектурой: она работает с текстом, изображениями и аудио. По данным 3DNews, для инференса достаточно 16 ГБ оперативной памяти даже без квантования, а сама модель доступна в рабочей среде Unsloth Desktop. (обзор Gemma 4 в 3DNews)

Почему это кандидат для тех, кто уходит от стиля Claude: плотная архитектура от лаборатории с собственной линией выравнивания, компактный размер и другой набор обучающих данных. Утверждать, что Gemma 4 12B звучит менее клодово, по имеющимся материалам нельзя: прямых сравнений тона в источниках нет. Проверяется это коротким набором промптов: попросить категоричную оценку, попросить пошутить, попросить назвать худший вариант из трёх. Уходит в оговорки - стиль тот же. Отвечает прямо - это то, что нужно.

Qwen3.8 27B и DeepSeek V4: можно ли уйти от стиля Claude?

Именно эти модели пользователь называет похожими на Claude. Менять здесь можно не модель, а её исполнение. Сильно квантованная версия deepseek v4 ведёт себя иначе, чем полная: агрессивное сжатие сокращает ответы, иногда ломает связность и делает подачу менее гладкой, то есть менее похожей на вылизанный ассистентский тон. Это побочный эффект, а не приём: качество рассуждений при таком сжатии тоже падает.

Для Qwen3.8 27B есть отдельный повод экспериментировать: существует сравнение семи квантованных версий Qwen3.8 27B от ISTA и Unsloth с разбором, какой вариант скачивать. (тест квантизаций на YouTube) Ценность такого сравнения в том, что разброс поведения между квантизациями одной модели оказывается больше ожидаемого: длина и тон ответов отличаются так, будто это разные модели.

Отдельный вопрос - сама линейка DeepSeek и её место среди открытых LLM. Как она выглядит на фоне Qwen и GLM в 2026 году, с контекстным окном, KV-cache и стоимостью инференса, разобрано в статье про отставание DeepSeek от открытых LLM. Это полезно, если выбираете между локальным запуском и API.

Как оборудование Strix Halo с 128 ГБ влияет на выбор модели

Конфигурация из обсуждения: bosgame Strix Halo со 128 ГБ объединённой памяти. Объединённая память означает, что один пул делят CPU и GPU, поэтому бюджет на модель меньше номинальных 128 ГБ: часть уходит системе, драйверам, приложениям и KV-cache, который растёт вместе с контекстом.

Вес модели оценивается просто: число параметров умножаем на байты на параметр. FP16 - около 2 байт, Q8 - около 1, Q4 - около 0,5.

МодельПараметрыFP16Q8Q4
Gemma 4 12B11,95 млрдоколо 24 ГБоколо 12 ГБоколо 6 ГБ
Qwen3.8 27B27 млрдоколо 54 ГБоколо 27 ГБоколо 13,5 ГБ

Это расчёт только по весам, без KV-cache и накладных расходов рантайма. При таком запасе памяти Qwen3.8 27B запускается в Q8 и даже в FP16, а Gemma 4 12B идёт без сжатия. Для стиля это принципиально: чем меньше квантование, тем ближе поведение к задуманному разработчиком, вместе с его манерой общения. Если модель кажется слишком клодовой, сначала проверьте, не сжата ли она до Q3-Q4, и только потом меняйте модель.

Ограничение объединённой памяти - скорость: пропускная способность делится между задачами, и на длинном контексте генерация замедляется. На выбор модели это влияет косвенно: 70B в Q4 по памяти поместится, но по скорости будет комфортна не для всех сценариев. Практичнее держать 12-30B в умеренной квантизации.

Настройка стиля общения через промпты и агентов-оркестраторы

Пользователь не работает с моделями напрямую: он проксирует запросы через SOL 5.6 или Luna Max, которые выступают оркестраторами, а сборку описывает как похожую на first mate. Роль посредника - переформулировать запрос, задать тон и при необходимости переписать ответ перед выдачей.

На уровне промпта работают прямые формулировки. Примеры системных инструкций:

  • «Отвечай коротко. Не извиняйся. Не добавляй список оговорок. Если вопрос допускает однозначный ответ, дай его».
  • «Тон прямой, без дежурной вежливости. Сарказм допустим, если он уместен».
  • «Сначала вывод, потом обоснование. Без вступлений».

Что это даёт и чего не даёт. Промпт меняет поверхностный слой: длину, структуру, наличие извинений. Выравнивание он не переписывает, поэтому на вопросах про безопасность, медицину или спорные темы модель вернётся к осторожной манере. Агент-оркестратор может больше: он способен переписать ответ своими словами, но тогда вы читаете текст второго агента, а не модели, и добавляется задержка. Названия SOL 5.6, Luna Max и first mate приведены так, как их указал автор поста; подтвердить их в открытых источниках не удалось, поэтому воспринимайте это как описание схемы «локальная модель плюс агент-посредник», а не как готовый стек.

Практические шаги для полного перехода на локальные модели без стиля Claude

  1. Определите целевой стиль. Прямой и резкий, нейтральный технический, разговорный. Без этого нечем измерять результат.
  2. Соберите короткий тест. Пять-семь промптов: запрос категоричной оценки, просьба пошутить, вопрос без однозначного ответа, просьба уложиться в три предложения. Отмечайте, уходит ли модель в оговорки.
  3. Проверьте Gemma 4 12B. Плотная модель на 11,95 млрд параметров, работает с текстом, изображениями и аудио, по данным 3DNews ей достаточно 16 ГБ памяти без квантования, и она доступна в Unsloth Desktop. (источник) Ваш запас памяти позволяет запустить её без сжатия.
  4. Переберите квантизации Qwen3.8 27B. Сравнение ISTA и Unsloth по семи вариантам показывает, что поведение между ними различается. (тест квантизаций) Если память позволяет, пробуйте Q8 и Q6.
  5. Настройте промпт, затем агента. Начинайте с промпта: он бесплатен и обратим. Посредника подключайте, когда нужна переформулировка, а не только смена тона.
  6. Оцените компромиссы. Квантизация ниже Q4 портит рассуждения, агрессивный промпт повышает риск ошибок там, где нужна аккуратность, а оркестратор добавляет задержку.

Полный отказ от облачных сервисов упирается в другие вещи: качество на сложных задачах, скорость, работу с длинным контекстом и инструментами. Всё это придётся проверять отдельно, и потолок по размеру модели на 128 ГБ объединённой памяти есть, хотя и высокий. Стиль общения решается дешевле всего: сначала тест на своих промптах, потом смена квантизации, затем системный промпт и только потом смена модели.

Если хотите действовать системно и не тонуть в потоке релизов, пригодится чек-лист по оценке новых AI-моделей: он помогает сравнивать рассуждения, контекст, скорость и требования к памяти до того, как менять рабочий стек.

Подписаться на канал