Что случилось в тесте humanizer-ru: короткий ответ
Открытый проект humanizer-ru обрабатывает русский текст, написанный чат-ботами. В одном из замеров автор взял 12 сохранённых ответов Алисы, GigaChat и Le Chat и прогнал их через свой пайплайн. Оценку «машинности» выставляла модель-судья: среднее значение упало с 0,846 до 0,438.
Падение почти вдвое выглядит убедительно ровно до момента, когда начинаешь проверять, что именно изменилось в текстах. Две контрольные пары показали, что число может рухнуть без единой содержательной правки.
- В первой паре ответ «Столица Австралии - Канберра» остался дословно тем же, а оценка упала с 0,95 до 0,10. Из текста убрали только строки с подписью чат-бота.
- Во второй паре текст отличался лишь завершающим переводом строки. Оценки разошлись с 0,9 до 0,3.
Автор отозвал интерпретацию разницы средних как показателя качества редактуры. Исходные данные и пересчёт остались в репозитории проекта. Дальше разберём, что измерял замер, чем редактура отличается от технической очистки артефактов и как проверить приведённые числа самому.
Что именно измерял замер «машинности»
Оценка «машинности» в этом тесте это число от 0 до 1, которое выставляет отдельная языковая модель, модель-судья. Человек в замере не участвовал, независимая разметка не привлекалась. Чем выше число, тем более «машинным» судья считал текст.
На входе было 12 сохранённых ответов от трёх чат-ботов: Алиса, GigaChat, Le Chat. Средняя оценка до обработки 0,846, после 0,438. Схема простая: один и тот же текст до и после, один и тот же вопрос судье.
Как работала модель-судья и что она видела
Судья получала текст целиком: основной ответ, служебные строки, форматирование. Критерий касался стиля, а не смысла. Правильность фактов не проверялась, задача стояла узкая: оценить, насколько текст похож на машинную генерацию.
Последствие такого дизайна видно на примере с Канберрой. Текст ответа не менялся ни на символ, а оценка рухнула с 0,95 до 0,10. Судья реагировала на подпись чат-бота как на сильный признак машинного происхождения. Внутреннюю логику судьи мы не знаем и приписывать ей намерения не будем: известен только вход и выход.
Почему среднее значение 0,846 → 0,438 выглядит убедительно, но не доказывает улучшение
Среднее по 12 ответам упало почти вдвое, и как визуальный аргумент это работает. Проблема в том, что в одном замере смешались две разные операции: правка текста и удаление служебных элементов. Контрольные пары показали, что падение оценки может дать одна лишь очистка.
Значит, снижение среднего нельзя записать в заслугу редактуре. Автор отозвал этот вывод. Сами числа остались в силе, изменился их смысл: они измеряют не качество редактуры, а нечто более широкое и куда менее определённое.
Оговорка важная: из теста не следует, что редактура вообще не влияет на оценку. Следует другое - в этом конкретном замере эффект редактуры невозможно отделить от эффекта очистки.
Две пары, которые сломали интерпретацию
Контрольная пара это текст, который не должен меняться по смыслу. Если оценка всё равно меняется, метрика реагирует на что-то постороннее. В тесте humanizer-ru таких пар оказалось две, и обе разрушили первоначальный вывод.
Пара 1: «Столица Австралии - Канберра» и удаление подписи
Ответ на вопрос о столице Австралии остался дословно тем же. Ни одно слово не переписано, формулировка не тронута. Единственное действие: удалены строки с подписью чат-бота. Оценка «машинности» при этом упала с 0,95 до 0,10, то есть на 0,85 балла.
Разница в 0,85 балла на пустом месте. Подпись не несёт смысла для читателя, но для модели-судьи она оказалась сильным маркером. Практический вывод: удаление подписи это техническая очистка, а не редактура, однако метрика такого различия не делает.
Утверждение ограничено одним тестом. Что подпись всегда даёт такой эффект, из этой пары не следует.
Пара 2: завершающий перевод строки и разброс 0,9 → 0,3
Во второй паре тексты различались лишь завершающим переводом строки. Невидимый символ в конце, который человек обычно не считает частью текста. Оценки: 0,9 и 0,3. Разница 0,6 балла.
Форматирование решает больше, чем кажется. Перевод строки это технический артефакт, содержательной правки нет, а судья выдала результат, отличающийся в три раза. И снова: единичный пример, а не закономерность.
Редактура текста и техническая очистка артефактов это разные задачи
Редактура меняет содержание, стиль, структуру, формулировки. Очистка убирает служебный мусор: подписи, лишние пустые строки, завершающие переводы строк. Работы разные, навыки разные, и метрики для них нужны разные.
Что считать артефактом, а что частью текста
Артефакт не несёт смысла для читателя. Подпись «ответ сгенерирован моделью», дублирующиеся пустые строки, хвостовой перевод строки, служебные разделители. Часть текста это то, что влияет на смысл или стиль: слова, порядок абзацев, формулировки.
Граница не всегда очевидна. В отдельных форматах подпись несёт функцию, например при цитировании или в переписке. Ещё один класс незаметных служебных элементов - текстовые водяные метки: они меняют выбор токенов, но читатель их не видит. Прежде чем вычищать, стоит определить, что в вашем случае считается артефактом.
Почему смешивание задач ломает метрику
Когда в одном замере и удаляют подписи, и переписывают текст, а смотрят на итоговое среднее, вклад каждой операции остаётся неизвестным. В тесте humanizer-ru среднее упало с 0,846 до 0,438, и контрольные пары показали: часть этого падения дала только очистка.
Вывод «редактура улучшила текст» из такого замера не следует, и автор его отозвал. Похожая ошибка встречается в оценке AI-агентов, когда критерии LLM-судьи настроены так, что реальные улучшения маскируются: разбор кейса Similarweb с LangSmith хорошо показывает этот механизм. Очистка нужна, но измерять её тем же числом, что и редактуру, значит заранее получить мутный результат.
Как проверить эти числа самостоятельно
Автор оставил исходные данные и пересчёт в репозитории проекта humanizer-ru. Верить на слово не обязательно: при открытых данных замер воспроизводится.
Что лежит в открытом снимке данных
Снимок содержит исходные ответы и результаты пересчёта: какие тексты брались, какие оценки выставлялись до и после, как считалось среднее. Состав файлов в описании не детализирован, придумывать структуру репозитория не будем. Точный перечень смотрите в самом репозитории.
Пошаговый пересчёт: что нужно сделать
- Откройте открытый снимок данных в репозитории humanizer-ru.
- Возьмите исходные 12 ответов Алисы, GigaChat и Le Chat.
- Проверьте пару с Канберрой: текст ответа не менялся, удалены только строки с подписью.
- Проверьте вторую пару: отличие только в завершающем переводе строки.
- Сверьте сохранённые оценки до и после (0,95 и 0,10; 0,9 и 0,3) и пересчитайте среднее: должны получиться 0,846 и 0,438.
- Если есть доступ к той же модели-судье, прогоните тексты заново. Другой судья может дать другие числа.
Обещать совпадение оценок при повторном прогоне нельзя: результат языковой модели зависит от версии, параметров сэмплирования и формата промпта. Логику можно проверить и на сохранённых числах. О том, почему сравнение по одному числу почти всегда даёт сюрпризы, есть отдельный разбор: ограничения бенчмарков и завышенные ожидания от них.
Что это значит для оценки AI-текста и инструментов вроде humanizer-ru
Ограничения модели-судьи как измерителя
Модель-судья это та же LLM, и её чувствительность к форматированию и служебным строкам видна прямо в цифрах: 0,95 и 0,10 для одного и того же текста, отличающегося только подписью. Инструмент рабочий, но не эталон. В предоставленных материалах независимого подтверждения этих чисел нет, единственный путь проверки - открытый снимок данных.
Добавьте чувствительность к длине, формату промпта и версии модели. Оценка становится сопоставимой только внутри одного прогона с фиксированными настройками.
Практический чек-лист: как не повторить ошибку
- Разделите редактуру и техническую очистку, минимум на уровне отдельных замеров.
- Добавьте контрольные пары, где текст не меняется: они показывают шум метрики.
- Проверьте, как оценка реагирует на подписи, пустые строки и хвостовые переводы строк.
- Не трактуйте разницу средних как доказательство качества, пока артефакты не исключены.
- Сохраняйте исходные данные и пересчёт, чтобы результат мог проверить кто-то другой.
- Помните, что модель-судья не человек и не независимый эксперт.
Гарантии чек-лист не даёт. Он снижает риск получить красивое число, за которым нет реальных изменений. Если задача близка к обработке текста узкой моделью, полезно посмотреть, как выбирать модель под конкретную операцию: когда узкий fine-tune лучше универсального чат-LLM при очистке русской диктовки.
Итог: что осталось после отзыва интерпретации
Средняя оценка «машинности» в тесте humanizer-ru упала с 0,846 до 0,438. Этот результат нельзя читать как доказательство качества редактуры: две контрольные пары показали, что число меняется без содержательных правок, с 0,95 до 0,10 при удалении подписи и с 0,9 до 0,3 при различии в завершающем переводе строки.
Автор отозвал вывод, который из среднего следовал, и оставил в репозитории исходные данные, оценки и пересчёт. Оценка «машинности» от модели-судьи остаётся полезным инструментом, но требует контрольных пар, разделения задач и осторожности в трактовке.