Перейти к содержанию
Публикация AiManual

Могут ли foundation-модели размечать данные на уровне человека?

Корреляция 0.5, позиционное смещение и тяга к длинным ответам: разбираем исследование о том, можно ли доверять GPT-4 оценку качества других LLM. Практические вы

Коротко

Что будет в материале

  1. 01

    Введение: проблема оценки качества ответов LLM

  2. 02

    Методология исследования: как сравнивали оценки GPT-4 и людей

  3. 03

    Результаты: корреляция между оценками GPT-4 и людей

  4. 04

    Систематические смещения GPT-4 при оценке

Короткий ответ: могут, но с существенными оговорками. Контролируемое исследование, сравнившее оценки GPT-4 и профессиональных разметчиков из Scale AI, показало среднюю корреляцию около 0.5. Этого достаточно, чтобы сохранить общий порядок моделей в рейтинге, но недостаточно для полной замены человека. Систематические смещения GPT-4: позиционное предпочтение первого ответа, тяга к длинным текстам и завышение оценок моделям, обученным на синтетических данных от других LLM.

Для ML-инженеров и продакт-менеджеров это означает конкретный практический вывод: LLM-оценка применима как дешёвый предварительный фильтр, но критичные решения о качестве моделей требуют человеческого контроля. Особенно в задачах с однозначно правильным ответом, где корреляция падает ниже среднего уровня.

Введение: проблема оценки качества ответов LLM

Число открытых инструкционных моделей растёт быстрее, чем возможности команд вручную оценивать их качество. Каждый релиз требует сравнения с конкурентами по сотням промптов, а платформы разметки вроде Scale AI стоят дорого и работают медленно. Один цикл человеческой оценки может занимать дни, тогда как модель выдаёт ответы за секунды.

Отсюда естественный вопрос: можно ли использовать foundation-модели, такие как GPT-4, для разметки данных вместо людей? Если да, это сократит стоимость итераций в десятки раз. Если нет, автоматическая оценка рискует закрепить неверные приоритеты в разработке.

Исследователи провели прямой эксперимент. Собрали предпочтения от людей через Scale AI и от GPT-4 для одного набора открытых инструкционных моделей, затем сравнили получившиеся рейтинги. Результат оказался неоднозначным: корреляция есть, но её уровень сильно зависит от типа задачи и подвержен влиянию трёх систематических смещений.

Эта тема напрямую связана с более широкой проблемой фрагментации тестирования LLM: когда каждый разработчик запускает собственные бенчмарки, единой картины не возникает. Вопрос о том, кто оценивает ответы, человек или другая модель, становится частью этой фрагментации.

Методология исследования: как сравнивали оценки GPT-4 и людей

Эксперимент построен на попарных сравнениях. Каждой паре моделей давали один и тот же промпт, получали два ответа, и оценщик выбирал лучший. Оценщиками выступали две группы: профессиональные разметчики через платформу Scale AI и GPT-4 с одинаковыми инструкциями.

Сбор данных предпочтений

Использовался набор открытых инструкционных моделей, покрывающий разные архитектуры и размеры. Задачи включали несколько типов: генерация идей, написание текстов, ответы на вопросы с фактической проверкой, решение задач кодинга. Для каждого промпта и пары моделей собиралось предпочтение: какой из двух ответов лучше.

Человеческие разметчики работали по стандартному протоколу Scale AI с инструкциями по качеству и фактической точности. GPT-4 получал тот же промпт, те же два ответа и просьбу выбрать лучший. Важно: модель не знала, какие именно системы сгенерировали ответы, чтобы исключить прямое предпочтение по имени.

Расчет рейтингов Elo

Попарные предпочтения преобразовывались в рейтинги Elo, заимствованные из шахматной системы. Каждая модель получала числовой балл, отражающий её относительную силу: победа над сильным соперником даёт больше очков, чем победа над слабым. Рейтинги считались отдельно для человеческих предпочтений и для предпочтений GPT-4, затем сравнивались.

Такой подход позволяет увидеть не только абсолютные позиции моделей, но и расстояния между ними. Если GPT-4 ставит модель A выше модели B с тем же отрывом, что и люди, корреляция высокая. Если порядок сохраняется, но расстояния искажаются, это уже повод для осторожности.

Результаты: корреляция между оценками GPT-4 и людей

Средняя корреляция между рейтингами Elo от GPT-4 и от людей составила 0.5. Это умеренный показатель. Общий порядок моделей сохраняется: сильные модели остаются сильными, слабые - слабыми. Но расхождения в отдельных парах существенные, и они концентрируются в определённых типах задач.

Цифра 0.5 означает, что GPT-4 объясняет примерно четверть дисперсии человеческих оценок. Для исследовательских целей этого может быть достаточно, для производственных решений о выборе модели - нет.

Высокая корреляция в творческих задачах

В задачах генерации идей и написания креативных текстов корреляция поднимается выше среднего. GPT-4 улавливает общие предпочтения: связность, оригинальность, соответствие стилю. Здесь нет однозначно правильного ответа, поэтому субъективные критерии, которые модель выучила из обучающих данных, совпадают с человеческими.

Пример: промпт «предложи пять нестандартных способов использования нейросетей в логистике». Люди и GPT-4 склонны выбирать ответ с более разнообразными идеями, даже если часть из них спорная. Модель оценивает креативность примерно так же, как разметчик.

Низкая корреляция в задачах с однозначным ответом

В задачах кодинга и фактической проверки корреляция падает. GPT-4 может предпочесть стилистически аккуратный, но неработающий код рабочему, но менее элегантному. Или выбрать ответ с уверенной формулировкой, содержащий фактическую ошибку, вместо корректного, но осторожного.

Это критично для оценки моделей, которые должны быть точными, а не просто убедительными. Подробнее о том, как модели завышают уверенность и почему это опасно, мы разбирали в статье о методах оценки уверенности LLM.

Систематические смещения GPT-4 при оценке

Три смещения выявлены в эксперименте. Каждое по отдельности искажает рейтинги, а вместе они могут привести к выбору неоптимальной модели для production.

Позиционное смещение

GPT-4 склонен выбирать первый ответ из пары независимо от качества. При случайном порядке предъявления это добавляет шум, при фиксированном - систематически завышает модели, которые чаще оказываются на первой позиции. В эксперименте позиционное смещение проявлялось стабильно: доля выбора первого ответа превышала 50% даже при контроле качества.

Для практики это означает необходимость рандомизировать порядок ответов при каждом сравнении и усреднять результаты по нескольким перестановкам. Одиночное сравнение с фиксированным порядком даёт смещённую оценку.

Предпочтение длинных и подробных ответов

GPT-4 ассоциирует длину с качеством. Модель систематически выбирает более многословные ответы, даже если они содержат воду или отклоняются от сути запроса. Это завышает рейтинги моделей, которые генерируют развёрнутые тексты, и занижает позиции лаконичных, но точных систем.

Следствие: если вы используете GPT-4 для отбора моделей, вы рискуете выбрать генератор текстов, а не решатель задач. В production это приводит к росту затрат на инференс без улучшения качества ответов.

Предпочтение LLM-сгенерированных данных

GPT-4 завышает оценки моделям, обученным на данных, сгенерированных другими LLM. Такие модели получают от GPT-4 более высокие рейтинги, чем от людей. Причина: похожесть стиля. Ответы, сгенерированные моделями, обученными на синтетике, ближе к тому, что GPT-4 сам считает «хорошим ответом».

Это создаёт петлю обратной связи: LLM-оценка поощряет модели, обученные на LLM-данных, что ускоряет деградацию разнообразия и фактической точности. Вопрос о том, существуют ли модели, обученные только на человеческих данных, и почему это важно, мы разбирали в статье о чистом претрейнинге.

Ограничения LLM-оценивания и пути улучшения

Результаты LLM-оценки чувствительны к формулировке задачи. Изменение шкалы оценок, порядка ответов или инструкции может привести к другим результатам. Это ограничивает воспроизводимость и делает сравнение между разными исследованиями ненадёжным.

Чувствительность к шкале оценок и формату запроса

Один и тот же набор ответов может получить разные рейтинги при использовании бинарного выбора («какой ответ лучше?») и шкалы от 1 до 5. GPT-4 также реагирует на формулировку: просьба «оценить фактическую точность» даёт иной результат, чем «оценить полезность». Формат запроса становится скрытой переменной, которую редко контролируют.

Практическое следствие: если вы внедряете LLM-оценку в пайплайн, зафиксируйте промпт и шкалу как часть конфигурации. Изменение промпта - это изменение метрики, и его нужно версионировать.

Рекомендации по использованию LLM-оценки

Используйте LLM-оценку для предварительного скрининга: отсеять явно слабые модели, сузить пул кандидатов перед человеческой проверкой. В творческих задачах с высокой корреляцией можно доверять автоматическим рейтингам больше. В задачах с однозначным ответом, особенно в кодинге, человеческий контроль обязателен.

Калибруйте оценку: усредняйте результаты по нескольким перестановкам порядка ответов, используйте несколько формулировок промпта, сравнивайте с эталонной человеческой разметкой на подвыборке. Это снижает влияние позиционного смещения и чувствительности к формату.

Проблема расхождения между бенчмарками и реальной работой модели рассмотрена в статье о evaluation awareness. Там же показано, как модели могут завышать метрики на тестах, что напрямую связано с вопросом доверия к автоматическим оценкам.

Заключение: перспективы автоматической разметки

Foundation-модели могут размечать данные на уровне, частично сопоставимом с человеком. Корреляция 0.5, систематические смещения и вариативность по типам задач означают, что полная замена человеческой разметки сегодня неоправданна. LLM-оценка работает как ускоритель: она дешёвая, быстрая и способна отсеять большую часть неподходящих кандидатов.

С улучшением методологии: рандомизация порядка, калибровка промптов, комбинирование с человеческой проверкой, автоматическая разметка станет надёжнее. Но пока критические решения о качестве моделей требуют человека. Особенно в задачах, где цена ошибки высока: код, факты, безопасность.

Для тех, кто внедряет LLM-оценку в production, ключевой вывод: используйте её как фильтр, а не как истину. Фиксируйте промпты, усредняйте по перестановкам, проверяйте на человеческой подвыборке. Тогда автоматическая разметка даст реальную экономию без потери качества.

Подписаться на канал