Проект Humor Arena сравнил 20 версий языковых моделей по чувству юмора. Тест шёл на 360 фиксированных промптах-шутках, на каждый промпт модель выдавала по четыре шутки, а названия моделей скрывались от судьи.
Лидер рейтинга - Fable 5 с 66,8 балла на 100 сравнений, у Fable 5.1 - 58,2. Победа даёт одно очко, ничья - половину, поэтому балл показывает долю выигранных пар, а не абсолютное качество шуток. Оценки выставлял специально дообученный open-source судья, который, по заявлению авторов, лучше коррелирует с человеческими предпочтениями, чем другие модели.
Что такое Humor Arena и зачем понадобился отдельный тест на юмор
Humor Arena - проект, авторы которого решили измерить чувство юмора у языковых моделей отдельным замером. В сравнении участвовали 20 версий LLM, набор заданий составил 360 фиксированных промптов-шуток, и на каждый промпт каждая модель генерировала четыре шутки.
Логика простая. Стандартные бенчмарки проверяют то, где есть правильный ответ: математику, код, извлечение фактов. У шутки правильного ответа нет, и метрика вроде точного совпадения строк здесь бесполезна. Значит, нужен отдельный механизм оценки, и в Humor Arena им стала модель-судья.
Скрытие названий моделей от судьи - ключевая деталь методики. Судья видит только текст шуток, без бренда и номера версии, и не может отдать очко за громкое имя линейки.
Методика: 360 промптов, 20 моделей и слепой судья
Сравнение строится на нескольких элементах, и каждый из них влияет на то, что означают итоговые числа:
- 360 промптов-шуток, одинаковых для всех участников;
- четыре шутки на промпт от каждой модели;
- 20 версий LLM в одном рейтинге;
- скрытые названия моделей на входе у судьи.
Фиксированный набор промптов означает, что все модели получали одни и те же задания, а не подстраивались под удобную тему. Четыре шутки на промпт дают судье материал для выбора: сравнивать один вариант с одним слишком грубо, четыре повышают шанс поймать разницу в стиле, попадании и подаче.
Слепота снимает часть предвзятости, но не всю. У LLM-судей фиксируют позиционное смещение (склонность выбирать первый ответ) и предпочтение длинных, подробных ответов. Разбор исследования о разметке данных foundation-моделями приводит конкретику: корреляция с оценками людей около 0,5, а для задач с однозначным правильным ответом она ниже, чем для творческих.
Почему судья - open-source и дообученный
Оценивать юмор людьми дорого: нужны разметчики, инструкции и контроль согласованности между ними. Авторы Humor Arena пошли другим путём и дообучили open-source модель под роль судьи. Открытые веса дают воспроизводимость: метод можно повторить, а не принимать на веру.
Заявление авторов звучит так: их судья лучше коррелирует с человеческими предпочтениями, чем другие модели. Это заявление, а не независимо подтверждённый факт. Контекст важен: у LLM-судей есть систематические смещения, и сила связи с человеческими оценками зависит от типа задачи. Для генерации идей она выше, для кодинга ниже.
Как считались очки: победа, ничья и 100 сравнений
Подсчёт устроен как в турнире. Победа в сравнении приносит одно очко, ничья - половину. Итоговый балл - это доля очков от 100 сравнений.
Оценка 66,8 у Fable 5 означает 66,8 очка из 100 возможных, то есть примерно две трети сравнений в её пользу с учётом ничьих. Формула простая, но она объясняет главное: 66,8 - это частота успеха в конкретном наборе пар, а не универсальный балл качества.
Результаты: Fable 5 лидирует, но с оговорками
Верхнюю часть рейтинга заняли две версии одной линейки. Fable 5 - 66,8 балла на 100 сравнений, Fable 5.1 - 58,2. Разрыв между ними 8,6 балла.
Оба результата выше половины, то есть обе модели чаще выигрывали, чем проигрывали, в слепых парах. На фоне 20 участников это заметный результат, но именно слово «заметный» здесь уместнее слова «доказанный».
Что означают 66,8 и 58,2 балла
Это доля очков, а не абсолютная оценка юмора. Модель с 66,8 не «смешная на 66,8 процента»: балл говорит, как часто её шутки выигрывали у шуток соперников, когда судья не знал, чей текст читает.
58,2 у Fable 5.1 - тоже сильный показатель, больше половины сравнений в её пользу. Разница в 8,6 балла выглядит солидной, но авторы предупреждают: у моделей в верхней части рейтинга интервалы неопределённости пересекаются. Значит, превосходство Fable 5 над Fable 5.1 нельзя считать статистически доказанным.
Аудит судьи: 1400 оценок от 50 человек - что это доказывает и что нет
Отдельный этап проекта - аудит качества судьи. Он опирался на 1400 оценок от 50 человек. Задача аудита: понять, насколько вердикты судьи согласуются с человеческими предпочтениями.
Чего этот аудит не делает, так это не проверяет заново выводы Fable 5.1. Это не новое человеческое тестирование рейтинга. Люди оценивали работу судьи на отобранных парах, а не прогоняли 360 промптов заново и не выносили вердикт по всей таблице.
Разница принципиальная. Аудит инструмента отвечает на вопрос «можно ли доверять измерителю». Проверка рейтинга отвечает на вопрос «верны ли конкретные числа и порядок моделей». Это два разных этапа, и второй человеческими силами в описанном проекте не подтверждался.
Практический смысл для читателя: строка «судья прошёл аудит» не равна строке «рейтинг подтверждён людьми».
Ограничения автоматической оценки юмора
Выводы ограничивают три вещи: приблизительность самих оценок, пересекающиеся интервалы неопределённости и природа предмета измерения.
Почему оценки приблизительные
Авторы прямо подчёркивают, что оценки приблизительные из-за масштабирования. Баллы приводятся к шкале 100 сравнений, и такое приведение вносит погрешность. Конкретных формул авторы не раскрывают, но сама оговорка важна: 66,8 и 58,2 - округлённые ориентиры, а не измерения с точностью до десятых.
Проблема не уникальна для юмора. Материал о стандартизации открытых бенчмарков LLM показывает, что расхождения между реализациями одного и того же теста меняют и абсолютные баллы, и порядок моделей.
Пересекающиеся интервалы неопределённости
У моделей в верхней части рейтинга интервалы неопределённости пересекаются. Аналогия с линейкой: если два измерения дают 66,8 и 58,2 при погрешности в несколько баллов, часть разницы может целиком уйти в шум.
Добавьте к этому сам предмет. Юмор зависит от языка, культуры, контекста и аудитории. Шутка, которая работает для носителя английского, часто рассыпается в переводе или в другой среде. Судья-модель оценивает текст по своим внутренним представлениям о смешном, и эти представления не универсальны.
Итог по ограничениям: рейтинг измеряет, как часто шутки модели выигрывали у соперников по версии конкретного судьи на конкретном наборе промптов. Расширять выводы дальше этой формулировки не стоит.
Можно ли доверять Humor Arena при выборе модели
Как интерпретировать рейтинг без иллюзий
Рейтинг показывает, что Fable 5 чаще выигрывал в слепых сравнениях на фиксированном наборе промптов. Он не гарантирует, что модель окажется смешнее в вашем продукте, на вашей аудитории и вашем языке.
Что из таблицы взять можно: сигнал, что линейка Fable сильна в генерации шуток. Что взять нельзя: утверждение «Fable 5 - лучшая модель для юмора» без оговорок. Пересекающиеся интервалы и приблизительность оценок такого права не дают.
Осторожность нужна и с любыми замерами, где модель оценивает сама себя. Сравнение методов оценки уверенности LLM показывает, что разные способы измерения дают разную калибровку, а самооценка модели после RLHF плохо предсказывает реальную точность.
Что делать, если юмор важен для вашей задачи
Практический путь такой: взять Humor Arena как отправную точку, а дальше прогнать две-три модели из верхней части на собственных промптах. Соберите 20-30 типовых запросов вашего продукта, сгенерируйте варианты и отдайте их на оценку людям из целевой аудитории.
Автоматический судья ускоряет отбор, но не заменяет человеческую оценку. Если юмор - часть продукта, разметка нескольких десятков примеров живыми людьми обходится дешевле, чем релиз с шутками, которые никого не смешат.
Держите в голове и масштаб проблемы: любой отдельный бенчмарк измеряет узкий навык. Разбор бенчмарка выживания агента хорошо показывает, как тест с броским названием проверяет конкретный набор умений, а не общую пригодность модели.
Итог: что мы узнали из Humor Arena
Humor Arena сравнила 20 версий LLM на 360 фиксированных промптах-шутках, по четыре шутки на промпт, со слепым судьёй. Лидер - Fable 5 с 66,8 балла на 100 сравнений, у Fable 5.1 - 58,2. Победа приносит одно очко, ничья - половину.
Ограничения в силе: оценки приблизительные из-за масштабирования, интервалы неопределённости у верхних моделей пересекаются, а аудит судьи на 1400 оценках от 50 человек не заменяет человеческое тестирование выводов Fable 5.1.
Рабочий вывод: держите Humor Arena в списке ориентиров, проверяйте кандидатов на своих промптах и не строите выбор модели на одной таблице.