Перейти к содержанию
Публикация AiManual

Новый бенчмарк Creative Writing: 24 LLM против людей на 475 творческих промптах

Вышел первый релиз бенчмарка Creative Writing: 24 LLM сравнили с живыми авторами на 475 промптах для творческого письма. Сильнейшие frontier-модели обошли талан

Коротко

Что будет в материале

  1. 01

    Что за бенчмарк Creative Writing и зачем он нужен

  2. 02

    Как оценивают творчество: кастомная reward-модель и человеческие предпочтения

  3. 03

    Результаты: frontier-модели обошли любителей, но не профессионалов

  4. 04

    Где смотреть полные результаты и как сравнивать модели

Вышел первый релиз бенчмарка Creative Writing. В нём 24 языковые модели сравнили с живыми авторами на 475 промптах для творческого письма. Результат: сильнейшие frontier-модели уже ранжируются выше группы талантливых авторов-любителей, но профессиональные писатели лидируют с большим отрывом.

Что делает этот бенчмарк непохожим на MMLU или HumanEval: он не ищет правильный ответ. Творческое письмо субъективно, поэтому рейтинг моделирует не вкус отдельного читателя, а предпочтения большой группы читателей. Оценки выставляет кастомная reward-модель, обученная специально на человеческих предпочтениях в креативном письме.

На сайте бенчмарка можно просмотреть полные результаты, сравнить выводы моделей бок о бок и посмотреть, как устроена оценка (анонс релиза). Дальше - что именно тестировали, как читать таблицы и когда эти результаты стоит учитывать, а когда нет.

Что за бенчмарк Creative Writing и зачем он нужен

Первый релиз Creative Writing benchmark решает узкую, но практичную задачу: показать, где сейчас проходит граница между машинным и человеческим текстом в задачах на стиль, а не на логику. Авторы сравнили модели не только между собой, но и с двумя группами живых авторов. Это даёт понятную систему координат вместо абстрактного балла.

Ключевые цифры: 24 модели, 475 промптов, живые авторы

Масштаб эксперимента: 24 LLM, 475 промптов для творческого письма и живые авторы в качестве ориентира. Люди представлены как минимум двумя когортами - талантливые авторы-любители и профессиональные писатели.

ПараметрЗначение
Число моделей24 LLM
Число промптов475 заданий на творческое письмо
Группы сравненияталантливые авторы-любители, профессиональные писатели
Метод оценкикастомная reward-модель на человеческих предпочтениях
Что показывает рейтингпредпочтения большой группы читателей, а не одного человека

Чего в анонсе нет: жанрового разбиения промптов, языка заданий, размера групп авторов и имён конкретных моделей. Это не значит, что данных не существует, но в тексте релиза они не приведены, поэтому опираться на догадки не стоит.

Почему творчество потребовало отдельного бенчмарка

Стандартные бенчмарки LLM устроены вокруг проверяемого ответа: задача по математике, код, вопрос с фактом. Точность, pass@k, F1 - всё это работает, когда есть эталон. В творческом письме эталона нет: два разных текста на один и тот же промпт могут быть одинаково удачными, а выбор между ними зависит от вкуса читателя.

Именно здесь и появляется отдельный инструмент. Он не измеряет грамотность или связность напрямую, он отвечает на другой вопрос: какой текст предпочла бы большая группа читателей, если поставить варианты рядом. Похожая логика лежит в основе прикладных бенчмарков, где оценка привязана к реальному использованию, а не к абстрактной метрике (разбор прикладного подхода к оценке LLM).

Как оценивают творчество: кастомная reward-модель и человеческие предпочтения

Методика строится на кастомной reward-модели, которую обучили на человеческих предпочтениях в креативном письме. Проще говоря, это отдельная модель, которая смотрит на текст и предсказывает, насколько он понравится большой группе читателей. Универсальной метрикой её назвать нельзя: она настроена на конкретный домен, поэтому её оценки имеют смысл внутри этого домена.

Почему рейтинг не равен вашему личному вкусу

Читатели часто воспринимают лидерборд как персональную рекомендацию: возьму первую строчку, и мне понравится. С Creative Writing benchmark так не работает. Рейтинг предсказывает усреднённое предпочтение большой аудитории, а личный вкус может сильно от него отличаться: кому-то важна сухая точность формулировок, кому-то образность, кому-то ритм.

Практический вывод: высокое место в рейтинге подсказывает, что модель устроит большинство, но не гарантирует, что она устроит вас. Если вы пишете в узком жанре, с усреднённым вкусом вы можете не совпасть.

Что такое reward-модель в контексте креативного письма

Reward-модель - это обученная на оценках людей модель, которая ставит тексту балл. В обучении с подкреплением такие модели обычно направляют генерацию, здесь же они выступают судьёй. Аналогия - усреднённое мнение жюри: каждый судья субъективен, но общая оценка позволяет сравнивать работы между собой.

Детали архитектуры, объём обучающих данных и процедуру сбора человеческих оценок в анонсе не раскрывают. Если для вашей задачи важно, как именно собрали предпочтения и сколько было разметчиков, эти вопросы стоит проверять на сайте бенчмарка и в документации к релизу.

Результаты: frontier-модели обошли любителей, но не профессионалов

Главный вывод: сильнейшие frontier-модели уже ранжируются выше группы талантливых авторов-любителей, при этом профессиональные писатели лидируют с большим отрывом. Формулировка авторов важна в деталях: речь идёт о верхней группе моделей, а не о всех 24 участниках (анонс бенчмарка).

Кого конкретно обошли модели в верхней части таблицы, автор анонса не называет. Нет и абсолютных значений баллов. Поэтому корректная интерпретация звучит так: разрыв между топовыми LLM и любительским уровнем в креативном письме сократился до нуля или стал отрицательным в пользу моделей, а разрыв с профессионалами сохраняется.

Что это значит для практического использования LLM

Для повседневных творческих задач моделей уже достаточно. Черновик рассказа, варианты слоганов, тексты для соцсетей, короткие сцены - уровень, который бенчмарк описывает как талантливый любитель, для многих рабочих сценариев закрывает потребность.

Там, где нужен уровень профессионала (книга под издательство, сценарий с выверенной драматургией, сложная работа со стилем), процесс стоит строить иначе: модель как генератор вариантов и ускоритель черновика, человек как редактор и автор финального текста. Категоричных рекомендаций здесь дать нельзя: слишком многое зависит от жанра, объёма и требований к тексту.

Ограничения и риски интерпретации результатов

Ограничения следуют прямо из методики. Творческое письмо субъективно. Рейтинг отражает предпочтения большой группы читателей, а не отдельного человека. Оценки ставит кастомная reward-модель, значит качество лидерборда зависит от того, насколько хорошо она выучила человеческие предпочтения в этом домене.

Отдельный фактор - новизна. Это первый релиз бенчмарка, поэтому набор промптов, методика и итоговые позиции моделей могут меняться в следующих версиях. Подобная проблема знакома индустрии: частые обновления бенчмарков без полноценных повторных оценок искажают картину и путают читателей (почему обновления бенчмарков без переоценки вредят).

Где смотреть полные результаты и как сравнивать модели

Авторы открыли сайт бенчмарка: там доступны полные результаты, выводы моделей бок о бок и описание того, как устроена оценка. Ссылка на него есть в анонсе релиза (анонс).

Как читать таблицу результатов

Таблица устроена не как обычный лидерборд моделей. В ней рядом стоят несколько групп: LLM, талантливые авторы-любители и профессиональные писатели. Позиция модели говорит о том, какую долю предпочтений большой группы читателей она собрала бы относительно этих групп, а не об её абсолютном качестве.

Смотрите на порядок групп, а не на микроразницу между соседними моделями. Если две модели стоят рядом, разрыв между ними, скорее всего, в пределах того, что бенчмарк уверенно различает. Куда важнее, на каком месте относительно любителей и профессионалов оказалась конкретная модель.

Сравнение выводов моделей бок о бок: на что обращать внимание

Главная ценность сайта - не цифры, а примеры текстов. Возьмите промпты из тех сценариев, которые близки вашей работе, и прочитайте ответы моделей подряд. Так видно то, что не покажет никакой балл: чувство ритма, любовь к штампам, склонность к длинным описаниям, умение держать заданный тон.

Бенчмарк остаётся ориентиром, а не заменой личной проверки. Если вы выбираете модель для творческих задач, после знакомства с примерами стоит прогнать несколько собственных промптов.

Стоит ли учитывать Creative Writing benchmark при выборе LLM

Да, но как один из сигналов, а не как единственный критерий. Его сильная сторона в том, что он измеряет то, что другие бенчмарки игнорируют: стиль и предпочтения читателей. Слабая сторона - субъективность оценки, ориентация на усреднённый вкус и статус первого релиза.

Для каких задач бенчмарк наиболее релевантен

Творческое письмо в широком смысле: рассказы и короткая проза, сцены и диалоги, поэтические тексты, сценарии, креативные маркетинговые тексты, генерация идей и вариантов формулировок. В этих сценариях усреднённое читательское предпочтение работает как разумный прокси качества.

На технические и логические задачи выводы бенчмарка не переносятся: там качество определяется правильностью, а не вкусом. Границы жанров внутри самого бенчмарка в анонсе не описаны, поэтому для узкой специализации, например юридических текстов или сценариев под конкретный формат, результаты стоит проверять отдельно.

Ещё один момент для русскоязычной аудитории: в анонсе не указано, на каком языке составлены 475 промптов. Если вы пишете по-русски, считайте языковой состав набора открытым вопросом и проверяйте модель на своих текстах.

Как комбинировать с другими бенчмарками и тестами

Разумная схема: Creative Writing benchmark для творческих сценариев, отдельные тесты на следование инструкциям, на работу с кодом и на фактологию, плюс собственный набор промптов под ваши задачи. Ни один публичный бенчмарк не покрывает все сценарии, и открытая стандартизация оценки пока остаётся нерешённой задачей (как сообщество пытается стандартизировать тесты LLM).

Практический алгоритм: посмотрите позицию интересующих моделей в Creative Writing benchmark, откройте примеры выводов на сайте, выберите два-три варианта, которые выглядят ближе всего к вашему стилю, и прогоните их на своих промптах. Так вы получите решение, основанное на ваших задачах, а не на усреднённом рейтинге.

Подписаться на канал