Вышел первый релиз бенчмарка Creative Writing. В нём 24 языковые модели сравнили с живыми авторами на 475 промптах для творческого письма. Результат: сильнейшие frontier-модели уже ранжируются выше группы талантливых авторов-любителей, но профессиональные писатели лидируют с большим отрывом.
Что делает этот бенчмарк непохожим на MMLU или HumanEval: он не ищет правильный ответ. Творческое письмо субъективно, поэтому рейтинг моделирует не вкус отдельного читателя, а предпочтения большой группы читателей. Оценки выставляет кастомная reward-модель, обученная специально на человеческих предпочтениях в креативном письме.
На сайте бенчмарка можно просмотреть полные результаты, сравнить выводы моделей бок о бок и посмотреть, как устроена оценка (анонс релиза). Дальше - что именно тестировали, как читать таблицы и когда эти результаты стоит учитывать, а когда нет.
Что за бенчмарк Creative Writing и зачем он нужен
Первый релиз Creative Writing benchmark решает узкую, но практичную задачу: показать, где сейчас проходит граница между машинным и человеческим текстом в задачах на стиль, а не на логику. Авторы сравнили модели не только между собой, но и с двумя группами живых авторов. Это даёт понятную систему координат вместо абстрактного балла.
Ключевые цифры: 24 модели, 475 промптов, живые авторы
Масштаб эксперимента: 24 LLM, 475 промптов для творческого письма и живые авторы в качестве ориентира. Люди представлены как минимум двумя когортами - талантливые авторы-любители и профессиональные писатели.
| Параметр | Значение |
|---|---|
| Число моделей | 24 LLM |
| Число промптов | 475 заданий на творческое письмо |
| Группы сравнения | талантливые авторы-любители, профессиональные писатели |
| Метод оценки | кастомная reward-модель на человеческих предпочтениях |
| Что показывает рейтинг | предпочтения большой группы читателей, а не одного человека |
Чего в анонсе нет: жанрового разбиения промптов, языка заданий, размера групп авторов и имён конкретных моделей. Это не значит, что данных не существует, но в тексте релиза они не приведены, поэтому опираться на догадки не стоит.
Почему творчество потребовало отдельного бенчмарка
Стандартные бенчмарки LLM устроены вокруг проверяемого ответа: задача по математике, код, вопрос с фактом. Точность, pass@k, F1 - всё это работает, когда есть эталон. В творческом письме эталона нет: два разных текста на один и тот же промпт могут быть одинаково удачными, а выбор между ними зависит от вкуса читателя.
Именно здесь и появляется отдельный инструмент. Он не измеряет грамотность или связность напрямую, он отвечает на другой вопрос: какой текст предпочла бы большая группа читателей, если поставить варианты рядом. Похожая логика лежит в основе прикладных бенчмарков, где оценка привязана к реальному использованию, а не к абстрактной метрике (разбор прикладного подхода к оценке LLM).
Как оценивают творчество: кастомная reward-модель и человеческие предпочтения
Методика строится на кастомной reward-модели, которую обучили на человеческих предпочтениях в креативном письме. Проще говоря, это отдельная модель, которая смотрит на текст и предсказывает, насколько он понравится большой группе читателей. Универсальной метрикой её назвать нельзя: она настроена на конкретный домен, поэтому её оценки имеют смысл внутри этого домена.
Почему рейтинг не равен вашему личному вкусу
Читатели часто воспринимают лидерборд как персональную рекомендацию: возьму первую строчку, и мне понравится. С Creative Writing benchmark так не работает. Рейтинг предсказывает усреднённое предпочтение большой аудитории, а личный вкус может сильно от него отличаться: кому-то важна сухая точность формулировок, кому-то образность, кому-то ритм.
Практический вывод: высокое место в рейтинге подсказывает, что модель устроит большинство, но не гарантирует, что она устроит вас. Если вы пишете в узком жанре, с усреднённым вкусом вы можете не совпасть.
Что такое reward-модель в контексте креативного письма
Reward-модель - это обученная на оценках людей модель, которая ставит тексту балл. В обучении с подкреплением такие модели обычно направляют генерацию, здесь же они выступают судьёй. Аналогия - усреднённое мнение жюри: каждый судья субъективен, но общая оценка позволяет сравнивать работы между собой.
Детали архитектуры, объём обучающих данных и процедуру сбора человеческих оценок в анонсе не раскрывают. Если для вашей задачи важно, как именно собрали предпочтения и сколько было разметчиков, эти вопросы стоит проверять на сайте бенчмарка и в документации к релизу.
Результаты: frontier-модели обошли любителей, но не профессионалов
Главный вывод: сильнейшие frontier-модели уже ранжируются выше группы талантливых авторов-любителей, при этом профессиональные писатели лидируют с большим отрывом. Формулировка авторов важна в деталях: речь идёт о верхней группе моделей, а не о всех 24 участниках (анонс бенчмарка).
Кого конкретно обошли модели в верхней части таблицы, автор анонса не называет. Нет и абсолютных значений баллов. Поэтому корректная интерпретация звучит так: разрыв между топовыми LLM и любительским уровнем в креативном письме сократился до нуля или стал отрицательным в пользу моделей, а разрыв с профессионалами сохраняется.
Что это значит для практического использования LLM
Для повседневных творческих задач моделей уже достаточно. Черновик рассказа, варианты слоганов, тексты для соцсетей, короткие сцены - уровень, который бенчмарк описывает как талантливый любитель, для многих рабочих сценариев закрывает потребность.
Там, где нужен уровень профессионала (книга под издательство, сценарий с выверенной драматургией, сложная работа со стилем), процесс стоит строить иначе: модель как генератор вариантов и ускоритель черновика, человек как редактор и автор финального текста. Категоричных рекомендаций здесь дать нельзя: слишком многое зависит от жанра, объёма и требований к тексту.
Ограничения и риски интерпретации результатов
Ограничения следуют прямо из методики. Творческое письмо субъективно. Рейтинг отражает предпочтения большой группы читателей, а не отдельного человека. Оценки ставит кастомная reward-модель, значит качество лидерборда зависит от того, насколько хорошо она выучила человеческие предпочтения в этом домене.
Отдельный фактор - новизна. Это первый релиз бенчмарка, поэтому набор промптов, методика и итоговые позиции моделей могут меняться в следующих версиях. Подобная проблема знакома индустрии: частые обновления бенчмарков без полноценных повторных оценок искажают картину и путают читателей (почему обновления бенчмарков без переоценки вредят).
Где смотреть полные результаты и как сравнивать модели
Авторы открыли сайт бенчмарка: там доступны полные результаты, выводы моделей бок о бок и описание того, как устроена оценка. Ссылка на него есть в анонсе релиза (анонс).
Как читать таблицу результатов
Таблица устроена не как обычный лидерборд моделей. В ней рядом стоят несколько групп: LLM, талантливые авторы-любители и профессиональные писатели. Позиция модели говорит о том, какую долю предпочтений большой группы читателей она собрала бы относительно этих групп, а не об её абсолютном качестве.
Смотрите на порядок групп, а не на микроразницу между соседними моделями. Если две модели стоят рядом, разрыв между ними, скорее всего, в пределах того, что бенчмарк уверенно различает. Куда важнее, на каком месте относительно любителей и профессионалов оказалась конкретная модель.
Сравнение выводов моделей бок о бок: на что обращать внимание
Главная ценность сайта - не цифры, а примеры текстов. Возьмите промпты из тех сценариев, которые близки вашей работе, и прочитайте ответы моделей подряд. Так видно то, что не покажет никакой балл: чувство ритма, любовь к штампам, склонность к длинным описаниям, умение держать заданный тон.
Бенчмарк остаётся ориентиром, а не заменой личной проверки. Если вы выбираете модель для творческих задач, после знакомства с примерами стоит прогнать несколько собственных промптов.
Стоит ли учитывать Creative Writing benchmark при выборе LLM
Да, но как один из сигналов, а не как единственный критерий. Его сильная сторона в том, что он измеряет то, что другие бенчмарки игнорируют: стиль и предпочтения читателей. Слабая сторона - субъективность оценки, ориентация на усреднённый вкус и статус первого релиза.
Для каких задач бенчмарк наиболее релевантен
Творческое письмо в широком смысле: рассказы и короткая проза, сцены и диалоги, поэтические тексты, сценарии, креативные маркетинговые тексты, генерация идей и вариантов формулировок. В этих сценариях усреднённое читательское предпочтение работает как разумный прокси качества.
На технические и логические задачи выводы бенчмарка не переносятся: там качество определяется правильностью, а не вкусом. Границы жанров внутри самого бенчмарка в анонсе не описаны, поэтому для узкой специализации, например юридических текстов или сценариев под конкретный формат, результаты стоит проверять отдельно.
Ещё один момент для русскоязычной аудитории: в анонсе не указано, на каком языке составлены 475 промптов. Если вы пишете по-русски, считайте языковой состав набора открытым вопросом и проверяйте модель на своих текстах.
Как комбинировать с другими бенчмарками и тестами
Разумная схема: Creative Writing benchmark для творческих сценариев, отдельные тесты на следование инструкциям, на работу с кодом и на фактологию, плюс собственный набор промптов под ваши задачи. Ни один публичный бенчмарк не покрывает все сценарии, и открытая стандартизация оценки пока остаётся нерешённой задачей (как сообщество пытается стандартизировать тесты LLM).
Практический алгоритм: посмотрите позицию интересующих моделей в Creative Writing benchmark, откройте примеры выводов на сайте, выберите два-три варианта, которые выглядят ближе всего к вашему стилю, и прогоните их на своих промптах. Так вы получите решение, основанное на ваших задачах, а не на усреднённом рейтинге.