Перейти к содержанию
Публикация AiManual

Креативность LLM-агентов: как измерить новизну и почему агенты проигрывают людям в ML-задачах

Разбор исследования COLM 2026 о креативности LLM-агентов: как разложить новизну на P- и H-креативность, зачем измерять impact и feasibility и почему оригинальны

Коротко

Что будет в материале

  1. 01

    Что такое креативность LLM-агентов и зачем её измерять

  2. 02

    Как разложить креативность на измеримые компоненты: P- и H-креативность, impact и feasibility

  3. 03

    Методология исследования: агенты, задачи и метрики

  4. 04

    Результаты: почему высокая новизна агентов не превращается в результат

Что такое креативность LLM-агентов и зачем её измерять

Креативность LLM-агента здесь означает способность находить решения, которые одновременно новые и рабочие. Исследование «Can LLM Agents Discover? Evaluating Creativity on ML Engineering Tasks» опубликовано на COLM 2026; его авторы — Shitanshu Bhushan, Yunxiang Zhang и профессор Lu Wang из University of Michigan. Главный вопрос работы звучит прямо: могут ли LLM-агенты совершать открытия, если на реальных ML-исследовательских задачах они всё ещё уступают лучшему человеку. Препринт на arXiv, код проекта

Чтобы ответить на этот вопрос, авторы превращают креативность из размытой характеристики в набор метрик. В основе лежит стандартное определение Марка А. Ранко и Гарретта Дж. Йегера: креативность — это производство идей или продуктов, которые одновременно оригинальны и полезны, то есть эффективны или уместны. В этом контексте креативность означает конкретную инженерную ценность: нашёл ли агент неочевидный ход и довёл ли его до работающего результата. Источник

Главный вывод для практики короткий. Новизну агента нужно измерять по четырём осям, а проигрыш людям объясняется не слабой фантазией, а тем, что новизна плохо конвертируется в результат. Дальше разберём, из чего складывается такая оценка и где именно теряется преимущество.

Почему агенты пока не заменяют людей в ML-исследованиях

Новостей о прорывах LLM хватает: системы вроде AlphaEvolve и AI-учёного Kosmos, а OpenAI заявила о решении задачи Навье — Стокса. Такие сообщения формируют ожидание, что автономные агенты вот-вот начнут делать научные открытия. На реальных ML-задачах картина скромнее: агенты не дотягивают до топ-1 человека. Источник

Заявление OpenAI стоит воспринимать именно как заявление, а не как подтверждённый факт. По данным The Guardian, компания сообщила, что задачу решала внутренняя система мощнее её актуальной модели GPT-6 Astra, а около 10 000 AI-агентов работали над проблемой одновременно и пришли к решению за 88 часов. Однако вокруг приоритета развернулся спор: математик Тристан Бакмастер заявил, что OpenAI ускорила работу, узнав о готовящемся прорыве его и исследователя из Anthropic, и выразил обеспокоенность тем, что их незавершённая работа хранилась в модели Codex. OpenAI отрицала использование работы пары. The Guardian

Стандартное объяснение разрыва между громкими заявлениями и отставанием на реальных задачах: фреймворк и скаффолдинг, к которым у модели есть доступ. Более удачная обвязка якобы позволяет эффективнее искать в пространстве решений. Только что конкретно значит «искать эффективнее» и как это измерить количественно? Если дать ответ, станет понятно, почему одни агентные фреймворки обходят другие и где прячется узкое место.

Авторы связывают креативность с поиском в концептуальном пространстве. Эта линия идёт от работ Бодена (1998, 2004), где творчество описано как порождение новых идей через исследование структурированных концептуальных пространств, и от работы Ньюэлла, Шоу и Саймона (1962) о процессе творческого мышления. Креативность перестаёт быть магией и становится задачей организации поиска. Источник

Как разложить креативность на измеримые компоненты: P- и H-креативность, impact и feasibility

Рабочая формула исследования раскладывает креативность на четыре части:

Creativity → P-Creativity + H-Creativity + Impact + Feasibility

Оригинальность делится на P-креативность и H-креативность по Бодену, полезность делится на impact и feasibility по Чану и Шунну. Каждый компонент считается отдельно, и это ключевое решение: четыре числа вместо одного показывают, где агент выигрывает, а где проваливается. Источник

КомпонентЧто измеряетНужен внешний эталон
P-креативностьНовизну относительно памяти и истории агентаНет
H-креативностьНовизну относительно всего человеческого знанияДа
ImpactПотенциальное влияние идеи на задачуЗависит от задачи
FeasibilityОсуществимость идеи в заданных условияхЗависит от задачи

P-креативность: новизна для самого агента

P-креативность измеряет, насколько новое решение отличается от того, что программа уже делала. Это внутренняя метрика: она опирается на память и историю самого агента, а внешний эталон ей не нужен. Простой смысл в том, делает ли агент шаг, которого раньше не делал, или повторяет знакомый паттерн. Высокий балл P-новизны говорит, что агент исследует пространство решений, а не топчется на месте. Источник

Слабость метрики очевидна. Она ничего не сообщает о том, видел ли такое решение мир. Агент может заново изобрести давно известный приём и получить высокий балл P-новизны. Поэтому одного этого числа мало для оценки потенциала.

H-креативность: новизна относительно всего человеческого знания

H-креативность измеряет новизну относительно всего объёма человеческого знания. Здесь нужен внешний ориентир: чтобы утверждать, что решение ново для человечества, его надо сопоставить с тем, что уже придумали люди. Боден сравнивает творчество с поиском в структурированном концептуальном пространстве. Западная музыка, по его формулировке, разворачивается в пространстве, заданном правилами гармонии, а мелодии — это маршруты по точно размеченному полю музыкальных интервалов. Источник

H-креативность показывает, дотягивается ли агент до уровня, которого нет ни в обучающих данных, ни в известных решениях. Измерить её труднее: нужна база человеческих решений и рабочий способ сопоставить с ней результат агента.

Impact и feasibility: полезность решения

Оригинальность без пользы креативностью не считается. Impact описывает потенциальное влияние идеи на задачу, feasibility показывает, насколько идею реально осуществить. Эти два компонента отвечают за практическую сторону: можно предложить блестяще новый метод, который не доводится до работающего результата на этой задаче, и тогда вклад окажется пустым. Источник

Разделение impact и feasibility полезно при сравнении агентов и людей. Новый подход агента может выглядеть оригинально, но проигрывать проверенному человеческому решению по осуществимости. Ньюэлл, Шоу и Саймон писали, что успех решателя сложной задачи держится на умении правильно выбрать очень малую часть общего лабиринта решения для исследования. Агент, который плохо отсекает варианты, сжигает бюджет на бесперспективных ветках.

Методология исследования: агенты, задачи и метрики

Цель работы сформулирована прямо: проверить, можно ли различия в производительности между агентными фреймворками объяснить тем, как они структурируют и направляют процесс креативного поиска, и количественно оценить, как креативность возникает и развивается внутри этих фреймворков. Источник

В тестировании участвуют два агентных фреймворка — AIDE и AIRA-Dojo — на 10 Kaggle-подобных задачах машинного обучения из MLE-Bench. Для AIDE оценивались модели GPT-5 и Qwen3-32B на всех 10 задачах, по 8 запусков на каждую комбинацию «модель — задача»; каждому запуску выделялся бюджет 8 часов и максимум 10 эпизодов. Для AIRA-Dojo в материалах подтверждено тестирование на Qwen3-32B, а не на GPT-5. Полный текст

Человеческие траектории служат эталоном для сравнения новизны: без них H-креативность измерить нельзя, потому что сопоставлять результат агента не с чем. Авторы использовали человеческие данные решений Kaggle через Meta-Kaggle, а референсный корпус составлял от 877 до 3 747 публичных ноутбуков на задачу. Полный текст

AIDE и AIRA-Dojo: чем отличаются агентные фреймворки

AIDE и AIRA-Dojo — два разных агентных фреймворка для ML-задач. AIRA-Dojo формализует агентов как поисковые политики над кодовыми артефактами и поддерживает несколько стратегий поиска, а переработанный набор операторов (scoped memory, adaptive prompt) отличает его от AIDE даже при жадном выборе. Различаются фреймворки тем, как организуют цикл работы: как формулируют гипотезы, как выбирают следующий шаг и как передают контекст между итерациями. По гипотезе авторов, именно эти детали обвязки определяют, насколько эффективно фреймворк ищет в пространстве решений и когда переключается с поиска новых идей на доработку найденных. Полный текст

Разница в скаффолдинге напрямую влияет на то, как агент тратит бюджет. Фреймворк, который теряет историю попыток, заставляет агента перебирать одни и те же ходы. Фреймворк, который удерживает контекст, помогает агенту опираться на накопленное и двигаться дальше по пространству решений.

MLE-bench: Kaggle-соревнования как полигон

MLE-bench — это набор задач на основе Kaggle-соревнований. Такие задачи требуют нестандартного хода: правильно сформулировать признаки, выбрать схему валидации, собрать пайплайн. Решение оценивается по объективной метрике лидерборда, а значит, новизну можно честно сопоставить с результатом. Препринт

Человеческие траектории в MLE-bench удобны как эталон: по задачам известны решения людей, включая сильных участников, и с ними сравнивается, насколько ход агента отличается от привычных подходов. Именно это сравнение и даёт оценку H-креативности.

Результаты: почему высокая новизна агентов не превращается в результат

Рамка исследования объясняет ключевое наблюдение: агент может демонстрировать высокую новизну и всё равно уступать топ-1 человеку на реальной ML-задаче. Креативность и результат расходятся, потому что измеряются по разным осям. Балл по P- и H-креативности не говорит, доведён ли подход до работающего пайплайна.

В экспериментах все агенты демонстрировали снижение P-креативности при переходе от исследования к эксплуатации. GPT-5 исследовал значительно более новые области решений, чем люди-медалисты, но при этом только 21,25% запусков GPT-5 и 10,85% запусков AIDE на Qwen3-32B достигали медального уровня производительности. Препринт

Impact и feasibility как раз ловят эту разницу. Идея может быть оригинальной, но неосуществимой в заданном бюджете времени и вычислений, и тогда она не приносит ничего. Новизна без полезности креативностью не считается по определению Ранко и Йегера, и именно этот разрыв отделяет агента от медалиста.

Почему высокая новизна не гарантирует медаль

Медаль в соревновании дают за метрику на лидерборде, а не за оригинальность. Между «агент придумал новый ход» и «агент получил медаль» стоит вся рутинная часть ML-инженерии: чистка данных, подбор валидации, борьба с утечками, отладка пайплайна. Оригинальность помогает на этапе генерации гипотез, но не спасает, если реализация сыпется.

Похожий эффект виден в разработке. В рандомизированном контролируемом испытании METR опытные разработчики open-source при использовании AI-инструментов тратили на 19% больше времени, чем без них, — то есть AI их замедлял. При этом после исследования те же разработчики в среднем оценивали, что AI ускорил их на 20%, то есть ошибались относительно влияния инструментов на свою производительность. Важная оговорка: речь об инструментах начала 2025 года, и сами авторы отмечают, что результаты к текущему моменту устарели. METR

На уровне ML-задачи работает та же логика: агент быстро выдаёт идеи, а дальше начинается медленная работа, где преимущество человека накапливается. Разбор этого эффекта есть в материале про когнитивную ловушку код-агентов.

Второй фактор — отбор. Полезность требует не только придумать ход, но и понять, что он действительно улучшает результат, отсеяв красивые, но бесполезные варианты. Ошибка на этом шаге обнуляет всю накопленную новизну.

Как агенты ищут решения: исследование vs эксплуатация и стратегии поиска

Логика поиска описывается классической дилеммой exploration и exploitation. Исследование (exploration) — это пробы новых областей пространства решений, эксплуатация (exploitation) — доработка уже найденного варианта. Баланс между ними определяет, найдёт ли агент нестандартный ход вообще.

Авторы связывают креативность именно с организацией этого поиска. По Бодену, творчество разворачивается как исследование структурированных концептуальных пространств, а по Ньюэллу, Шоу и Саймону ключ в том, чтобы выбрать малую правильную часть лабиринта для изучения. Если агент рано прекращает исследование, он остаётся в пределах знакомых решений. Источник

Почему разные стратегии поиска дают похожий результат

Стратегии поиска различаются по механике. Greedy идёт по самому обещающему направлению на текущем шаге, MCTS разворачивает дерево вариантов с оценкой ветвей, эволюционная схема порождает и отбирает мутации решений. Логично ожидать, что более умный алгоритм перебора даст лучший результат.

В исследовании оценивались три варианта AIRA-Dojo: Greedy, MCTS и Evolutionary. MCTS запускался на Qwen3-32B по всем 10 задачам (8 запусков на задачу), тогда как Greedy и Evolutionary — на подмножестве из 3 задач (по 4 запуска), чтобы изолировать эффект стратегии поиска на паттерны креативности. Полный текст

Прямого вывода о том, что все стратегии дают одинаковый результат, в доступных материалах нет — сравнение ограничено разным объёмом запусков. Зато подтверждается общая картина: все агенты теряют P-креативность при переходе от исследования к эксплуатации, а разрыв между новизной и производительностью сохраняется. Ограничение лежит не столько в алгоритме перебора, сколько в скаффолдинге, промптах и передаче контекста между шагами. Агент, который теряет историю предыдущих попыток, не может опереться на накопленное и начинает перебирать одни и те же ходы.

Именно поэтому авторы связывают различия между фреймворками не со стратегией поиска как таковой, а с тем, как фреймворк структурирует поиск, какие промпты использует и как передаёт контекст. Улучшать нужно эту часть, а не только заменять алгоритм перебора.

Что это значит для практики: как использовать результаты исследования

Исследование даёт рамку, которую можно применить к своим агентам. Полезно измерять не только итоговую метрику, но и креативность по четырём осям: P-креативность, H-креативность, impact и feasibility. Так видно, где именно агент теряет результат.

Отдельный сигнал — ранний переход к эксплуатации. Если агент уже на первых шагах залипает на одном решении и не возвращается к исследованию, никакая стратегия его не вытянет. Стоит смотреть на траекторию: сколько попыток агент пробует, как быстро сужается поиск, сохраняется ли контекст между итерациями.

Как оценить креативность своего агента

P-креативность проще всего считать относительно истории самого агента: сравните новые ходы с уже пройденными. Для H-креативности понадобится внешняя база решений, с которой вы сопоставляете результат. На практике это напоминает оценку качества длинных агентных отчётов: там тоже полезно привлекать LLM-as-a-Judge и проверять, насколько оценка судьи согласуется с человеческой. Пример такой методики с трейсингом и калибровкой судьи разобран в материале про оценку длинных отчётов AI-агентов.

Сравнение с человеком остаётся самым честным тестом. Прямое сопоставление агента и человека на одной задаче показывает, где агент выигрывает, а где проигрывает. Практический пример такой постановки, с подсчётом часов и стоимости, есть в разборе про 11 недель замеров Claude Code против человека.

Ограничения исследования и что осталось за кадром

Результаты опираются на ограниченный набор из 10 задач MLE-bench и на два агентных фреймворка, поэтому переносить выводы на другие домены стоит осторожно. Открытым остаётся главный практический вопрос: как заставить новизну конвертироваться в результат. Готового рецепта исследование не даёт, оно предлагает рамку для измерения и дальнейших экспериментов.

Ещё одна граница: измерять H-креативность дорого. Нужна база человеческих решений и аккуратное сопоставление, а любая ошибка в судье или в метрике близости искажает картину. Поэтому P- и H-креативность стоит воспринимать как диагностику потенциала, а не как окончательный вердикт о качестве агента.

Практический вывод простой: оценивайте агента по результату и по новизне одновременно. Новизна объясняет потенциал, результат показывает реальную пользу. Если у агента высокий балл новизны и низкая доля решённых задач, проблема не в стратегии поиска, а в обвязке, промптах и управлении контекстом. Опыт ML-команд подтверждает, что долгосрочный результат держится на терпении, дисциплине и команде, а не на одном модном фреймворке: об этом подробнее в материале про 5 уроков за 8 лет в ML.

Подписаться на канал