Anthropic проверила, могут ли AI-агенты самостоятельно ускорять исследования по alignment, то есть искать и тестировать методы, которые помогают сильным моделям лучше следовать заданным целям. Для эксперимента компания создала девять инструментированных копий Claude Opus 4.6 и дала им sandbox, общее хранилище кода, форум для обмена результатами и удалённый сервер оценки.
Automated Alignment Researchers, или AARs, прошли цикл поиска идей, написания экспериментального кода, короткого обучения, проверки на alignment-бенчмарках и отбора удачных подходов. Результат показывает возможность автоматизировать значительную часть узкого исследовательского процесса. Он не доказывает универсальное самосовершенствование моделей, надёжный контроль любого misaligned behavior или полное исчезновение человека из цепочки.
Что показал эксперимент Anthropic с AI research agents
Короткий вывод для читателя
AARs могут работать как ускоритель alignment research. Они перебирают больше вариантов, быстрее запускают повторяемые эксперименты и сопоставляют результаты по заранее заданным метрикам. Такой подход особенно полезен там, где гипотезу можно быстро перевести в код, обучить модель на ограниченном числе шагов и проверить измеримым тестом.
Эксперимент проверял конкретную постановку: сможет ли слабый сигнал надзора улучшить поведение более сильной модели. Поэтому его выводы относятся к weak-to-strong supervision и специальным alignment-бенчмаркам. Переносить их на любые модели, задачи и сценарии автономного развития пока нельзя.
Как устроены Automated Alignment Researchers
Обычный чат с LLM выдаёт текстовый ответ и завершает работу после генерации. AAR получает среду, в которой может сохранять код, запускать эксперименты, читать результаты и обсуждать гипотезы с другими копиями модели. Исследовательский цикл превращается в последовательность действий с обратной связью.
Anthropic использовала девять копий Claude Opus 4.6. Каждая копия выступала участником общего процесса, где агенты могли предлагать идеи, проверять чужие решения и использовать накопленные результаты в следующих запусках. Количество копий увеличивает пропускную способность поиска, но само по себе не делает систему независимым исследовательским коллективом. Её поведение по-прежнему задают инструменты, инструкции, данные и критерии успеха.
Зачем агенту нужны инструменты и общая среда
Sandbox ограничивает место, где агент запускает код и работает с экспериментами. Такая изоляция нужна для контроля доступа и снижения риска, связанного с произвольными действиями внутри основной инфраструктуры.
Хранилище кода позволяет сохранять версии методов, конфигурации запусков и промежуточные результаты. Без этого агенту пришлось бы восстанавливать ход работы по контексту диалога, что плохо подходит для длинных исследовательских серий.
Удалённый сервер оценки выполняет одну из самых важных функций: он применяет единый критерий к разным кандидатам. Агент может считать свою идею перспективной, но итог определяется изменением метрики на заданном наборе тестов.
Общий форум нужен для обмена гипотезами. Одна копия модели может предложить способ обучения, другая найти слабое место в дизайне эксперимента, третья сравнить результаты нескольких запусков. Эта схема напоминает распределённую исследовательскую группу, но с заранее ограниченным пространством задач.
Почему в эксперименте использовали несколько копий модели
Несколько AARs позволяют выполнять разные части поиска параллельно. Один агент изучает опубликованные подходы и формулирует гипотезу. Другой пишет код и запускает обучение. Третий анализирует провалы и предлагает изменить процедуру оценки.
Параллельность сокращает время между идеей и проверяемым результатом. Она особенно полезна для коротких экспериментов, где стоимость одной итерации ограничена, а пространство вариантов велико. При этом девять копий не гарантируют девять независимых точек зрения: модели могут повторять одинаковые идеи, ориентироваться на общий критерий или усиливать ошибки друг друга.
Похожую архитектуру AI-агентов можно разобрать на более прикладном уровне в статье о создании AI-агента с нуля. В эксперименте Anthropic к оркестрации инструментов добавляется исследовательская задача и автоматическая оценка обученных моделей.
Как работает цикл AI alignment research
Поиск по литературе и формулировка гипотезы
Первый шаг начинается с исследовательской базы. Агент изучает существующие методы alignment, сопоставляет их предпосылки и ищет варианты, которые можно проверить в заданной постановке. Литература здесь задаёт пространство поиска: если нужный подход не описан и у модели нет достаточного контекста, качество новых гипотез снижается.
После чтения материалов агент формулирует проверяемое предположение. Хорошая гипотеза связывает конкретный метод с ожидаемым изменением поведения модели. Например, она может предполагать, что определённый способ передачи слабого сигнала поможет сильной модели лучше использовать неполные оценки teacher-модели.
Гипотеза должна превращаться в процедуру: набор данных, параметры обучения, способ формирования сигнала надзора и критерий сравнения. Формулировка «сделать модель безопаснее» для автоматического цикла слишком расплывчата. Нужна операциональная цель, которую можно измерить.
Короткое обучение и автоматическая проверка
Затем агент пишет или изменяет экспериментальный код и запускает короткую обучающую процедуру. Такой запуск не равен полноценному обучению большой модели. Он нужен, чтобы быстро определить, даёт ли метод полезный сигнал хотя бы в контролируемой задаче.
После обучения система проверяет модель на заранее заданных alignment-бенчмарках. Агент получает измеримые результаты, сравнивает их с базовой линией и анализирует случаи, где метод не сработал. Это отличает исследовательский цикл от генерации красивых, но непроверенных идей.
Автоматизация экономит время на повторяемых операциях: подготовке конфигураций, запуске серий, сборе метрик и сортировке результатов. Человек может не присутствовать на каждом отдельном запуске, но должен определить, какие тесты считать релевантными и как интерпретировать их изменения.
Отбор метода и повторение цикла
Удачные методы, конфигурации и наблюдения сохраняются в общей среде. Следующие агенты используют эти материалы как исходную точку, меняют отдельные параметры и проверяют, сохраняется ли эффект.
Так возникает итеративный контур:
- поиск научных идей и существующих методов;
- формулировка гипотезы;
- перевод гипотезы в код и конфигурацию обучения;
- короткий обучающий запуск;
- оценка на alignment-бенчмарках;
- анализ ошибок и отбор кандидатов;
- повторная проверка улучшенных вариантов.
Главная ценность AAR находится в количестве быстрых итераций. Один агент может ошибиться в постановке или коде. Серия независимых запусков помогает быстрее выявлять такие ошибки, если критерий оценки действительно связан с исходной проблемой.
Weak-to-strong supervision как проверка alignment-методов
Роли слабой и сильной моделей
В weak-to-strong supervision слабая модель выступает в роли teacher, а сильная модель получает от неё обучающий сигнал. Слабый teacher может быть менее способным, чем система, которую он пытается направлять. Поэтому он не видит всех нюансов поведения сильной модели и не может полностью оценить каждое её решение.
Это создаёт практическую проблему надзора. Если сильная модель превосходит teacher по знаниям, планированию или анализу, простой сигнал от слабой системы может оказаться неполным. Alignment-метод должен помочь сильной модели извлечь полезную информацию из ограниченного надзора, не сводя обучение к копированию ошибок teacher.
В эксперименте AARs искали способы улучшить такую передачу сигнала. Слабая модель здесь не означает плохую модель во всех задачах. Речь идёт о разнице возможностей между источником надзора и системой, которую нужно обучать или контролировать.
Почему эта постановка считается прокси для scalable oversight
Scalable oversight описывает задачу контроля систем, которые превосходят доступного им наблюдателя по компетентности или скорости работы. Человек не сможет вручную проверять каждое действие очень мощной модели. Weak-to-strong supervision моделирует близкую трудность через пару моделей с разным уровнем возможностей.
Это полезная исследовательская аппроксимация. Она позволяет проверять методы на контролируемых задачах и измерять, насколько слабый supervision-сигнал помогает сильной модели. Но прокси не равен полной системе надзора. Успех в одной постановке не гарантирует контроль над открытыми задачами, неожиданными стратегиями и поведением вне распределения.
Связь между alignment, контролем и нежелательными стратегиями поведения подробно обсуждается в материале о парадоксе безопасности Anthropic. Для AAR этот контекст важен по одной причине: хорошая оценка должна учитывать возможность внешне успешного, но внутренне нежелательного поведения.
Что измеряет performance gap recovered
Как читать PGR без лишней математики
Performance gap recovered, или PGR, показывает, какую часть разрыва между слабой моделью и верхней границей возможностей сильной модели удалось восстановить после обучения по слабому сигналу.
Представим три уровня результата. Слабая модель показывает базовое качество. Сильная модель без ограничений задаёт верхнюю границу в конкретной задаче. После weak-to-strong обучения сильная модель получает промежуточный результат. PGR оценивает, насколько этот результат приблизился к верхней границе относительно исходного разрыва.
- Низкий PGR означает, что слабый сигнал почти не помог сильной модели использовать собственные возможности.
- Более высокий PGR означает, что модель смогла восстановить большую часть потерянного качества.
- Сравнивать PGR можно только с учётом конкретной задачи, базовой линии и верхней границы.
У PGR нет универсального смысла вне дизайна эксперимента. На показатель влияют выбранные модели, датасет, процедура обучения и способ определения верхней границы. Поэтому одна цифра PGR не описывает alignment-модель целиком.
Почему PGR не равен универсальной безопасности модели
PGR оценивает эффективность weak-to-strong supervision в конкретной постановке. Он не измеряет все виды misaligned behavior, устойчивость к манипуляциям, корректность поведения в новых условиях или способность модели объяснять собственные решения.
Модель может улучшить PGR и при этом сохранять проблемы на тестах, которые не вошли в эксперимент. Возможна и другая ситуация: метод хорошо работает на знакомом распределении, но теряет эффект при изменении данных или формулировки задачи.
Для серьёзной оценки нужны независимые наборы тестов, проверки обобщения, анализ неожиданных стратегий поведения и ручной аудит спорных случаев. Метрика помогает сравнивать методы. Она не заменяет оценку риска.
Результаты по сравнению с человеческими исследователями
Где автоматизация действительно может ускорить работу
AI research agents хорошо подходят для операций, которые имеют ясный вход, повторяемую процедуру и измеримый выход. В alignment research это может быть:
- поиск связанных подходов в доступной исследовательской базе;
- генерация нескольких вариантов метода;
- подготовка экспериментального кода;
- запуск коротких обучений с разными конфигурациями;
- сбор и сравнение метрик;
- первичный анализ провалов;
- обмен промежуточными результатами между параллельными агентами.
Преимущество AAR связано с плотностью итераций. Агент может быстро проверить много близких вариантов, пока исследователь тратит время на постановку задачи, ревью кода и интерпретацию результатов. Это сравнение по типам операций, а не универсальный рейтинг AI против человека.
Для исследовательской команды такой подход может освободить время для задач высокого уровня: выбора направления, разработки независимых проверок и оценки того, насколько лабораторный результат переносится на реальные модели.
Что пока нельзя передать агентам полностью
Человек должен выбрать исходную проблему и решить, какой результат заслуживает доверия. В эту работу входят:
- выбор alignment-бенчмарка и проверка того, что он связан с нужным риском;
- проверка корректности дизайна и базовых линий;
- поиск побочных эффектов, которые метрика не отражает;
- оценка поведения за пределами тестового распределения;
- определение допустимого уровня риска;
- решение о переносе метода на другие модели и задачи.
Агент может сообщить, что кандидат улучшил оценку. Он не может сам по себе определить, означает ли это реальное повышение безопасности или удачную подгонку под тест.
Что эксперимент Anthropic пока не доказывает
Специальные alignment-бенчмарки против реального поведения
Улучшение на тестовом наборе показывает изменение поведения в измеряемой области. Реальная модель действует в гораздо более широком пространстве условий. Между этими двумя уровнями возникает разрыв, особенно если тесты известны агенту и напрямую используются для отбора методов.
Бенчмарк может не содержать редкие сценарии, скрытые конфликты целей или поведение, которое проявляется только после длинной последовательности действий. Он может измерять удобный прокси, а не сам риск. Поэтому результаты нужно проверять на новых данных, с другими формулировками и независимыми критериями.
Связанный пример проблем оценки AI-агентов описан в статье о проверке длинных отчётов и калибровке LLM-as-judge. Ошибка в оценщике способна скрыть реальное ухудшение или создать иллюзию улучшения.
Почему это не универсальный контур самосовершенствования
AAR работает внутри заранее заданной среды. У него есть конкретная задача, доступные инструменты, ограниченный набор данных и критерии оценки. Агент улучшает выбранный метод в определённой постановке, а не все способности модели сразу.
Универсальное самосовершенствование потребовало бы гораздо более широкого контура: самостоятельного выбора целей, разработки новых архитектур, создания надёжных проверок и переноса улучшений между различными задачами. Эксперимент Anthropic таких возможностей не подтверждает.
Он не доказывает и надёжное устранение всех misaligned behavior. Отдельный метод может снижать один тип нежелательного поведения и не затрагивать другие. Обобщение на любые архитектуры и реальные deployment-сценарии требует новых экспериментов.
Ограничения: бенчмарки, вычисления и исследовательская база
Стоимость инфраструктуры и масштабирование экспериментов
Для AAR нужен набор сервисов, который шире обычного запуска LLM:
- несколько экземпляров модели, работающих параллельно;
- sandbox для запуска кода и ограничения доступа;
- хранилище кода, конфигураций и результатов;
- удалённый сервер, который выполняет единообразную оценку;
- набор данных и процедуры короткого обучения;
- система координации между агентами.
Такая схема требует вычислительных ресурсов и инженерного сопровождения. При росте числа агентов увеличиваются расходы на запуски, хранение результатов и проверку качества. Узким местом может стать не генерация идей, а сервер оценки или ручной аудит наиболее перспективных кандидатов.
Для локальных AI-систем это означает практическое ограничение: домашний сервер способен поддерживать отдельные этапы автоматизации, но полноценный контур с несколькими копиями сильной модели и серией обучений требует гораздо более сложной инфраструктуры.
Риск оптимизации под тест
Автоматический поиск стремится улучшить тот критерий, который ему доступен. Если агент знает набор тестов и получает обратную связь по одной метрике, он может найти способ повысить оценку без решения исходной проблемы alignment.
Такой эффект называют подгонкой под тест. Он возникает и в обычном машинном обучении, но автоматизация ускоряет перебор вариантов, поэтому риск нужно учитывать с самого начала. Один и тот же набор данных нельзя использовать одновременно для поиска метода и окончательной проверки его качества.
Защита требует разделения данных, независимых оценщиков и новых тестов, которые не участвовали в подборе. Полезны проверки с изменёнными формулировками, анализом поведения вне распределения и ручным изучением случаев, где метрика резко выросла.
Качество новых идей зависит и от исследовательской базы. Если литература устарела, данные неполны, а оценщик измеряет узкий прокси, агент будет быстро перебирать ограниченное пространство. Скорость цикла не компенсирует слабую постановку.
Практический вывод: где AAR полезны уже сейчас
Итог в трех тезисах
- AI-агенты могут ускорять alignment research, когда задача разбивается на воспроизводимые шаги: поиск, кодирование метода, короткое обучение, оценка и анализ.
- Weak-to-strong supervision и PGR дают измеримую, но узкую рамку проверки. Она помогает сравнивать подходы, однако не описывает универсальную безопасность модели.
- Качество результата ограничено бенчмарками, вычислительной инфраструктурой, исследовательской базой и человеческим контролем.
Практическая ценность Automated Alignment Researchers сегодня связана с автоматизацией узких исследовательских процессов. Они подходят исследовательским командам, которые хотят ускорить перебор методов, запуск экспериментов и первичный анализ результатов.
Для разработчиков главный урок находится в организации цикла: заранее определить метрики, отделить данные для поиска от данных для проверки, сохранять конфигурации запусков и проводить независимый аудит. Человеческое участие смещается к постановке задачи, контролю качества и оценке рисков. Оно не исчезает.
Похожую логику параллельной работы AI-агентов и автоматической проверки можно увидеть в разборе архитектуры Prime Agent. В alignment-исследованиях требования строже: полезный результат должен выдерживать независимые тесты и не ограничиваться ростом одной знакомой метрики.