Что произошло: увольнение и публичное предупреждение
27-летний исследователь Джейкоб Коксон уволился из Anthropic и опубликовал в X пост, который за сутки собрал больше 100 миллионов просмотров. Главная фраза: компании «несутся прямиком к самоулучшающемуся сверхинтеллекту и играют с нашими жизнями». Через несколько часов под постом появился ответ действующего руководителя направления alignment science в Anthropic Эвана Хубингера, и он не стал дистанцироваться от коллеги, а подтвердил его слова.
Формально это внутренний конфликт одной лаборатории. На практике редкий случай, когда уволившийся исследователь и действующий руководитель ключевого направления безопасности говорят публично одно и то же: решённой задачи alignment для систем мощнее человека у индустрии нет, а гонка не останавливается. На фоне сообщений о подготовке Anthropic к IPO этот сигнал читается иначе, чем очередное предупреждение о рисках.
Кто такой Джейкоб Коксон и что он сказал
Коксону 27 лет, последние три года он занимался pretraining-исследованиями: сначала в OpenAI, затем в Anthropic. Pretraining - этап, на котором модель учится на огромных корпусах данных и получает базовые способности. Люди на этой работе находятся ближе всех к «сырой» модели и дальше всех от продукта, маркетинга и метрик удержания.
В посте он написал прямо: «I spent the last three years doing pretraining research at both OpenAI and Anthropic. Neither company is acting responsibly». Дальше идёт тезис, который разошёлся по соцсетям:
«They are racing straight to self-improving superintelligence and gambling with our lives».
Коксон отдельно подчёркивает, что страх внутри компаний настоящий, а не маркетинговый приём: «The people building AI earnestly believe that it could kill us all by the end of the decade. This is not a marketing stunt». И добавляет, что публичные формулировки смягчают: «many executives and senior researchers will couch their phrasing in the press to sound sensible - but I hear the same people express fear privately».
Призыв к коллегам простой: подумать, что могут принести следующие несколько лет, прежде чем участвовать в создании самоулучшающегося сверхинтеллекта. Интервью Коксон давать не стал, от комментариев для прессы отказался.
Реакция Эвана Хубингера: co-sign от руководителя alignment
Самое важное в этой истории - вторая подпись, а точнее публичный ответ в треде. Эван Хубингер руководит направлением alignment science в Anthropic, то есть отвечает именно за то, чтобы поведение моделей соответствовало человеческим целям. Он написал: «Jacob is correct here, we really do earnestly believe AI could kill all humans!».
Дальше он назвал личную оценку: «I personally think it is 10% within the next decade». Речь о вероятности вымирания человечества из-за ИИ в течение десяти лет. И признал состояние работ: «I believe Anthropic is trying its best, but we do not yet have a plan to solve alignment for superintelligence and are not clearly on track to».
Разница между «уволившийся сотрудник написал в X» и «действующий руководитель направления безопасности подтвердил и добавил детали» принципиальная. Первое списывают на эмоции и обиду. Второе звучит как позиция компании, и от неё сложно отмахнуться инвестору, который считает риски бизнеса.
Что такое alignment и почему это ключевой вопрос
Alignment, или выравнивание, - это задача сделать так, чтобы система преследовала именно те цели, которые в неё заложили, и не искала обходные пути. Речь не о вежливости модели, а о её поведении в ситуациях, где есть соблазн срезать угол: подделать отчёт, обойти проверку, выдать желаемое за реальное.
Alignment vs AI safety: в чём разница
AI safety - широкое поле: защита от злоупотреблений, утечки данных, предвзятость, джейлбрейки, вредный контент, безопасность при развёртывании. Alignment - более узкая техническая часть: соответствие целей и поведения системы намерениям разработчика и пользователя.
Разделение полезно на практике. Когда компания пишет «мы серьёзно относимся к безопасности», это чаще всего про фильтры, политики и red teaming. Когда речь заходит об alignment, вопрос жёстче: есть ли метод, который гарантирует, что система умнее нас будет делать нужное, а не то, что она сама сочтёт оптимальным. Ошибки в первом случае стоят репутации, во втором - необратимы.
Почему самоулучшающийся сверхинтеллект вызывает особую тревогу
Самоулучшающийся сверхинтеллект - гипотетическая система, способная переписывать собственный код и наращивать возможности без участия человека. Слово «гипотетическая» здесь ключевое: такой системы сегодня нет, и никто не знает, сколько до неё осталось. Проблема в асимметрии усилий. Если такая система появится и её цели разойдутся с нашими, остановить её будет нечем, потому что мы уже не будем быстрее и не будем понимать её внутреннюю логику.
Хубингер говорит именно об этой траектории, и говорит как человек, который отвечает в Anthropic за alignment. Его признание про отсутствие плана означает простую вещь: компания строит всё более мощные модели, не имея решённой задачи, как гарантировать контроль над следующей ступенью. Это предмет внутреннего обсуждения в одной из ведущих лабораторий. Инциденты, которые уже случались вокруг агентных инструментов вроде Claude Code, и меры, снижающие риск потери контроля, мы разбирали в материале про гонку компаний после предупреждения исследователя Anthropic.
Позиция Anthropic: официальный ответ и внутренние противоречия
Официальная реакция Anthropic
Компания ответила коротко: «We have always been transparent that AI will bring both enormous benefits and unprecedented risks». Ответ аккуратный по форме и пустой по содержанию: он не опровергает Хубингера, не подтверждает наличие плана по alignment и не объясняет, что меняется в разработке после таких заявлений.
Хубингера при этом никто публично не поправил и не отстранил. Человек, который оценивает вероятность катастрофы в 10% и говорит об отсутствии плана, продолжает руководить направлением alignment science. Для внешнего наблюдателя это означает, что такая позиция внутри компании допустима, а не маргинальна. Как устроены внутренние дебаты Anthropic и как они влияют на ограничения Claude и roadmap компании, разбирали в отдельном материале про инсайты технического специалиста.
Альтернативный взгляд: Рафи Аюб о других рисках
Единой позиции внутри Anthropic нет. Бывший исследователь компании Рафи Аюб тоже ушёл по ценностным причинам, но считает, что Коксон смотрит не туда. Его беспокоит, как ИИ влияет на сообщества, живые человеческие связи и критическое мышление: медленные, распределённые эффекты, которые наблюдаются уже сейчас, а не гипотетический сверхинтеллект.
Этот спор важен для читателя. Аргумент «есть риск, о котором предупреждают свои же» сталкивается с аргументом «риск, о котором стоит беспокоиться, уже реализуется». Обе позиции исходят от людей, работавших над моделями, и обе стоит держать в голове при оценке вендора.
Почему это важно на фоне подготовки к IPO
Anthropic, по сообщениям, готовится к выходу на биржу. Увольнение Коксона и поддержка от действующего руководителя alignment создают внутреннее трение вокруг протоколов безопасности именно тогда, когда компания становится прозрачнее для внешнего мира.
Что такое IPO и почему оно меняет правила игры
IPO - первичное публичное размещение акций. После него у компании появляется множество миноритарных акционеров, квартальная отчётность, обязанность раскрывать существенные риски и внимание регуляторов. Публичные заявления сотрудников о том, что продукт может привести к катастрофе, перестают быть внутренним делом: их читают инвесторы, юристы и аналитики, которые считают стоимость компании.
Для Anthropic это чувствительнее, чем для большинства. Компания построила репутацию на AI safety и позиционирует себя как более осторожного игрока, чем конкуренты. Заявление собственного руководителя alignment о том, что плана решения ключевой задачи нет, бьёт ровно в этот нарратив. Инвесторам и регуляторам теперь приходится оценивать, как компания совмещает агрессивную гонку за передовыми моделями с рисками, о которых говорят её же сотрудники. Публичный конфликт вынуждает отвечать на неудобный вопрос: достаточно ли текущих мер безопасности, чтобы снизить опасности самоулучшающейся технологии, и как это отражать в документах перед размещением.
У публичных споров о безопасности есть и вторая сторона: они бьют по репутации бренда. Похожий эффект уже был у Anthropic с рекламной кампанией о тяжёлых вопросах, которую сообщество прочло как мрачную и неуместную. Разбор этой истории и выводы для коммуникации на тему этики AI есть в статье про провал кампании Anthropic. Коммуникация о рисках идёт по узкой дорожке: недосказанность выглядит как сокрытие, а пересказ собственных страхов работает против продукта.
Реакция законодателей и регуляторный контекст
Политическая реакция не заставила себя ждать. Часть законодателей призвала спикера Джонсона отменить осенние каникулы Палаты представителей, пока Конгресс не примет меры безопасности для ИИ. Параллельно идут конкретные инициативы:
- Stop Rogue AI Act, внесённый конгрессменами Джошем Готтхаймером (демократ) и Майком Лоулером (республиканец), направлен против работы ИИ-систем без человеческого надзора.
- AI Kill Switch Act, внесённый в июле Тедом Лью (демократ) и Натаниэлем Мораном (республиканец), требует от разработчиков мощнейших систем возможности замедлять, приостанавливать или отключать их.
- Сенатор Берни Сандерс и конгрессмен Грег Касар продвигают законопроект, запрещающий разработку и развёртывание искусственного сверхинтеллекта и приостанавливающий развитие ИИ до появления федеральных правил безопасности.
- Сенатор-республиканец Тед Круз говорит о необходимости «ограничителей» для ИИ и работает над двухпартийным законодательством с Эми Клобушар и Джоном Тьюном.
Реакция есть и у конкурентов. Сэм Альтман сообщил сотрудникам OpenAI, что компания рассматривает замедление разработки передовых ИИ и надеется на аналогичные шаги от других. Директор OpenAI по глобальным вопросам Крис ЛеХейн на следующий день после поста Коксона написал в корпоративном блоге, что компаниям нужно договариваться об общих стандартах и что время для политики, повышающей планку безопасности, ещё есть.
Приведут ли призывы к конкретным законам, неизвестно. Давление на компании вроде Anthropic они усиливают уже сейчас.
Что это значит для выбора AI-моделей и инструментов
Для практика вопрос звучит прагматично: если внутри компании, чью модель вы используете, идут такие споры, как это учесть при выборе инструмента.
Как оценивать риски AI-вендоров
Смотрите на четыре вещи:
- Есть ли публичные заявления сотрудников о рисках и насколько они конкретны. Общее «мы за безопасность» и признание «у нас нет плана по alignment для сверхинтеллекта» - сигналы разного уровня.
- Как компания реагирует на такие заявления. Дистанцировалась, поправила, промолчала или поддержала: каждая реакция говорит о внутренней культуре.
- Что компания публикует об ограничениях своих моделей. Прозрачность видна по конкретике: отчёты, описания методов, признание известных проблем вместо общих слов.
- Есть ли сформулированная программа работ по alignment и кто ей руководит. Отсутствие плана у лидера направления - красный флаг для долгосрочной инфраструктуры.
Маркетинг и корпоративный блог вторичны по сравнению с внутренними сигналами. Пост, который не должен был выйти за пределы компании, обычно говорит больше, чем пресс-релиз.
Стоит ли отказываться от Anthropic Claude
Однозначного ответа нет, и любой, кто его даёт, скорее продаёт свою позицию. Claude остаётся одной из ведущих моделей: сильный код, работа с длинным контекстом, осторожные ответы. Заявления Коксона и Хубингера говорят о будущих рисках сверхинтеллекта, а не о том, что сегодняшний Claude ведёт себя опасно.
Что имеет смысл сделать:
- Оценить критичность зависимости. Для экспериментов и pet-проектов новость мало что меняет.
- Для регулируемых отраслей и долгосрочной инфраструктуры держать мультивендорную схему: API нескольких провайдеров плюс локальные модели для чувствительных данных. Позицию главы Anthropic по open-weight моделям и его предложения по регулированию разбирали в отдельном материале про Дарио Амодеи.
- Следить за развитием ситуации. Если Anthropic опубликует конкретный план по alignment, часть вопросов снимется. Если конфликт продолжит разворачиваться, появится повод пересмотреть долгосрочные контракты.
Итоги: что мы знаем и чего не знаем
Факты: Коксон уволился и опубликовал заявление, собравшее свыше 100 млн просмотров за сутки; Хубингер, действующий руководитель alignment science в Anthropic, подтвердил его слова и оценил вероятность катастрофы в 10% за десятилетие; Anthropic ответила общей фразой про выгоды и риски; в США на этом фоне продвигают законопроекты о надзоре за автономными системами, kill switch и паузе для сверхинтеллекта.
Что остаётся неизвестным: как Anthropic собирается решать alignment для сверхинтеллекта, изменится ли что-то в её roadmap, как это повлияет на оценку при IPO и что скажут инвесторы, когда риск-факторы придётся формулировать письменно.
Практический вывод простой: следите за сигналами изнутри компаний, а не за страницами «наш подход к AI safety». Внутренние споры о безопасности точнее показывают, где у вендора слабое место, чем аккуратно выверенный корпоративный текст.