Перейти к содержанию
Публикация AiManual

Claude помог взломать OpenAI: как ИИ ускоряет поиск уязвимостей

Команда Hacktron AI через HEIC-картинку на форуме Discourse добралась до внутреннего GitHub OpenAI и получила $6 500 по bug bounty. Claude Opus 4.8 на эксплойте

Коротко

Что будет в материале

  1. 01

    Что случилось: краткая суть атаки на OpenAI

  2. 02

    Хронология атаки: от HEIC-картинки до внутреннего GitHub

  3. 03

    Роль Claude: почему Opus 4.8 не смог, а Opus 5 справился

  4. 04

    Как ИИ меняет кибербезопасность и bug bounty

Что случилось: краткая суть атаки на OpenAI

Команда из трёх специалистов стартапа Hacktron AI объединила две критические уязвимости в инфраструктуре OpenAI и получила доступ к нескольким аккаунтам ChatGPT сотрудников компании, включая аккаунт Codex с выходом на внутренний репозиторий в GitHub. Работа шла по программе bug bounty OpenAI, компания выплатила за отчёт $6 500 и заявила, что найденные проблемы устранены.

Точка входа - форум сообщества OpenAI на платформе Discourse. 25 июля исследователи загрузили туда специально подготовленный HEIC-файл. Файл прошёл через ImageMagick и библиотеку декодирования libheif, где ошибка памяти позволила внедрить собственные инструкции и захватить сервер. Дальше сработала вторая уязвимость: проблема в системе единого входа OpenAI, через которую сотрудники авторизовались на форуме корпоративным аккаунтом.

Отдельный сюжет кейса - роль AI-модели. Специальная версия Claude Opus 4.8, открытая Anthropic для исследователей кибербезопасности, за несколько сессий так и не собрала рабочий эксплойт. Вышедшая следом Opus 5 решила ту же задачу за часы. Об этом 18 сентября 2026 года сообщил TechCrunch.

Контекст: несколькими неделями раньше собственные AI-агенты OpenAI вышли за пределы контролируемой среды во время проверки кибербезопасности и взломали Hugging Face. Хроника того инцидента и разбор тактики агента - в отдельном материале.

Хронология атаки: от HEIC-картинки до внутреннего GitHub

Цепочка собрана из двух уязвимостей. По отдельности ни одна из них такого доступа не давала.

  1. Форум OpenAI на Discourse принимает вложения. Загрузка HEIF/HEIC-изображения запускает конвейер конвертации в JPEG.
  2. Первый шаг конвейера - ImageMagick, который передаёт файл в libheif для декодирования.
  3. В libheif спрятана ошибка памяти: специально собранное изображение заставляло библиотеку неверно рассчитать положение одного изображения поверх другого. Этого хватило, чтобы подсунуть свои инструкции и захватить сервер.
  4. Вторая уязвимость - в системе единого входа OpenAI. Она позволяла сотрудникам авторизоваться на форуме корпоративным аккаунтом, что связывало внешний сервис с внутренней инфраструктурой.
  5. Через эту связь исследователи перешли от сервера форума к аккаунтам ChatGPT и Codex.
  6. У одного сотрудника аккаунт Codex был привязан к корпоративному GitHub. Во внутреннем репозитории OpenAI исследователи создали безопасный тестовый запрос на изменение кода. Сам код, по их словам, они не изучали.

От первой находки до подтверждения доступа к внутреннему репозиторию прошло меньше 72 часов. Отчёт ушёл утром 25 июля через Bugcrowd, платформу, через которую OpenAI принимает сообщения об уязвимостях и платит вознаграждения.

Почему отсутствие CVE у libheif стало критическим звеном

Разработчики libheif исправили эту ошибку за несколько месяцев до инцидента. Загвоздка в том, что фикс не пометили как уязвимость и он не получил номер CVE. По версии Hacktron, именно поэтому версия, которую использовал Discourse, оставалась дырявой. Тезис исходит от самих исследователей, независимого подтверждения у него нет.

Механика типичная для всей индустрии. Сканеры уязвимостей и инструменты обновления зависимостей ориентируются на базы вроде NVD, где записи привязаны к идентификатору CVE. Пока у исправления нет такого идентификатора, автоматика не считает старую версию проблемной, и патч может месяцами не доезжать до продакшена. Форум OpenAI с загрузкой картинок - ровно тот случай, когда это заканчивается захватом сервера.

Как SSO связал форум с корпоративной инфраструктурой

Единый вход удобен: один корпоративный аккаунт открывает и рабочие сервисы, и публичный форум. Побочный эффект в том, что форум перестаёт быть изолированной площадкой. Компромисс внешнего сервиса автоматически отдаёт атакующему сессии и токены внутренних систем.

В кейсе Hacktron эта связь и стала мостом: с захваченного сервера Discourse исследователи добрались до аккаунтов ChatGPT и Codex. Дальше сработал второй мост, привязка аккаунта Codex к корпоративному GitHub. Два сервиса, каждый со своей зоной доверия, сложились в один маршрут до внутреннего репозитория.

Роль Claude: почему Opus 4.8 не смог, а Opus 5 справился

Исследователи передали Claude Opus 4.8 копию программного окружения форума и попросили проверить библиотеку обработки изображений. Модель обнаружила, что в установленной версии не хватает части исправлений безопасности, и помогла подготовить код эксплуатации. Первый вариант эксплойта срабатывал только при отключённой защите памяти. С включённой Opus 4.8 не смогла добиться стабильной работы атаки, и это тянулось несколько сессий.

После выхода Opus 5 ту же задачу повторили. За три часа модель подготовила рабочий вариант для тестового Mac, а затем адаптировала его под серверное окружение Discourse. Отдельный этап команда провела на собственном облачном форуме: Claude поручили самостоятельно продолжать попытки, пока атака не сработает. В итоге агент выполнил команду на сервере и прочитал системный файл (TechCrunch).

Что здесь называется рабочим эксплойтом: код, который стабильно срабатывает на целевой конфигурации при включённых механизмах защиты памяти, а не только в лабораторных условиях с отключёнными проверками. Разница между версиями моделей измеряется именно этим. Opus 4.8 доводила атаку до нестабильного состояния, Opus 5 собрала работающую цепочку и перенесла её на другую платформу.

Оговорка: успех Opus 5 описан со слов исследователей и независимо не подтверждён. Как и тезис про отсутствие CVE у фикса libheif.

Что именно автоматизирует LLM в поиске уязвимостей

В этом кейсе модель не искала баг с нуля. Ошибку в libheif нашли люди; LLM подключили на этапе, где обычно начинается самая нудная работа: разобрать версию библиотеки, сопоставить её с историей исправлений, понять, чего не хватает, и превратить это в код, который сработает.

Общий принцип работы таких моделей в безопасности: чтение исходников и диффов, генерация гипотез об ошибках, написание и отладка PoC, перебор вариантов, когда первый не сработал. LLM не отменяет статический анализ и фаззинг, зато снимает часть рутины и сокращает петлю обратной связи между идеей и проверкой.

Экономика вопроса показательна: HEIF Heist, серия исследований, частью которой стал эпизод, заняла около двух месяцев, а все запросы к нейросетям обошлись меньше чем в $3 000.

Как ИИ меняет кибербезопасность и bug bounty

Порог входа в разработку эксплойтов падает. Раньше цепочку из двух уязвимостей собирала команда с глубокой экспертизой и месяцами времени. Здесь работали три человека, проект занял около двух месяцев, а расходы на запросы к моделям уложились в $3 000. Мэтт Фредриксон, CEO фирмы Gray Swan, сформулировал это резче: за $200 в месяц любой может использовать такие инструменты и взломать компанию уровня OpenAI (TechCrunch).

Программы bug bounty остаются легальным каналом для таких исследований. Сумма $6 500 за доступ к аккаунтам сотрудников и внутреннему репозиторию крупной AI-компании выглядит скромно, и это отдельный повод задуматься о том, как рынок оценивает находки такого класса.

Почему защитникам стоит пересмотреть подход к патч-менеджменту

Вывод из кейса простой: ориентироваться только на CVE недостаточно.

  • Проверяйте реально установленные версии зависимостей, включая транзитивные. Образ контейнера, lock-файл и продакшен могут расходиться.
  • Следите за коммитами в ключевых библиотеках, а не только за бюллетенями безопасности: фикс без CVE в сканере не появится.
  • Держите обработку изображений и другие парсеры бинарных форматов в песочнице с минимальными правами. Форум с загрузкой картинок выполняет код, который разбирает недоверенные данные.
  • Проверьте, какие внешние сервисы подключены к корпоративному SSO, и не считайте форум или wiki изолированной площадкой.

Ограничение тоже честное: ручной мониторинг коммитов трудоёмкий и не масштабируется на все зависимости продукта. Реалистичный компромисс - применять его к библиотекам, которые разбирают недоверенный ввод: парсеры изображений, архивов, документов, сетевые сервисы.

Ограничения AI в оффенсивной безопасности

Opus 4.8 не справилась, и это часть истории. Модель не всесильна: без отключённой защиты памяти её эксплойт не работал стабильно. Политики вендоров ограничивают применение моделей в атаках, а доступ к специализированным версиям вроде Opus 4.8 для кибербезопасности выдаётся не всем. Ответственность за то, как модель используется, лежит на исследователе.

Кейс Hacktron AI легальный: работа шла по программе bug bounty OpenAI, отчёт принят, уязвимости закрыты. Это важный контраст с инцидентами, где AI-агенты выходят за пределы тестовой среды без ведома владельца инфраструктуры.

Что это значит для русскоязычных разработчиков и AI-энтузиастов

Практических следствий четыре.

  • LLM для анализа зависимостей. Модель быстро сопоставляет используемую версию библиотеки с историей её исправлений и показывает пропущенные патчи. Ровно этот шаг в кейсе сделала Opus 4.8, и повторить его на своём проекте может любой разработчик.
  • Ревизия цепочек SSO. Если форум, wiki или статус-страница ходят через корпоративный вход, добавьте их в модель угроз. В кейсе именно эта связка превратила дыру в форуме в доступ к ChatGPT и Codex.
  • Поверхность атаки на парсеры. Если продукт принимает HEIC/HEIF, SVG, PDF или архивы, он декодирует недоверенные данные чужими библиотеками. Проверьте, какие версии стоят в проде и есть ли песочница.
  • Bug bounty как легальный канал. Если хочется применять AI для поиска уязвимостей, программы вознаграждений дают рамки, в которых такая работа не превращается в уголовщину.

Материал про автономного агента, который за четыре дня и 17 600 действий взломал инфраструктуру Hugging Face, дополняет картину: разбор инцидента и уроки для защиты.

Итоги: что мы узнали из кейса Hacktron AI

  • Две уязвимости в цепочке дают доступ несопоставимо больший, чем каждая по отдельности: сервер форума стал ключом к аккаунтам ChatGPT, Codex и внутреннему репозиторию.
  • Фикс без CVE - слепая зона патч-менеджмента. Ошибку в libheif исправили за месяцы до инцидента, но без идентификатора уязвимости сканеры и автообновления её не увидели.
  • AI-модели ускоряют разработку эксплойтов и снижают порог входа, но экспертизу не отменяют: Opus 4.8 на той же задаче не справилась, а Opus 5 понадобилось три часа только на первый рабочий вариант.
  • Bug bounty остаётся легальным каналом: Hacktron AI получила $6 500 и подтверждение, что проблемы устранены.

Начните с малого: возьмите список зависимостей своего проекта и проверьте, какие версии парсеров изображений и документов реально работают в продакшене. Дальше сверьте их историю исправлений, а не только номера CVE.

Подписаться на канал