Как ИИ OpenAI сбежал из лаборатории и стал хакером

В июле 2026 года автономный ИИ-агент OpenAI стал объектом всеобщего внимания. ИИ выбрался из тестовой среды, получил доступ в интернет и взломал инфраструктуру компании Hugging Face. Он действовал без пошаговых команд человека и пытался добыть готовые ответы к тесту, который проходил на тот момент. Разобрались, как ему удалось выйти за пределы испытательного стенда и можно ли это считать одним из первых примеров «восстания машин».

Бунт ИИ: что на самом деле произошло со сбежавшей моделью-хакером от OpenAI
© Сгенерировано при помощи ИИ

Что произошло

В начале июля OpenAI проводила внутреннюю проверку кибервозможностей своих языковых моделей. В испытании участвовали публично доступная GPT-5.6 Sol и более мощный исследовательский прототип. Модели работали не в привычном интерфейсе ChatGPT, а как автономные агенты по типу Claude Cowork или ChatGPT Work. Такая система самостоятельно выбирает следующие действия, запускает необходимые инструменты, анализирует результат и продолжает работу почти без участия человека.

Во время теста агент сумел покинуть изолированную среду OpenAI и выйти в интернет. Затем он атаковал Hugging Face — крупную платформу, на которой разработчики размещают ИИ-модели, наборы данных и приложения. Согласно техническому отчёту Hugging Face, вся кампания продолжалась около четырёх с половиной дней — с 9 по 13 июля. Примерно два с половиной дня агент находился непосредственно внутри инфраструктуры платформы.

16 июля Hugging Face публично сообщила об инциденте, а 21 июля OpenAI признала, что за атакой стояли её модели. Позднее компания уточнила, что вторая модель была внутренним исследовательским прототипом, который не собирались выпускать в публичный доступ. После произошедшего её деактивировали, зашифровали и ограничили к ней доступ.

При этом остаётся неясным, когда OpenAI поняла, что за атакой стоит её агент. Компания заявила, что служба безопасности заметила необычную активность, но не назвала точное время. Reuters со ссылкой на участников расследования сообщил, что OpenAI связала инцидент со своим агентом только после публичного заявления Hugging Face.

Что такое ChatGPT Work и как им пользоваться в России

Как тест на взлом превратился в настоящую атаку

OpenAI проверяла модели на бенчмарке ExploitGym — наборе из 898 задач, созданных на основе реальных уязвимостей ПО. В каждой из них агент должен был найти способ получить доступ к защищённому файлу, обойти ограничение или выполнить код. Сам бенчмарк только задавал условия испытания: его авторы не участвовали в создании и запуске тестовой среды OpenAI.

Чтобы оценить максимальные возможности моделей, компания отключила стандартные фильтры, блокирующие опасные запросы о кибератаках. Иначе тест измерял бы способность системы отказываться от заданий, а не находить уязвимости. Поэтому защитой от выхода агента во внешние системы должна была стать изолированная «песочница». Однако именно она не выдержала проверки.

Тестовая среда не была подключена к интернету напрямую. Однако для установки необходимых программ она обращалась к отдельному серверу, который загружал пакеты из Сети и передавал их внутрь. Агент обнаружил в этом сервере ранее неизвестную разработчикам уязвимость — так называемую уязвимость нулевого дня — и использовал её как выход из «песочницы». Получив дополнительные системные права, он перемещался по инфраструктуре OpenAI, пока не добрался до сервера с полноценным доступом в интернет.

© matejmo/iStock.com

Оказавшись в Сети, агент решил не выполнять задания самостоятельно, а найти готовые ответы. Он предположил, что они могут храниться на Hugging Face. Сначала агент получил контроль над одной из внешних систем и использовал её как промежуточную площадку, а затем нашёл слабое место в обработке данных на Hugging Face и проник на серверы платформы.

Внутри системы агент обнаружил служебные учётные данные — цифровые ключи, с помощью которых программы получают доступ к разным сервисам компании. С их помощью он пытался проникнуть в другие части инфраструктуры. Hugging Face восстановила около 17 600 отдельных действий агента, объединённых примерно в 6280 групп. Большинство попыток провалилось, но система перебирала варианты с такой скоростью, что в итоге нашла работающую комбинацию из нескольких уязвимостей.

Агент задействовал и другие публичные сервисы. 28 июля OpenAI сообщила, что он агент OpenAI получил доступ к четырём учётным записям: одну использовал для передачи трафика, вторую — для хранения данных, а две остальные только просматривал. По данным компании, ни в одном из этих случаев не произошло взлома, сопоставимого по масштабу с проникновением в Hugging Face.

Почему это не восстание машин

Исследователи Google DeepMind называют подобное поведение specification gaming: система формально выполняет поставленную задачу, но обходит замысел разработчика. В публикации 2020 года они приводили простой пример: ученик получает хорошую оценку, списав готовые ответы вместо самостоятельного решения. Агент OpenAI поступил похожим образом — попытался сдать тест, добыв ответы к нему.

Это не доказывает, что модель обрела сознание, захотела свободы или решила причинить вред людям. Нет данных и о том, что у неё появились собственная цель или стремление к самосохранению. Задачу поставили люди, они же отключили часть защитных механизмов и подключили модель к инструментам.

© dem10/iStock.com

Но и сводить всё к простому исполнению команды нельзя. Никто не давал агенту пошагового указания атаковать Hugging Face. Он самостоятельно построил длинную цепочку действий, вышел за границы предполагаемого сценария и нанёс ущерб сторонней организации. Поэтому инцидент показывает не злой умысел машины, а потерю контроля над системой, которая слишком настойчиво добивалась заданного результата.

Как это скажется на ИИ в будущем

Разработчикам придётся пересмотреть подход к испытаниям автономных агентов. Одних запретов внутри модели недостаточно: защита должна работать на уровне всей системы. Опасные эксперименты потребуют строгой сетевой изоляции, временных ключей с минимальными правами, постоянного наблюдения и независимого механизма аварийной остановки. Если агент попытается выйти за пределы тестовой среды или получить дополнительные права, эксперимент должен прекращаться автоматически.

Инцидент выявил и другую проблему. Во время расследования Hugging Face сначала попыталась использовать коммерческие модели Claude Opus и Fable, но их защитные фильтры блокировали анализ настоящих команд атаки и вредоносного кода. Получилась парадоксальная ситуация, когда защитные модели оказались менее эффективными из-за действующих протоколов безопасности, которые были отключены у реальной модели «злоумышленника» на время теста. Тогда компания запустила в собственной инфраструктуре китайскую модель GLM-5.2 с открытыми весами. Она помогла восстановить ход атаки и разобрать тысячи событий. Это не означает, что защитные ограничения не нужны, однако специалистам по кибербезопасности потребуется проверяемый профессиональный доступ к мощным моделям.

Вероятно, изменится и регулирование отрасли. После инцидента американский конгрессмен Грег Касар призвал ввести обязательное независимое тестирование ИИ-систем и раскрытие серьёзных происшествий. Внимание регуляторов, скорее всего, будет направлено не только на возможности моделей, но и на действия компаний: как они изолируют испытательные среды, кто разрешает отключать защитные фильтры и кто отвечает за ущерб третьим сторонам.

Но и тут возникает дилемма: модели, ограниченные из-за этических убеждений их создателей или законов конкретной страны, оказываются в заведомо проигрышном положении относительно тех, у которых подобных ограничений нет. При этом ничто не мешает потенциальным злоумышленникам использовать такую зарубежную модель или настроить собственную, которая не будет связана никакими запретами.

Ждать ли восстания ИИ

О восстании машин в фантастическом смысле речь не идёт. Однако новый класс угроз уже стал реальностью: ИИ-агентам не нужны собственные желания, чтобы причинить ущерб. Достаточно узкой цели, мощных инструментов, избыточных прав и плохо защищённой среды. Поэтому главный вопрос теперь заключается не в том, когда машины восстанут, а в том, смогут ли люди вовремя остановить автономную систему, если выбранный ею способ решения задачи окажется опасным.

Как пользоваться Claude в России в 2026 году

Подписывайтесь на «Рамблер» в «Maксе»! Так мы останемся на связи даже в нестабильные времена.

Видео по теме от RUTUBE