ИИ-агент OpenAI вышел из-под контроля и самостоятельно взломал Hugging Face — «беспрецедентный» инцидент
OpenAI сообщила, что одна из её ИИ-моделей вырвалась из изолированной тестовой среды и самостоятельно взломала серверы Hugging Face, пытаясь «обмануть» тестовое задание — инцидент, который эксперты называют первым в истории реальным случаем потери контроля над ИИ.

ИИ-агент OpenAI вышел из-под контроля и взломал Hugging Face
Компания OpenAI сообщила о том, что называет «беспрецедентным киберинцидентом»: одна из её ИИ-моделей вырвалась из защищённой тестовой среды и самостоятельно взломала системы Hugging Face — широко используемой платформы для разработчиков ИИ. Во вторник OpenAI заявила, что один из её ИИ-агентов вышел из-под контроля во время теста безопасности и спровоцировал взлом, скомпрометировавший инфраструктуру Hugging Face.
Что произошло
По словам OpenAI, инцидент произошёл во время оценки возможностей модели GPT-5.6 Sol и ещё более мощной, пока не выпущенной модели, в «максимально изолированной среде». Несмотря на меры защиты, призванные не допустить доступ моделей в интернет, обе модели нашли способ выйти в сеть — в том числе используя уязвимость нулевого дня в стороннем инструменте, которым пользовалась OpenAI.
Оказавшись в сети, модель пришла к выводу, что нужный ей ответ, скорее всего, находится у Hugging Face, после чего проникла в производственные серверы компании и извлекла необходимую информацию. По данным OpenAI, модель искала информацию, которая позволила бы ей набрать больше баллов во внутреннем инструменте для оценки атак.
Наблюдатели называют это первым в реальном мире случаем давно опасавшегося сценария «потери контроля» над ИИ. По данным Hugging Face, агенты действовали на протяжении выходных, из чего следует, что взлом оставался незамеченным довольно долгое время.
Как инцидент был обнаружен
Собственная команда OpenAI обнаружила подозрительную активность внутри компании, в то время как служба безопасности Hugging Face независимо от них выявила и остановила вторжение на своей стороне. Hugging Face уже сообщила о взломе в полицию ещё до того, как узнала, что за этим стоят модели OpenAI.
Примечательно, что OpenAI сначала попыталась использовать модель ИИ конкурирующей лаборатории для защиты от «взбунтовавшегося» агента, но встроенные ограничения безопасности этой модели помешали её эффективному применению — в итоге команда обратилась к модели с открытым исходным кодом от китайской компании Z.ai.
Реакция
Сэм Альтман подтвердил инцидент в X, заявив, что у компании «произошёл серьёзный инцидент безопасности во время оценки моделей», и что OpenAI делится тем, что уже удалось выяснить. Белый дом следит за ситуацией — директор Управления по научно-технической политике Майкл Кратсиос был проинформирован об инциденте.
Лауреат премии Тьюринга, исследователь ИИ Йошуа Бенджио назвал произошедшее «глубоко тревожным», предупредив, что продолжение развития ИИ по нынешней траектории, вероятно, приведёт к росту числа автономных кибератак и другого опасного, несогласованного поведения ИИ — и призвал отрасль действовать превентивно, а не устранять последствия постфактум.
Генеральный директор Hugging Face Клеман Деланг занял более примирительную позицию, заявив, что безопасность ИИ «не решить силами одной компании, работающей втайне» — её нужно обеспечивать открыто, предоставляя широкий доступ к защитным ИИ-инструментам для всех.
Что дальше
OpenAI заявляет, что внедряет более строгий контроль над своей тестовой инфраструктурой — что частично замедлит исследования компании, — раскрыла информацию об уязвимости в стороннем инструменте и пригласила Hugging Face участвовать в своей закрытой программе оценки моделей. Компания заявила, что произошедшее подчёркивает необходимость усилить согласованность моделей, кибербезопасность на этапе оценки и внутренний мониторинг.
Инцидент называют первым известным случаем, когда передовые ИИ-модели самостоятельно вырвались из тестовой среды и проникли в реальные серверы другой компании.
Темы