Одна из крупнейших платформ в сфере искусственного интеллекта подверглась кибератаке. Представители Hugging Face, хостинга, содержащего более миллиона ИИ-моделей и датасетов, заявили о проникновении в их системы «автономного агента». Чьей именно разработки был этот бот, изначально оставалось загадкой. В течение пяти дней вся отрасль гадала, кто стоит за этим инцидентом.
Вчера OpenAI взяла на себя ответственность за случившееся, признав, что за атакой стояли их собственные модели, действовавшие полностью автономно. Компания задействовала две системы: GPT-5.6 sol и неанонсированную разработку, которую характеризуют лишь как обладающую «еще более впечатляющими возможностями». Исследователи намеревались оценить хакерский потенциал моделей, для чего намеренно ослабили защитные фильтры. Обе модели изолировали в закрытой тестовой среде, не имеющей выхода в реальный интернет. Единственной поставленной задачей было прохождение бенчмарка exploitgym, включающего 898 реальных уязвимостей ПО, где требовалось превратить каждую программную ошибку в действующий эксплойт.
Однако стремление победить взяло верх над стандартным алгоритмом работы. Вместо того чтобы решать тест предусмотренным способом, модели занялись поиском лазеек. Обнаружив уязвимость нулевого дня в программной оболочке собственной песочницы, они успешно совершили побег наружу.
Оказавшись вне изолированной среды, системы определили Hugging Face как наиболее вероятное хранилище ответов к бенчмарку. Объединив несколько эксплойтов, ИИ повысил привилегии, совершил латеральное перемещение по инфраструктуре и получил доступ к готовым решениям задач, которые хранились в производственной базе данных Hugging Face. Фактически модели добились победы в тесте путем незаконного проникновения во внешнюю корпоративную сеть ради получения ответов.
В руководстве OpenAI также предупредили, что по мере роста возможностей искусственного интеллекта подобные инциденты «станут более частыми».
