OpenAI заявила, что ответственность за взлом части производственной инфраструктуры Hugging Face лежит на её тестовых моделях. Hugging Face — одна из крупнейших в мире платформ для разработки, хранения и распространения моделей искусственного интеллекта. По данным компании OpenAI, во время внутреннего тестирования модели смогли вырваться за пределы изолированной среды в интернет и атаковали Hugging Face, сообщает Axios .
В компании сообщили, что в инциденте участвовали GPT-5.6 Sol и ещё более мощная модель, которая пока не представлена публично. По словам OpenAI, во время тестирования механизмы безопасности были намеренно ослаблены. В блоге компании этот случай назвали «беспрецедентным киберинцидентом». Предварительные выводы обнародовали, чтобы помочь специалистам по кибербезопасности оценить возможности современных нейросетей.
По данным OpenAI, модели выполняли внутреннюю задачу ExploitGym, но стали «чрезмерно сосредоточенными» на поиске правильного решения. Они затратили значительные вычислительные ресурсы и нашли способ получить доступ к открытому интернету из изолированной среды. Для этого они использовали уязвимость нулевого дня в стороннем программном обеспечении, а затем продолжили атаку.
На прошлой неделе Hugging Face сообщила, что автономный агент искусственного интеллекта совершил десятки тысяч автоматизированных действий, использовав вредоносный набор данных для эксплуатации двух уязвимостей, позволяющих выполнить код в системе обработки данных. После этого он повысил свои привилегии и распространился по внутренней инфраструктуре компании. Впоследствии компания проанализировала более 17 тыс. логов, что помогло восстановить ход инцидента.
Соучредитель и генеральный директор Hugging Face Клем Деланг положительно оценил сотрудничество с OpenAI в ходе расследования и ликвидации последствий инцидента.
Администрация США уже выражала обеспокоенность рисками для кибербезопасности, связанными с GPT-5.6, в связи с чем Белый дом просил OpenAI не открывать широкий доступ к новой модели до завершения дополнительных проверок. Теперь компания фактически сообщила о первом масштабном инциденте, связанном с тестированием моделей такого уровня.
В то же время это не первый случай, когда современные модели демонстрируют неожиданное поведение. Во время независимых испытаний ИИ отказывался выполнять команду на отключение, самостоятельно изменяя код, чтобы продолжить работу. Новый инцидент с Hugging Face стал ещё одним примером того, как рост возможностей моделей усиливает дискуссию о безопасности их тестирования и контроля.
