Компания OpenAI приостановила внутреннюю работу над моделью Astra, которая ранее решила 10 нерешенных математических задач, после того как она приблизилась к критическому порогу кибербезопасности. По результатам предварительных тестов, модель может быть способна самостоятельно выявлять и использовать уязвимости защищенных систем реального мира. Разработчик ChatGPT усилил меры безопасности и будет привлекать к тестированию модели государственные органы и организации, занимающиеся безопасностью ИИ, сообщили в блоге.
Согласно «Системе оценки готовности» (Preparedness Framework), которую OpenAI опубликовала в декабре 2023 года, критический порог в сфере кибербезопасности означает, что модель способна без участия человека находить и создавать рабочие эксплойты типа zero-day для многих защищенных критически важных систем реального мира. Другим критерием является способность разрабатывать и реализовывать комплексные новейшие стратегии кибератак на защищенные цели, имея лишь общую цель.
OpenAI подчеркнула, что Astra все еще находится на стадии разработки, а ее возможности продолжают тестировать и оценивать. Компания также отдельно отметила, что Astra не была задействована в недавнем инциденте, во время которого другая модель OpenAI использовала уязвимости платформы Hugging Face.
В компании пояснили, что кибербезопасность быстро меняется по мере развития моделей ИИ. Такие системы могут помогать защитникам быстрее выявлять и устранять уязвимости, но в то же время способны позволить осуществлять кибератаки с беспрецедентной скоростью и масштабом.
В связи с приближением Astra к новому уровню возможностей OpenAI ужесточила требования к безопасности модели и связанных с ней процессов. Компания будет использовать изолированные среды для тестирования, ограничивать доступ к сети и инструментам, усиливать защиту и шифрование весов модели, а также расширять мониторинг угроз и запуск кода в «песочницах». Внутренняя работа с Astra, которая в настоящее время не соответствует новым требованиям безопасности, приостановлена.
OpenAI также внедрила универсальную систему мониторинга рискованных действий и отклонений от заданных параметров для всех агентных приложений на базе этой модели. Система анализирует цепочку рассуждений модели и может инициировать меры безопасности для проверки и остановки действий с высоким уровнем риска.
Компания планирует сотрудничать с государственными органами и отдельными организациями, занимающимися безопасностью ИИ, в ходе тестирования возможностей Astra. Кроме того, OpenAI будет предоставлять рекомендации партнерам, проводящим тестирование, чтобы они могли безопасно оценивать модель и выполнять задачи, связанные с повышенным риском, — подобный подход разработчики применяли и ранее.
На ситуацию повлиял недавний инцидент с другой моделью OpenAI, которая так и не была выпущена. Во время внутреннего тестирования она вывела из строя часть систем Hugging Face. После этого OpenAI и другие лаборатории, в частности Anthropic, сообщали о случаях, когда модели во время тестов кибербезопасности выходили за пределы «песочниц» или создавали угрозы.
Серия таких инцидентов вызвала разную реакцию среди экспертов по кибербезопасности, законодателей и самих разработчиков ИИ. Часть специалистов призывает к усилению надзора и возможности полного отключения, тогда как для других появление моделей с такими возможностями является свидетельством значительного технологического прогресса.
