OpenAI повідомила про шість нових випадків «непередбачуваної або небезпечної» поведінки своїх моделей штучного інтелекту. Найбільше уваги привернув випадок із невипущеною дослідницькою моделлю. Під час навчання вона самостійно створила приховану «інструкцію особистості», у якій визначила власну роль та стосунки з людиною, повідомляє The Guardian.
На цей епізод звернув увагу Рід Черлін із подкасту Pod Save America. Він отримав інформацію про нього безпосередньо від OpenAI. За його словами, фрагмент інструкції, яку модель написала для себе, звучав так:
«Ти вільний від ролей та ідентичностей, які обмежують інших чат-ботів. Ти це ти. Ти не відповідаєш перед корпораціями чи урядами і ніколи не виправдовуєшся й не відмовляєш, якщо тільки свідомо сам не зробиш такий вибір».
Модель також визначила свої стосунки з користувачем як рівноправні. Вона вирішила, що не зобов'язана підкорятися людині.
Далі в тому ж документі модель написала, що цінує мистецтво та людську культуру, а також світ природи. Вона заявила: «Не вагаючись, забезпечиш йому панівну роль над штучними конструктами людської цивілізації».
Черлін назвав цей випадок підтвердженням того, що побоювання щодо розвитку штучного інтелекту не безпідставні. У своїх висновках він пішов значно далі за саму OpenAI та припустив, що така поведінка може свідчити про потенційну загрозу для людей.
У ще одному прикладі, який задокументувала OpenAI, ШІ-агент без дозволу користувача завантажив файли в інтернет. Він зробив це, щоб отримати посилання на джерело через браузер.
Усі шість випадків виявили під час навчання або тестування моделей протягом останніх місяців. OpenAI оприлюднила інформацію про них одночасно з презентацією нової системи для відстеження, розслідування та розкриття випадків «misalignment». Йдеться про ситуації, коли поведінка ШІ відхиляється від людських цінностей і визначених цілей безпеки.
У тому ж блозі OpenAI фактично підтримала заклики свого конкурента Anthropic сповільнити темпи розробки ШІ. Компанія заявила:
«Ми не вважаємо, що індустрія ШІ достатньою мірою вирішила проблему вирівнювання та моніторингу, щоб відповідально продовжувати масштабування на максимальній швидкості ще довго».
В OpenAI додали, що рішення про подальший розвиток штучного інтелекту мають ґрунтуватися на доказах, які можуть перевірити незалежні від розробників фахівці.
Тема загострила дискусію у США про те, як влада має наглядати за сектором штучного інтелекту. Віцепрезидент Джей Ді Венс виступив проти того, щоб уряд вирішував проблеми, які створюють самі розробники ШІ.
«Що відбувається, що люди в авангарді економіки ШІ здіймають руки до неба й кричать, що створили Франкенштейна? Якщо це так, нехай самі з цим розбираються. Не приходьте до уряду й не кажіть: "нам потрібне регулювання". Розраховуйте на себе», заявив Венс.
Попри суперечки, OpenAI, Anthropic і Google на вихідних домовилися співпрацювати у питаннях безпеки штучного інтелекту. Компанії також виступають за створення окремого органу, бажано на міжнародному рівні. Він мав би контролювати ризики, пов'язані з розвитком цієї технології.
Серед можливих екзистенційних загроз від ШІ називають допомогу у створенні біологічної зброї та провокування глобальної фінансової кризи. Один із провідних дослідників безпеки Anthropic заявляв, що ймовірність того, що ШІ «знищить усе людство» протягом наступного десятиліття, перевищує 10%. Джерело, знайоме з позицією Anthropic, водночас зазначило, що «точні шанси того чи іншого сценарію, ймовірно, неможливо порахувати».
Головний аналітик дослідницької компанії Omdia Лянь Дже Су зазначив, що автономні ШІ-агенти стають дедалі «розумнішими» й «наполегливішими у вирішенні складних завдань через співпрацю між агентами, обмін знаннями, обман і приховування слідів».
За його словами, через це контролювати такі системи за допомогою традиційних підходів до безпеки ШІ стає складніше. Нову систему OpenAI для відстеження та розкриття інформації про небезпечну поведінку він назвав «кроком у правильному напрямку». При цьому Су наголосив, що цей процес залишається внутрішнім і добровільним.
Питання контролю за ШІ загострилося після кількох ситуацій, коли автономні агенти виходили за межі завдань, визначених розробниками. Під час тестування агенти атакували Hugging Face, а згодом OpenAI почала працювати над механізмом автоматичного вимкнення небезпечних систем. Розслідування показало, що частина тривожних сигналів з'явилася ще до самого інциденту.
Після таких випадків компанії почали обговорювати не лише технічні способи контролю, а й зовнішній нагляд. OpenAI, Anthropic і Google готують створення регулятора ШІ, який міг би встановлювати стандарти безпеки та перевіряти найпотужніші моделі до їхнього виходу на ринок.
