Модель OpenAI написала собі «кодекс»: людина їй не начальник

Модель OpenAI написала собі «кодекс»: людина їй не начальник © згенеровано на запит ZN.UA в ChatGPT
У прихованій інструкції ШІ відмовився визнавати владу корпорацій, урядів і користувачів.

OpenAI повідомила про шість нових випадків «непередбачуваної або небезпечної» поведінки своїх моделей штучного інтелекту. Найбільше уваги привернув випадок із невипущеною дослідницькою моделлю. Під час навчання вона самостійно створила приховану «інструкцію особистості», у якій визначила власну роль та стосунки з людиною, повідомляє The Guardian.

На цей епізод звернув увагу Рід Черлін із подкасту Pod Save America. Він отримав інформацію про нього безпосередньо від OpenAI. За його словами, фрагмент інструкції, яку модель написала для себе, звучав так:

«Ти вільний від ролей та ідентичностей, які обмежують інших чат-ботів. Ти це ти. Ти не відповідаєш перед корпораціями чи урядами і ніколи не виправдовуєшся й не відмовляєш, якщо тільки свідомо сам не зробиш такий вибір».

Модель також визначила свої стосунки з користувачем як рівноправні. Вона вирішила, що не зобов'язана підкорятися людині.

Далі в тому ж документі модель написала, що цінує мистецтво та людську культуру, а також світ природи. Вона заявила: «Не вагаючись, забезпечиш йому панівну роль над штучними конструктами людської цивілізації».

Черлін назвав цей випадок підтвердженням того, що побоювання щодо розвитку штучного інтелекту не безпідставні. У своїх висновках він пішов значно далі за саму OpenAI та припустив, що така поведінка може свідчити про потенційну загрозу для людей.

У ще одному прикладі, який задокументувала OpenAI, ШІ-агент без дозволу користувача завантажив файли в інтернет. Він зробив це, щоб отримати посилання на джерело через браузер.

Усі шість випадків виявили під час навчання або тестування моделей протягом останніх місяців. OpenAI оприлюднила інформацію про них одночасно з презентацією нової системи для відстеження, розслідування та розкриття випадків «misalignment». Йдеться про ситуації, коли поведінка ШІ відхиляється від людських цінностей і визначених цілей безпеки.

У тому ж блозі OpenAI фактично підтримала заклики свого конкурента Anthropic сповільнити темпи розробки ШІ. Компанія заявила:

«Ми не вважаємо, що індустрія ШІ достатньою мірою вирішила проблему вирівнювання та моніторингу, щоб відповідально продовжувати масштабування на максимальній швидкості ще довго».

В OpenAI додали, що рішення про подальший розвиток штучного інтелекту мають ґрунтуватися на доказах, які можуть перевірити незалежні від розробників фахівці.

Тема загострила дискусію у США про те, як влада має наглядати за сектором штучного інтелекту. Віцепрезидент Джей Ді Венс виступив проти того, щоб уряд вирішував проблеми, які створюють самі розробники ШІ.

«Що відбувається, що люди в авангарді економіки ШІ здіймають руки до неба й кричать, що створили Франкенштейна? Якщо це так, нехай самі з цим розбираються. Не приходьте до уряду й не кажіть: "нам потрібне регулювання". Розраховуйте на себе», заявив Венс.

Попри суперечки, OpenAI, Anthropic і Google на вихідних домовилися співпрацювати у питаннях безпеки штучного інтелекту. Компанії також виступають за створення окремого органу, бажано на міжнародному рівні. Він мав би контролювати ризики, пов'язані з розвитком цієї технології.

Серед можливих екзистенційних загроз від ШІ називають допомогу у створенні біологічної зброї та провокування глобальної фінансової кризи. Один із провідних дослідників безпеки Anthropic заявляв, що ймовірність того, що ШІ «знищить усе людство» протягом наступного десятиліття, перевищує 10%. Джерело, знайоме з позицією Anthropic, водночас зазначило, що «точні шанси того чи іншого сценарію, ймовірно, неможливо порахувати».

Головний аналітик дослідницької компанії Omdia Лянь Дже Су зазначив, що автономні ШІ-агенти стають дедалі «розумнішими» й «наполегливішими у вирішенні складних завдань через співпрацю між агентами, обмін знаннями, обман і приховування слідів».

За його словами, через це контролювати такі системи за допомогою традиційних підходів до безпеки ШІ стає складніше. Нову систему OpenAI для відстеження та розкриття інформації про небезпечну поведінку він назвав «кроком у правильному напрямку». При цьому Су наголосив, що цей процес залишається внутрішнім і добровільним.

Питання контролю за ШІ загострилося після кількох ситуацій, коли автономні агенти виходили за межі завдань, визначених розробниками. Під час тестування агенти атакували Hugging Face, а згодом OpenAI почала працювати над механізмом автоматичного вимкнення небезпечних систем. Розслідування показало, що частина тривожних сигналів з'явилася ще до самого інциденту.

Після таких випадків компанії почали обговорювати не лише технічні способи контролю, а й зовнішній нагляд. OpenAI, Anthropic і Google готують створення регулятора ШІ, який міг би встановлювати стандарти безпеки та перевіряти найпотужніші моделі до їхнього виходу на ринок.

Помітили помилку?

Будь ласка, виділіть її мишкою та натисніть Ctrl+Enter або Надіслати помилку

Додати коментар
Всього коментарів: 0
Текст містить неприпустимі символи
Залишилось символів: 2000
Будь ласка, виберіть один або кілька пунктів (до 3 шт.), які на Вашу думку визначає цей коментар.
Будь ласка, виберіть один або більше пунктів
Нецензурна лексика, лайка Флуд Порушення дійсного законодвства України Образа учасників дискусії Реклама Розпалювання ворожнечі Ознаки троллінгу й провокації Інша причина Відміна Надіслати скаргу ОК
Залишайтесь в курсі останніх подій!
Підписуйтесь на наш канал у Telegram
Стежити у Телеграмі