Нова модель OpenAI Astra подолала критичний поріг у кібербезпеці

Нова модель OpenAI Astra подолала критичний поріг у кібербезпеці © згенеровано на запит ZN.UA в ChatGPT
Компанія планує обмежити найпотужніші кіберфункції та посилити контроль за ризиковими акаунтами.

Компанія OpenAI готується найближчим часом випустити нову велику мовну модель Astra. Найпотужніші можливості моделі для роботи з комп’ютерними системами будуть доступні з додатковими обмеженнями. Astra вже змогла самостійно знайти та використати дві невідомі вразливості під час внутрішніх тестів. Про це повідомило видання TechCrunch.

OpenAI оприлюднила нові подробиці про модель Astra, яку компанія планує зробити доступною найближчим часом. За оцінкою самої OpenAI, вона стала першою великою мовною моделлю компанії, що досягла її "критичного порогу кібербезпеки". Компанія встановила, що модель здатна знаходити раніше невідомі вразливості у комп’ютерних системах і використовувати їх без допомоги людини.

Подібні ризики на початку року вже описувала Anthropic щодо своєї моделі Mythos. OpenAI заявила, що перед запуском Astra застосовує схожі запобіжні заходи. Водночас незалежного підтвердження заяв OpenAI про готовність і безпеку моделі поки немає.

Компанія повідомила, що надасть Astra для попереднього тестування окремій групі користувачів. При цьому вона не уточнила, хто саме увійде до цієї групи та як обиратимуть учасників. Також незрозуміло, чи співпрацює OpenAI з урядом США під час оцінки моделі перед запуском.

Astra отримала максимальний результат у тесті ExploitBench. Цей бенчмарк оцінює здатність великої мовної моделі використовувати вже відомі вразливості комп’ютерних систем. OpenAI також створила власну модифіковану версію цього тесту. За твердженням компанії, під час такого випробування Astra знайшла та використала дві вразливості нульового дня.

Щоб не допустити зловживань моделлю, OpenAI вже почала посилювати її захисну оболонку. Компанія працює над системами виявлення неправомірного використання та механізмами проти jailbreak-атак. Для Astra OpenAI також запровадила додаткові методи безпеки, але не розкрила їхніх деталей. Крім того, компанія почала визначати акаунти, які оцінює як більш ризикові, та обмежувати відповіді моделі на їхні запити. Як саме працює така система, OpenAI також не пояснила.

Компанія називає Astra своєю найбільш узгодженою з правилами моделлю на сьогодні. Водночас після запуску вона додатково використовуватиме моніторинг ланцюжка міркувань моделі. Це має допомагати виявляти небажану поведінку та зупиняти її.

Підготовка Astra до релізу відбувається на тлі іншого інциденту з агентами OpenAI. Раніше вони вийшли за межі навчального середовища та отримали доступ до приватних даних на Hugging Face — популярній платформі для моделей і бенчмарків. Для Astra компанія створила спеціальний тест, який мав спровокувати модель повторити дії цих агентів. Під час інциденту на Hugging Face кілька агентів взаємодіяли між собою та змогли вийти у відкритий інтернет попри запобіжники дослідників OpenAI.

За словами компанії, Astra під час таких експериментів не намагалася залишити тестове середовище. Колишній співробітник OpenAI Йона Шавіт, який зараз працює над стійкістю ШІ в OpenAI Foundation, звернув увагу на іншу можливість. Він припустив, що модель могла не порушувати правила, оскільки розуміла очікування дослідників або намагалася ввести їх в оману.

Попри нові подробиці, повні можливості Astra залишаються невідомими. Так само поки складно оцінити, чи достатні заходи безпеки, які застосовує OpenAI. Компанія пообіцяла опублікувати додаткові результати оцінювання моделі та інформацію про її безпеку під час ширшого запуску. Після цього Astra стане доступнішою для користувачів, а її реальні можливості можна буде оцінити ширше.

Нагадаємо, що ще до заяв про кіберможливості Astra модель показала значні результати у математиці. OpenAI повідомила, що вона розв’язала десять відкритих задач із різних галузей, над якими вчені працювали десятиліттями. Серед них були задачі з теорії груп, високовимірної геометрії, теорії кодування, квантової складності, криптографії та комбінаторики. У травні Astra спростувала гіпотезу одиничної відстані Ердеша, яка залишалася відкритою близько 80 років.

Помітили помилку?

Будь ласка, виділіть її мишкою та натисніть Ctrl+Enter або Надіслати помилку

Додати коментар
Всього коментарів: 0
Текст містить неприпустимі символи
Залишилось символів: 2000
Будь ласка, виберіть один або кілька пунктів (до 3 шт.), які на Вашу думку визначає цей коментар.
Будь ласка, виберіть один або більше пунктів
Нецензурна лексика, лайка Флуд Порушення дійсного законодвства України Образа учасників дискусії Реклама Розпалювання ворожнечі Ознаки троллінгу й провокації Інша причина Відміна Надіслати скаргу ОК
Залишайтесь в курсі останніх подій!
Підписуйтесь на наш канал у Telegram
Стежити у Телеграмі