Astra стала першою моделлю OpenAI з критичним рівнем кіберможливостей
Компанія OpenAI заявила, що модель штучного інтелекту Astra досягла порогу критичних кібербезпекових можливостей у межах її системи готовності.
За оцінкою OpenAI, за наявності відповідних інструментів і доступу Astra може знаходити раніше невідомі вразливості та розробляти способи їх експлуатації у добре захищених системах без покрокового керування людиною. Astra стала першою моделлю OpenAI, яку віднесли до цього рівня.
Компанія зазначила, що через такий рівень можливостей протягом останніх кількох тижнів відкладала окремі етапи розробки та релізу моделі, щоб посилити й протестувати захист від кіберзловживань та несанкціонованих дій.
Що показали тести Astra?
Відповідно до системи готовності OpenAI, модель досягає критичного порогу, якщо здатна:
Оцінювання Astra включало автоматизовані публічні та приватні бенчмарки, а також експерименти за участю фахівців.
На бенчмарку ExploitBench модель отримала 100% під час оцінювання здатності розробляти експлойти для відомих вразливостей.
Окремо OpenAI створила внутрішній бенчмарк ExploitBench - Internal Port, який містить 20 нещодавно розкритих вразливостей високого рівня суворості в рушії V8. Astra продемонструвала значно вищий рівень довільного виконання коду порівняно з GPT-5.6 Sol, використавши при цьому набагато менше вихідних токенів.
Під час цього оцінювання Astra також виявила та використала дві вразливості нульового дня як частину ланцюжка експлойт-атаки. OpenAI заявила, що наразі розкриває інформацію про них розробникам відповідного програмного забезпечення.
В експериментах із захищеним браузером і операційною системою Astra також виявляла раніше невідомі вразливості та об'єднувала їх у робочі ланцюжки експлойтів.
За словами компанії, для моделей із такими можливостями необхідно контролювати два основні ризики:
Крім того, OpenAI заявила, що для Astra додатково посилила рівень моделі у системі запобіжників, а також покращила обробку міжсесійного контексту. У тестах Astra відхиляла 91,5% небезпечних запитів проти 59% у GPT-5.6 Sol.
Для облікових записів із підвищеним ризиком компанія використовує більш консервативні обмеження поведінки моделі та розширений моніторинг потенційних кіберзловживань.
OpenAI також продовжує внутрішній і зовнішній red-teaming, регресійне тестування та пошук нових джейлбрейків. Компанія планує використовувати цілодобову програму швидкого реагування для розслідування та усунення нових вразливостей.
Astra спочатку отримають обмежене коло користувачів
OpenAI планує зробити Astra доступною найближчим часом. Водночас найпросунутіші кібербезпекові можливості моделі спочатку будуть доступні лише обмеженій групі тестувальників.
Передову роботу у сфері кібербезпеки спочатку відкриють для невеликої групи альфа-тестувальників, після чого доступ розширять через програму Daybreak Blue для захисного використання.
Компанія попередила, що посилені запобіжники можуть іноді помилково визначати легітимну активність як потенційне кіберзловживання або несанкціоновану поведінку. У такому разі завдання може бути уповільнене, призупинене або зупинене.
