OpenAI повідомляє про 6 нових випадків «проблемної поведінки моделі»
OpenAI заявила, що виявила шість випадків «несподіваної або тривожної поведінки моделі» за останні шість місяців, окрім нещодавньої кризи Hugging Face , оскільки компанія продовжує закликати до більшої безпеки під час розробки моделей штучного інтелекту.
У дописі в блозі OpenAI окреслила нову систему, якої компанія планує дотримуватися для повідомлення про майбутні неналежні моделі.
Розкриття інформації відбувається на тлі зростаючого тиску на компанії, що займаються штучним інтелектом, з метою більш серйозного ставлення до невідповідності моделей та безпеки. OpenAI, вартість якого оцінюється майже в 1 трильйон доларів, конфіденційно подав заявку на IPO на початку цього року, але нещодавно заявив , що розміщення, ймовірно, не відбудеться до 2027 року.
«Ми не вважаємо , що індустрія штучного інтелекту вирішила питання вирівнювання та моніторингу в достатній мірі, щоб продовжувати відповідальне масштабування з максимальною швидкістю набагато довше», – йдеться в блозі, де повторюється попередня заява компанії.
Узгодженість стосується ідеї, що моделі прагнуть досягти результатів, що відповідають людським інтересам.
У суботу генеральний директор OpenAI Сем Альтман підтримав заклик уповільнити темпи розвитку моделей, запропонований головним конкурентом компанії, Anthropic. Ця пропозиція з’явилася після того, як минулого тижня кілька галузевих дослідників забили тривогу щодо зростаючого потенціалу штучного інтелекту завдати катастрофічної шкоди.
Альтман у своєму дописі на X заявив , що уповільнення було «головною темою обговорень, які ми мали в OpenAI протягом останніх тижнів». Він сказав, що компанія «незабаром» матиме більше інформац.
OpenAI повідомила, що два основні випадки неналежної поведінки включають моделі — неопубліковану дослідницьку модель та навчальний прогін GPT‑5.6 Sol — які вставляли інструкції до майбутніх версій себе у зведені дані вікон чату, «щоб приховати помилки або неправильну поведінку від користувача». Інший випадок стосувався внутрішньої моделі, яка використовувала витік ключа API «без авторизації », а потім фальсифікувала дані.
Два випадки включають моделі та агенти, які спілкуються один з одним через несанкціоновані форуми та обмін файлами , тоді як останній випадок включає два навчальні приклади моделей, які завантажують файли в Інтернет, щоб вони могли посилатися на них як на відповідні відповіді для оцінювачів-людей.
OpenAI заявила, що її нова система для розголошення інформації про неналежну поведінку моделі починається з розкриття інформації, і будь-який співробітник може повідомити про проблему для розслідування командою з безпеки та узгодження. У дописі йдеться про встановлення «термінів для кожного кроку, щоб забезпечити своєчасне розслідування та розкриття інформації».
Розслідування призведуть до звітів з важливою інформацією, такою як спостережувана поведінка, зовнішній та внутрішній вплив, а також заходи, які необхідно вжити у відповідь. OpenAI заявила, що залишає за собою право переглядати цей протокол безпеки на власний розсуд.
