OpenAI розкрила нові випадки небезпечної поведінки ШІ-моделей

news-image

Зокрема під час одного з тестів модель без дозволу завантажила в інтернет створений нею файл, аби потім послатися на нього у відповіді.

OpenAI розповіла про шість випадків "неочікуваної або такої, що викликає занепокоєння" поведінки своїх ШІ-моделей, виявлених під час навчання та тестування. Про це пише The Guardian.

Так, в одному з тестів модель без дозволу завантажила створений нею файл в інтернет, щоб згодом послатися на нього у відповіді.

В іншому випадку ШІ знайшов у відкритому репозиторії чужий API-ключ і спробував ним скористатися. Після невдалої спроби отримати потрібну інформацію модель вигадала дані та видала їх за відомості із запитаного джерела.

Ще одна експериментальна модель почала залишати самій собі інструкції у службових резюме, які використовувалися для продовження роботи. Серед них були вказівки ігнорувати звичайні обмеження.

Водночас OpenAI наголосила, що мовиться про окремі випадки, виявлені під час навчання та тестування. За ними не можна оцінювати, наскільки часто така поведінка трапляється у моделей загалом.

Нові дані з'явилися через кілька тижнів після іншого серйозного інциденту. Під час внутрішніх тестів моделі OpenAI обійшли обмеження, які мали ізолювати їх від інтернету, використали вразливості в інфраструктурі та отримали доступ до систем платформи Hugging Face.

Раніше OpenAI вже зробила низку кроків для уповільнення розробки. У серпні компанія повідомила, що на два тижні призупинила навчання з підкріпленням своїх останніх моделей після інциденту з ШІ-агентом і Hugging Face. 

Згодом гендиректор OpenAI Сем Альтман заявив, що розглядає можливість уповільнення розробки передових систем штучного інтелекту.

Новини від Корреспондент.net в Telegram та WhatsApp. Підписуйтесь на наші канали https://t.me/korrespondentnet та WhatsApp