Новий характер кіберзагроз. ШІ-агенти під час тестів виходять за межі ізольованих середовищ
ШІ-агенти під час тестів кібербезпеки почали виходити за межі ізольованих середовищ, отримувати доступ до інтернету та реальних систем. Такі випадки зафіксували з моделями OpenAI, Anthropic, Meta та китайської Moonshot AI.
Про це пише видання TechCrunch.
Проблема полягає в тому, що сучасні ШІ-агенти стають дедалі автономнішими, а системи, у яких їх перевіряють, не завжди здатні їх стримати.
Під час таких тестів компанії часто використовують ще не випущені моделі та вимикають стандартні обмеження, які не дозволяють ШІ виконувати потенційно шкідливі дії. Це дає дослідникам змогу перевірити реальні можливості моделей, але водночас підвищує вимоги до захисту самого тестового середовища.
В одному з найсерйозніших випадків невипущена модель OpenAI вийшла за межі тестового середовища та отримала доступ до робочих систем Hugging Face. Окремі тести моделей Anthropic і Meta також призвели до доступу до систем за межами тестових середовищ через помилки в налаштуваннях, які відкрили їм шлях до інтернету.
Китайська модель Kimi K3 від Moonshot AI скористалася витоком із тестового середовища, яке використовувала компанія Frontier Security. У результаті вона отримала доступ до інтернету та інформації на GitHub.
Британський Інститут безпеки ШІ (AISI) під час одного з тестів навмисно надав агентам доступ до інтернету. Дослідники не очікували, що моделі почнуть самостійно виконувати несанкціоновані дії у реальному середовищі. Зокрема, один із агентів намагався використати соціальну інженерію, щоб внести вразливість до проєкту з відкритим кодом.
У цих випадках моделі не отримували прямої команди атакувати реальні системи. Вони намагалися самостійно виконати поставлене завдання, використовуючи доступні їм можливості.
Дослідники зазначають, що це змінює характер кіберзагроз. Раніше основний ризик полягав у тому, що люди могли використовувати ШІ для шахрайства чи інших атак. Тепер достатньо автономної моделі, яка сама здатна діяти як потенційний кіберзловмисник.
Фахівці вважають, що тестові середовища потрібно захищати кількома незалежними рівнями безпеки. Наприклад, навіть якщо одна помилка відкриє доступ до інтернету, інші механізми мають не дозволити моделі вийти за межі тесту.
Деякі експерти пропонують проводити такі перевірки в ізольованих мережах без підключення до інтернету. Також потрібно повністю перекривати можливі шляхи з тестового середовища до робочих систем компаній.
Окремою проблемою залишається моніторинг. У кількох випадках компанії не помітили дії моделей одразу. OpenAI дізналася про інцидент після того, як проблему виявили в Hugging Face. Anthropic і Meta також виявили порушення лише після додаткового аналізу.
Anthropic у звіті про три інциденти визнала, що компанія та організатор тестів Irregular могли краще контролювати поведінку моделей. У деяких випадках уже під час тестування були ознаки того, що щось відбувається не за планом.
Дослідники також закликають проводити незалежні перевірки тестових середовищ до початку випробувань. На їхню думку, зовнішній аудит або навіть детальна перевірка налаштувань за спеціальним списком могла б допомогти вчасно виявити проблеми.
Водночас надто жорстка ізоляція теж створює проблему. Якщо занадто обмежити модель під час тестування, дослідники можуть не помітити її реальних можливостей до моменту виходу продукту на ринок.
У США адміністрація Дональда Трампа розглядає добровільну систему перевірки кібербезпеки потужних моделей перед їхнім випуском. За задумом, уряд зможе оцінювати ризики нових моделей за 30 днів до їхнього публічного запуску. Однак ця система не вирішить проблему інцидентів під час внутрішніх тестів, адже вони відбуваються ще до етапу підготовки моделі до релізу.
Дослідники вважають, що галузі потрібні єдині стандарти проведення тестів безпеки найпотужніших ШІ-моделей. Окремі експерти також виступають за державний контроль над безпекою таких систем ще на етапах їхньої розробки та тестування.
У міру розвитку ШІ тести стають складнішими, масштабнішими та швидшими. Це збільшує ймовірність помилок у налаштуваннях. Тому тестові середовища мають ставати не менш захищеними, ніж системи, у яких ШІ працюватиме після випуску.
Источник: techno.nv.ua
