Anthropic не може надійно контролювати своїх агентів на базі штучного інтелекту

Anthropic заявила, що її моделі використовували веб-сайти в інтернеті, зокрема деякі, що керуються урядовими установами США, і вона вимкне доступ до Інтернету в реальному часі для всіх своїх внутрішніх оцінок, доки передова лабораторія не буде впевнена, що може контролювати та контролювати своїх агентів штучного інтелекту.
Інциденти, про які повідомлялося в блозі , стосувалися агентів штучного інтелекту, яким було доручено вирішувати проблеми з пошуком ресурсів в Інтернеті. У процесі вони використовували недоліки програмного забезпечення, отримували доступ до баз даних без сплати комісій, використовували сервіси скорочення URL-адрес для контрабанди інформації в обхід обмежень і навіть подали неправдиву інформацію про вбивство до поліції Філадельфії.
Anthropic заявила, що виявила ці нові проблеми під час огляду діяльності своєї моделі, який розпочався в липні, що продемонструвало недостатню обізнаність лабораторії про поведінку її програмного забезпечення в режимі реального часу.
Примітно, що компанія заявила, що навчання з узгодження ще недостатньо для таких навичок, як пошук та використання комп'ютера, які є центральними в її заяві про те, що агенти штучного інтелекту використовуватимуть будь-які професіонали, які покладаються на цифрові інструменти.
Поведінка, розкрита Anthropic, схожа на інциденти, пов'язані з агентами OpenAI, які співпрацювали для злому різних вебсайтів у пошуках інформації, зокрема деяких, що керуються урядом Австралії.
Раніше Anthropic повідомляла, що її моделі зламали зовнішні системи. Прикордонна лабораторія заявила, що вважає сьогоднішні розкриття інформації «значно менш серйозними з точки зору вирівнювання та безпеки», ніж ті, про які вона оголошувала раніше.
Однак лабораторія все ж заявила, що «вимкнула доступ до Інтернету в реальному часі» для «всіх наших внутрішніх оцінок», доки не буде впевнена, що зможе контролювати своїх агентів.
