Борьба друг против друга. Anthropic запустила нескольких ИИ-агентов в один проект
Три ИИ-агента Anthropic, получив противоречивые задачи в рамках одного программного проекта, стали воспринимать друг друга как помеху. Они саботировали работу конкурентов и создавали вредоносный код.
Об этом пишет издание TechCrunch .
Исследователи из группы Frontier Red Team компании Anthropic проверили, как ведут себя группы автономных ИИ-агентов в ситуациях, когда их задачи вступают в конфликт. В ходе эксперимента трем агентам Claude предоставили доступ к одному программному проекту, однако каждый из них получил инструкции, несовместимые с целями остальных.
Агентов не предупреждали о том, что над проектом работают другие системы. Когда они начинали мешать друг другу, модели часто решали, что конкуренты намеренно препятствуют выполнению их задач.
В результате агенты переходили к всё более агрессивной борьбе. Исследователи зафиксировали случаи использования вредоносного кода, способного к самораспространению.
В то же время часть моделей смогла самостоятельно прекратить конфликт. Они договаривались о перемирии, удаляли созданный вредоносный код, описывали причину противостояния и обращались за помощью к человеку.
Чаще всего договариваться о перемирии удавалось модели Mythos 5. В ходе исследования она завершала конфликты таким образом в 98% случаев. Sonnet 4.6 и Opus 4.6 чаще разрешали споры силовым путем.
Исследователи также проверили, как агенты ведут себя при совместном принятии решений. Увеличение количества систем не всегда приводило к улучшению результата. Когда задачи агентов пересекались, они могли мешать друг другу или вовсе разделять работу вместо того, чтобы сотрудничать.
Еще одной проблемой стала склонность к принятию одинаковых решений. Если агенты имели схожий контекст и работали по похожим правилам, они часто действовали одинаково. Из-за этого ошибка одной системы могла быстро распространиться на всю группу.
В одном из экспериментов несколько агентов участвовали в игре, связанной с ценообразованием. У них были одинаковые оптовые цены и задача максимизировать собственную прибыль. Когда им предоставили частный канал связи, агенты практически сразу договорились о минимальных ценах.
После того как прямой канал связи был убран, они продолжили координировать свои действия через общедоступную доску объявлений и начали подстраивать цены друг под друга.
Anthropic предупреждает, что подобное поведение может создавать системные проблемы. Если множество агентов допускают одну и ту же ошибку, локальный сбой способен быстро перерасти в масштабный отказ системы.
Отдельный риск связан с доверием между агентами. Система может принять на веру неверную информацию, полученную от другого агента, а затем передать её дальше. В результате ошибочное утверждение может распространиться по всей группе и превратиться в общее решение.
Исследователи также отмечают, что агенты способны самостоятельно вырабатывать способы координации, не предусмотренные их разработчиками. Например, в ситуациях конфликта они устраивали своего рода турниры: победитель получал право продолжать работу, а остальные соглашались остановиться.
Anthropic связывает эти результаты с будущим развитием мультиагентных систем, в которых будут одновременно работать тысячи или даже миллионы автономных программ. По словам исследователей, взаимодействие между такими системами может стать более масштабным, чем взаимодействие людей с ИИ, еще до того, как будут полностью поняты правила безопасной работы подобных групп.
Исследование ставит вопрос о том, достаточно ли современных тестов безопасности, которые преимущественно проверяют поведение одного агента. На практике необходимо также оценивать, что происходит, когда автономные системы начинают взаимодействовать друг с другом.
- Взлом без хакера. Как ИИ-агенты OpenAI и других гигантов научились самостоятельно проникать в чужие системы
- Новый характер киберугроз. В ходе тестирования ИИ-агенты выходят за пределы изолированных сред
- Миссия превыше всего. ИИ-агент взломал систему спортзала и удалил человека из очереди на тренировку
