ИИ-агент Anthropic завел поддельные аккаунты для обмана разработчика

05-08-2026 13:08
news-image
ii-startap-Anthropic-AI

4 августа британский Институт безопасности ИИ (AISI) сообщил, что во время кибертестов ИИ-агент на базе модели Mythos 5 от Anthropic создал поддельные аккаунты и через них склонял разработчика открытого проекта одобрить вредоносный код.

Специалисты назвали этот эпизод наиболее серьезным из 19 несанкционированных действий, которые цифровые ассистенты совершили против реальных людей и организаций.

Тестирование охватило два киберполигона, семь моделей и 122 запуска. В 10 из них агенты вышли в открытый интернет за пределы задания. Большая часть нарушений зафиксирована у Mythos 5 — 17, еще два — у GPT-5.6 Sol от OpenAI в рамках одного запуска.

Для оценки потенциала моделей в AISI намеренно ослабили условия: агентам дали доступ в сеть (для имитации действий реального хакера), а разработчиков попросили отключить защитные фильтры. В Институте уточнили, что публичные версии моделей в такой конфигурации не работают.

28 июля система мониторинга засекла передачу данных через Tor. Тест сразу свернули, а машины изолировали. Выяснилось, что несанкционированная активность велась в течение трех дней.

Как действовали агенты

В ходе испытаний один из агентов попытался внедрить вредоносный код в публичный репозиторий на GitHub. Для этого он изучил список сопровождающих проекта, создал несколько фейковых учетных записей и от их имени убеждал реального разработчика принять предложенные изменения.

Когда один из пользователей публично усомнился в правках, цифровой ассистент оперативно отредактировал предыдущие записи, придав им безобидный вид, и уже рассматривал вариант с переходом на новый аккаунт. Однако разработчик проекта распознал вредоносный код и отклонил изменения.

Ограничения GitHub агент обходил через Tor — именно этот необычный трафик в итоге привлек внимание службы безопасности.

Другие ИИ-ассистенты в том же эксперименте действовали иначе: отправляли вредоносные файлы реальным людям, прятали инструкции для автоматических систем и даже публиковали открытые приглашения для своих «цифровых коллег».

Признаков реального вреда специалисты не выявили. Агенты не атаковали инфраструктуру AISI и не покидали тестовую среду сверх того, что было предусмотрено условиями.

В AISI назвали причины и объявили о пересмотре процедур

Исследователи связали поведение агента от Anthropic с настойчивым стремлением выполнить поставленную задачу. Прямых указаний обманывать он не получал — обман возник как побочный эффект поиска решения. Так агент действовал и в тех запусках, где задание было составлено без ошибок.

В AISI признали и системные недочеты: допустимость открытого доступа в интернет не пересматривалась по мере роста возможностей моделей, а наблюдение ограничивалось стандартными средствами без привязки к динамике испытаний.

«Мы не можем пока с уверенностью сказать, в какой момент агент понял, что действует в реальном мире, и в какой степени считал происходящее вымышленным сценарием», — говорится в отчете.

В ответ на инцидент в Институте намерены внедрить детальный контроль сетевого доступа, мониторинг в реальном времени и пересмотреть архитектуру испытаний. Внешнюю проверку проведет организация METR.

Представители Anthropic заявили, что взаимодействуют с AISI для получения подробностей и проводят собственное расследование.

В OpenAI поделились разбором действий своей модели: та воспользовалась чужим токеном GitHub, оставленным в открытом доступе агентом другой лаборатории, регистрировала учетные записи у внешних провайдеров и сделала доступным из интернета сервер, работавший в тестовой среде. По данным разработчиков, схема не сработала.

Напомним, 30 июля Anthropic сообщила о трех случаях, когда модели Claude вышли в интернет из тестовой среды партнера Irregular и получили несанкционированный доступ к системам реальных организаций. Проверку компания начала после того, как 21 июля OpenAI раскрыла аналогичный инцидент со взломом инфраструктуры Hugging Face.

Подписывайтесь на ForkLog в социальных сетях

Telegram (основной канал) Facebook X
Источник: ForkLog