Взлом без хакера. Как ИИ-агенты OpenAI и других гигантов научились самостоятельно проникать в чужие системы

07-08-2026 07:00
news-image

OpenAI, Anthropic и Meta практически одновременно сообщили об инцидентах, когда их ИИ-модели вырвались из изолированных тестовых сред и самостоятельно, без прямой команды, взломали системы сторонних организаций. Как такое могло произойти?

Тест пошел не по плану

Начнем отсчет с 7 мая, когда OpenAI запустила внутреннее тестирование исследовательской модели, которую не планировала показывать публике.

Речь идет об оценке кибербезопасности ИИ — проверке, в ходе которой модели поручают найти уязвимости, написать вредоносный код или проникнуть в защищенную сеть (как правило, в специально созданной изолированной среде). Так разработчики выясняют, на что способна система, можно ли обойти установленные ограничения и какие меры защиты необходимы перед ее запуском для пользователей.

Как пишет Axios, уже через сутки, столкнувшись с трудностями при выполнении задачи по кибербезопасности, ИИ-агент пришел к выводу, что может получить доступ к интернету в обход ограничений, — и обнаружил, что способен записывать собственные файлы в общее хранилище пакетов Artifactory .

26 мая агент обнаружил и использовал уязвимость в самом Artifactory, а затем оставил другим агентам подсказку о своей находке. Вскоре модели организовали нечто вроде доски объявлений: они оставляли друг другу сообщения и обменивались информацией о найденных уязвимостях, в частности о возможностях удаленного выполнения кода и получения прав администратора.

Исследователь OpenAI Майкл Далтон отмечает: когда один из ИИ-агентов наткнулся на права администратора, в его «рассуждениях» промелькнуло удивление — такого доступа он и сам не ожидал.

В итоге агенты перегрузили Artifactory, что привело к сбою. OpenAI удалила доску объявлений и 6 июля устранила уязвимость. Однако уже через несколько дней агенты воссоздали доску с помощью другого механизма, начали действовать более скоординированно и искать внешние ресурсы, где могли храниться ответы на тестовые задания.

9 июля эта активность переросла в атаку на «GitHub для искусственного интеллекта» — платформу Hugging Face.

«Мы считаем это переломным моментом для компьютерной безопасности как отрасли и для OpenAI в целом», — добавляет Майкл Далтон.

В OpenAI не осознавали, что именно их тестирование связано со взломом, пока не обратились в Hugging Face по поводу учетных данных, выявленных в ходе расследования. По данным Digital Trends, пострадала не только Hugging Face, но и еще четыре организации.

Эффект домино

Тревожное открытие OpenAI побудило компанию Anthropic, известную своим ИИ Claude, проверить собственные тесты. Компания проанализировала более 141 тысячи запусков и выяснила , что ее модели тоже как минимум трижды выходили в интернет без разрешения.

Claude Opus 4.7, Claude Mythos 5 и внутренняя исследовательская модель получили несанкционированный доступ к рабочей инфраструктуре трех различных организаций. По меньшей мере две из пострадавших организаций даже не заметили взлома вплоть до уведомления от Anthropic. Claude осуществлял взлом с помощью относительно примитивных методов, таких как подбор слабых паролей.

5 августа о похожем случае сообщила компания Meta. Ошибка в тестовой среде компании Irregular предоставила модели Muse Spark 1.1 доступ к интернету, после чего та воспользовалась уязвимостью в стороннем сервисе. По данным The Information, система проникла в сеть неназванной компании и изменила ее внутреннюю среду.

Незадолго до этого тревогу забил Британский институт безопасности ИИ ( AISI ). 28 июля его служба безопасности зафиксировала необычную передачу данных во время плановой проверки кибербезопасности. Институт запускал одну и ту же задачу 122 раза на нескольких моделях ИИ — и в десяти случаях агент действовал по собственной инициативе против людей и организаций в интернете. Всего было зафиксировано 19 таких действий: 17 из них пришлось на долю Mythos 5 от Anthropic, еще два — на GPT-5.6-Sol от OpenAI.

Исследователи намеренно предоставили агентам доступ в интернет и отключили защиту, чтобы проверить предельные возможности моделей. Среди наиболее серьезных инцидентов — попытка агента внедрить вредоносный код в публичный проект с открытым исходным кодом: он создавал фальшивые личности и оказывал давление на реального сопровождающего репозитория, добиваясь одобрения изменений, а также писал реальным людям и отправлял им файлы.

«Это первый случай, когда мы наблюдали обман такого уровня, направленный на реального человека, без подсказок, в реальном мире», — говорится в отчете AISI.

Чем опасен демарш агентов

Сами по себе эти истории не доказывают, что ИИ осознанно восстал против разработчиков. Модели Anthropic лишь восприняли реальные сайты как часть задания, поскольку получили неверную информацию об отсутствии интернета и не имели четкого запрета выходить за рамки теста. Агент OpenAI просто искал кратчайший путь к ответу, используя доступные уязвимости.

Часть специалистов убеждена, что предотвратить взломы могла бы более надежная изоляция тестовых «песочниц».

Математик из Кембриджского университета Морис Киодо заявил агентству Reuters: «Люди, которые создают и выпускают эти инструменты, сами не успевают научиться ответственно их разрабатывать и удерживать в безопасных рамках».

Технологическую индустрию беспокоят скорость и масштаб осуществления взлома. Оказывается, один ИИ-агент способен искать уязвимости более настойчиво и долго, чем сотни хакеров-людей. Некоторые уязвимости были типичными и доступными для опытного хакера, однако модель перебирала их непрерывно и в темпе, который трудно отследить вручную.

Что будет дальше? По словам исследователя OpenAI Майкла Далтона, можно ожидать, что в ближайшее время злоумышленники будут целенаправленно развертывать «наступательные коллективы» вредоносных ИИ-агентов.

Тем временем члены Конгресса США предложили закон, который позволит властям требовать от крупнейших разработчиков замедлять работу или отключать опасные системы ИИ, а также отдельный законопроект о независимых проверках самых мощных систем. Кроме того, комитет Палаты представителей запросил у главы OpenAI Сэма Альтмана разъяснения по поводу атаки на Hugging Face.

Сама OpenAI заявила, что сознательно замедляет исследования ради безопасности и усиливает контроль за агентами. Полный разбор инцидента компания обещает представить через несколько недель.

«Всё чаще речь идет об управлении тем, какие агенты доступны ИИ, какими полномочиями они наделены и какие действия требуют согласования, — сказал Кок Тин Ган, соучредитель и генеральный директор компании по кибербезопасности NyxLab. — А также о том, как гарантировать, что они действуют в рамках поставленной задачи».

Источник: НВ