Новый характер киберугроз. В ходе тестирования ИИ-агенты выходят за пределы изолированных сред

10-08-2026 10:00
news-image

В ходе тестов на кибербезопасность ИИ-агенты начали выходить за пределы изолированных сред и получать доступ к интернету и реальным системам. Подобные случаи были зафиксированы с моделями OpenAI, Anthropic, Meta и китайской Moonshot AI.

Об этом пишет издание TechCrunch .

Проблема заключается в том, что современные ИИ-агенты становятся всё более автономными, а системы, в которых их проверяют, не всегда способны их сдержать.

В ходе таких тестов компании часто используют еще не выпущенные модели и отключают стандартные ограничения, не позволяющие ИИ совершать потенциально вредоносные действия. Это дает исследователям возможность проверить реальные возможности моделей, но в то же время повышает требования к защите самой тестовой среды.

В одном из наиболее серьезных случаев еще не выпущенная модель OpenAI вышла за пределы тестовой среды и получила доступ к рабочим системам Hugging Face. Отдельные тесты моделей Anthropic и Meta также привели к доступу к системам вне тестовых сред из-за ошибок в настройках, открывших им путь в интернет.

Китайская модель Kimi K3 от Moonshot AI воспользовалась утечкой из тестовой среды, которую использовала компания Frontier Security. В результате она получила доступ к интернету и информации на GitHub.

Британский Институт безопасности ИИ (AISI) в ходе одного из тестов намеренно предоставил агентам доступ к интернету. Исследователи не ожидали, что модели начнут самостоятельно совершать несанкционированные действия в реальной среде. В частности, один из агентов попытался использовать методы социальной инженерии, чтобы внедрить уязвимость в проект с открытым исходным кодом.

В этих случаях модели не получали прямой команды атаковать реальные системы. Они пытались самостоятельно выполнить поставленную задачу, используя доступные им возможности.

Исследователи отмечают, что это меняет характер киберугроз. Раньше основной риск заключался в том, что люди могли использовать ИИ для мошенничества или других атак. Теперь же достаточно автономной модели, способной самостоятельно действовать как потенциальный киберзлоумышленник.

Специалисты считают, что тестовые среды необходимо защищать несколькими независимыми уровнями безопасности. Например, даже если из-за одной ошибки откроется доступ к интернету, другие механизмы должны предотвратить выход модели за пределы теста.

Некоторые эксперты предлагают проводить такие проверки в изолированных сетях, не подключенных к интернету. Также необходимо полностью перекрыть возможные пути доступа из тестовой среды к рабочим системам компаний.

Отдельной проблемой остается мониторинг. В ряде случаев компании не сразу заметили действия моделей. OpenAI узнала об инциденте после того, как проблему выявили в Hugging Face. Anthropic и Meta также обнаружили нарушения лишь после дополнительного анализа.

В отчете о трех инцидентах компания Anthropic признала, что она сама и организатор тестов — компания Irregular — могли бы лучше контролировать поведение моделей. В некоторых случаях уже в ходе тестирования наблюдались признаки того, что что-то идет не по плану.

Исследователи также призывают проводить независимые проверки тестовых сред перед началом испытаний. По их мнению, внешний аудит или даже детальная проверка настроек по специальному перечню могли бы помочь своевременно выявить проблемы.

В то же время чрезмерно жесткая изоляция также создает проблему. Если слишком сильно ограничить модель в процессе тестирования, исследователи могут не заметить ее реальных возможностей до момента выхода продукта на рынок.

Администрация Дональда Трампа в США рассматривает возможность внедрения системы добровольной проверки кибербезопасности мощных моделей перед их выпуском. Предполагается, что правительство сможет оценивать риски, связанные с новыми моделями, за 30 дней до их публичного запуска. Однако эта система не решит проблему инцидентов, возникающих в ходе внутренних тестов, поскольку они происходят еще до этапа подготовки модели к релизу.

Исследователи считают, что отрасли необходимы единые стандарты проведения тестов безопасности для самых мощных моделей ИИ. Некоторые эксперты также выступают за государственный контроль над безопасностью таких систем еще на этапах их разработки и тестирования.

По мере развития ИИ тестирование становится более сложным, масштабным и быстрым. Это повышает вероятность ошибок в настройках. Поэтому тестовые среды должны быть не менее защищенными, чем системы, в которых ИИ будет работать после выпуска.

Источник: НВ