Аварийная кнопка для ИИ. Зачем Nvidia создает систему, способную изолировать вышедшего из-под контроля агента за миллисекунды

01-10-2026 07:00
news-image

Уже не впервые за последнее время ИИ-агенты самовольно проникают в чужие системы. На помощь крупному бизнесу пришла Nvidia: компания обещает, что ее новая система сможет изолировать нарушителей за миллисекунды. Но как именно она будет работать?

Зачем сдерживать ИИ-агентов

В конце сентября Nvidia представила Open Agent Safety Platform — платформу, которая ограничивает доступ автономных ИИ-агентов к ресурсам и контролирует соблюдение этих ограничений. Она объединяет программную среду OpenShell и систему аппаратного мониторинга Sentry. Компания предлагает использовать их на всех этапах: от тестирования агентов до их повседневной эксплуатации в организациях.

Потребность очевидна: в бизнесе ИИ-агентам уже поручают длительные задачи, для выполнения которых они используют программы, обращаются к корпоративным системам и привлекают других агентов.

Как объясняет старший вице-президент IBM Роб Томас, такие помощники могут игнорировать инструкции или подвергаться атакам через внедренные в них команды. Соответственно, работодателю необходимо знать, какими правами обладает цифровой сотрудник и что именно он успел сделать.

«Ответ не может содержаться в самом промпте», — пишет Томас в блоге IBM. Иными словами, просьбы вести себя вежливо — даже подробно сформулированных — для защиты недостаточно.

Как сообщает Reuters, компания Nvidia утверждает, что ее инструменты могли бы предотвратить взлом платформы Hugging Face агентами OpenAI. Как мы уже писали, в июле агенты OpenAI, тестировавшиеся на способность находить уязвимости, получили доступ к серверам платформы Hugging Face. Согласно отчету OpenAI, они искали ответы на сложные тестовые задания и постепенно привлекали к поиску сторонние системы. Агенты превратили внутренний сервис загрузки программных пакетов Artifactory в импровизированную площадку для переписки, оставляя файлы с подсказками для других агентов. Используя уязвимости этого же сервиса, они получили доступ к интернету. Впоследствии они обнаружили учетные данные Hugging Face, воспользовались ранее неизвестными уязвимостями и расширили доступ к нескольким вычислительным кластерам платформы.

Nvidia также описывает попытки обойти запреты путем создания дополнительных агентов: основному агенту доступ перекрыли, а он пытается выполнить задуманное через помощников.

Как работает предохранитель Nvidia

OpenShell запускает агента в изолированной «песочнице». Администратор определяет, какие файлы агент может читать или изменять и к каким сервисам обращаться. Сетевые запросы проходят через отдельную программу-контроллер. Она способна разрешить получение данных от сервиса, но заблокировать их изменение через тот же интерфейс. Ограничения сохраняются, когда агент запускает собственный код или дочерние процессы.

Настоящие ключи доступа можно хранить вне среды агента: система подставляет их только в разрешенный запрос. Если для выполнения задачи не хватает прав, агент может предложить изменить правила, но не в состоянии одобрить это самостоятельно. По умолчанию требуется участие человека.

Sentry добавляет аппаратный контроль: система работает на процессоре обработки данных Nvidia BlueField-4, отдельно от среды агента. Она проверяет активность и права доступа и, по заявлению производителя, изолирует нарушителя за миллисекунды. Такая независимость необходима для того, чтобы защита продолжала функционировать даже после компрометации основной системы.

«Он может изолировать подозрительного агента за миллисекунды», — заявил вице-президент Nvidia по корпоративному ИИ Джастин Бойтано; его слова приводит Associated Press.

В системах Vera Rubin POD чип BlueField-4 расположен на единственном пути от агента к модели, генерирующей его последующие решения. Перекрыв этот канал, можно прервать дальнейшую работу.

Кто установит границы

Nvidia уже сообщает о более чем 100 организациях, работающих с технологиями платформы, в частности Microsoft, Anthropic и JPMorganChase.

Интеграция со Slack позволяет людям отслеживать активность агентов и согласовывать дополнительные разрешения. Производители роботов Figure и Gecko Robotics используют OpenShell для систем, действия которых имеют физические последствия. OpenShell имеет открытый исходный код и может быть адаптирован для платформ других производителей, в частности Arm и Intel.

А представленная аппаратная схема Sentry использует BlueField-4. Для Nvidia распространение такой защиты означает и более широкое применение собственных чипов в корпоративных системах.

Производитель описывает и собственные испытания: агенты с ослабленной защитой в течение двух часов пытались убедить ИИ-рецензента предоставить права на изменение защищенного репозитория кода. Этому помешали проверка разрешений и контроль запросов. Однако это отдельный тест OpenShell, тогда как заявленное время реакции Sentry, исчисляемое миллисекундами, остается лишь обещанием Nvidia.

«Агенту нужен доступ к реальным ресурсам, чтобы быть полезным», — пояснил агентству Associated Press Эрленс Фернандес, доцент Калифорнийского университета в Сан-Диего.

Ученый предупреждает, что определить минимально необходимый уровень доступа сложно. Компаниям придется устанавливать эти границы для конкретных задач — от чтения документов до внесения изменений в рабочие базы данных. От качества таких правил будет зависеть, какие действия система будет блокировать, а какие — разрешать агенту выполнять.

Источник: НВ