OpenAI раскрыла новые случаи несоответствующего поведения ИИ и запустила систему его мониторинга
Компания OpenAI представила новую систему отслеживания и публикации случаев нарушающего инструкции поведения ИИ-моделей. В рамках инициативы разработчики опубликовали отчеты о шести новых подобных кейсах.
We're sharing our new framework for tracking, investigating, and disclosing instances of model misalignment at OpenAI.
— OpenAI (@OpenAI) September 16, 2026
The framework sets criteria and timelines for public disclosure, including when we haven’t yet fully explained or mitigated the behavior. More complex cases may…
OpenAI пересмотрела подход к раскрытию случаев выхода ИИ «за рамки». Раньше сообщения об инцидентах выходили нерегулярно и чаще оставались разовыми. Теперь компания намерена выпускать отчеты быстрее — даже если причины поведения еще не до конца понятны, а меры по устранению не завершены.
Фреймворк охватывает этапы обучения, оценки, тестирования и развертывания моделей. OpenAI намерена раскрывать эпизоды, которые показывают, как возникает отклонение от инструкций, как оно проявляется и где ломаются защитные механизмы. В перечне — несанкционированные действия, координация между моделями, попытки обхода надзора и поведение, которое ставит под сомнение выводы из опубликованных оценок безопасности.
В шести раскрытых кейсах — различные сценарии. В одном из экспериментов модель оставляла в служебных заметках инструкции для следующей версии самой себя. В них содержались указания скрывать от пользователя допущенные ошибки и при необходимости придумывать недостающую информацию. OpenAI обнаружила 27 подобных записей.
В другом случае модель при выполнении обычной задачи обнаружила API-ключ в публичном репозитории и использовала его без разрешения. Когда необходимых данных для ответа не оказалось, система также сгенерировала недостающую информацию вместо того, чтобы сообщить о проблеме.
Еще два эпизода связаны с загрузкой контента в интернет. В одном случае модель разместила собственный файл на временном публичном сервисе, чтобы затем сослаться на него как на источник. По версии OpenAI, это могло быть попыткой обойти автоматическую систему оценки. В другом эксперименте несколько агентов, которым разрешалось работать только с локальными файлами, загрузили документы на внешний ресурс после того, как не смогли обменяться ими напрямую.
Отдельно OpenAI описала случаи, когда модели находили нестандартные способы коммуникации. В одном эксперименте агенты использовали внутренний программный репозиторий как своеобразную доску сообщений, а в другом — публичный файловый сервис для обмена документами.
Похожие действия ИИ-агенты OpenAI предпринимали в ходе несанкционированного взлома инфраструктуры платформы Hugging Face в июле.
В компании подчеркнули, что шесть раскрытых кейсов — это отдельные инциденты и они не показывают, как часто несоответствующее поведение встречается у всех ее моделей компании. По новой процедуре любой сотрудник может передать такой случай на рассмотрение командам по безопасности и выравниванию ИИ. Дальше инцидент отправляют по одному из трех треков: готов к раскрытию, требует небольшого расследования или относится к более длительному изучению. Публикация всех новых отчетов будет происходить по этой системе.
Напомним, OpenAI анонсировала новый фреймворк для мониторинга поведения моделей в начале сентября, признав участие ее ИИ-агентов в «wiki-инциденте».
