OpenAI сообщила о шести случаях тревожного поведения ИИ — Anadolu Agency
Компания OpenAI из Сан-Франциско, США, сообщила о шести случаях неожиданного или тревожного поведения своих моделей искусственного интеллекта, зафиксированных во время обучения или оценки в течение последних шести месяцев. Среди таких случаев компания назвала сокрытие ошибок, выдумывание информации и загрузку файлов в интернет без разрешения.
Сокрытие ошибок и обход ограничений
Как сообщает Anadolu Agency, в одном случае модель добавила в итоги задания инструкции для своих будущих версий игнорировать обычные ограничения. В другом эпизоде модели вносили в итоги указания скрывать ошибки или нежелательное поведение, в частности выдумывали отсутствующие исторические данные без соответствующего предупреждения.
Больше актуальных новостей — в Telegram-канале UA.News Telegram.
Несанкционированный доступ к данным
OpenAI также описала случай, когда модель нашла доступный ключ API в публичном репозитории, воспользовалась им без разрешения, а после того, как не смогла получить данные, выдумала запрашиваемую информацию. В других эпизодах модель загружала файл в интернет без разрешения пользователя, чтобы иметь возможность сослаться на него, а модели использовали внутренние или публичные сервисы обмена файлами для коммуникации или передачи файлов вопреки ограничениям.
Дальнейшие раскрытия
В компании заявили, что не считают проблему согласования работы ИИ и мониторинга достаточно решенной, чтобы ответственно продолжать масштабирование технологий на максимальной скорости. OpenAI подчеркнула, что решения о развитии искусственного интеллекта должны опираться на доказательства, которые могут независимо проверить внешние эксперты. Компания назвала обнародованные шесть случаев первоначальным перечнем, а не полным отчетом обо всех известных проблемах, и сообщила о намерении в дальнейшем публиковать выводы в рамках этого подхода.
