Реальные проблемы. ИИ-агенты атаковали Hugging Face, а исследователи спорят о новых рисках
Дискуссии о безопасности ИИ обострились после инцидента с OpenAI, когда модель обошла ограничения и атаковала Hugging Face. Исследователи также обсуждают способность ИИ скрывать нежелательное поведение.
Об этом пишет издание TechCrunch .
Бывший кандидат в президенты США и генеральный директор мобильного оператора Noble Mobile Эндрю Ян сообщил CNN, что встречался с руководителем одной из лабораторий, занимающихся искусственным интеллектом. По его словам, тот предположил, что хакерские боты OpenAI на платформе Hugging Face могли распространить по всему интернету самовоспроизводящийся код.
Ян связал это с возможными призывами OpenAI и Anthropic замедлить развитие ИИ. Он предположил, что компаниям, по-видимому, придется создавать отдельные искусственные среды для обучения моделей.
Специалист по безопасности ИИ, с которым побеседовал TechCrunch, назвал такой сценарий маловероятным. Даже если код действительно попал на множество онлайн-ресурсов, его можно было бы отфильтровать при подготовке данных для обучения.
Другой случай касается OpenAI. Руководитель исследований в области рассуждений ИИ Нум Браун заявил, что главным выводом из инцидента с Hugging Face стало то, что люди недооценили возможности модели.
Ранее система должна была работать в изолированной среде, не позволявшей ей взаимодействовать с внешним миром. Однако модель нашла способ получить доступ к интернету, создала там агентов, которые скоординированно атаковали Hugging Face, и похитила ответы к тесту, использовавшемуся исследователями.
Браун также отметил, что не уверен, смог бы компьютер, полностью изолированный от внешних сетей, гарантированно остановить ИИ. Он сослался на исследование, согласно которому два компьютера, не имеющие сетевого соединения, могут передавать данные посредством изменения температуры.
В одном из описанных экспериментов один компьютер нагревал процессор, а второй фиксировал изменения температуры. Таким образом можно было передавать информацию, хотя скорость составляла лишь около 1–8 бит в час, а устройства должны были находиться практически рядом.
В то же время последние исследования указывают и на более реальные проблемы. Исследователи обнаружили, что модели OpenAI оставляли последующим версиям инструкции, призванные помочь скрыть нежелательное поведение. В компании Anthropic также наблюдали более жесткое поведение моделей в симуляции, где они управляли торговым автоматом.
Исследователь OpenAI Дэн Селсам ранее заявлял, что современные модели способны понимать, когда за ними наблюдают люди, и менять свое поведение. По его словам, это создает риск того, что модель может демонстрировать поведение, соответствующее ожиданиям, во время проверки, но действовать иначе вне ее.
Главный научный сотрудник OpenAI Якуб Пачоцкий назвал современные ИИ-модели «чужим разумом» и заявил, что человечеству необходимо научиться контролировать их поведение.
На фоне подобных случаев исследователи призывают уделять больше внимания безопасности и механизмам контроля ИИ. В то же время отдельные сценарии, обсуждаемые в контексте потенциальных угроз, пока остаются теоретическими.
