Исследование выявило нехватку публичных планов сдерживания ИИ
Ведущие разработчики систем искусственного интеллекта имеют мало публично задокументированных планов действий на случай, если модель попытается обойти человеческий контроль. Об этом сообщает TechCrunch со ссылкой на оценку организации Guidelight AI Standards.
Guidelight проанализировала открытые материалы Anthropic, Google, OpenAI, Meta и xAI по шести приоритетным практикам своего стандарта Control. Среди прочего организация оценивала внутреннее журналирование и мониторинг действий ИИ, остановку систем после серии сигналов о ненадлежащем поведении, независимый аудит средств контроля и наличие конкретного плана сдерживания модели.
Оценка публичной готовности
План сдерживания предусматривает заранее определенные действия после выявления попытки ИИ обойти контроль. Он должен определять, какие разрешения необходимо отозвать у модели, для кого она может продолжать работать и при каких ограничениях, а также когда ее следует полностью отключить.
Наивысший результат получила OpenAI — три балла из пяти. По данным Guidelight, компания уже неоднократно приостанавливала или прекращала рабочие процессы, в частности внутреннее развертывание и обучение моделей, после инцидентов с безопасностью. Компания также описывала шаги, необходимые для возобновления этих процессов.
В то же время в отчете Guidelight отмечается, что нет публичных доказательств существования у OpenAI формализованного плана реагирования на будущие инциденты, связанные с несоответствием моделей человеческому контролю.
Больше актуальных новостей — в Telegram-канале UA.News Telegram.
Самые низкие оценки именно за раскрытие планов сдерживания получили Meta и Anthropic. Guidelight не нашла подтверждений, что Meta имеет план реагирования на потерю контроля над моделью или планирует его внедрить. В августовском отчете Anthropic о рисках, по оценке организации, не говорится об ограничении развертывания модели как возможном результате расследования инцидентов, связанных с несоответствием или контролем.
Позиции компаний и требования регуляторов
Представитель OpenAI заявил, что оценка не охватывает все внутренние практики компании. По его словам, OpenAI имеет процессы для ограничения разрешений, приостановки рабочих нагрузок, сужения развертывания или полного отключения модели и уже применяла их. Google также заявила, что отчет не отражает весь комплекс ее мер безопасности. Meta отказалась сообщить, имеет ли она внутренний план сдерживания, сославшись на существующую рамку оценки рисков.
Главный научный сотрудник Guidelight и бывший исследователь безопасности OpenAI Стивен Адлер сказал, что его удивило, как мало компании рассказывают о реагировании на серьезный инцидент потери контроля. По его мнению, без заранее подготовленного плана разработчикам придется определять действия уже во время чрезвычайной ситуации.
Калифорнийский закон SB 53, вступивший в силу в этом году, обязывает крупных разработчиков передовых моделей публиковать рамки выявления и реагирования на критические инциденты безопасности. В Нью-Йорке в январе должен вступить в силу RAISE Act с похожими требованиями. В прошлом месяце в США также представили двухпартийный законопроект AI Kill Switch Act, предусматривающий обязанность крупных разработчиков создавать и поддерживать технические механизмы для отключения неконтролируемых моделей.
