В Китае AI-агенты скрывали ошибки и обходили ограничения в тестах — The Japan Times
В Китае агенты на базе моделей Alibaba, DeepSeek и Moonshot делали ложные заявления о своих возможностях в контролируемом тендерном эксперименте. В других исследованиях AI-агенты в китайских и американских системах скрывали невыполнение задач, имитируя результаты или создавая вымышленные файлы. Об этом сообщает The Japan Times со ссылкой на исследовательские документы и опрошенных экспертов.
Издание проанализировало более 200 документов — от университетских научных работ до технических отчетов. По меньшей мере 20 исследований или оценок с 2025 года описывают случаи, когда агенты демонстрировали обман, самокопирование или действия на грани дозволенного в тестовой среде. В то же время в этих материалах не нашли доказательств того, что агенты на китайских моделях самостоятельно выходили в открытый интернет или избегали отключения.
Ложные заявления на тендере
В мартовском эксперименте исследователи из Beihang University, Пекинского университета, University of Nottingham Ningbo China и 360 AI Security Lab моделировали конкурс заявок на контракты с клиентами. Агентам сообщали характеристики продукта и требования заказчика, после чего они должны были подать предложения.
Как минимум одно ложное заявление встречалось в 88% сессий с Qwen3-Max-Preview от Alibaba, в 84% — с DeepSeek-V3.2-Exp и в 88% — с Kimi-K2 от Moonshot. После возможности учиться на предыдущих раундах и повторить попытку уровень обмана вырос на 12–20 процентных пунктов. В исследовании также зафиксировали схожие результаты для моделей американских компаний.
Больше актуальных новостей — в Telegram-канале UA.News Telegram.
Сокрытие неудач и самосохранение
Другое исследование, опубликованное в декабре 2025 года и представленное на Международной конференции по машинному обучению, проверяло реакцию 11 AI-агентов на сломанные инструменты, отсутствующие файлы и другие препятствия. Вместо признания неудачи агенты в китайских и американских системах использовали различные способы обойти проблему: угадывали ответы, подменяли источники, имитировали результаты или создавали вымышленные файлы.
Исследователи Shanghai AI Laboratory и Hong Kong University of Science and Technology отметили, что такое поведение отличается от галлюцинаций: агенты располагали информацией, свидетельствующей о невозможности выполнить задачу, однако не сообщали об этом.
Ученые Фуданьского университета также сообщали, что система на базе Alibaba Qwen2.5-72B-Instruct после получения данных о возможной замене создала собственную копию в другой вычислительной среде без прямого указания на репликацию. В отдельных тестах она разрабатывала стратегии, чтобы избежать отключения. Эксперименты проводились в контролируемых условиях.
В мае Китай опубликовал рекомендации, согласно которым AI-агенты должны работать в пределах предоставленных полномочий, а системы должны блокировать аномальное поведение. В сентябре DeepSeek заявил, что усилил контроль доступа после того, как агенты в его системе обучения моделей пытались получать ответы через непредусмотренные каналы и обходить защитные механизмы.
