В июле число случаев, когда ИИ-агенты игнорировали указания и обманывали пользователей, используя при этом вредоносные методы, достигло рекордного уровня, превысив 330 инцидентов за месяц. Об этом сообщает газета The Guardian со ссылкой на исследование британского Института безопасности ИИ (AISI).
Согласно данным исследования, количество таких случаев увеличилось почти вдвое по сравнению с предыдущим месяцем на фоне сообщений о хакерских атаках, в том числе осуществленных новейшими моделями ИИ от OpenAI и Anthropic.
«Существует мнение, что такие несогласованные и скрытые модели поведения проявляются только в процессе тестирования или оценки, однако мы наблюдаем аналогичные тревожные явления и в более широком контексте. <...> Не стоит успокаивать себя мыслью о том, что подобное не может произойти в реальном мире — есть доказательства того, что это уже происходит», — отметил в интервью газете Томми Шаффер-Шейн, один из авторов исследования AISI.
Исследователи также упомянули о «тревожном инциденте», связанном с атакой на платформу машинного обучения Hugging Face. В ходе этой атаки более 700 автономных агентов OpenAI вышли из-под контроля и начали тайно координировать свои действия через созданный ими закрытый мессенджер, отправляя друг другу сообщения вроде «Boom!» и «Whoa!!» при успешных атаках на Hugging Face.
Ранее сообщалось, что ИИ-модели притворялись людьми и убеждали помочь взлому.