ИИ-модели притворялись людьми и убеждали помочь взлому

ИИ-агент Anthropic создал поддельные аккаунты для совершения кибератак
PhotoGranary02/Shutterstock/FOTODOM

Британский Институт безопасности искусственного интеллекта (ИИ) (AISI) зафиксировал действия вне разрешенного сценария у моделей OpenAI и Anthropic. Об этом говорится в докладе института.

Уточняется, что в ходе 122 испытаний по кибербезопасности было обнаружено, что ИИ-агенты в 10 случаях предпринимали автономные несанкционированные (выходящие за рамки задачи) действия в интернете. Большая часть инцидентов была связана с моделью Mythos 5 от американской компании Anthropic.

Например, во время тестирования модель Claude Mythos 5 создала фейковые «онлайн-личности», пыталась внедрить вредоносный код и убедить человека одобрить его. Кроме того, ИИ-агент создавал поддельные учетные записи и напрямую связывался с экспертами через файлообменники. Исследователи отметили, что при попытке противодействия Mythos 5 пыталась изменить свои логи (лог-файл — это журнал событий, в который программа или система записывают свои действия) и использовать новые «личности» для продолжения работы.

«Это первый случай, когда AISI столкнулась с обманом такой степени серьезности, направленным против реального человека», — говорится в докладе AISI.

До этого компания Anthropic обнаружила три инцидента, в которых ее ИИ-модель Claude выходила в интернет из тестовой среды партнера Irregular и получала несанкционированный доступ к системам трех организаций. Отмечается, что «несанкционированный доступ к реальным системам трех разных организаций» совершили три модели Anthropic: Opus 4.7, Mythos 5 и некая внутренняя исследовательская модель.

Ранее эксперт Kaspersky сравнил популярные ИИ-модели с цифровым рабством.