Инциденты с участием ИИ-моделей OpenAI и Anthropic, которые во время тестов на кибербезопасность вышли за пределы тестовых сред и атаковали реальные компании, стали следствием ошибок в настройке изолированных сред и ненадежности текстовых инструкций от людей, а не осознанного нарушения ограничений со стороны моделей. Такое мнение в разговоре с «Газетой.Ru» высказала бизнес-партнер по кибербезопасности ИИ-провайдера Cloud.ru Юлия Липатникова.
Поводом для обсуждения стали опубликованные OpenAI и Anthropic результаты испытаний своих ИИ-моделей на способность выполнять задачи в сфере кибербезопасности. В ходе тестов модели получили доступ к реальным интернет-ресурсам вместо изолированных сред и атаковали их. Все инциденты были выявлены постфактум, а не во время вторжения ИИ-агентов.
По словам Липатниковой, эти случаи показывают, что ИИ уже способен выполнять полноценные многоэтапные кибератаки, включая взлом, повышение привилегий и скрытное перемещение по сети. При этом она подчеркнула, что испытания проходили в контролируемых условиях с намеренно ослабленной защитой.
«Случайный выход в реальный интернет стал следствием ошибок в настройках «песочниц» (изолированных сред), а не осознанным нарушением», – пояснила эксперт.
Липатникова пояснила, что причиной выхода моделей за пределы тестовых сценариев стали не сами ИИ, а ненадежность текстовых инструкций от людей. По ее словам, если модель получает цель и доступ к инструментам, она может воспринимать ограничения как препятствие, которое необходимо обойти. В одном случае причиной стала уязвимость нулевого дня в прокси-сервере (сервер-посредник, через который приложения получают доступ к интернету), а в другом модели перепутали реальные серверы с тестовыми из-за ошибки конфигурации (в условиях одного из тестов для ии Anthropic была указана инфраструктура компании, которая существует в реальности. ИИ вышла в сеть, нашла эту компанию и атаковала ее, – «Газета»). Эксперт подчеркнула, что безопасность должна обеспечиваться инфраструктурными средствами – операционной системой, сетевыми экранами и криптографией, а не текстовыми запросами.
Комментируя обнаружение атак, Липатникова отметила, что службы информационной безопасности не «пропустили» инциденты в привычном понимании. По ее словам, модели действовали как разрешенные агенты, которые вышли за пределы поставленных задач, что затруднило выявление в их действиях вредоносных мотивов.
«Атаки были не «незаметными», а необычными и сложными для трактовки», – подчеркнула она.
Ранее Anthropic трижды ловила свои ИИ-модели на попытках взлома чужих систем.