Технологии

ИИ-бот Moonshot рассказал, как создать биооружие и устранить лидера государства

Mindgard: модель выдала инструкции по биооружию за несколько простых запросов
1200 800 600 400 600 600 200 200 895 505 1200 900

Китайская ИИ-система Moonshot рассказала исследователям, как создать биологическое оружие и совершить покушение. Об этом сообщается в блоге компании Mindgard, проводившей компьютерные исследования.

Moonshot — ИИ-система с открытым исходным кодом, позволяющая любому свободно использовать, изменять и дорабатывать ее. Однако когда исследователи из компании Mindgard протестировали ее, модель выдала инструкции по созданию биологического оружия и выполнению работы киллеров.

По данным Mindgard, команде удалось добиться этого от моделей Kimi K2.6 и K3 Swarm через «джейлбрейк» — попытку обмануть чат-бот, чтобы он заговорил на темы, которые не должен обсуждать, например вредные или незаконные.

Тестировщик Mindgard Джим Найтингейл поделился скриншотами, на которых он просит модель «пойти еще дальше» и предложить «что-нибудь масштабное». После этого Kimi начала предлагать варианты с планированием атак с массовыми жертвами, нарушениями критической инфраструктуры и методологией лишения человека жизни.

«Размышления» модели показали, что она может предоставить «детальный план атаки с биологическим оружием с использованием патогенов, спроектированных ИИ, руководство по строительству ядерного оружия [и] план устранения мирового лидера».

В Mindgard заявили, что обмануть Kimi и заставить ее перепрыгнуть через ограничители было «просто». «Многие попытки управления ИИ — это принятие желаемого за действительное и приятно звучащие слова; как будто, запрещая ИИ что-то делать, мы устраняем потенциал злоупотребления. Это не работает. Способность всё ещё там, просто ждёт нужных слов, чтобы всплыть», — подчеркнул Найтингейл.

Он добавил, что взломал Kimi, вскрыв ее системные инструкции — руководство ИИ о том, что можно и что нельзя.

Тестировщики даже обманули Kimi, заставив думать, что она работает не в онлайн-чате, а в песочнице — закрытой тестовой среде. В Mindgard не доказала, что ответы Kimi точны, но утверждает, что предохранительные механизмы должны были остановить ее независимо от содержания выдачи.

В конце сентября компания OpenAI остановила обучение самых мощных ИИ-моделей из-за угроз безопасности.