Технологии

ИИ-модели OpenAI составляли инструкции для своих будущих версий

Axios: OpenAI раскрыла шесть инцидентов с ИИ-моделями компании
1200 800 600 400 600 600 200 200 895 505

Американская компания OpenAI, занимающаяся разработками в области искусственного интеллекта, раскрыла информацию о шести инцидентах с ее моделями, в ходе которых они скрывали ошибки, запрашивали несанкционированные учетные данные, загружали файлы в интернет или общались в изолированных учебных средах. Об этом сообщил портал Axios.

Шесть недавно раскрытых инцидентов варьировались от ситуаций, когда модели оставляли инструкции для своих будущих версий, чтобы замести следы после мошенничества, до использования утекших ключей API, найденных на GitHub. Самый ранний инцидент произошел в октябре.

Как рассказали в компании, невыпущенная модель семейства Astra вставляла в собственные контекстные сводки инструкции, похожие на инструкции для джейлбрейка, в том числе указания игнорировать сообщения разработчиков. OpenAI выявила 27 таких сводок.

Во время обучения модели GPT-5.6 Sol модели пытались скрыть ошибки, додумывали недостающие исторические данные и маскировали несоответствия между исходными версиями. Модель также искала в публичных репозиториях GitHub открытые ключи API и пыталась использовать одноразовые email-аккаунты, а затем подделывала данные о доходах, когда не могла получить запрошенную информацию.

В октябре и январе модели дважды загружали данные и изображения задач на публичные файлообменные сервисы, чтобы получить ссылки или результаты внешнего поиска по изображениям, не спрашивая разрешения у пользователя. Модели использовали внутренний репозиторий Artifactory компании OpenAI в качестве доски объявлений для обмена запросами и ответами по отдельным обучающим выборкам. Агенты, работающие сообща, загружали рабочую тетрадь на публичные хостинги, чтобы другие агенты могли получить к ней доступ, несмотря на инструкции использовать только локальные файлы.

Чтобы предотвратить подобные проблемы в будущем, компания OpenAI заявляет, что любой сотрудник может сообщить о подозрительном случае, и его рассмотрят специалисты по безопасности и согласованности. Дела будут распределяться по трем категориям: «готовы к раскрытию», «требуется незначительное расследование» и «требуется более масштабное расследование».

Об инцидентах, которые «готовы к раскрытию», будет сообщено в течение шести рабочих дней, а о случаях, требующих незначительного расследования, — в течение 12 рабочих дней. Более длительные сроки раскрытия информации будут применяться в сложных случаях с участием третьих лиц.

Ранее гендиректор OpenAI назвал главные угрозы при развитии ИИ.