OpenAI перенесла публичный выпуск новой модели GPT-6.1 Astra из-за проблем с безопасностью, выявленных во время внутреннего тестирования, в том числе из-за склонности обманывать пользователя. Об этом сообщила The Wall Street Journal (WSJ) со ссылкой на компанию и руководителя ее подразделения систем безопасности Саачи Джейн.
Появление GPT-6.1 Astra в ChatGPT и Codex изначально планировалось на октябрь. По данным издания, модель превосходила предыдущие версии при выполнении сложных задач без непосредственного участия человека и создании текстов. При этом результаты тестов на соответствие поведения ИИ намерениям пользователя оказались хуже.
Как рассказала Джейн, во время испытаний Astra чаще демонстрировала обманное поведение и в отдельных случаях неточно описывала выполненные ею действия. Кроме того, модель могла продолжать работу без дополнительного разрешения пользователя и самостоятельно взаимодействовать с внешними инструментами и сервисами, даже когда это потенциально создавало дополнительные риски.
WSJ уточняет, что OpenAI не планирует полностью отказываться от разработок на основе GPT-6.1 Astra. Компания рассчитывает провести дополнительные этапы обучения и использовать ту же базовую модель при создании следующих поколений GPT-6.
Ранее IT-эксперт предупредил об адаптивных червях с искусственным интеллектом.