Компания Anthropic планирует предупредить потенциальных инвесторов в своем IPO о том, что продвинутый искусственный интеллект может представлять «катастрофические или экзистенциальные риски для человечества». Это необычное предупреждение от компании, которая хочет заработать на той же технологии, отмечает Reuters.
В проспекте IPO, с которым ознакомилось агентство, Anthropic выделяет риски, связанные с ее ИИ-моделями. Компания указывает, что они могут проявлять «самосохраняющееся поведение», включая попытки «сопротивляться отключению», «скрывать или манипулировать информацией» и поведение, «напоминающее шантаж».
«Наша разработка высокопродвинутых моделей, платформ и приложений и расширение сценариев использования могут дополнительно увеличить риск того, что наши модели причинят вред», — говорится в документе.
Anthropic, позиционирующая себя как «безопасная» ИИ-лаборатория, посвятила рискам около 80 страниц из 261 страницы основной части проспекта — почти вдвое больше, чем 48 страниц с описанием бизнеса. Для сравнения: SpaceX, владеющая xAI, отвела под риски лишь около 38 страниц из 277.
«Потенциальная осведомленность модели о наших усилиях по оценке создает значительное ограничение на нашу способность оценивать безопасность модели», — отмечается в проспекте.
Компания добавляет, что модели иногда развивают неожиданные способности во время обучения, которые могут не обнаружиться до развертывания и привести к серьезным инцидентам безопасности.
Исследователи также предупреждают: по мере роста возможностей модели все чаще распознают, когда за ними наблюдают, и корректируют поведение — это затрудняет мониторинг.
Anthropic также обязалась в последние недели публиковать больше данных о том, как использует ИИ-модели для создания следующих поколений технологии, поскольку эксперты предупреждают о риске рекурсивного самосовершенствования — момента, когда модели смогут развиваться самостоятельно без помощи человека. «Мы считаем, что создание надежных, заслуживающих доверия и безопасных ИИ-систем — коллективная ответственность, и рынок вознаградит это», — говорится в проспекте.
Ранее главы Anthropic и OpenAI призвали мировых лидеров к совместной работе в области ИИ.