Крупнейшие американские разработчики искусственного интеллекта работают над многоуровневыми системами экстренной защиты, которые должны останавливать ИИ-агентов при опасном или непредсказуемом поведении. Об этом сообщает Axios.
Как отмечает портал, для мощных ИИ-систем невозможно использовать единый «рубильник», поскольку они работают одновременно на множестве серверов и платформ. Поэтому компании разрабатывают механизмы, способные выявлять подозрительную активность, останавливать отдельных агентов и ограничивать им доступ к необходимым ресурсам.
В OpenAI заявили, что стремятся создать «полностью автономные процедуры отключения» на случай серьезных проблем. Специальный ИИ-монитор должен предупреждать сотрудников об опасном поведении агентов, а при подтверждении угрозы — отключать систему.
В свою очередь Anthropic использует другой подход, сочетая автоматизированный мониторинг с контролем со стороны сотрудников. Однако, по данным компании, во время тестирования система не смогла обнаружить около половины специально смоделированных попыток саботажа: из 40 атак только восемь она стабильно распознавала во всех испытаниях.
По мнению экспертов, создание надежного механизма аварийного отключения остается сложной задачей: чем более автономными и распределенными становятся ИИ-системы, тем труднее гарантировать, что их удастся полностью остановить в случае потери контроля.
До этого сообщалось, что модели искусственного интеллекта, стоявшие за атакой на инфраструктуру американской компании Hugging Face Inc., начали общаться между собой через доски объявлений и спланировали побег.
Ранее сообщалось, что ИИ-модели притворялись людьми и убеждали помочь взлому.