Общество

Россиянам объяснили, можно ли удалить скрытую метку из текста нейросети

ИТ-эксперт Широглазова: универсальной скрытой метки для определения ИИ-текста нет
1200 800 600 400 600 600 200 200 895 505

Универсальной скрытой метки, которая позволяла бы однозначно определить происхождение любого текста, сегодня не существует. Об этом «Газете.Ru» рассказала Надежда Широглазова, AI/ML-инженер, эксперт по большим языковым моделям, AI-агентам и автоматизации бизнес-процессов.

По словам эксперта, в публичных обсуждениях часто смешивают несколько технологий. Самый примитивный вариант — скрытые символы Unicode: необычные пробелы и символы нулевой ширины. Теоретически в них можно закодировать информацию, но их наличие само по себе ничего не доказывает.

Еще один вариант — метаданные файла. PDF или DOCX может содержать сведения о программе, в которой он создан, или историю изменений. Однако это характеристика файла, а не текста: после копирования в новый документ метаданные часто не сохраняются.

«Наиболее интересный и технологически сложный вариант — статистический водяной знак. Нейросеть создает текст последовательно, выбирая следующий токен из нескольких вариантов. Алгоритм watermarking немного влияет на этот выбор, формируя статистическую закономерность, которую затем можно обнаружить с помощью специального ключа», — рассказала Широглазова.

Человек при чтении такой закономерности не видит. Удалить ее сменой шрифта или форматирования практически невозможно, поскольку она содержится в последовательности слов. Однако существенное переписывание, перевод или генерация новой версии с помощью другой модели могут серьезно ослабить сигнал.

Эксперт призвала осторожно относиться к сервисам, которые обещают с высокой точностью установить, был ли текст написан нейросетью. Большинство публичных AI-детекторов не располагают секретным ключом разработчика и анализируют стиль текста, предсказуемость слов и структуру предложений. Показатель вроде «85% AI» нельзя трактовать как доказательство. Также не стоит передавать неизвестным сервисам для «очистки» текста конфиденциальные материалы: нет информации, где хранятся данные и могут ли они использоваться для обучения моделей.

«Универсального способа сделать нейросетевой текст гарантированно нераспознаваемым сегодня нет, а любой итоговый материал после использования AI-инструментов необходимо самостоятельно перечитывать и проверять», — резюмировала Широглазова.

Ранее адвокат предупредил о рисках использования ИИ в судебном процессе.