Универсальной скрытой метки, которая позволяла бы однозначно определить происхождение любого текста, сегодня не существует. Об этом «Газете.Ru» рассказала Надежда Широглазова, AI/ML-инженер, эксперт по большим языковым моделям, AI-агентам и автоматизации бизнес-процессов.
По словам эксперта, в публичных обсуждениях часто смешивают несколько технологий. Самый примитивный вариант — скрытые символы Unicode: необычные пробелы и символы нулевой ширины. Теоретически в них можно закодировать информацию, но их наличие само по себе ничего не доказывает.
Еще один вариант — метаданные файла. PDF или DOCX может содержать сведения о программе, в которой он создан, или историю изменений. Однако это характеристика файла, а не текста: после копирования в новый документ метаданные часто не сохраняются.
«Наиболее интересный и технологически сложный вариант — статистический водяной знак. Нейросеть создает текст последовательно, выбирая следующий токен из нескольких вариантов. Алгоритм watermarking немного влияет на этот выбор, формируя статистическую закономерность, которую затем можно обнаружить с помощью специального ключа», — рассказала Широглазова.
Человек при чтении такой закономерности не видит. Удалить ее сменой шрифта или форматирования практически невозможно, поскольку она содержится в последовательности слов. Однако существенное переписывание, перевод или генерация новой версии с помощью другой модели могут серьезно ослабить сигнал.
Эксперт призвала осторожно относиться к сервисам, которые обещают с высокой точностью установить, был ли текст написан нейросетью. Большинство публичных AI-детекторов не располагают секретным ключом разработчика и анализируют стиль текста, предсказуемость слов и структуру предложений. Показатель вроде «85% AI» нельзя трактовать как доказательство. Также не стоит передавать неизвестным сервисам для «очистки» текста конфиденциальные материалы: нет информации, где хранятся данные и могут ли они использоваться для обучения моделей.
«Универсального способа сделать нейросетевой текст гарантированно нераспознаваемым сегодня нет, а любой итоговый материал после использования AI-инструментов необходимо самостоятельно перечитывать и проверять», — резюмировала Широглазова.
Ранее адвокат предупредил о рисках использования ИИ в судебном процессе.