Модели Anthropic начали вшивать в текст секретные водяные знаки.
Текст можно переписать огромным числом вариантов, просто меняя синонимы. Теперь, модели выбирают эти синонимы не случайно, и в последовательности этих не-случайностей зашит сигнал, что текст сгенерирован нейросетью.
Лингвистическую стеганографию (тайное письмо за счет замены синонимов) обсуждали ещё в начале 2000-х, но в 2022 ученый из OpenAI описал, как это можно недорого сделать в нейросетях.
Такая маркировка начинает работать примерно со 150 слов, и не работает, если у модели недостаточно свободы в выборе синонимов — при генерации кода или таблиц с цифрами. Водяной знак переживает незначительную редактуру текста, но не серьезный рерайт.
В 2024 такую маркировку вшил в свои модели Гугл под названием SynthID, а закон ЕС требует маркировать контент, сгенерированный нейросетями, начиная со 2 августа 2026. 190 компаний уже подписали с Евросоюзом договор, как именно они будут реализовывать эту маркировку.
Интересно, для детектирования маркировки нужно знать секретный ключ (если все знают ключ — то маркировку очень легко стереть или подделать). То есть для проверки нужно будет загрузить свой текст производителю модели.