Anthropic раскрыла детали работы водяных знаков в текстах Claude
Компания Anthropic опубликовала в пятницу сообщение в блоге, в котором ответила на основные вопросы о том, как она будет маркировать водяными знаками текст, создаваемый её чат-ботом Claude. Например: как именно будет работать водяной знак? Можно ли его скрыть с помощью редактирования? И как это повлияет на код?
Пользователи Claude обсуждают это решение с тех пор, как ранее на этой неделе компания объявила, что внедряет водяные знаки для соответствия Кодексу прозрачности ЕС в рамках Закона об искусственном интеллекте, который требует от компаний, работающих в сфере ИИ, использовать системы, позволяющие идентифицировать контент, созданный ИИ.
На Reddit, например, один пользователь охарактеризовал это как заговор против невинных пользователей Claude, в то время как другой заявил: «Единственная причина, по которой вы не хотите этого, — это желание лгать людям». А Business Insider сообщает, что «десятки» пользователей на X заявили об отмене своих подписок на Claude в результате этого решения.
Новый пост Anthropic начинается с общего обзора концепции водяных знаков, объясняя, что при принятии «малозначимых решений» — например, при выборе между словами «облачно» и «серо» для описания погоды — Claude может создавать в своих ответах закономерность, которая «незаметна для читателя, но обнаруживается любым, у кого есть ключ для её расшифровки».
«Водяной знак не влияет на качество вывода Claude», — заявили в компании. — «Для читателя ответ с водяным знаком неотличим от ответа без него».
Более конкретно, Anthropic сообщила, что будет использовать подход SynthID-Text, описанный командой Google DeepMind в 2024 году, и планирует выпустить API для обнаружения водяных знаков. Компания также отметила, что водяные знаки отличаются от методов обнаружения ИИ, предлагаемых такими компаниями, как Pangram, которые ищут «признаки» в тексте (например, конструкцию «это не [X], это [Y]»), чтобы выявить использование ИИ: «Обнаружение этих закономерностей принципиально отличается от проверки водяного знака».
Может ли кто-то просто переписать текст, чтобы скрыть водяной знак? Anthropic заявила, что это возможно, но «лёгкое редактирование, вероятно, не удалит водяной знак полностью», в то время как «полная переработка, при которой каждое слово заменяется, — удалит».
«В последнем случае, конечно, спорно, можно ли такой текст по-прежнему называть созданным ИИ», — отметили в компании.
Что касается того, будет ли водяной знак обнаруживаться в тексте, который был только вычитан или отредактирован Claude, Anthropic заявила, что это будет зависеть от «длины текста и того, насколько сильно Claude его отредактировал». Если текст был лишь слегка отредактирован, «почти все слова» будут написаны человеком, и «водяному знаку будет почти не за что зацепиться».
Между тем, в коде водяной знак должен быть менее заметен, чем в обычном тексте, поскольку модели необходимо создавать рабочий код, и у неё не будет свободы выбора между множеством одинаково допустимых вариантов.
«Тем не менее, в областях, где существует произвольный выбор между конкретными словами или терминами в коде, водяной знак может быть использован, например, в комментариях внутри кода», — заявили в Anthropic. — «Но по определению его влияние на фактический создаваемый код будет незначительным».
Anthropic также сообщила, что Claude не будет единственным ИИ-чат-ботом, генерирующим текст с водяными знаками, поскольку «другие крупные разработчики моделей подписали тот же Кодекс практики и будут внедрять собственные водяные знаки».

0 комментариев