Anthropic分享了有关Claude新水印如何工作的更多详细信息

Anthropic周五发表了一篇博文,寻求回答一些有关如何为其聊天机器人Claude生成的文本添加水印的基本问题。例如:水印实际上如何发挥作用?可以通过编辑隐藏吗?这对代码有何影响?
自从该公司本周早些时候透露将进行这种水印以遵守欧盟人工智能法案的透明度准则以来,Claude用户一直在争论此举,该准则要求人工智能公司使用能够识别人工智能生成内容的系统。
例如,在Reddit上,一位发帖者将此描述为针对无辜Claude用户的阴谋,而另一位发帖者则声称,“你不希望这样做的唯一原因是对人们撒谎。”据《商业内幕》报道,X上的“数十名”用户声称因此取消了他们的Claude订阅。
Anthropic的新帖子首先对水印概念进行了总体概述,解释说,当做出“低风险选择”时——比如在“阴天”和“灰色”之间进行选择来描述天气——Claude可以在其响应中创建一种模式,“读者无法察觉,但任何拥有编码密钥的人都无法察觉”。
“水印不会影响Claude输出的质量,”该公司表示。 “对于读者来说,带水印的回复与未加水印的回复没有区别。”
更具体地说,Anthropic表示将使用Google DeepMind团队在2024年概述的SynthID Text方法,并计划发布水印检测API。它还指出,水印与Pangram等公司提供的人工智能检测方法不同,后者在文字中寻找“告诉”(例如“这不是 [X],这是 [Y]”的结构)来揭示人工智能的使用情况:“识别这些模式与检查水印根本不同。”
有人可以重写文本来隐藏水印吗? Anthropic说这是可能的,但“轻微编辑可能不会完全删除水印”,而“替换每个单词的完全重写会。”
该公司表示:“当然,在后一种情况下,文本是否可以再被描述为人工智能生成是有争议的。”
至于仅由Claude校对或编辑的文本中是否可以检测到水印,Anthropic表示,这将取决于“文本的长度以及Claude对其进行编辑的程度。”如果仅进行了轻微编辑,“几乎所有文字”都将由人类作者编写,并且“几乎没有(如果有的话)可以附加水印。”
与此同时,代码的水印应该比其他文本少,因为模型需要创建工作代码,并且不能自由地在各种同等有效的选项之间进行选择。
“话虽如此,在代码中特定单词或术语之间存在任意选择的区域,可以使用水印,例如代码中的注释,”Anthropic说。 “但据定义,它对实际生成的代码的影响可以忽略不计。”
Anthropic还表示,Claude不会是唯一生成带水印文本的人工智能聊天机器人,因为“其他主要模型开发人员已经签署了相同的实践准则,并将实施自己的水印。”