据日本IT媒体ITmedia 16日报道,Anthropic公开说明了其AI聊天机器人Claude生成文本中“不可见水印”的工作机制。
Anthropic于当地时间14日发布相关介绍。该方案基于Google DeepMind的水印技术SynthID-Text,核心做法是将模型原本用于选词的随机过程,改为由密钥与前文共同决定,从而在文本中留下可通过统计方式识别的模式。
Anthropic表示,由于公司已签署与欧盟《AI法案》透明度义务相关的行为准则,今后将陆续在Claude生成文本中启用水印。适用范围并不限于欧盟,而是覆盖包括韩国在内的全球模型和产品。公司解释称,现阶段尚无法稳定地按地区区分适用范围,因此上线初期将统一面向全球启用。报道称,该行为准则已有约190家机构签署,其他主要AI开发商也计划分别推出各自的水印方案。
■ 不插入额外内容,对成本和速度影响有限
大语言模型(LLM)是按词元(Token)逐步生成文本的。Anthropic举例称,在“今天天气很冷”这样的语境之后,模型可能会在“阴天”“多云”等多个语义合理的选项中进行选择。通常,这一步由随机数驱动;而引入水印后,这一随机过程将由密钥和前文若干词共同决定,进而形成只有持有密钥的一方才能识别的统计特征。
Anthropic强调,这一机制不会刻意引导模型偏向特定词汇,也不会为了嵌入水印而选用生僻表达。由于文本中不会增加任何额外内容,也不会插入隐藏字符,因此不会消耗额外Token,整体上不会推高使用成本,对生成速度的影响也较小。与此同时,水印和密钥本身均不包含可用于识别用户、机构或具体对话的信息。
■ 彻底改写后,水印将失效
在检测方面,Anthropic表示将很快推出专用API,利用密钥对文本词序列进行校验,以判断Claude参与生成的可能性。不过,并非所有文本都适合嵌入水印。对于可选表述空间较小的句子,水印效果会受到限制。比如“Isaac Newton最著名的著作为《Principia…》”这类事实性表述,或“2+2=”这样的算式,由于答案基本唯一,不属于适用场景。
在代码场景中,如果替换用词可能引发错误,因此水印只会用于可自由表述的注释部分。相较之下,对于由Claude重新选择全部措辞生成的翻译文本,则可以嵌入水印。
Anthropic同时指出,该方案本身也存在局限。轻度编辑通常难以彻底去除水印,但如果全文用词都被彻底改写,水印就会消失。在这种情况下,这类文本是否仍应被视为AI生成,业内本身也存在争议。换句话说,水印只能反映Claude可能以某种形式参与过内容生成,无法区分“由Claude直接撰写”还是“经Claude大幅修改”;同时,它也不能证明内容一定出自人类,或判断文本是否由其他公司的AI模型生成。通常而言,文本越短,识别准确性越低;文本越长,准确性则越高。
■ 图像采用C2PA元数据标记方案
对于Claude生成的PNG、JPG、SVG等图像/图形文件,Anthropic将采用与文本不同的处理方式:在文件元数据中加入加密签名信息,标明内容由Claude生成或处理,并遵循内容来源标准C2PA。这一标准与相机厂商及图像编辑软件采用的规范一致,可通过兼容C2PA的工具进行验证。Anthropic表示,未来也将提供自有验证工具。
报道还提到,欧盟《AI法案》第50条有关透明度义务的规定已于本月2日开始适用。对于此前已发布的既有模型,受法律过渡安排影响,新增水印功能将在未来几个月内分阶段推出。