随着欧盟相关法规逐步落地,AI平台正陆续推进AI生成内容水印方案。不过,也有研究提出警示:这类机制可能在提升可识别性的同时,给大语言模型带来新的安全风险。
Anthropic表示,未来将把Google开源的SynthID-Text应用于Claude模型。
据Ars Technica报道,SynthID-Text的工作原理,是利用秘密密钥对模型生成文本时的下一个词选择做细微干预。比如,模型原本可能输出“朦胧”,在密钥作用下则更倾向于输出“多云”。掌握密钥的一方,可据此识别文本是否由特定平台生成。
不过,安全公司Lasso Security的研究指出,SynthID-Text的影响可能并不止于选词本身,还可能改变模型的工具调用表现,以及其对安全机制的遵守情况。
在攻击者试图诱导模型泄露密码或敏感信息的对抗性提示场景下,这类风险可能被进一步放大。研究发现,某些原本不会执行的指令,在启用水印后,部分情况下却会被执行。该结果表明,开发者在部署水印方案时,需要对大语言模型及其Agent的行为进行更严格的安全验证。
Lasso Security AI安全研究员Andrea Siposova在接受Ars Technica采访时表示,与未启用水印的同一模型相比,加入水印后的模型行为会出现“明显不同”,尤其是在对抗性条件下,或在驱动Agent调用工具时,这种差异更为突出。她还表示,水印机制本就被设计为尽量不被用户察觉,但只要对模型输出施加哪怕极其轻微的改动,都可能在其他环节引发副作用,而这一点其实早已为业界所认知。
报道指出,这项研究并未直接验证Claude在启用水印后的响应变化,而是基于6款开源模型展开测试。实验验证的也只是Hugging Face版本的SynthID-Text“tournament sampling”实现,与Claude未来可能采用的具体方案并不完全一致,因此研究本身存在一定局限性。不过,相关结果仍显示,部分水印方案可能对模型及Agent的安全性产生影响。