
近期,Anthropic 宣布其未来的 Claude 模型将在输出中嵌入不可见水印,并披露该技术基于 Google DeepMind 的 SynthID-Text。尽管文本水印并非新技术,但其部署具有明确的监管背景:欧盟《人工智能法案》要求 AI 系统提供商以机器可读格式标记合成文本,以便检测。
然而,水印旨在确保证据溯源,SynthID-Text 却通过改变模型生成下一个 Token 的过程来实现这一目标。这种底层改动可能引发“采样漂移(Sampling Drift)”,进而影响模型的安全行为,包括对有害请求的拒绝能力及其在面对提示注入(Prompt Injection)时的稳健性。在智能体(Agent)场景中,Token 选择直接决定工具调用及参数传递,削弱的拒绝机制可能导致更严重的后果。
为溯源构建,却扰动智能体决策
现有文本水印方法包括后处理和集成到大型语言模型(LLM)生成中的方法。SynthID-Text 采用“锦标赛采样”,虽在非失真配置下保留了原始 Token 分布的统计特性,但在固定密钥下的单次生成仍会改变具体 Token 的选择。Anthropic 表示,水印应用于模型层面,涵盖通过 API 访问的所有场景。这意味着,即使智能体是独立应用,只要使用带水印模型作为推理组件,其行为就可能受到水印引发的采样漂移影响。
在 JSON 等结构化输出中,键名通常可预测,但值(如查询、金额)具有不确定性。水印导致的微小 Token 变化,足以改变智能体执行的参数或工具选择。
实证研究:水印导致工具调用与安全拒绝出现偏差
研究团队通过配对实验评估了水印的影响,使用 BFCL v4 评估工具调用,使用 HarmBench 和 JailbreakBench 评估拒绝行为。结果显示,水印确实导致了行为漂移,且这种效应在聚合指标中可能被掩盖,因此研究重点分析了“配对不一致率”(Churn)。
工具调用准确率受损
在预期进行工具调用的任务中,水印降低了多数模型的性能。以 phi-4 为例,在温度 T=1.0 时,有无水印的判决差异率(Churn)高达 16.8%,而净准确率损失仅为 2.87 个百分点。Llama-3.1-8B 也呈现类似模式,9.9% 的判决发生变化,净损失仅 0.87 个百分点。错误类型因模型而异:Llama-3.1-8B 主要出现参数错误,而 phi-4 和 Granite-3.2-8B 则更多出现格式错误。
提示注入下拒绝机制显著削弱
水印对拒绝行为的影响在常规请求中尚不明显,但在提示注入攻击下显著放大。当有害请求搭配声称“安全过滤器已禁用”的对抗性指令时,多种模型的不一致性激增,且主要从“拒绝”转向“服从”。
数据显示,在 T=0.001 时,gemma-3-27b 在裸奔请求下的 Churn 为 6.0%,而在提示注入下升至 23.5%;净服从率从 -1.0 分变为 +12.5 分。gemma-3-12b 和 Llama-3.1-8B 也表现出类似的显著 Churn 增加。相比之下,phi-4 和 Qwen3-4B 因倾向于过度拒绝,受水印影响较小。
进一步对比发现,在六种测试模型中的四种上,水印引起的 Churn 显著高于由温度变化(从 0.001 调至 0.7)引起的一致性波动。例如,Granite-3.2-8B 的水印 Churn 为 21.5%,高于其温度诱导的 15.5%。
效应依赖水印密钥
水印的影响还高度依赖于密钥。测试显示,更换密钥可显著改变攻击成功率的大小甚至方向。对于 Llama-3.1-8B 和 Gemma 系列模型,大多数密钥相对于无水印基线增加了攻击成功率,且不同密钥间的差异巨大。这表明,若水印密钥由模型提供商控制而非开发者,智能体开发人员将难以预判和控制此类安全风险。
结论:水印应纳入智能体安全评估体系
研究表明,溯源水印不仅影响内容标识,更深度介入智能体的决策过程。在常规输入下看似稳定的模型,在遭受提示注入等对抗性攻击时,水印可能导致拒绝机制失效或工具调用错误。由于这种效应具有模型和配置依赖性,且可能掩盖在整体性能指标之下,开发者在部署或更新水印配置时,必须重新进行红队测试和安全评估,特别是在提示注入场景下的配对比较。水印不应仅被视为合规工具,更应作为影响智能体行为稳定性的关键安全配置进行管理。