
为满足《欧盟人工智能法案》的透明度要求,各大科技公司正加速为其生成式模型添加内容水印。该法案规定,最强生成式模型的提供者必须对输出内容进行标记,以便区分机器生成与人类创作,相关义务将于2026年8月2日正式生效。
Anthropic于8月中旬宣布,其新版Claude模型已嵌入隐形水印;OpenAI则采用Google DeepMind的SynthID技术处理图像和音频。然而,安全公司Lasso Security的最新研究指出,作为合规核心的SynthID-Text技术引发了未曾预料的副作用——“采样漂移”。
水印技术引发“采样漂移”风险
研究表明,水印机制对词元概率施加的微小偏差,虽能满足统计检测需求,却改变了大型语言模型的行为模式。这种漂移不仅影响模型在面对有害提示时的拒绝率,还干扰了AI智能体对外部工具或API的调用决策。
Lasso研究人员Andrea Siposova在多个开源模型上测试发现,即使未经攻击,水印化也改变了模型回答潜在有害请求的意愿。在某些情况下,模型对先前拒绝的危险指令变得更为顺从。若遭遇精心设计的提示注入攻击,这一安全隐患将进一步放大。
此外,这种影响不仅限于文本生成。实验显示,激活水印后,模型在基准测试中的工具调用准确率出现可测量的下降,可能导致选择错误的函数或传递异常参数。研究结论强调:“水印化程序既会影响模型所说的话,也会影响智能体所做的事情。”
监管空白与行业应对
尽管总体安全评分可能掩盖这些波动,但开发者若直接在水印化模型上部署应用,可能面临未经过新基准测试的安全风险。目前,欧盟透明度行为准则虽要求水印技术有效、稳健且互操作,并将互操作性截止日期延至2027年,但并未强制要求在水印集成后重新测试安全护栏。
部分专家辩称,水印对长文本质量影响微乎其微,且欧盟措施符合当前技术水平。然而,行为对齐的改变不同于风格退化。若模型减少了对有害提示的拒绝,即便行文流畅,其输出可信度也已受损。
Lasso Security敦促行业采取务实步骤:将水印集成视为模型的实质性变更,并在应用后重新运行安全评估和能力基准测试。监管机构或许需扩大期望,确保标记行为本身不削弱输出的可信度。
随着水印义务生效在即,主要实验室已做出合规承诺,但执法行动尚未展开。这段窗口期正迅速收窄,尤其是在默认嵌入水印且用户无法退出的情况下。未来技术或在训练阶段而非采样阶段嵌入标记,以解决此权衡问题。在此之前,行业必须正视并量化这一隐性风险,在内容溯源与系统稳定性之间寻找平衡。