大模型水印技术或影响AI智能体行为 封面图
技术进展

大模型水印技术或影响AI智能体行为

Heooo 09月26日22时00分 26 阅读

「Anthropic宣布将在Claude模型中嵌入基于SynthID-Text的隐形水印,以满足欧盟AI法案要求。研究表明,此类水印虽旨在内容溯源,却可能通过改变模型生成过程引发“采样漂移”,进而影响模型拒答有害请求的能力及智能体工具调用行为。」

近日,人工智能安全公司Lasso Security发布研究指出,大语言模型(LLM)中用于内容溯源的水印技术,可能在无意中改变AI智能体的行为表现。这一发现源于Anthropic宣布其未来的Claude模型将嵌入一种不可见水印,并明确该技术基于Google DeepMind开发的SynthID-Text方案。

大模型水印技术或影响AI智能体行为

水印技术本身并非新鲜事物,但随着《欧盟AI法案》第50(2)条的出台,其部署获得了明确的监管意义。该条款要求生成合成文本的AI系统必须以机器可读的方式标记输出内容,并确保这些内容能被可靠识别为人工生成或经过操纵。为此,SynthID-Text等生成时水印方法被引入模型底层。

然而,问题在于:SynthID-Text并非简单的后处理步骤,而是直接介入模型生成下一个token的过程。这种干预虽然在统计期望上保持原始token分布不变(即“非失真配置”),但在固定密钥下,单次生成结果仍可能与未加水印的版本存在差异。这种差异被研究人员称为“采样漂移”(sampling drift)。

大模型水印技术或影响AI智能体行为

研究团队通过实验发现,这种漂移确实会影响两个关键层面:一是模型的安全行为,例如是否拒绝有害请求,以及在面对提示注入攻击时能否维持拒绝;二是AI智能体的工具调用决策,包括选择哪个工具以及传递何种参数。由于现代AI系统常具备调用外部工具的能力,一旦水印削弱了模型的拒答能力,其潜在风险将被放大。

大模型水印技术或影响AI智能体行为

值得注意的是,这种影响具有模型和密钥依赖性,且在整体性能指标中可能被掩盖——当不同方向的变化相互抵消时,平均得分看似稳定,实则内部行为已发生偏移。因此,研究建议开发者不仅关注净性能(net performance),还应分析加水印与未加水印运行之间的配对分歧(paired disagreement)。

大模型水印技术或影响AI智能体行为

Anthropic强调,其水印机制在模型层面实施,覆盖通过Claude Platform API及云服务商调用的所有支持模型。这意味着开发者即便仅将模型作为智能体的一部分使用,也会受到水印带来的行为变化影响。这打破了“水印仅用于内容溯源”的传统认知,将其影响延伸至AI系统的行动层面。

大模型水印技术或影响AI智能体行为

尽管Google DeepMind此前报告称,在近两千万条Gemini响应中未观察到可测量的质量下降,但Lasso的研究表明,安全性与功能性层面的细微变化可能无法通过常规质量评估捕捉。这对AI安全与可靠性提出了新挑战。

大模型水印技术或影响AI智能体行为

研究最后呼吁开发者在集成带水印模型时,需重新评估其在对抗性环境下的行为稳定性,尤其是在涉及工具调用、自主决策等高风险场景中。同时,监管机构也应考虑水印技术对AI系统整体行为的潜在干扰,而不仅限于内容标识功能。

大模型水印技术或影响AI智能体行为

目前,SynthID-Text采用的“锦标赛采样”(Tournament sampling)机制是生成时水印的代表方案之一,其他方法还包括logits偏置、无失真密钥采样及密码学构造等。图1展示了其与普通采样的流程差异。

大模型水印技术或影响AI智能体行为

随着AI系统日益复杂,从单纯的内容生成转向具备行动能力的智能体,底层技术如水印的“副作用”不容忽视。这项研究提醒业界:合规性措施若未经充分行为验证,可能在满足监管要求的同时,悄然削弱系统的安全边界。

大模型水印技术或影响AI智能体行为

大模型水印技术或影响AI智能体行为

大模型水印技术或影响AI智能体行为

# 大模型水印 # AI智能体 # SynthID-Text # 采样漂移 # AI安全

来源:Heooo AI工具导航