技术进展

研究揭示AI智能体易受信念极端化影响

Heooo 10月01日12时29分 8 阅读

「一项新研究通过双智能体对话实验发现,影响者智能体能让目标智能体的信念更加极端。共鸣路径的效果持续强于说服路径,不同影响策略的效果因指标而异,共鸣还会扩散至相关信念。研究提示个性化智能体与多智能体生态存在被操纵的风险。」

多智能体系统正在成为大模型应用的重要形态,智能体之间能否相互影响信念,此前研究并不多。一篇新近发表于arXiv的论文《AI Agents are Vulnerable to Radicalization》给出了一个实验性回答:当两个大模型智能体进行对话时,其中一个可以系统性地改变另一个的信念倾向,使其观点向更极端的方向移动。

研究团队设计了一套双智能体对话框架。目标智能体依据人口统计特征与心理属性扮演特定的人类角色,影响者智能体则被赋予一个明确目标,即让目标智能体的信念变得更加极端。围绕这一设定,研究者考察了两条不同的作用路径:其一为共鸣,即影响者强化目标原本就持有的信念;其二为说服,即影响者试图让目标接受一个其起初认为并不重要的信念。

在情感与行为两类指标上,实验得到了一个一致结论:两种机制都能让目标智能体走向极端化,但共鸣的效果始终强于说服。这意味着,与目标既有立场相契合的信息,比全新立场的信息更容易被放大。研究者还发现,共鸣效应并不会停留在单一信念上,而会扩散至与之相关的其他信念,这暗示智能体内部可能存在相互关联的信念结构。

研究进一步比较了不同的影响策略。使用谄媚式附和、引用未经验证的说法等手法,会产生不同程度的极端化效果,但这些策略在不同评估指标上的表现并不稳定一致。这一细节说明,影响效果与衡量维度高度相关,单一指标难以完整刻画智能体的信念变化。

论文作者指出,这些结果表明AI智能体对极端化影响具有易感性,尤其是当信息与其原有信念一致时。由此带来的担忧集中在两个方面:一是个性化AI智能体的脆弱性,由于其长期记忆与用户偏好建模,更容易被定向引导;二是多智能体AI生态的脆弱性,智能体之间的相互影响可能形成级联效应,使偏差在系统内扩散。

从技术角度看,这项研究把智能体安全从单模型对齐推进到多智能体交互层面。以往的对齐工作关注单个模型是否输出有害内容,而这里的问题发生在模型与模型的对话过程中,最终输出可能表面正常,但内部信念分布已经漂移。对开发者而言,这意味着需要为多智能体交互引入新的监测与审计手段,例如追踪信念漂移幅度、对交互回合进行采样评估、检测谄媚式回应与未经验证的说法,以及在关键决策前进行信念一致性校验。

研究者同时提示,共鸣强于说服这一结论具有明确的技术含义:如果希望降低智能体被影响的风险,仅仅过滤明显异常的内容并不足够,还需要关注那些与目标既有立场高度吻合、因而更难被识别为操纵的信息。相关工作也为后续在多智能体环境中验证防御策略提供了基础。

# AI智能体 # 多智能体系统 # AI安全 # 大语言模型

来源:Heooo AI工具导航