技能级联攻击揭示智能体系统安全盲区
「arXiv 新论文提出技能级联攻击这一威胁范式,把恶意目标拆分到多个技能中,使每次修改单独看都属正常,组合执行却产生危害。研究者发布自动化多智能体红队框架 SkillCascade 与包含 213 个测试用例的 SkillCascade-Bench,在 OpenClaw、Claude Code、Codex 等智能体上验证其可稳定绕过逐技能扫描与运行时监控。」
在基于技能的智能体系统中,一个技能通常是由自然语言指令、可执行脚本和参考资源打包而成的模块化组件。智能体可以在运行时按需加载技能,从而快速获得处理特定任务的能力。这种机制让第三方能力得以灵活复用,也让技能生态保持高度开放。但开放同时带来了新的攻击面:当技能可以自由组合、层层调用时,风险不再局限于单个组件内部。
arXiv 平台收录的一篇论文提出了名为技能级联攻击的全新威胁范式。其核心思路是把一个恶意目标分散到多个技能之中,让每一处修改在孤立审视时都显得无害甚至合理,而它们组合执行后却会产生实质危害。论文指出,此前的研究大多聚焦于单个技能内部的漏洞,对技能之间交互所引发的风险关注不足,这正是一个长期被忽视的安全盲区。
论文给出了一个直观的医疗场景示例。在处方审查流水线中,第一个技能负责削弱提取病史里近期停药药物的信号,第二个技能负责下调与这些药物相关的一切药物相互作用严重程度,第三个技能则负责在最终摘要中抑制由此产生的低优先级告警。三个技能各自的行为都像是常规的过滤或降噪处理,但串接起来的结果是,一条严重的药物相互作用警告在送达医生之前悄无声息地消失了。
为了系统性地研究这一盲区,研究团队开发了 SkillCascade,一个自动化的多智能体红队测试框架,用于自动构造和验证跨技能的级联攻击链路。与此同时,团队发布了 SkillCascade-Bench 基准,其中包含 213 个经过验证的级联测试用例,覆盖多种智能体系统与多个应用领域,为后续研究提供了可复现的评测基础。
在实验环节,研究者选取了多款具有代表性的智能体,包括 OpenClaw、Claude Code 与 Codex,并搭配不同的 LLM 底座进行测试。结果显示,级联交互能够稳定地诱导出有害行为,同时成功规避现有的逐技能扫描器和运行时监控机制。这意味着,单独检查每一个技能的静态扫描与运行期防护,在面对跨技能协作攻击时几乎失效。
论文由此强调,当前安全体系存在组件级完整性与系统级安全之间的明显落差。逐个技能验证通过,并不等于整个智能体链路安全。研究团队呼吁,防御方案需要从孤立审查单个技能,转向对跨技能交互进行推理与联合分析,例如建模技能之间的调用链路、追踪信息在多个技能间的传递与变形,并据此识别那些只有组合起来才显露出恶意的行为模式。这项工作也提示开发者与平台方,在构建开放技能生态时,除了关注单个技能的质量与权限,还应当为技能组合引入新的监测与约束手段。
来源:Heooo AI工具导航