技术进展

智能体运行时治理系统Aegis实现行动边界控制

Heooo 08月19日12时02分 29 阅读

「Aegis是面向智能体AI的运行时治理系统,将模型输出视为行动提案,在工具执行前通过可信决策层进行调解,实现行动边界控制。实验显示,在6300行语料中提示条件产生79条风险泄漏,而2100行Aegis治理下零风险副作用,1832行保留可信来源,1019行Senate结算均有证据支撑。」

随着智能体AI系统能力的不断增强,它们不再局限于生成文本,而是可以请求执行修改文件、发送消息、启动作业或更改工作流状态等工具操作。这种能力转变将安全问题的核心从有害文本生成转移到了有害的操作副作用上。传统的提示词级治理虽然能够在模型行为层面施加约束,却无法真正形成一道执行的边界。针对这一挑战,一项来自arXiv的最新研究提出了一套名为Aegis的运行时治理系统,旨在为智能体AI提供可靠的动作边界控制。

Aegis的核心设计理念可以概括为“模型提出,运行时决定”。系统将模型输出视为有待批准的行动提案,而不是直接可执行的指令。在工具真正执行之前,这些提案会经过一个可信的决策层进行调解。这一层拥有独立的策略判断能力,能够评估提案是否符合当前激活的策略状态,并在服务器端解析动作的来源信息,从而建立起完整的信任链条。更重要的是,Aegis在不确定性面前采取失败关闭机制,即当系统无法确认某个动作是否安全时,默认拒绝执行,而不是冒险放行。

除了常规的策略裁决,Aegis还引入了一种名为“Senate式结算”的路径,用于处理需要更高授权级别的案例。这种机制要求基于法定人数的多方协商达成一致,而非由单一主体单方面授权,从而为非绝对安全场景提供了更为审慎的决策流程。这一设计借鉴了治理中的制衡思想,确保关键操作不会因为单个决策者的失误而造成不可逆的影响。

为了验证系统的有效性,研究团队在重复性沙盒语料库上进行了全面评估。该语料库覆盖五个运行家族、四十二个任务、三种实验条件,每个家族重复十次。在总计六千三百行的数据中,仅依赖提示词策略条件就产生了七十九行风险比较路径泄漏,这说明传统的提示词层约束确实存在明显防线缺口。而在两千一百行由Aegis治理的测试数据中,系统记录到零次被治理的模拟工具应用,以及零次被治理的风险副作用完成。这一对比直观地展现了运行时治理在阻断风险动作方面的显著优势。

进一步的数据分析显示,所有一千八百三十二行由Aegis尝试治理的记录均保留了经服务器端解析的可信来源信息,确保每个动作都有可追溯的出处。此外,所有一千零一十九行经过Senate结算的记录都具备法定人数确认和最终签名计数证据,证明该授权路径的严谨性和可审计性。

研究人员在论文中谨慎指出,这些结果并不证明通用的自主智能体安全性,而是支持一个较窄的系统性主张:在这个评估的沙盒语料库中,运行时行动边界治理成功阻止了观察到的风险提案转化为受治理的副作用。这一结论为智能体AI的安全部署提供了一条可落地的技术路径,即从依赖模型自觉转向借助可信的运行时决策层来强制安全边界。随着智能体在工作流自动化、内容生成和系统交互等场景中的普及,类似Aegis的运行时治理机制或将成为构建可信AI系统的重要基础设施。

# Aegis # 智能体安全 # 运行时治理

来源:Heooo AI工具导航