技术进展

OpenEvoShield:多智能体系统新型防御框架

Heooo 07月23日12时02分 4 阅读

「针对大语言模型多智能体系统(LLM-MAS)面临的双重动态攻击威胁,研究人员提出了OpenEvoShield共演化持续防御框架。该框架通过非对称速率控制器解耦攻击侧与正常侧漂移信号,结合动态行为边界更新与EWC正则化策略集成,以及能量多粒度检测器,实现对新攻击的持续检测。在五个基准和四种拓扑上的实验表明,OpenEvoShield能有效检测未知攻击并保持低误报率。」

随着大语言模型多智能体系统(LLM-MAS)在安全关键型应用中的广泛部署,其面临的安全威胁日益严峻。攻击者能够通过智能体间的通信注入恶意指令,从而传播有害行为。与传统静态威胁不同,这些攻击呈现出双重动态特性:一方面,攻击者会根据部署的防御策略不断调整注入手法;另一方面,正常智能体的行为也会随着系统扩展而发生漂移。现有防御方法通常将部署视为封闭世界问题,一旦分布偏移超出训练覆盖范围,性能便会迅速下降。

针对这一挑战,来自学术界的研究团队提出了OpenEvoShield框架,这是一种面向LLM-MAS的共演化持续防御方案。该框架的核心创新在于其非对称速率控制器(M1),能够从双重漂移信号中解耦出快速攻击侧和慢速正常侧的学习速率。通过这种解耦设计,系统可以分别处理攻击行为的快速变化和正常行为的缓慢演变,从而更精准地应对动态威胁。

OpenEvoShield框架包含四个关键模块。首先是M1非对称速率控制器,它通过分析双重漂移信号,动态调整攻击侧和正常侧的学习速率,确保系统在快速变化的攻击环境中保持适应性,同时避免对正常行为过度响应。其次是M2正常边界更新器,它以慢速率维护一个动态的行为边界,这个边界能够随着正常智能体行为的自然漂移而缓慢更新,从而保持对正常行为的准确描述。

第三模块是M3 EWC正则化策略集成,它实现了快速适应而不会发生灾难性遗忘。弹性权重巩固(EWC)技术允许模型在适应新攻击模式的同时,保留对之前学习到的攻击模式的记忆,这对于持续学习环境至关重要。最后是M4能量多粒度检测器,它融合了节点级、子图级和图级证据,将新型攻击分类为分布外样本。这种多粒度分析能够从不同层次捕获攻击行为特征,提高检测的全面性和准确性。

研究团队在五个基准测试和四种多智能体系统拓扑结构上进行了实验,覆盖了100个部署轮次。实验结果表明,OpenEvoShield在性能上显著优于静态防御和持续学习基线方法。具体而言,该框架能够检测大多数之前未见过的攻击类型,同时将误报率保持在较低水平。这种低误报特性对于实际部署至关重要,因为频繁的误报会降低系统的可用性和用户信任。

从技术角度看,OpenEvoShield的共演化设计理念值得关注。传统防御方法往往假设攻击模式是固定的,或者只考虑单方面的变化。而OpenEvoShield认识到,在多智能体系统中,攻击者和防御者之间存在持续的博弈过程,正常行为也会随系统演进而变化。通过将这三者纳入统一的持续学习框架,该方案更贴近真实世界的安全挑战。

该研究为LLM-MAS的安全防护提供了新的思路。未来,随着多智能体系统在自动驾驶、金融交易、医疗诊断等领域的深入应用,类似OpenEvoShield的持续防御机制将成为保障系统安全的关键技术。研究团队表示,后续工作将探索如何降低框架的计算开销,以及如何将其扩展到更大规模的智能体网络。

# 多智能体系统 # 持续防御 # 大语言模型 # 安全检测 # 共演化

来源:Heooo AI工具导航