技术进展

KL散度门控机制优化多智能体通信时机

Heooo 08月18日12时58分 24 阅读

「多智能体强化学习中通信时机决定协作效率。现有方法要么每步都通信,要么用高方差REINFORCE学习二值门控。新研究提出基于信念分布KL散度超过阈值才通信的原则性方案,在捕食者-猎物及MPE基准上验证,展现出性能提升与方差降低的双重优势。」

在多智能体强化学习领域,通信策略的设计直接关系到协作任务的整体效率。传统方法往往采取两种极端:一是每个时间步都进行通信,虽然简单但带来了巨大的信息冗余与带宽消耗;二是通过REINFORCE策略梯度学习一个二值门控信号,决定何时通信,但该方法存在高方差问题,导致门控行为不稳定且难以解释。

针对这一痛点,来自arXiv的最新研究提出了一种原则性的替代方案。该方法的核心思想是:智能体仅在自身学得信念分布之间的KL散度超过固定阈值时才进行通信。具体而言,每个智能体维护一个关于潜在世界状态的信念分布,该分布通过对LSTM隐藏状态取softmax计算得到。当智能体之间信念分歧足够大时,才触发信息交换,从而实现通信时机的自主且可解释的决策。

该研究在IC3Net基准中的Predator-Prey任务上开展了实验,覆盖两个环境尺寸,每种配置运行5次随机种子,同时也在MPE的simple_spread环境中进行了验证。对比对象包括IC3Net、CommNet以及独立控制器。实验结果显示,在较为简单的PP 10×10环境中,IC3Net在所有阈值下均优于KL信念门控方法。然而,在更具挑战性的PP 20×20环境中,阈值消融实验揭示了倒U型规律:当KL散度阈值设为0.5时,新方法平均73.84步完成任务,成功率42%,而IC3Net平均需75.31步,成功率仅31%,两者差距达1.47步和11个百分点,且新方法的种子方差更小,稳定性更优。

值得注意的是,研究还发现了一个重要的副产品:即使门控机制并未激活,使用信念头(belief head)也能显著改善MPE环境的平均奖励,提升12个点,并将方差降低26倍。这表明该方法的贡献具有正交性——一方面,当信念分布能够有效收敛时,基于KL散度的门控提供了合理的通信决策依据;另一方面,引入信念分布本身也增强了潜在表征的质量,从而独立地促进了多智能体间的协调能力。

这一研究为多智能体通信时机提供了新的理论视角与实用工具。相较于依赖高方差梯度的端到端学习,基于信息论度量的门控机制更符合直觉,也更容易被调试与解释。未来,如何让阈值能够自适应调整,以及如何将类似原则扩展到更复杂的部分可观测环境,或将成为后续研究的重要方向。

# 多智能体强化学习 # KL散度 # 通信门控

来源:Heooo AI工具导航