新基准MERIT评估LLM代理长期记忆效用
「研究人员提出MERIT基准,首次在工具调用型大语言模型代理中量化长期记忆对任务成功的边际效用,并引入成本感知机制。实验覆盖多个主流模型,在23,440个任务回合中发现记忆机制可将依赖历史事实的任务成功率从0提升至0.55–1.00,但不同记忆实现方式效果差异显著。」
近日,一项发表于arXiv的前沿研究《When Does Memory Help? A Cost-Aware Evaluation of Long-Term Memory in Tool-Using LLM Agents》提出了名为MERIT(Memory Evaluation for Realistic Instrumented Tasks)的新基准,旨在系统评估长期记忆在工具调用型大语言模型(LLM)代理中的实际效用。该工作突破了当前主流仅依赖对话回忆任务(如LoCoMo、LongMemEval)的局限,首次将记忆能力与代理在真实任务中的行为决策直接关联。
MERIT的核心创新在于引入“成本感知”机制,不仅衡量记忆是否帮助完成任务,还精确计量每次记忆操作所消耗的token数量与美元成本。该基准设计了三个领域的工具使用任务,每个任务都经过自动化“信息泄露检查”,确保任务成功必须依赖此前回合中获取的事实信息。此外,MERIT包含难度递进的任务结构,最终阶段要求代理处理已被更新的事实,从而测试其记忆更新与检索的一致性。
研究团队在总计23,440个评分任务回合(总成本42.57美元)中进行了大规模实验。初步测试涵盖gpt-4.1-mini,并进一步开展了预注册的3模型×3随机种子网格实验,涉及GPT-4.1和Claude Haiku 4.5等主流模型,同时固定记忆模块以隔离变量。结果显示,在依赖历史事实的任务中,启用记忆机制可将成功率从经验证的0.00基线显著提升至0.55–1.00区间。
然而,研究也揭示了当前记忆实现方式的重大缺陷。在处理已更新的事实时,基于嵌入检索的记忆系统表现极不稳定,成功率在0.30至0.95之间波动,且同一模型不同随机种子间最大差距达0.45。更令人意外的是,即使代理成功检索到正确的更新值,也仅有55%的概率据此采取正确行动。相比之下,采用“写时更新”策略的结构化事实存储(包括LLM自动摘要机制)则稳定维持在0.70–1.00的成功率。值得注意的是,混合使用多种记忆机制反而导致性能下降,甚至不如单独使用结构化事实存储。
后续对最新模型Claude Sonnet 5的抽查实验复现了上述模式,进一步验证了结论的普适性。研究还发现,仅更换记忆模块的实现方式,即可使任务成功率变动高达60个百分点。更重要的是,全量回放(full replay)策略在经济性上始终不具优势——各领域中表现最佳的记忆配置,其单位成本带来的边际效用可达其他方案的2.7至3.9倍。
该研究团队已开源MERIT基准、评估框架及全部实验轨迹数据,为未来LLM代理记忆系统的设计与评估提供了标准化工具。这一工作不仅推动了对长期记忆机制的深入理解,也为构建高效、可靠、经济的智能代理系统奠定了实证基础。
来源:Heooo AI工具导航