技术进展

智能体可控遗忘机制实现上下文可逆压缩

Heooo 10月09日12时02分 3 阅读

「arXiv论文提出智能体控制的遗忘机制,让模型把冗余的工具返回结果替换为简短笔记并存入可恢复归档,无需任务训练。在OpenTelemetry调试实验中,提示词token从912492降至231951,成本从约4.38美元降至约1.28至1.44美元,但耗时增加17%,且节省效果依赖具体工作负载。」

在使用工具的大模型智能体中,上下文窗口常常被大量冗长的工具返回结果占据,而其中真正有用的内容可能只占很小一部分。arXiv上一项题为《Agent-Controlled Forgetting for Tool-Using Agents: Reversible Context Curation in Practice》的研究,提出了一种让模型自己决定压缩哪些历史观察、如何压缩以及如何完整恢复的机制,称为智能体控制的遗忘。

该方法的核心设计是:由正在执行任务的模型主动挑选此前观察到的工具调用结果,把每一条结果在其原始位置上替换为一段简短笔记,同时把完整原文保存进可恢复的归档中。整个流程由一个Python框架实现,对外提供批量归档与显式恢复能力,全程不需要针对具体任务做模型训练。值得关注的是,该机制把用户指令和助手消息列为受保护内容,不允许对这两类信息执行归档操作,从而避免任务目标本身被遗忘,这也是它区别于普通截断或摘要压缩的关键点。

论文给出了一个探索性实验:在一个OpenTelemetry调试任务之后紧接一个不相关的实现任务。采用该方法的运行最终耗用提供方报告的提示词token为231951个,而保留完整历史记录的对照组达到912492个;累计输入token减少约50%,估算API成本从约4.38美元下降至约1.28至1.44美元。两组都通过了两个案例的主要行为判定,但都没有完全满足后续评估要求。代价方面,该方法发出的请求次数更多,整体耗时增加约17%。

研究同时揭示了这一机制的适用边界。在一个对比性的应用开发任务组合中,该方法没有带来任何上下文或成本上的节省;在此前一次延续实验中,尽管上下文规模下降,人工评估的质量反而有所降低。作者由此指出,可逆上下文管理存在明显的工作负载依赖性:只有当工具调用轨迹足够嘈杂、冗余信息占据主导时,遗忘与归档才可能带来可观收益。

从工程视角看,这项工作的价值在于提供了一种可逆的记忆治理范式。传统的上下文压缩手段,无论是直接截断还是生成式摘要,都会造成信息不可逆的丢失,一旦模型在后续步骤中需要某个被丢弃的原始返回值,任务就可能失败。而把完整结果放进归档、在上下文里只留下位置对齐的简短笔记,相当于在有限的窗口预算内维持了一条可回溯的索引,模型可以按需把原文重新取回。这种位置保持的设计也很关键,它让历史消息的因果顺序与引用关系不被破坏。

论文也留下了若干值得继续探索的问题。首先是什么时候触发遗忘,目前依赖模型自行判断,如何在提示中设计策略、如何避免模型过度压缩或压缩不足,仍然缺少系统性的评测。其次是归档本身的管理成本,如果被恢复的内容反复进出上下文,是否会重新推高token消耗,需要更长时间跨度的任务来验证。再次是质量与成本之间的权衡,实验显示节省资源并不必然带来更好的任务表现,某些场景下反而下降,这提示可逆上下文管理应当作为可配置策略而非默认行为。

对于正在构建智能体应用的开发者而言,这项研究提供了一条务实的思路:把上下文视作需要主动经营的资源,让执行任务的模型参与记忆的取舍,同时以可恢复的方式为判断失误兜底。随着工具调用链条越来越长,如何让智能体在长轨迹中保持信息密度与可追溯性,可能会成为与模型能力同等重要的工程课题。

# 智能体 # 上下文管理 # 工具调用 # arXiv论文

来源:Heooo AI工具导航