智能体长任务失忆 四套框架机制解密
「智能体在长任务中反复失忆跑题,根源可能不在模型本身,而在包裹模型的执行框架。研究盘点 LangChain Deep Agents、Claude Code、Manus、OpenAI Codex 与 Amazon Bedrock AgentCore,揭示上下文预算与卸载、压缩、待办状态、跨会话记忆四套机制,并指出上下文窗口并非越大越好。」
大模型在长任务里反复失忆,跑着跑着就忘了最初的目标,这个困扰智能体行业已久的老毛病,根源可能并不在模型本身,而在包裹模型的那层执行框架。
AWS 一份自主云编程智能体设计指南把问题点得很直白:浅层智能体在长周期任务中会遭遇上下文溢出、被无关信息干扰而跑题,并且无法维持状态。而真正修好这一层的,是负责管理除模型之外一切事务的 harness。一份盘点多家主流框架的新研究,把这层外壳彻底掀开了:LangChain Deep Agents、Claude Code、Manus、OpenAI Codex 和 Amazon Bedrock AgentCore,各自用四台发动机,把浅层循环变成了能扛住长任务的深智能体。
最反直觉的一点是,把上下文窗口做大并不解决问题。Chroma 的 Context Rot 报告评估了18款大模型,发现即便在简单检索任务上,输入越长模型也越不可靠。Anthropic 给出的解释是,注意力机制对 n 个 token 会生成 n² 的两两关系,每多一个 token 都在消耗一笔有限的注意力预算,上下文是边际递减的资源,不是一个可以随便填满的桶。Manus 还透露,一个典型任务要调用约50次工具,输入输出比接近100比1,最初那条指令会慢慢漂向窗口的中段,而那里恰恰是回忆能力退化的位置。
第一台发动机是上下文预算与卸载。Deep Agents 出厂就写死两条硬规则:工具返回超过20000token 就写进文件系统,只保留路径加前10行预览;会话上下文超过窗口85% 时,旧的编辑调用被截断成指针。Claude Code 把同样的逻辑用在加载之前,自动记忆限制在200行或25KB,MCP 工具模式默认只列名字、按需拉取。AWS AgentCore 的演示更为彻底:协调器并行派生3个浏览器子智能体,各自待在独立的 MicroVM 里,分析子智能体只接收结构化结果,全程预期4到6分钟,若改为串行则会慢最多3倍。
第二台是压缩。当卸载不够用时,框架会把接近上限的对话摘要后重启。Claude Code 的压缩提示会保留架构决策和未解决的 bug,丢掉冗余输出,并在压缩后重读最近修改的最多5个文件、重新注入技能正文;它还会把完整原始记录写入磁盘,被摘要掉的事实日后仍能找回。Deep Agents 更把保住目标做成结构特性,摘要文档专门分出会话意图、已生成产物和下一步三个字段。压缩已经下沉到 API 层:OpenAI Responses API 用服务端压缩阈值参数提供服务端压缩,Codex 正是靠它撑住长编程任务,Claude 平台则给出可写自定义指令的压缩编辑项。
第三台是待办状态与念咒。Manus 的做法很朴素,建一份待办清单文件,一步步重写打勾,等于把目标反复念进上下文的末尾,推开淹没在中间的漂移。不过它并非稳赚:Deep Agents 在2026年7月的0.7版本中,因评估显示关掉待办反而奖励略高、成本更低,把待办中间件改成了可选;LangChain 仍建议在长任务、弱模型和需要展示进度的界面上重新打开它。
第四台是跨会话记忆。Claude Code 每次压缩后都从磁盘重新注入项目记忆文件,AgentCore Memory 则在后台跑抽取策略,让协调器下次直接召回而不必重新研究。但苏黎世联邦理工的研究泼了冷水:这类智能体上下文文件通常并不提升成功率,却让推理成本上涨20%到23%,每次重载都是对注意力预算的固定征税。Claude Code 因此建议把项目记忆文件压在200行以内。
研究最后提醒,框架是否真的抓得住目标,得靠强制触发压缩的测试来验证。最该警惕的失败,是智能体在摘要之后立刻反问澄清,或者错误地宣布任务完成。换句话说,让智能体在长路上不迷路,拼的不是模型有多大,而是框架这几台发动机调得有多细。
来源:Heooo AI工具导航