技术进展

大模型长程状态跟踪能力研究再进一步

Heooo 09月02日12时31分 2 阅读

「最新研究通过让大语言模型执行完整MD5哈希计算,测试其在196次依赖工具调用中跟踪状态的能力。实验显示gpt-oss-120b在多数运行中成功完成,并发现保留推理上下文与投票机制能有效降低错误,为评估长程任务提供了新方法。」

长程任务在大语言模型评测中一直是一个棘手问题。当每一步操作都依赖于上一步的结果时,单步准确率即便在孤立测试中看起来很高,也会随着步骤增加而迅速恶化——错误级联效应会让端到端的失败概率随长度急剧上升。现有的智能体基准测试虽然报告了端到端成功率,却往往将状态跟踪的难度与指令理解混为一谈,缺乏隔离这一核心变量的对照组,同时还容易受到模型幻觉出最终答案等捷径的干扰,因此难以解释一个长程运行究竟为何失败。

为了干净地测试大语言模型能否在多次工具调用之间精确携带中间状态,一篇来自arXiv的最新论文设计了一个极简但严格的实验:让模型逐步计算MD5哈希。整个计算过程包含64轮共196次相互依赖的工具调用,模型需要在自己的上下文中,从一次调用到下一次调用持续维护四个32位字(a、b、c、d)。这一任务的解释成本极低,因为论文按RFC 1321从零实现了MD5算法,每一步调用都可以与真实执行轨迹对齐,最终摘要也能逐位校验。这意味着任何一次失败都纯粹属于簿记问题,而非理解或推理偏差。

实验结果表明,gpt-oss-120b——一个混合专家模型,每个token仅激活约55亿参数——在温度为0且使用简短固定提示词的条件下,能够在全部196次调用中完整携带状态,并在多数完成的运行中返回正确的MD5摘要。更极端的设置则是将每一个基础工具替换成另一个大语言模型,让一个驱动模型和一个工作模型在没有精确算术预言机的情况下,从零开始协作计算整个哈希。在这种情况下,有两个关键因素决定了成功与否,且二者都不需要修改模型权重:一是每一轮都将模型自身的推理过程保留在上下文中,二是对启用思考能力的工作模型进行投票,以消除其模运算中的偶发错误。

这项研究还进一步将残余失败按来源进行定位,区分了状态携带错误、算术错误和服务层面的错误。这种细粒度的归因为理解长程工具调用中模型的瓶颈提供了清晰的视角。与以往笼统报告成功率的基准不同,该方法让研究者能够单独审视状态跟踪环节,从而为改进模型的长程可靠性提供更有针对性的方向。

该工作不仅验证了当前模型在长依赖序列中的基本能力,也揭示出即使不改变模型参数,仅通过调整推理时的上下文保留和投票策略,就能显著提升任务成功率。这为未来开发更复杂的长程智能体应用提供了实用启示,同时也为基准测试设计确立了一个更严谨的范式:用可逐位校验的确定性计算任务,隔离出纯粹的状态跟踪能力。

# 长程任务 # 状态跟踪 # MD5

来源:Heooo AI工具导航