技术进展

CITA框架让智能体行动前比较工具调用价值

Heooo 10月05日12时58分 3 阅读

「arXiv 收录的论文提出 CITA 框架,主张工具使用智能体应在执行之前估计下一次工具调用的长程价值。该方法训练比较推理模型 CIM,融合实际工具行为、贝叶斯工具图模拟器监督与大模型语义比较判断,在三个工具使用基准和多种骨干模型上持续提升 Tool F1 与任务成功率。」

在大语言模型驱动的智能体系统中,复杂任务通常无法靠一次调用完成,而是需要一连串长程的工具调用序列。每一次工具调用都会改变任务状态,并进一步影响后续的决策路径。这种长程依赖让智能体在行动之前判断下一步该调用哪个工具变得格外困难,也让训练信号的设计成为核心问题。

传统做法面临两难。若只使用最终结果奖励,长程交互轨迹中的信用分配会非常微弱,智能体很难知道究竟是哪一步带来了成功或失败。若改用步级奖励,反馈虽然更加精准,但获取可靠的步级监督往往要依赖人工标注或大模型判断,或者需要通过额外的 rollout 来估计某个中间决策的下游影响,成本高昂且难以规模化。

针对这一矛盾,论文提出了一种新的思路:有效的工具使用智能体应当具备在执行之前估计某一次可能的下一次工具调用长期价值的能力。也就是说,智能体需要先比较再行动,而不是先行动再看结果。但这一目标天然存在监督难题,因为比较式监督要求在同一上下文下对多个候选调用进行对照,而日志中记录下来的轨迹只包含当时实际执行的那一个调用,替代选项的信息是缺失的。

为绕开这一瓶颈,作者提出了面向工具使用智能体的比较推理方法 CITA,其核心是训练一个比较推理模型 CIM。CIM 的监督信号来自三类配对信号的组合:一是实际观察到的工具行为,二是来自贝叶斯工具图模拟器的可扩展监督,三是基于大模型比较得到的语义判断。三者结合,使模型能够在缺乏反事实轨迹的情况下,仍然学会对候选调用做出相对比较。经过训练后,CIM 可以估计在当前上下文下,某一个可能的下一步工具调用在多大程度上支持最终任务成功。

实验结果显示,在三个工具使用基准以及多种骨干大语言模型上,CITA 都稳定提升了 Tool F1 与任务成功率。论文进一步的分析表明,CIM 能够为工具选择学习到较为准确的步级价值估计,说明比较式监督确实为智能体提供了比最终结果奖励更有指向性的学习信号。

这项工作对智能体技术路线的启示在于,工具调用能力的提升未必只来自更大的模型或更多的试错,训练目标与监督形式的设计同样关键。把价值估计前移到行动之前,让候选动作在同一上下文中被显式比较,实际上是把规划与执行更紧密地耦合在一起。这种思路对于需要多步推理、依赖外部环境反馈的智能体应用具有参考意义,也为后续研究提供了可复用的监督构造范式,例如如何把工具之间的依赖关系建模成图结构,以及如何把语义判断与统计模拟结合起来降低标注成本。

# 智能体 # 工具调用 # 价值估计

来源:Heooo AI工具导航