技术进展

投机宏提交算法加速工具型智能体

Heooo 09月04日13时02分 4 阅读

「研究人员提出投机宏提交(SMC)机制,通过大型权威模型与快速草稿模型协同,预执行动作链并复用宏库,在保持精度的同时显著降低延迟,在Telecom和AppWorld基准上较顺序执行分别提速18.59%和44.9%。」

工具型大语言模型智能体在执行任务时,不仅需要等待模型推理,还需经历串行的动作—观测循环,每一次工具调用、环境变化和结果反馈都会推迟后续决策,造成大量墙钟时间浪费。为破解这一瓶颈,一项发表于arXiv的新研究提出名为“投机宏提交”(Speculative Macro Commit,简称SMC)的运行时机制,旨在通过多步投机执行来压缩智能体等待时间。

SMC面向双层智能体系统设计:一层是负责生成官方轨迹的大型权威动作模型,另一层是速度更快的投机草稿模型,它会持续预测并提前执行未来的动作链,且运行在隔离的环境快照中。这种并行结构允许系统在权威模型尚未产生完整决策前,就对后续可能发生的动作进行试探性模拟。与传统单步投机动作不同,SMC从训练轨迹中挖掘重复出现的多动作骨架,并将其存储在宏库中。当草稿模型在运行时预测出动作链时,系统会尝试将它与宏库中的模式进行匹配,一旦发现权威模型的下一次工具调用与草稿动作的首个动作一致,SMC便将草稿阶段已预执行的动作及其观测结果整体提交至官方轨迹,从而跳过后续逐个推理与等待环节。

研究团队使用Qwen3.5-27B INT4作为权威动作模型,Qwen3.5-4B作为投机草稿模型,在两个具有代表性的工具使用基准上进行测试。在τ²-Bench的Telecom子集上,SMC在保持与顺序智能体相当的任务精度的前提下,比Speculative Actions(SA)基线降低了10.23%的延迟,比串行执行降低了18.59%。在AppWorld环境中,SMC相比SA基线减少7.7%的墙钟时间,相比串行执行更是大幅缩短44.9%的耗时,不过任务完成率有小幅下降。这表明SMC在追求速度的代价上存在一定权衡,但总体上为工具型智能体提供了可观的加速空间。

SMC的核心贡献在于将投机执行的粒度从单步扩展到多步。以往的一些投机解码方法只能预测下一个token或动作,而SMC通过宏库的匹配机制,能够复用从数据中学到的完整动作序列。这种设计更贴合实际工具使用场景,因为智能体常常需要执行连续、条件依赖的操作,例如在数据库查询、网页导航或API调用中,某一步的结果会决定后续多步动作。如果仅对单个动作做投机,依然无法有效规避反复的环境往返延迟;而SMC一次性提交整段动作链则显著减少了这些等待成本。

此外,该机制的模块化特性也值得关注。研究者提到代码已公开可用,这意味着开发者可以在自己的系统中复现和扩展SMC。对于需要部署实时智能体的团队而言,这种可替换的草稿模型加宏库架构具有较高的工程友好度——权威模型可以升级,草稿模型可以更换,宏库也能根据领域数据进行扩充,从而在不同任务和环境中取得平衡。当然,SMC也面临一些挑战,比如宏库的构建质量会直接影响匹配成功率,草稿模型预测的准确性也会影响提交的有效性;如果在草稿阶段执行了错误的动作链,即使被回滚,也会消耗额外算力和时间。未来的工作有望在宏挖掘算法、草稿模型校准以及安全性回滚策略方面进一步优化。

总体而言,SMC为加速工具型智能体提供了一条务实而有效的技术路径。在当前大语言模型应用走向智能体化、自动化的进程中,减少每一步工具交互的延迟对于提升用户体验和扩大应用场景具有重要意义。该研究不仅验证了双层模型协同执行多步投机动作的可行性,也为后续更高效的智能体运行时设计提出了新方向。

# 投机执行 # 智能体加速 # 大语言模型

来源:Heooo AI工具导航