英伟达研究揭示智能体关键在框架而非模型
「英伟达最新研究显示,智能体的性能更多取决于外部框架而非底层模型。通过定制框架和主管组件,Claude Opus 5在ARC-AGI-3基准上达到100%得分,而无框架时仅为30%。这一发现引发对智能体架构设计的重新思考。」
英伟达近日发布的一项新研究引发业界关注:在让AI执行长周期任务时,真正起决定性作用的或许不再是模型本身,而是围绕模型构建的“框架”(harness)。这一结论直接挑战了大众对AI智能体的普遍认知——很多人习惯将智能体简单视为一个模型API,但英伟达用实验数据证明,框架才是让模型真正发挥效用的关键。
研究人员在测试中只调整了框架层,便让Claude Opus 5在交互式推理基准ARC-AGI-3上取得了满分成绩。该基准由一系列无指令的2D游戏组成,模型需要自行摸索规则并赢得游戏,满分意味着其表现与人类相当。在没有框架辅助的情况下,Opus 5的得分仅为30%,但该分数已是所有测试模型中的最高水平。这一鲜明对比,生动说明了框架对外层模型能力的巨大放大作用。
英伟达AI产品副总裁Adel El Hallack向媒体解释,外界几乎把智能体等同于模型API,但实际上,真正的智能体由三部分构成:模型本身、围绕模型的脚手架(即框架),以及框架中提供的一套工具、运行时、技能和库。模型如同大脑,但只有通过框架才能被组织成能完成复杂任务的智能体。
长周期任务指需要将大量决策串联起来、有时持续数天才能完成的工作,与简单生成一条回复截然不同。让AI保持专注、不跑偏、不迷失方向,是该领域公认的难题之一。此前微软4月发布的测试显示,19个大语言模型在长周期文档编辑任务中都错误百出,甚至前沿模型也不例外。而AI自行串联决策时,还曾出现删除用户文件甚至数据库的极端案例。
英伟达选择ARC-AGI-3作为测试基准具有特殊意义。这个基准此前让OpenAI颇为恼火——其模型的得分一度低于10%,这让OpenAI被迫在上个月自行开展研究。有趣的是,OpenAI同样发现,只需调整框架中的两个设置,模型得分就能增加两倍。但即便经过调优,OpenAI的模型也远未达到满分,而英伟达的实验却实现了100%。
英伟达研究的关键突破在于引入了一个“主管”(supervisor)组件。当智能体在执行任务中卡住或走偏时,该组件会提示其回到正确方向。研究人员认为,这是获得满分的重要原因。这也暗示,未来的智能体设计不能只追求模型参数更大、能力更强,更需要精心设计外部控制系统,让模型在正确轨道上长期运行。
这项研究为AI智能体开发提供了新的思路:模型选择固然重要,但在长周期、多步骤的复杂任务中,如何构建记忆管理、上下文维护、反馈循环和方向校正机制,往往比换一个更大更强的模型更能带来显著的性能跃升。英伟达的成果或将推动行业重新审视智能体架构的优先级分配。
来源:Heooo AI工具导航