AREX-2:长周期反思让智能体自我进化
「arXiv论文提出AREX-2,将智能体自我改进定义为测试阶段的迭代优化,依赖反思与长周期执行两种能力。研究从机器学习与算法编程任务合成改进轨迹,基于Qwen3.8-27B训练的智能体在MLE-bench Lite得81.8、Frontier-CS得70.7,并迁移至深度研究任务。」
近日,arXiv上发布了一篇题为AREX-2的论文,副标题为通过长周期反思任务推进自我改进智能体,隶属于计算机科学中的人工智能方向。该研究聚焦大语言模型智能体的自我改进能力,并将其定义为在测试阶段对已有解进行迭代式优化的能力。研究团队认为,这一能力是智能体从一次性给出答案走向持续进步的关键所在。
论文指出,自我改进能力建立在两种互补的能力之上。其一是反思能力,即能够产出一个比当前方案更优的新方案;其二是长周期执行能力,即让这种迭代在数十轮甚至更多轮次中依然保持有效,而不是在几轮之后就陷入停滞或退化。作者进一步提出假设:这两种能力与具体领域无关,属于可迁移的通用能力,因此可以在监督信号充足、反馈明确的场景中被学习到。
基于这一思路,研究团队从机器学习与算法编程两类任务中合成了长周期的改进轨迹数据。选择这两个领域的原因在于,它们能够提供可验证的反馈,并且奖励持续的迭代行为,对错可以被自动判定,改进是否真实发生也有据可查,这使得长链条的自我修正过程能够被有效地监督。
在这些数据上训练得到的智能体以Qwen3.8-27B为基础模型。实验结果显示,该智能体在MLE-bench Lite上取得81.8分,在Frontier-CS上取得70.7分。更值得注意的是能力的迁移表现:在深度研究类任务中,该智能体在BrowseComp上达到84.0,在HLE上为52.6,在GAIA上为92.2,在DeepSearchQA上更是达到93.8。这些结果说明,在机器学习与算法任务中习得的反思与长周期执行能力,并没有被局限在原有领域,而是具备了向开放研究任务外溢的潜力。
论文还强调了一个趋势性现象:随着允许的迭代轮数预算增加,智能体的表现持续提升。这意味着模型并非只是在固定轮数内做有限修补,而是能够真正利用更多的思考轮次换取更好的结果,展现出可扩展的测试时计算特征。对于希望在实际产品中部署智能体的开发者而言,这一特性意味着可以通过调整推理预算来控制效果与成本之间的平衡。
研究者由此得出结论,长周期反思数据是通向自我改进智能体的一条有效路径。相较于依赖人工设计提示词或单轮推理的通用做法,用可验证任务合成的长轨迹数据来训练反思与迭代行为,为智能体在开放任务中持续自我提升提供了一种可复制的范式。这一思路也为后续工作提出了新的问题:如何把长周期反思监督扩展到反馈不那么明确、难以自动验证的任务领域中去。
来源:Heooo AI工具导航