Iris搜索智能体刷新开源性能基准
「研究团队发布Iris-mini与Iris-pro两款搜索智能体,分别基于35B-A3B和397B-A17B规模训练,提出SFT-RL攀登式训练流程,在BrowseComp、DeepSearchQA等基准上取得开源搜索智能体最强成绩,并计划开源模型权重与完整训练配方。」
搜索与推理的深度融合正成为人工智能体能力跃升的关键路径。近日公布的一项研究提出名为Iris的搜索智能体系列,包含Iris-mini与Iris-pro两个版本,分别基于35B-A3B和397B-A17B的稀疏激活架构训练。研究团队同时公开了支撑其能力的数据流水线与训练范式,为开源搜索智能体社区提供了可复现的完整参考。
数据构建是该工作的核心创新之一。研究者并未使用人工撰写的问答对,而是从网络语料的超链接结构中反向构造任务。具体而言,系统从一个种子页面及其外部链接中提炼实体图,并在该图上生成多跳推理链条。为避免模型通过简单字符串匹配获取线索,所有非答案实体都被改写为描述性指称形态,使问题必须依赖语义理解而非表面复制才能求解。通过这种策略,研究者还引入一道严苛的过滤门槛:所有题目先经闭卷参考模型验证无法作答,再确认其在提供支持证据后能够被求解。这样的双重确认机制保证了数据具备真实的多跳推理难度,而非仅靠知识记忆即可完成。
在获得高质量任务后,研究团队将问题转化为可训练的轨迹数据,并在轨迹级别与单轮级别进行双重过滤,以剔除低质量或偏差样本。随后进入监督微调阶段,使模型初步习得搜索与推理的基本协作模式。而真正的性能跃升则来自强化学习阶段:策略模型直接面对实时搜索引擎进行交互优化,奖励判定器与观测摘要器被部署在训练集群内部,以最小化推理延迟。针对过长生成序列,系统在请求层面进行中断,并在下一步从已提交的前缀继续执行,从而有效管理训练过程中的计算资源。
一个值得关注的细节是,研究者将监督微调与强化学习交替运行,形成名为“SFT-RL攀登”的迭代流程。每一轮强化学习产出的最难求解且运行效率最高的轨迹,会被重新注入下一轮监督训练的数据池中。这种自我提升的闭环使模型能够持续向搜索前沿推进,不断挑战并征服更具难度的推理问题。相较于一次性训练的固定流程,该策略表现出更强的数据利用效率和能力增长潜力。
评测环节同样设计得极为严谨。研究团队明确指出,在基准测试中,推理时的上下文管理策略带来的增益往往大于系统间多数报告的差异。因此,所有基准均在启用与禁用上下文管理两种条件下进行评估,并保持工具集、上下文限制与判定器完全一致。全部结果均出自单一的ReAct智能体架构,未引入任何子智能体或测试时验证机制,从而确保对比的公平性与结论的可归因性。
在基础性能表现上,启用上下文管理后,Iris-mini与Iris-pro在BrowseComp、BrowseComp-ZH、DeepSearchQA和HLE四个基准上分别取得82.2/84.8/86.9/52.3与88.6/85.1/92.9/56.4的成绩。研究团队表示,这是各自参数范围内开源搜索智能体的最佳综合表现。其中Iris-pro在深层搜索任务DeepSearchQA上的92.9分尤其引人注目,体现出大规模参数与高质量训练流程结合后的显著优势。
从开源社区视角看,该研究最具吸引力的部分在于其计划公开模型权重,同时提供数据构建、训练与评测的完整配方。这意味着其他研究机构与开发者不仅能够直接使用模型,还能基于同样的数据管线自主生成训练数据,甚至在SFT-RL攀登框架下开展进一步探索。这种透明度在搜索智能体领域并不多见,也是推动该方向走向成熟的重要一步。
搜索智能体的本质是在交互式环境中将信息检索与逻辑推理进行紧密耦合。Iris系列通过精心设计的合成任务、稳健的强化学习流程以及审慎的评测方法,系统地展示了如何在开源条件下逼近搜索性能的前沿。随着权重与配方的释放,围绕该模型的应用拓展、二次训练与基准优化预计将快速涌现,从而为更广泛的研究群体提供一块坚实的出发阵地。
来源:Heooo AI工具导航