Harbor适配器构建大规模代理评测新基建
「研究团队推出Harbor Adapters统一评测基础设施,将逾80个基准移植至通用代理评测环境,并发布精选元数据集Harbor-Index。跨54个基准对8款模型的大规模评测显示,最强配置通过率仅28.0%,验证了该评测体系的挑战性与可靠性。」
随着语言模型代理(Agent)能力的快速演进,各类代理基准(benchmark)数量激增。然而,这些基准往往依赖复杂的运行环境和特定的代理集成方式,使得研究者难以在统一框架下进行大规模横向对比。针对这一痛点,研究团队提出了Harbor Adapters——一套统一的代理评测基础设施,旨在为任意代理提供标准化、可扩展的评测接口。
该工作的第一个贡献是开发了覆盖超过80个基准的适配器层。通过代码审查与一致性实验的双重验证,这些适配器能够将原始基准无缝移植到统计算环境中,从而支持对任意模型的直接评测。这一设计大幅降低了研究者适配新基准的成本,也提升了不同研究之间评测结果的可比性。
第二个贡献在于大规模评测本身。团队跨越多个能力层级,选取了8款代表性模型,在54个基准上进行了系统性实验。每一款模型不仅使用Terminus-2作为运行框架,还搭配了3种原生评测框架中的一种进行对照。这种“模型×框架×基准”的组合设计,比以往任何公开研究都能更全面地揭示代理的能力边界与失败模式。例如,研究者可以据此分析模型在特定任务类别中表现不佳的内在原因,是感知、规划、工具调用还是上下文利用环节的缺陷。
第三个贡献是发布了Harbor-Index元数据集。这一数据集并非简单聚合,而是经过严格筛选的高质量任务集合:从已适配的基准套件出发,经过难度过滤、人工智能辅助审查、人工审核以及“审计-修复”循环等多道工序,最终保留82项困难且多样化的任务,横跨29个不同基准。Harbor-Index的设计目标是保持大规模评测的挑战性与广度,同时控制运行成本。评测结果显示,没有任何一种“模型-框架”组合在该数据集上的通过率超过30%,表现最强的配置(GPT-5.5配合Codex)也仅为28.0%。这表明该数据集对当前技术水平的代理而言仍具有充足的区分度,能够有效捕捉模型间差异。
Harbor项目选择将所有成果以开源形式释放,包括适配器、评测结果、深度分析报告以及Harbor-Index数据集本身。这一决定在现有代理评测生态中具有积极意义:研究社区可以在统一基础设施之上持续扩充基准,模型开发者也能借助标准化指标定位自身系统弱点。从更宏观的角度看,Harbor Adapters与Harbor-Index共同指向一个目标——让语言模型代理的评估更加可靠且全面,为智能体技术的健康发展提供可复现的度量基准。
来源:Heooo AI工具导航