OpenDiscoveryTrace:首个AI科学家工作流过程追踪数据集发布
「OpenDiscoveryTrace发布包含558条完整AI科学代理轨迹的公开数据集,记录模型在药物发现、材料科学等任务中的详细推理过程,支持对AI科研行为的过程级评估与审计,弥补现有仅关注最终输出的评测缺陷。」
传统评估自主AI科学家能力的方法长期局限于对最终产出的衡量——例如生成的代码、假设或论文质量,却忽视了这些成果背后的推理路径。这种“黑箱式”评测方式难以揭示模型是否遵循了严谨的科学方法,也无法区分系统性推理与偶然猜对的结果。为解决这一关键问题,研究人员近日在arXiv平台发布了名为OpenDiscoveryTrace的全新数据集,首次系统性地捕捉并公开了AI科学代理在执行科研任务时的完整过程轨迹。
OpenDiscoveryTrace收录了558条完整的AI代理工作流轨迹,覆盖124项跨领域的科学任务,涵盖药物发现、材料科学、基因组学以及科学文献分析四大方向。其核心创新在于每一步操作均被结构化记录为包含9个字段的详细日志,包括模型的内部思考(thoughts)、调用的工具(tool calls)、获得的观测结果(observations)、发生的错误(errors)、触发修正的机制(revision triggers)以及模型自评的置信度(self-reported confidence)等。这种细粒度的过程追踪使得研究者能够深入剖析AI如何“思考”和“实验”,而不仅关注其是否“答对”。
该数据集涵盖了七种主流大语言模型的表现:三种前沿闭源模型(GPT-5.4、Claude Opus 4.6 和 Gemini 3.1 Pro),每种各贡献124条轨迹,确保在不同科学领域和任务难度上的均衡分布;此外还包括四种开源权重模型(Qwen2.5-7B、Mistral-7B-v0.3、Phi-3.5-mini 和 Qwen2.5-1.5B),每种提供30条轨迹,并额外包含60条使用实时检索(live-retrieval)变体的轨迹,进一步丰富了评估维度。
初步分析基于363条经大模型评判的轨迹,揭示了仅靠最终输出无法察觉的关键差异。尽管三大前沿模型的成功率相近(84%至89%),但其错误模式截然不同:Claude Opus 4.6平均每条轨迹产生2.5个错误,是GPT-5.4(0.08个/轨迹)的30倍以上(p < 0.0001)。更值得注意的是,Claude的错误中66.7%源于工具误用,而GPT-5.4的错误则有83.6%属于逻辑推理失误。这一发现凸显了过程追踪在诊断模型行为缺陷方面的不可替代价值。
为推动相关研究,项目团队还定义了五项基准任务,并提供了基于逻辑回归、随机森林、LSTM及Transformer模型的基线结果。整个数据集、轨迹格式规范、代理运行框架及基准定义均已依据CC BY 4.0协议开源,旨在促进AI科学代理的过程级评估、可审计性研究及未来AI治理机制的发展。OpenDiscoveryTrace的发布标志着AI科研能力评测从“结果导向”迈向“过程透明”的重要一步,为构建更可靠、可解释的AI科学家奠定了基础。
来源:Heooo AI工具导航