DS-Lighting:显式代理框架提升数据科学自动化
「arXiv新论文提出DS-Lighting,一种显式化数据科学自动化代理框架。该工具将代理“harness”拆解为数据、工作流、执行与评估四层,支持可复现、可比较的端到端AI代理实验,并集成多个开源基准任务,显著提升可靠性与可复现性。」
在大型语言模型(LLM)驱动的自动化数据科学领域,尽管各类智能代理展现出强大潜力,但其端到端性能高度依赖于一个关键但常被忽视的组件——代理“harness”(即代理运行所需的任务表示、状态管理、输出约束与反馈机制)。然而,当前大多数数据科学代理系统往往将这一harness设计隐式嵌入代码中,导致不同任务之间难以复现、比较或归因结果,严重制约了研究进展与工程落地。
针对这一问题,一篇发布于arXiv的最新论文《DS-Lighting: Making Agent Harnesses Explicit for Data-Science Automation》提出了一种名为DS-Lighting的统一工具包,旨在将代理harness的设计显式化、模块化和标准化。该框架的核心创新在于将传统隐式的harness结构清晰地分解为四个可重用的层次:数据层(Data)、工作流层(Workflow)、执行层(Execution)和评估层(Evaluation)。每一层都定义了明确的接口与职责,使得研究人员可以灵活组合、替换或扩展特定组件,而不影响整体架构。
更重要的是,DS-Lighting将各类数据科学代理统一表示为“可执行的操作符程序”(executable operator programs),既支持预定义的静态流水线,也兼容基于搜索或推理的自适应策略。这种设计兼顾了确定性流程与动态决策的需求,为复杂数据科学任务提供了更灵活的自动化基础。
为支持公平且可控的实验评估,研究团队还将多个开源数据科学基准(如AutoML、特征工程、模型调优等任务)整合进类似MLE-Bench的标准化任务格式中。所有任务共享统一的接口规范、沙箱化运行环境和指标协议,确保不同代理、模型或harness配置之间的对比具有科学性和可重复性。
通过在多种代理架构、harness变体、基础模型及消融实验上的系统测试,研究证实:采用显式harness设计的DS-Lighting不仅能显著提升实验的可复现性与结果可比性,还能有效减少因系统级配置错误或状态管理混乱导致的非必要失败。这对于推动AI for Data Science领域的工程化与标准化具有重要意义。
目前,DS-Lighting的完整代码已开源,为社区提供了一个透明、可扩展的基准平台,有望成为未来数据科学自动化研究的重要基础设施。
来源:Heooo AI工具导航