技术进展

MoFlow实现多目标智能体工作流生成

Heooo 10月01日12时01分 13 阅读

「研究人员提出MoFlow框架,通过多目标马尔可夫决策过程与凸包蒙特卡洛树搜索,一次性生成覆盖帕累托前沿的智能体工作流,无需针对不同偏好重新训练,显著优于现有单目标优化基线方法。」

在人工智能领域,智能体(Agentic)系统正逐渐成为复杂任务自动化的关键工具。然而,如何高效生成兼顾多个性能指标的工作流,一直是技术难点。近日,arXiv上发布了一篇题为《MoFlow: Multi-Objective Agentic Workflow Generation》的研究论文,提出了一种创新的多目标工作流生成框架——MoFlow,旨在解决传统方法在目标权衡上的局限性。

当前主流的工作流生成方法通常仅优化单一目标(如准确率),或采用加权求和的方式将多个目标合并为一个标量值进行优化。这类方法存在明显缺陷:一旦用户对各目标的偏好发生变化,模型就必须从头开始重新训练,效率低下且资源消耗大。更关键的是,这种固定权重的策略无法灵活适应多样化的实际应用场景,例如在成本敏感的部署环境中可能需要牺牲部分精度以换取更低延迟。

MoFlow的核心突破在于将工作流生成问题建模为一个多目标马尔可夫决策过程(Multi-Objective Markov Decision Process, MOMDP)。在此框架下,系统不再追求单一最优解,而是探索所有可能的非支配解(即帕累托最优解集)。为高效求解该问题,研究团队设计了一种名为“凸包蒙特卡洛树搜索”(Convex-Hull Monte Carlo Tree Search)的算法,并结合“乐观集合值备份”(optimistic set-valued backups)机制。在搜索过程中,每个树节点存储的不是一个标量得分,而是一组可达的性能权衡点构成的集合。通过这种方式,一次完整的搜索即可近似覆盖整个帕累托前沿。

这一设计使得MoFlow具备极强的灵活性:在推理阶段,用户只需指定任意偏好向量(例如“更看重低延迟而非高精度”),系统即可直接从已构建的帕累托前沿中检索出最匹配的工作流,完全无需重新训练或微调。这不仅大幅提升了部署效率,也增强了系统在动态环境中的适应能力。

为验证MoFlow的有效性,研究团队在涵盖数学推理、代码生成和问答任务的六个基准数据集上进行了全面评估。由于现有基线方法本质上是单目标优化器,公平比较颇具挑战。为此,作者采用了对基线更有利的评估设置:每次测试时都根据当前偏好重新运行基线方法,而MoFlow则仅使用一次训练结果应对所有未见过的偏好组合。即便如此,MoFlow仍在平均超体积(Hypervolume)指标上取得最高分,充分证明了其在多目标优化中的优越性。

MoFlow的提出标志着智能体工作流生成从“单目标最优”迈向“多目标灵活权衡”的重要一步。其开源实现有望推动AI系统在真实世界复杂约束下的落地应用,为开发者提供更强大、更自适应的自动化工具。

# MoFlow # 多目标优化 # 智能体工作流 # 帕累托前沿 # 蒙特卡洛树搜索

来源:Heooo AI工具导航