技术进展

FinProBench:以专业交付物为基准的金融AI评估新框架

Heooo 08月06日12时03分 26 阅读

「新研究提出FinProBench基准与角色接地评估法(RGRC),通过分析57个职业的1723份专业交付物构建评估标准,显著提升对专业细分角色的AI评估准确性,并降低评估任务构建成本6.7倍。」

随着大语言模型在金融领域的应用日益广泛,如何准确评估这些AI智能体的专业能力成为亟待解决的问题。传统评估方法往往依赖任务提示词或模型输出构建评分标准,却忽略了真实从业者在实际工作中所体现的隐性专业标准。针对这一缺陷,一项名为FinProBench的新研究提出了一种创新的评估框架,旨在更真实地反映金融AI智能体的专业水平。

这项研究发表于arXiv平台,其核心贡献在于引入了“角色接地评分标准构建”(Role-Grounded Rubric Construction,简称RGRC)这一可复用流程。该方法并非从任务描述或模型输出出发,而是直接从同岗位从业者产出的专业交付物中提炼评分标准。研究团队认为,这些交付物中蕴含着大量难以言明但至关重要的专业惯例和判断标准,是评估AI智能体是否真正掌握岗位技能的关键依据。

RGRC流程包含四个阶段:交付物收集、能力提取、评分标准综合与验证。通过这一系统化流程,所构建的评分标准不仅能够捕捉隐性专业标准,还能区分不同质量等级,并在同一角色内的不同任务之间实现迁移应用。这种设计使得评估体系具有更强的通用性和实用性。

为了验证RGRC的有效性,研究团队进行了细致的职业分类。他们依据交付物类型,将57个金融相关职业划分为30个“先验丰富型”常规角色和27个“先验稀疏型”专业细分角色。实验结果显示,对于常规角色,仅使用提示词(Prompt-only)的评估方法几乎与RGRC方法表现相当(89.2%对90.7%),说明当模型先验知识中已充分包含该职业的常规标准时,简单的提示词工程即可满足需求。然而,对于专业细分角色,RGRC方法展现出显著优势,准确率达到99.1%,而仅依赖提示词的方法仅为78.0%。这一鲜明对比揭示了专业背景知识在评估超出模型先验范围的专业标准时的重要性。

FinProBench基准的构建规模可观,它整合了来自57个职业、8个金融子行业、161种交付物类型的1723份精选交付物。研究团队还发布了初步评估集,包含覆盖7个子行业中20个角色的20个完整任务。在评估实验中,研究团队使用异构大语言模型作为评审,并采用角色级评分标准。结果显示,人类交付物的平均得分最高(73.7分),而四个AI系统得分分别为70.3、70.2和69.6分(满分100分),且所有系统的95%置信区间存在重叠,表明各系统在能力上各有千秋,但整体仍与人类专业水平存在差距。

值得关注的是,RGRC方法在成本效率方面也表现出色。研究指出,通过复用角色级评分标准,每个评估任务的构建工作量相比从零开始编写评分标准降低了约6.7倍。这一效率提升对于大规模评估金融AI智能体具有重要意义,使得构建高质量评估体系变得更加可行。

FinProBench的提出为金融AI评估领域提供了一种新的思路,即从专业交付物中挖掘隐性标准,使评估更贴近实际工作需求。该方法不仅适用于金融领域,其角色接地原则也可能推广至其他专业领域,为AI智能体的专业能力评估提供更可靠的参考框架。随着AI在专业服务中的渗透加深,这类基于真实工作产物的评估工具将成为确保AI系统可靠性和专业性的重要基石。

# FinProBench # 金融AI评估 # 角色接地评分标准

来源:Heooo AI工具导航