基准测试推理不具组合性:AI评估的投射性问题
「一项AI基准测试结果很少能一步得出重要结论,需要经过泛化、解释、外推、迁移等步骤。本文指出,即使每个环节都有充分证据,相邻推理的合理组合并不自动成立。研究者提出非组合原则,并通过法律研究案例和模拟实验,展示了聚合稳定性如何掩盖后续投射所需的区分,最终提出投射性审计方法,以诊断基准到应用论证中的不支持的连接。」
在人工智能评估领域,一项基准测试结果很少能直接得出具有广泛影响力的结论。评估者通常需要将其泛化到更多案例,解读为特定能力的证据,外推到新任务,迁移到其他系统或环境,并与关于人工审查和下游影响的假设相结合。这种多步骤的推理链条,每一步都需要相应的证据支持。然而,一篇最新研究指出,即便每个环节都有充分的证据支持,这些环节组合在一起时,其结论的可靠性并不自动成立。
这篇题为《When benchmark inferences do not compose: Projectibility in AI evaluation》的论文,从认识论角度深入探讨了AI评估中的投射性问题。所谓投射性,指的是从已观察到的情况向未观察到的情况进行有限扩展是否合理。论文借鉴了古德曼关于竞争性扩展的经典问题,并引入基于论证的有效性框架来检验这些扩展。研究者认为,现有的以有效性为中心的方法虽然要求为每个主张提供证据,但忽略了一个关键问题:有充分证据支持的相邻推理,并不一定构成一个有充分证据支持的完整推理链。
论文的核心贡献在于提出了一个非组合原则。该原则指出,只有当相邻投射的端点和假设对齐,并且依赖性和不确定性被贯穿传递时,对相邻投射的支持才能组合成对整体推理的支持。换言之,一个研究的目标可能不是下一个研究的来源,系统、人群、结果或条件可能在接口处发生变化,而共享的数据或模型血缘可能使看似独立的支持变得相互依赖。这些因素都会破坏推理链条的整体有效性。
为了具体说明这一问题,研究者提供了一个法律研究案例。在该案例中,基准测试证据和部署研究各自在方法论上都是可靠的,但它们的结论却是平行的,无法直接串联。这表明,即使每个独立研究都无懈可击,它们之间的逻辑连接也可能存在断裂。此外,研究者还通过重新分析和模拟实验,展示了聚合稳定性如何可能掩盖后续投射所需的区分。例如,一个在整体上表现稳定的基准测试结果,可能掩盖了不同子群体或不同条件下的性能差异,而这些差异对于后续的投射推理至关重要。
基于这些分析,论文提出了一种投射性审计方法。这种方法旨在诊断基准到应用论证中不支持的连接,帮助评估者识别推理链条中的薄弱环节。通过系统地检查每个投射步骤的端点、假设和依赖关系,评估者可以更准确地判断一项基准测试结果是否能够支持其所声称的结论。
这项研究对于AI评估领域具有重要的方法论意义。它提醒我们,基准测试结果的有效性不仅仅取决于单个测试的质量,还取决于从测试到实际应用之间整个推理链条的完整性。随着AI系统在越来越多的高风险场景中部署,这种对评估推理链条的严谨审视显得尤为必要。研究者希望通过提出投射性审计,为AI评估提供更坚实的认识论基础,帮助社区更可靠地解读基准测试结果,并做出更明智的决策。
来源:Heooo AI工具导航