LLM测试框架:重复得分不等于任务专精
「arXiv一篇论文质疑自动生成LLM测试框架能否带来任务专精。研究在386个MATH-500任务上比较八个生成框架与一个基线的九个相同副本,每个成员执行三次,发现相同程序即可带来2.16个百分点的重复平均oracle余量,而生成程序的持续优势仅出现在一个任务上,冻结选择器增益为零。」
在大模型推理能力优化的研究中,为特定任务自动生成LLM测试框架(harness)被视为一条提升推理表现的重要路径。其基本假设是:针对不同任务生成不同的程序化框架,可以通过任务专精带来额外的正确率收益。然而来自arXiv的一篇论文《More Programs or More Rolls? Separating Coverage from Specialization in LLM Harnesses》指出,单纯观察到答案覆盖面的提升,并不足以证明专精真的存在,因为重复执行同一个程序同样可能扩大覆盖范围。
为厘清覆盖度与专精之间的关系,研究者设计了一套受控评估方案,把答案覆盖、可重复的任务优势以及执行前选择带来的增益三者分离开来。实验选取386个MATH-500任务,比较了八个自动生成的测试框架,以及一个基线和它的九个字节完全相同的副本,每个成员执行三次。这样的设置使得任何来自随机性与重复采样的收益都能被单独度量,从而避免把“多跑几次”误读为“更懂任务”。
结果显示,完全相同的程序在多次执行后产生了2.16个百分点的重复平均oracle余量(oracle headroom)。这说明即便程序本身没有任何差异,仅靠重复执行就能让覆盖率上升,从而制造出看起来像进步的假象。自动生成的程序虽然展现出更明显的可重复得分模式,但这些模式主要揭示的是持续性的弱点:在100个任务上,相对于基线的性能损失在三次重复中全部存在;而持续性的优势只出现在一个任务上,并且对答案抽取方式高度敏感。
论文还检验了执行前选择机制。所谓冻结选择器(frozen selector)带来的增益为0.00个百分点。当两个程序群体各自执行27次时,它们的oracle覆盖率都达到了98.70%。这意味着在匹配的推理预算下,增加不同程序的数量并没有比重复执行已有程序带来更好的结果。作者指出,在三次重复的实验条件下,稳定的互补性依然无法被确认,也就是说,暂时找不到证据说明这些框架之间存在可被可靠利用的差异。
BIRD相关的追踪分析进一步定位了失败原因,包括机制实现、激活以及输出有效性等环节的问题。也就是说,自动生成的框架往往在具体机制落地时出现错误,或者在运行时未能被正确激活,又或者输出格式不合法,导致最终答案无法被正确解析。这些失败模式说明,生成出来的程序之所以得分波动,更多源于工程实现层面的不稳定,而非真正掌握了任务的独特结构。
基于这些发现,论文给出了一个明确的结论:覆盖率与可重复性本身并不能为有用的专精提供充分依据。作者据此提出了一套面向harness多样性的评估标准:任务优势应当在多次执行中稳定持续,能够指导实际可用的决策,并且在推理预算匹配的前提下,优于对固定程序的额外执行。这一标准为后续自动化框架生成的研究提供了更严谨的衡量尺度,也提醒开发者在报告收益时,必须把重复采样带来的覆盖增益与真正的任务专精区分开来。
来源:Heooo AI工具导航