技术进展

多智能体代码评判的可信度新测度

Heooo 09月28日12时03分 26 阅读

「一项arXiv新研究指出,当前多智能体代码评判系统在缺乏独立证据时仍会给出自信判断。研究提出两种无需标签的评估指标,并设计一种能主动拒绝无依据判断的评判机制,显著提升判断可靠性。」

在人工智能辅助编程日益普及的背景下,如何准确评估生成代码的正确性成为关键挑战。近期一篇发布于arXiv的论文《When Is a Multi-Agent Code Judge Actually Grounded? Two Label-Free Measurements, and a Judge That Declines to Guess》深入探讨了多智能体代码评判系统的“接地性”(groundedness)问题,即评判结果是否真正基于可靠证据。

研究指出,当前主流方法中,一个语言模型在评判另一模型生成的代码时,即便缺乏有效证据,也会输出带有推理过程的自信结论,这种行为与有充分依据时的表现几乎无法区分。为解决这一问题,学界提出了多智能体验证框架,将整体判断分解为多个可验证的子命题,并分别对照证据进行核实。该方法在文档检索等任务中表现良好,但在代码评判场景下却面临根本性挑战。

论文作者强调,有效的多智能体验证需满足两个关键条件:其一,所用证据必须独立于待评判的答案;其二,证据在比较两个候选答案时应存在差异。虽然这两个条件在基于检索的问答任务中自然成立,但在代码评判中却难以满足——因为用于验证的测试用例或规范往往与候选代码高度耦合,导致证据无法提供区分性信息。

为验证这一假设,研究团队在两个代码评判基准上运行了MARCH框架(一种已发表的多智能体验证系统),进行了80组条件-单元测量。结果显示,该框架在78%至95%的比较中判定两个候选方案“同样优秀”,整体准确率仅为4.4%,远低于同一模型直接判断时达到的43.7%。值得注意的是,无论是简化问题难度还是使用更大的评判模型,都无法显著改善这一现象。

突破在于,研究者从评判流程的日志中提取出两种无需真实标签的测量指标,成功解释了系统失效的原因。基于其中一种指标设置门控机制后,系统能够主动拒绝那些缺乏判断依据的比较任务。尽管仅回答了约一半的比较请求,但其准确率从20.7%显著提升至36.9%。这一成果的核心贡献并非构建更准确的评判模型,而是提供了一种无需标注数据即可识别“无依据判断”的方法,为构建可信的AI代码评估系统提供了新思路。

该研究对当前AI编程助手的可靠性评估具有重要启示意义,强调在自动化代码审查中引入“不确定性感知”机制的必要性,避免模型在证据不足时仍输出误导性结论。

# 多智能体系统 # 代码生成 # 可信AI # 模型评估 # arXiv

来源:Heooo AI工具导航