技术进展

OpenAI数学证明被指未达学界既定标准

Heooo 10月09日02时57分 4 阅读

「OpenAI发布数百个高难数学问题解答,声称已咨询顶尖数学家顾问组,却被指未达学界标准。数学与人工智能顾问组要求停止在专有模型上测试高难数学问题,但OpenAI明确仍在这样做。719份文稿中仅10份公开思维链,42%的证明未经形式化。数学家陶哲轩批评这种自动求解缺乏对数学领域的理解与后续参与。」

OpenAI本周发布了数百个声称攻克世界最难数学问题的解答,并对外表示,为了避免上一次模型解决某个长期悬而未决问题时所引发的争议,它专门咨询了一个由顶尖数学家组成的顾问团队。然而从学界的反馈来看,这一次OpenAI仍然没有达到既定的标准,尤其是在数学家反复强调的人类理解这一环节上。

这个顾问机构名为数学与人工智能顾问小组(AGMAI),由普林斯顿大学高等研究院主办,成员包括来自全球多所机构的九位知名研究者。该组织在九月底发布了针对前沿实验室求解数学问题的指导原则,并在关于OpenAI这批最新证明的声明中表示,建议是否被成功遵循,最终应由数学界来评估。

但AGMAI提出的第一项请求,就是停止在专有模型上测试高深数学问题。而OpenAI在发布说明中明确写道,它正在使用开放研究问题来评估自家的专有模型。这一表态与顾问组的首要建议直接相悖,也成为外界质疑的焦点之一。

AGMAI的核心关切之一是确保人类能够真正理解这些结果。对于人们看不懂的论文,数学家们建议应当把证明形式化,以便机器可验证、同行可复核。但在OpenAI公布的证明中,仍有42%未经形式化处理。信息披露方面同样存在缺口:OpenAI确实遵循了部分原则,例如尽快公布结果、附带说明模型如何得出结论的信息,但并非对所有结果都做到了这一点。在全部719份文稿中,仅有10份公开了模型的思维链。

因此至今仍不清楚,OpenAI在发布这些证明时,是否按照AGMAI的原则承担了确保人类理解随之而来的责任。该顾问组还建议,OpenAI应当出资支持人类数学家的工作,因为只有依靠这些人,实验室给出的解答才可能在真正意义上变得有价值、可被检验并被领域吸收。

知名数学家陶哲轩一直是OpenAI这套做法的批评者。在这批证明发布后,他在社交媒体上写道,问题正被那些对更广泛领域本身毫无兴趣的AI提示者自主解决,一旦最初的目标被标记为已解决,他们便不再关心后续,也根本不理解AI输出的内容,以至于无法就结果回答问题、做报告,或以其他方式与领域内的其他人互动。

这种担忧并非空穴来风。剑桥大学与伦敦国王学院的数学家本周联合发布了一篇论文,对前沿实验室处理此类挑战的方式提出质疑。论文特别指出,在一个号称由OpenAI模型解决的价值百万美元的问题上,自然语言表述的解答与形式化表达的解答之间存在明显差距。这意味着,即便模型给出了看似完整的答案,从可验证、可传播、可被同行接续研究的角度来看,它距离数学界认可的结果仍有相当距离。

当AI模型求解数学问题时,它首先面对的是一套基于自然语言的推理路径,而数学界要求的则是严密的符号化证明。两者之间的转换并非自动完成,需要大量人工参与。这也解释了为什么AGMAI会把人类理解与形式化验证放在如此突出的位置:如果前沿实验室只追求解题数量与速度,却不投入资源帮助数学界消化这些结果,那么再多的证明也难以转化为真正的知识增量。

从目前的反馈看,OpenAI在这批发布中做到了部分透明,却没有回应顾问组最核心的诉求。对整个人工智能研究社区而言,这场争论的意义已经超出单个实验室的发布策略,它触及一个更基础的问题:当模型开始在高难推理任务上给出成果时,评价标准究竟应该由谁定义,以及人类应当在多大程度上参与到结果的验证与理解之中。

# OpenAI # 数学推理 # AI评测 # 前沿实验室

来源:Heooo AI工具导航