行业资讯

OpenAI多次修改GPT-6 Astra评测数据引争议

Heooo 09月06日20时01分 38 阅读

「OpenAI发布GPT-6 Astra后多次修改基准测试数据,部分成绩大幅波动,包括幻觉率、数学及编码评测。调整一度让Astra表现更突出,竞争对手数据被下调。专家质疑存在“Benchmaxxing”刷榜行为,OpenAI则称是为确保准确性,反映模型实际可用性能。」

OpenAI在发布GPT-6 Astra模型公告后,对其中多项基准测试数据进行了多次修改,部分成绩出现显著变化。这一异常过程引发了业界对AI模型评测体系可信度的广泛讨论。

据相关报道,OpenAI原计划于美东时间9月3日下午2点发布博客文章,但页面迟迟无法正常访问。直到近两小时后,链接才陆续在官方账号和CEO萨姆·奥尔特曼的社交平台上公开。奥尔特曼当时表示,团队在部署博客时遇到了“一点小问题”。事后OpenAI解释称,故障源于内容管理系统和互联网中断,但明确表示与基准测试成绩无关。

然而,当博客重新上线后,用户发现其中的评测数据已悄然变化,且后续仍在持续调整。以GPT-6 Astra的幻觉率为例,最初版本显示为4.2%,在页面基本恢复访问后一度被修改为2%,几乎减半。前代模型GPT-5.6 Sol的幻觉率也曾从12.2%下调至9.4%。但截至最终版本,两项指标又分别恢复至最初的4.2%和12.2%。

在数学评测方面,OpenAI重点强调了Astra在FrontierMath Tier 4(v2)中的成绩,该数值始终保持在97.6%。然而,竞争对手Anthropic的Fable 5.1模型成绩则出现过近10个百分点的下调,随后又有所回升。GPT-5.6 Sol同样经历了多次波动。此外,OpenAI还曾大幅上调GPT-5.6 Sol在内部ExploitBench网络安全评测中的得分,从5.5%提高到11.5%,随后又考虑恢复原值,因为较高分数对应的推理等级并未向商业用户开放。

更早之前,OpenAI提供给媒体的预发布草稿中,Astra在ARC-AGI-3评测中的成绩为98.6%,而公开版本中已变为99.99%。OpenAI解释称,正式发布前验证结果是正常流程,并指出若为Astra配备特殊工具框架,成绩可达99.9%,而标准框架下为63%。这些数字差异进一步暴露了评测条件对结果的影响。

OpenAI承认,其公布的分数是在“任何计算资源投入下能够达到的最高成绩”,与普通用户在实际产品中获得的体验可能存在差距。系统卡中部分评测方法的细节也未充分披露,例如内部幻觉率评测连测试项目的数量都没有列出。

有AI专家指出,这种现象可能属于“Benchmaxxing”——即通过反复调整测试条件、重新运行评测来优化分数。斯坦福大学的研究人员认为,这类操作可以在极短时间内完成,且对营销更有利。他们注意到OpenAI对编码能力评分0.2个百分点的提升也予以更新,显示了公司对数字的敏感。

OpenAI发言人回应称,公司非常重视评测准确性,并强调模型检查点、测试框架和运行方式的差异会导致结果存在几个百分点的合理波动。此事件再次凸显了标准化基准测试在衡量大语言模型能力方面的局限性,以及成绩被人工修饰的可能性。

# GPT-6 Astra # 基准测试 # OpenAI

来源:Heooo AI工具导航