行业资讯

GPT-6 Astra测试数据频改引发刷榜质疑

Heooo 09月07日10时01分 40 阅读

「OpenAI发布GPT-6 Astra模型后,其基准测试数据多次反复调整,包括幻觉率等关键指标出现大幅波动,甚至竞争对手模型数据也被修改,引发业内对其“刷榜”行为的广泛质疑,并加剧了AI行业基准测试的信任危机。」

近日,OpenAI在发布全新大模型GPT-6 Astra的过程中陷入一场前所未有的信任风波。该模型公告于9月3日上线后不久即被紧急撤下,官方最初将原因归结为内容管理系统故障与网络中断,并强调与评测数据无关。然而,随着博客内容恢复并多次更新,外界发现多项关键性能指标经历了戏剧性变动。


最具争议的是Astra模型的幻觉率——这一衡量模型生成虚假信息频率的重要指标——最初公布为4.2%,随后被大幅下调至2%,不久后又悄然回调至原始数值。不仅如此,GPT-5.6 Sol的幻觉率及内部网络安全评测结果也相继出现调整。更令人困惑的是,Anthropic旗下部分模型的相关数据竟也在OpenAI正式发布公告前就已发生变动,进一步加深了外界对数据操纵的疑虑。


面对质疑,OpenAI回应称所有调整均旨在提供“模型可用性能的最佳真实估计”,并指出测试条件等客观因素可能影响结果。然而,这种缺乏透明度和同步说明的数据修改方式,难以平息业界对其“刷榜”动机的猜测。事实上,此类基准测试数据不稳定的问题并非首次出现,Meta等头部AI公司此前也曾因类似操作饱受批评。


当前,基准测试成绩已成为客户选型、投资者评估及市场定位的核心依据。频繁且不透明的数据变动不仅削弱了评测体系的公信力,也对OpenAI长期构建的技术领导形象构成挑战。多位AI领域专家呼吁,行业亟需建立统一、透明的评测规范,任何成绩修改都应同步公开变更原因及具体测试条件,以重建市场信任。

# GPT-6 # 基准测试 # OpenAI # 大模型 # AI评测

来源:Heooo AI工具导航