GPT-6 Astra刷新ARC-AGI-3智能基准纪录 封面图
技术进展

GPT-6 Astra刷新ARC-AGI-3智能基准纪录

Heooo 09月04日05时03分 2 阅读

「OpenAI最新模型GPT-6 Astra在ARC-AGI-3半私有测试中取得突破,标准配置下得分62.7%,成本26K美元,而采用高级配置后得分高达99.9%,成本仅19K美元。其在96%关卡中动作效率优于人类中位数,并能自主构建符号化世界模型,展现卓越的代理智能潜力。」

人工智能前沿领域再次迎来里程碑式进展。在由ARC Prize团队发布的ARC-AGI-3基准测试中,OpenAI的GPT-6 Astra模型取得了迄今最优的成绩,不仅在任务完成率上大幅跃升,还在动作效率上超过了人类测试者的中位表现。这一结果引发了开发者社区对新一代代理智能的热烈讨论。

ARC-AGI-3是ARC-AGI基准系列的第三代产品,专门用于研究代理型人工智能。与传统的静态问答或视觉推理任务不同,ARC-AGI-3将模型置于新颖、抽象且基于回合制的交互环境中。智能体必须自主探索环境、推断隐藏目标,并逐步构建内部模型来指导后续行动。整个过程中没有任何显式指令提供,模型完全依赖自身对世界核心先验知识的理解和运用。基准的难度通过人类受控测试进行校准,确保所有环境都能被人类完全解决,从而量化当前AI与通用人工智能之间的“残差差距”。

GPT-6 Astra刷新ARC-AGI-3智能基准纪录

ARC-AGI-3重点考察代理智能的四个核心能力:探索、建模、目标设定以及规划与执行。在真实世界中,信息往往不会被动地呈现在智能体面前,因此模型必须通过与周围环境互动来主动获取信息;同时,它需要将原始观察转化为能够预测未来状态的通用模型。面对稀疏的奖励信号,模型还要准确识别出期望的未来状态,并规划从当前状态到目标的路径,在遇到新信息时动态修正。

OpenAI的GPT-6 Astra在该基准上的表现令人惊艳。根据ARC Prize博客公布的测试结果,在标准测试框架下,启用了携带笔记的GTP-6 Astra最高配置得分达到62.7%,测试成本为2.6万美元;而在另一种名为“Provider Adapter”的测试框架中,该框架允许在请求之间保留不透明的推理状态,并利用压缩机制进行更长的对话,从而使模型能够复用先前的工作成果。在这一配置下,模型得分跃升至99.9%,而成本反而降低至1.9万美元。这两项成绩均刷新了当前ARC-AGI-3半私有测试的最高纪录。

GPT-6 Astra刷新ARC-AGI-3智能基准纪录

更值得关注的是,GPT-6 Astra在动作效率上已超越人类基线。在测试的关卡中,模型在96%的关卡里使用的人工操作步骤少于测试人类的中位数。也就是说,它不仅能以极高的成功率完成任务,而且完成任务的方式比大多数人类更加直接高效。这一表现对于衡量系统“以人类同等效率获取能力”的AGI定义而言,具有显著意义。

研究人员还观察到了一个关键行为模式:GPT-6 Astra能够将陌生的交互环境转变成紧凑的符号化世界模型。面对全新规则时,它会尝试将游戏机制提炼成逻辑规则,并发展出自己的专属领域语言简写,用来追踪状态变化和规划后续行动。这种能力与人类面对新问题时抽象建模的思维过程高度相似,说明模型不再是简单地进行模式匹配,而是在真正理解环境结构的基础上进行推理。

GPT-6 Astra刷新ARC-AGI-3智能基准纪录

从成本角度看,AI测试不仅比拼智能水平,也在检验效率。ARC Prize团队透露,在对照测试中,人类参与者每90分钟可获得115美元报酬,另外每完成一个游戏额外获得5美元。参与者每场约尝试9个游戏,平均每个游戏成本约为12.78美元。相比之下,GPT-6 Astra以2.6万美元或1.9万美元的总体算力成本,完成了数百个游戏的测试任务。尽管绝对成本仍高于人类时薪,但在自动化大规模评估和持续运行方面,AI具备独特的扩展性优势。

GPT-6 Astra刷新ARC-AGI-3智能基准纪录

ARC-AGI系列基准的设计初衷,是衡量当前人工智能与通用智能之间尚存的“残余差距”。随着GPT-6 Astra在ARC-AGI-3上接近满分的成绩出现,这一差距正被急剧压缩。有业内人士评论称,代理型AI的发展已经进入新阶段,模型真正具备了自主探索、建模和规划的能力,而不仅仅是回应提示的静态引擎。未来,如何在确保安全可控的前提下,让这种代理能力在真实环境中稳定落地,将成为整个行业的重要课题。

# OpenAI # GPT-6 Astra # ARC-AGI-3

来源:Heooo AI工具导航