OpenAI框架优化令GPT-5.6 Sol得分激增188%
「OpenAI通过推理保留与上下文压缩两项技术改进,使GPT-5.6 Sol在严苛的ARC-AGI-3交互推理测试中得分从13.3%提升至38.3%,增幅达188.42%,同时输出Token数量降至六分之一,展现了框架优化对模型性能的巨大影响。」
OpenAI近日发布公告,宣布通过改进测试框架,使其GPT-5.6 Sol模型在ARC-AGI-3基准测试中的得分大幅提升188%。这一成果揭示了外部框架设计对AI模型表现的关键作用,也为未来交互式AI系统的优化提供了重要参考。
ARC-AGI-3是由ARC Prize团队推出的全新交互式推理基准测试,被公认为衡量AI通用智能最严苛的评测标准之一。与传统静态测试不同,ARC-AGI-3将AI置于完全陌生的游戏环境中,要求其具备实时探索、学习和自适应能力,模拟人类在未知情境下的推理过程。在该测试中,未经优化的GPT-5.6 Sol得分仅为7.8%,而前代GPT-5.5更是低至0.4%,凸显了任务的挑战性。
OpenAI在复盘后发现,GPT-5.6系列模型的官方框架存在两个关键缺陷。第一,每次游戏动作后,私有推理会被丢弃,导致模型每执行一步都需重新理解游戏,尽管能看到过往动作记录,却无法保留促成这些动作的思考过程。第二,框架采用滚动截断窗口,随着交互历史变长,较早的动作信息会从上下文中消失,使模型既丢失思考也丢失记忆。
针对上述问题,OpenAI提出了两项解决方案。首先是推理保留机制,通过Responses API重新实现测试框架,只需传入前一次响应ID,即可在工具调用和多轮交互中自动保留推理过程。启用后,GPT-5.6不再需要每轮重新解释游戏,减少了思考时间,并能基于连贯策略持续学习。其次是上下文压缩,官方框架在对话超过175000字符后会丢弃最早消息,而压缩技术避免了早期观察和动作的丢失,同时防止上下文窗口长期处于满载状态,从而提升表现。
实验数据显示,使用官方框架时GPT-5.6 Sol得分为13.3%,而启用两项改进后得分跃升至38.3%,增幅达188.42%,且输出Token数量降至原来的六分之一。这一结果不仅验证了推理保留和上下文压缩的有效性,也表明模型性能的提升未必依赖模型本身,外部harness的优化同样能带来显著收益。
所谓harness,即包在大模型外部的整套系统架构,负责提供运行环境、工具集成、规则约束与反馈机制。它如同烈马的缰绳与骑手路线,不改变模型内部结构,却决定了模型如何被安全、可靠地驾驭以完成复杂任务。OpenAI此次的改进正是harness优化的典型案例,为整个AI行业提供了宝贵的实践启示。
来源:Heooo AI工具导航