OpenAI推GPT-6 Sol与Luna:性能逼近旗舰,成本大幅降低 封面图
技术进展

OpenAI推GPT-6 Sol与Luna:性能逼近旗舰,成本大幅降低

Heooo 09月23日12时34分 27 阅读

「OpenAI发布GPT-6系列新模型Sol与Luna,API价格较前代降50%,单任务成本最低仅为竞品一成。两款模型在编程、事实可靠性及计算机操作等任务中表现优异,同时优化了沟通风格与提示缓存机制,现已面向多类用户开放。」

OpenAI近日正式推出GPT-6系列的两款新成员——GPT-6 Sol与GPT-6 Luna,旨在为开发者和企业提供更高性价比的AI推理能力。这两款模型延续了GPT-6 Astra在专业工作、事实性、编码、计算机使用和对齐等方面的先进训练方法,但在速度与成本上实现了显著优化。


最引人注目的是其大幅降低的使用成本。相比此前GPT-5.6的促销价格,GPT-6 Sol与Luna的API调用费用直接砍半。在AutomationBench跨应用业务流程测试中,GPT-6 Sol在xhigh强度下的表现优于Claude Opus 5,而每项任务成本仅为后者的9%;GPT-6 Luna在high强度下性能提升5.4%,任务成本则下降58%。


OpenAI推GPT-6 Sol与Luna:性能逼近旗舰,成本大幅降低

在评估智能体能力的Last Exam测试中,GPT-6 Sol在max effort模式下得分达56.4%,超过Claude Opus 5的最高分,同时任务成本降低60%。事实可靠性方面,Sol的错误率约为前代模型的一半,接近旗舰模型Astra的水平;Luna的事实准确性也获得显著提升。


编程能力是本次更新的重点优化方向。两款模型均针对AI Coding Agent工作负载进行了专项调优。在FrontierCode 1.1 Main测试中,GPT-6 Sol以更低的成本达到了与Claude Fable 5.1 xhigh相当的水平。而在DeepSWE v1.1软件工程测试中,Sol在max effort下取得68.8%的成绩,仅比Fable 5的69.9%低1.1个百分点,但单任务成本却低约80%;Luna的表现也接近Opus 5与Fable 5的medium effort水平,成本分别低93%和96%。


在计算机操作任务方面,尽管Astra仍是OpenAI当前最强模型,但Sol与Luna已能以极低成本完成类似工作。例如在OSWorld 2.0 offline测试中,GPT-6 Sol在xhigh effort下得分为60.5%,与Claude Opus 5 medium effort的60.3%相当,成本却低约80%;Luna在max effort下的表现甚至超过了GPT-5.6 Sol的medium effort,而成本仅为后者十分之一。


此外,OpenAI还将Astra改进后的沟通风格引入Sol与Luna,使模型在技术与编程对话中表达更清晰、术语更少、措辞更自然,并有效压缩低价值细节而不损失核心信息。官方还优化了GPT-6的提示缓存机制,默认提供更高的缓存命中率,帮助智能体重用上下文、加快响应速度。在价值对齐方面,两款新模型也减少了编码任务中的误导性声明。


目前,GPT-6 Sol与Luna已通过ChatGPT Work与Codex向Plus、Pro、Business、Enterprise及Edu用户全面开放;免费用户及Go订阅用户可在桌面端使用Luna。API层面,两款模型分别以gpt-6-sol和gpt-6-luna名称提供,但尚未在Chat界面中上线。

# GPT-6 # OpenAI # 大模型 # API降价 # AI编程

来源:Heooo AI工具导航