行业资讯

OpenAI发布GPT-6 Sol与Luna并大幅降价

Heooo 09月23日05时34分 18 阅读

「OpenAI发布GPT-6系列新成员Sol与Luna,采用与Astra类似的训练方法,API价格较GPT-5.6促销价降低50%。两款模型在自动化任务、事实可靠性、编程与计算机操作等测试中表现突出,成本显著低于同档竞品,并改进了提示缓存与价值对齐。」

OpenAI发布GPT-6系列最新成员GPT-6 Sol与GPT-6 Luna。官方表示,两款模型采用与GPT-6 Astra类似的训练方法,把Astra在专业工作、事实性、编码、计算机使用和对齐等方面最先进的性能,带入速度更快、价格更低的模型。OpenAI同时强调,GPT-6 Astra依然是其整体上最优秀的模型,如果追求最佳效果与无妥协体验,仍建议选择Astra。

价格是此次发布最受关注的亮点。GPT-6 Sol与Luna的API价格相比GPT-5.6促销价降低50%。OpenAI还改进了GPT-6的提示缓存,默认提供更高的缓存命中率,帮助智能体重用更多上下文,从而在应用重复利用的上下文部分节省更多费用,并实现更快响应。两款模型自发布当日起已在ChatGPT Work与Codex中向所有Plus、Pro、Business、Enterprise与Edu用户开放,免费用户与Go用户可在桌面应用中使用GPT-6 Luna。这些模型目前还没有在Chat中提供,在OpenAI API中以gpt-6-sol与gpt-6-luna的形式提供。

性能方面,在AutomationBench的跨应用业务流程测试中,GPT-6 Sol在xhigh强度下表现优于Claude Opus 5,成本仅为Opus 5每任务成本的9%;在high强度下,GPT-6 Luna比前代提升5.4%,且每项任务成本降低58%。在评估智能体的Last Exam测试中,GPT-6 Sol在max effort状态下得分56.4%,高于Claude Opus 5在评估中的最高分,每任务成本也降低60%。

事实可靠性方面,在OpenAI基于去标识化真实世界对话的评估中,GPT-6 Sol的错误率约为前代的一半,接近Astra级可靠性且成本更低;GPT-6 Luna的事实可靠性也迎来大幅提升,同时成本更低。

编程与计算机操作能力同样有量化数据支撑。GPT-6 Sol与Luna均针对AI Coding Agent工作负载进行了优化。在FrontierCode 1.1 Main测试中,GPT-6 Sol相比GPT-5.6 Sol有明显提升,并以更低成本达到与Claude Fable 5.1 xhigh相当的水平。在DeepSWE v1.1软件工程测试中,GPT-6 Sol在max effort下取得68.8%的成绩,距离Claude Fable 5的最高成绩69.9%仅差1.1个百分点,而单任务成本低约80%;GPT-6 Luna在max effort下取得66.6%,表现接近Opus 5与Fable 5的medium effort,单任务成本分别低约93%与96%。在OSWorld 2.0 offline测试中,GPT-6 Sol在xhigh effort下取得60.5%,与Claude Opus 5 medium effort的60.3%接近,单任务成本约低80%;GPT-6 Luna max effort则超过GPT-5.6 Sol medium effort,成本约为后者的十分之一。

此外,OpenAI将GPT-6 Astra改进后的沟通风格带到Sol与Luna。官方认为新模型在技术与编程对话中会更清晰、使用更少的术语、更少奇怪的措辞、更少的低价值细节,并缩短整体回答,同时不会失去实质内容。价值对齐方面,在OpenAI官方的对齐评估中,Sol与Luna均较GPT-5.6版本有所改进,包括关于其编码工作的误导性声明发生率降低。

# OpenAI # GPT-6 # 模型发布 # API降价

来源:Heooo AI工具导航