GPT-5.6 Sol超快模式实现极速推理
「Cerebras与OpenAI合作推出Ultrafast模式,GPT-5.6 Sol在超快模式下输出速度高达每秒750个token,且无质量损失。在Humanity's Last Exam基准中,其速度比Claude Fable 5快近7倍,并在GDP-Val任务中实现5.6倍端到端加速,为高时效业务提供新选择。」
Cerebras与OpenAI今日联合发布了一项名为Ultrafast的新型服务层级,该服务将率先在OpenAI API中上线,并由Cerebras硬件提供算力支撑。这一模式专为对响应速度有极致要求的场景设计,初期面向特定客户群体开放,后续将逐步扩大使用范围。作为该模式的首个承载模型,GPT-5.6 Sol在Ultrafast状态下能够实现每秒高达750个输出token的吞吐量,同时官方强调这一速度提升并未带来任何质量折损。
长期以来,AI开发者往往需要在模型智能水平与响应速度之间做出取舍。随着模型规模扩大,计算开销和数据搬运成本显著增加,推理延迟也随之上升。用户要么等待更长时间以获得高质量结果,要么在短时间内接受相对平庸的输出。GPT-5.6 Sol Ultrafast的推出正是为了打破这一困局,将前沿智能引入到每一秒都至关重要的产品与工作流中。根据Artificial Analysis报告的对比数据,GPT-5.6 Sol的Ultrafast模式在输出速度上比Fable 5快11倍,比运行在Fast模式下的Opus 4.8快5倍。
为了进一步验证实际性能,Cerebras将Ultrafast模式与主流模型在Humanity's Last Exam基准上进行了正面较量。该基准包含2500道极具挑战性的问题,通常只有化学、经济学和文学等领域的博士级专家才能作答。在Cerebras的评测中,运行在Ultrafast模式下的GPT-5.6 Sol用时11小时11分钟便完成了全部2500道题,而Claude Fable 5则耗时78小时27分钟——超过三天连续计算——才得出相同结论。这意味着Ultrafast模式仅用一个工作日便完成了人类知识前沿的探索,在获得相近准确率的同时,整体效率提升了将近7倍。
这项基准测试由Cerebras于7月10日使用GPT-5.6 Sol Ultrafast配合Codex的xhigh推理设置完成,而Claude Fable 5的对照测试则在7月13日至15日期间进行。值得注意的是,随着模型能力不断增强,快速推理所能覆盖的应用范畴也在持续扩展。GPT-5.6 Sol已被视为OpenAI在法律文书、金融建模和工程报告等领域的最强模型。在面向高价值知识工作任务的GDP-Val基准上,Ultrafast模式实现了5.6倍的端到端加速,同时没有出现质量下降,清晰展示了更快的推理速度如何推动经济价值创造。
更高的智能速度正在重新定义个人与组织可能完成的事情。借助Ultrafast模式,开发者可以将AI智能体置于那些分秒必争的关键路径之上,例如在生产环境出现故障时快速定位根因并恢复服务,从而减少客户流失和业务损失。对于利用前沿AI对实时信息做出即时响应的企业而言,Ultrafast所提供的是一种持续性的竞争优势。
Ultrafast模式的发布不仅展现了Cerebras在专用计算平台上的技术积累,也反映了双方在追求“速度与智能兼得”这一方向上的共识。随着访问权限逐步开放,我们有望看到更多依赖低延迟推理的杀手级应用出现,而GPT-5.6 Sol Ultrafast则可能成为这一波效率革命中的标志性服务。
来源:Heooo AI工具导航