技术进展

OpenAI用GPT-5.6 Sol优化自身推理降本20%

Heooo 07月30日18时02分 29 阅读

「OpenAI于7月29日发布博文,宣布通过GPT-5.6 Sol模型优化GPT-5.6系列自身的AI推理链路,端到端服务成本最多降低20%。该模型通过Codex分析生产流量、识别负载失衡、测试路由策略,并自主改写GPU内核以提升效率。同时,GPT-5.6 Sol学习Triton和Gluon两种编程语言优化推理引擎,并借助开源工具FpSan验证内核正确性。此外,模型还优化了推测性解码技术,使token生成效率提升超过15%。」

OpenAI于7月29日发布博文,宣布通过其最新推出的GPT-5.6 Sol模型,对GPT-5.6系列模型自身的AI推理链路进行深度优化,成功将端到端服务成本最多降低20%。这一举措标志着OpenAI在模型效率优化上迈出了重要一步,展示了利用AI自身能力反哺系统性能的闭环策略。

GPT-5.6系列于7月9日首次亮相,被OpenAI称为其最强AI模型。在后续架构优化过程中,团队创新性地使用GPT-5.6 Sol模型来优化自身运行效率,重点降低计算成本并提高GPU利用效率。具体而言,系统会根据地域、可用容量和加速器类型分配请求;在集群内部,还会参考负载、上下文长度以及缓存可用性等因素进行任务分发。GPT-5.6 Sol通过Codex分析生产流量,能够精准识别负载失衡的来源,测试不同的路由策略,并动态调整启发式规则,从而在宏观调度层面实现资源的最优分配。

在模型前向传播环节,GPT-5.6 Sol展现出更强大的自主优化能力。它能识别出可预计算、可避免或可并行执行的工作负载,并通过Codex自主改写和优化生产环境中的GPU内核。为了让模型具备这一能力,OpenAI团队让GPT-5.6 Sol学习了Triton和Gluon两种编程语言,使其能够据此优化推理引擎内核。这种从底层代码层面进行的优化,直接带来了生产环境中GPU内核性能的提升,进而使端到端服务成本最多降低20%。为确保自主编写内核的正确性,OpenAI还使用了开源工具FpSan(浮点数清理器)进行验证,防止因数值误差导致模型输出异常。

除了内核优化,GPT-5.6 Sol还针对推测性解码(speculative decoding)这一推理加速技术进行了改进。推测性解码通常由较小的草稿模型快速预测下一个token,再由主模型验证或修正预测结果。OpenAI在7月29日的公开帖文中表示,经过GPT-5.6 Sol优化后,token生成效率提升了超过15%。这意味着在不牺牲生成质量的前提下,模型响应速度更快,用户体验得到显著改善。

此次GPT-5.6 Sol的应用,本质上是一种“模型自我进化”的实践。OpenAI通过让AI模型参与自身推理链路的诊断、优化与验证,不仅降低了运营成本,也为未来更高效的AI系统设计提供了新思路。随着模型规模和复杂度的持续增长,这种利用AI自身能力进行自动化、智能化运维的方式,或将成为行业标配。

# OpenAI # GPT-5.6 # 模型优化 # 推理成本 # GPU内核 # 推测性解码

来源:Heooo AI工具导航