英伟达展示DSX MaxLPS,AI工厂能效最高提升40%
「在AI基础设施峰会上,英伟达展示了面向AI工厂的DSX MaxLPS功耗调度系统,每兆瓦token吞吐量最高提升40%。该技术已由Emerald AI集成至Conductor平台,Lambda实测在固定功率预算下token吞吐量提升24%,每瓦性能提升23%。」
在近期举行的AI基础设施峰会上,英伟达展示了面向AI工厂的DSX MaxLPS功耗调度系统。根据官方披露的数据,该技术可将每兆瓦token吞吐量最高提升40%,为电力资源日益紧张的数据中心提供了新的能效思路。
所谓每兆瓦token吞吐量,指的是数据中心每消耗1兆瓦电力时,AI系统每秒能够生成或处理多少token。这一指标把功耗纳入计算口径,因此比单纯的峰值算力更适合衡量AI数据中心在电力受限条件下的实际产出能力。对于大规模推理集群而言,电力往往比芯片更早成为瓶颈,如何在既定功率预算内挤出更多有效算力,正成为基础设施优化的核心命题。
目前,DSX MaxLPS技术已由Emerald AI集成至Conductor平台,用于电网条件下的数据中心负载编排。平台中的DSX Flex能够依据电网状态动态调整数据中心的用电需求,从而实现负载与供电之间的实时匹配。据披露,该平台已接收200次电网状态信号,相关操作均未要求用户干预,全程由系统自动完成调度。
云服务商的实测数据进一步验证了这套方案的落地效果。GPU云服务商Lambda在固定功率预算下取得了24%的token吞吐量提升。Lambda的客户数量超过10000家,其测试集群包含5个机架和19个节点。在与16个节点满功率运行完全相同的功率预算下,19个节点的集群吞吐量从约每秒400万个token提升至每秒500万个,增幅24%,每瓦性能提升23%。这意味着在不增加电力供给的前提下,仅凭调度优化就能释放出可观的额外产能。
英伟达同时披露了下一代机架方案的能效表现。Vera Rubin与Groq 3 LPX机架在相同站点功耗范围内,GPU数量最多可增加40%;在不新增电力线路的条件下,token吞吐量最多可提升35%。在100K上下文、Qwen 3.8 27B工作负载中,Groq 3 LPX达到每位用户每秒2529个输出token。
围绕Vera CPU,多家AI企业已参与早期测试。结果显示,相关性能最高提升1.9倍,吞吐量提升73%,查询任务吞吐量提升3.3倍。Perplexity测得SPACE安全沙箱启动速度提升1.9倍,DeepInfra测得编排步骤延迟速度提升2.2倍。Redpanda的测试显示,Vera CPU相比其他CPU延迟降低5.5倍,吞吐量提升73%;Starburst测得查询吞吐量提升3倍,Kinetica测得分析查询性能提升2.7倍。
从功耗调度到机架密度,再到CPU侧的实测反馈,这一系列数据共同指向同一个方向:AI基础设施的竞争焦点,正从单卡算力转向单位电力所能承载的token产出。
来源:Heooo AI工具导航