技术进展

Vera Rubin能效达GB300三十倍

Heooo 08月25日15时35分 20 阅读

「英伟达使用SemiAnalysis AgentX工作负载测试DeepSeek-V4-PRO 1.6T模型,结果显示Vera Rubin NVL72每兆瓦吞吐量约为GB300 NVL72的30倍,每百万Token成本仅为后者的35分之一,显著提升AI推理能效与成本优势。」

IT之家8月24日消息,英伟达昨日使用SemiAnalysis AgentX工作负载,以DeepSeek-V4-PRO 1.6T模型进行评估测试。测试结果显示,Vera Rubin平台的每兆瓦吞吐量达到Blackwell平台的30倍,这一数据引发了业界对下一代AI基础设施能效表现的高度关注。

每兆瓦吞吐量(Tokens per Megawatt,简称tokens/MW)是衡量AI数据中心在固定电力额度下能产出多少AI Token的核心能效指标。随着AI模型规模持续扩大,推理阶段的电力消耗成为运营成本的主要构成部分,因此这一指标直接决定了在相同电力预算下,企业能够支持多少智能体并发任务,或者以更低的成本维持相同的服务能力。

根据IT之家援引的博文介绍,SemiAnalysis AgentX通过4项指标重点评估智能体编程推理工作负载。其中,端到端归一化交互性按请求提交至最终Token到达的完整时间计算,反映包含首个Token等待时间在内的用户可见输出效率;标准交互性则只统计首个Token至最后一个Token之间的生成阶段。端到端延迟统计单次请求从提交到最终输出Token到达的总时长,首个Token延迟(TTFT)则统计提交请求到首个输出Token到达的时间。这些指标从不同维度刻画了智能体在真实编程场景中的响应速度与吞吐表现。

在DeepSeek-V4-PRO 1.6T工作负载中,采用GB300 NVL72的Grace Blackwell服务器每兆瓦吞吐量达到H200 NVL8 Hopper方案的15倍。与此同时,Blackwell每百万Token成本约为上一代的十分之一,这意味着运营方可以在相同电力和基础设施预算下支持更多智能体,或以更低运营成本维持相同智能体容量。而Vera Rubin进一步放大了这一优势,在DeepSeek-V4-PRO模型上,Vera Rubin NVL72的每兆瓦吞吐量约为GB300 NVL72的30倍,每百万Token成本则仅为GB300 NVL72的35分之一。

这一测试结果表明,英伟达下一代平台在能效和成本控制方面实现了跨越式提升。对于大规模运行AI智能体的企业而言,Vera Rubin所提供的高吞吐和低成本特性,将使其能够持续、大规模地运行智能体,满足客户在不同工作负载下的需求。随着AI推理需求从简单的文本生成向复杂编程任务演进,能效指标将成为衡量数据中心竞争力的关键因素,而Vera Rubin的表现无疑为行业树立了新的标杆。

# 英伟达 # Vera Rubin # 能效

来源:Heooo AI工具导航