行业资讯

英伟达重启Rubin CPX推理预填充芯片项目

Heooo 09月01日17时33分 2 阅读

「英伟达重启AI推理预填充加速GPU Rubin CPX项目,设计大幅调整。新芯片接近标准Rubin GPU算力,功耗2300W,配备168GB HBM4内存。采用独立MGX ETL机架,建议与标准Rubin按1:1配对,以弹性部署和低成本承接预填充负载,预计2027年第一季度生产。」

根据分析师郭明錤的最新产业调查,英伟达已正式重启人工智能推理预填充加速芯片“Rubin CPX”项目,但与此前设计相比,新方案发生了大幅调整。该芯片预计将于2027年第一季度开始生产,定位与标准Rubin GPU形成互补,重点攻克AI推理中的预填充阶段。

在芯片层面,新的Rubin CPX拥有接近标准Rubin GPU的算力,预填充性能进一步提升。其单体最高功耗仍为2300W,但内存配置从旧版的128GB GDDR7改为168GB HBM4,这一容量变化或指向7组24GB HBM4堆叠的设计方案。更高的内存带宽和容量,对于处理长上下文输入并建立KV Cache至关重要。

在托盘与机架级别,8颗新Rubin CPX构成一个计算托盘,每个托盘拥有高达1.34TB的HBM内存,足以满足大多数长上下文预填充与KV Cache建立需求。8个计算托盘组成一个机架模组,内部采用Spectrum-6全铜以太网进行横向扩展。新Rubin CPX采用独立的MGX ETL机架,每机架包含1至4组机架模组,模组之间通过Spectrum-6搭配OSFP光学方案实现横向扩展。

在系统级部署上,英伟达建议将Rubin CPX与标准Rubin按1:1比例配对使用。Rubin CPX ETL机架与Vera Rubin NVL72机架之间采用基于以太网的RDMA连接,从而实现高效协同。这一架构设计体现了英伟达对AI推理工作负载的精细化划分:标准Rubin负责解码阶段,而Rubin CPX专注预填充阶段。

分析师指出,目前AI推理工作量中超过50%来自处理输入并建立相应的KV Cache。传统GPU在预填充阶段可能因内存带宽不足而成为瓶颈,导致整体推理效率下降。新的Rubin CPX凭借高容量HBM内存和优化的预填充性能,能以更具弹性的部署方式与更低成本承接这一负载,帮助数据中心在长上下文场景下获得更高的吞吐量和更低的时延。

此次重启并大幅调整Rubin CPX项目,反映出英伟达正在系统性地完善其AI推理加速产品矩阵。通过与标准Rubin GPU的协同工作,英伟达希望为企业级AI推理场景提供更细粒度、更经济高效的硬件组合方案。随着2027年量产节点的临近,Rubin CPX有望成为英伟达在推理预填充领域的重要技术布局。

# 英伟达 # Rubin CPX # AI推理芯片

来源:Heooo AI工具导航