行业资讯

FuriosaAI 公布第三代推理加速器

Heooo 09月22日16时01分 15 阅读

「韩国 AI 半导体初创企业 FuriosaAI 公布第三代 AI 推理加速器技术细节,该芯片由 FuriosaAI 与博通合作开发,采用 2 颗光罩极限级 2nm 计算裸晶与 1 颗独立 I/O 裸晶,配备 12 个 48GB HBM4E 内存堆栈,算力达 32 PFLOPS,内存带宽达 48TB/s,均为上一代的 32 倍。」

韩国 AI 半导体初创企业 FuriosaAI 公布了其第三代 AI 推理加速器的技术细节。这款产品由 FuriosaAI 与博通(Broadcom)合作开发,从裸晶设计到内存配置都进行了大幅升级,面向的是大规模 AI 推理场景下愈发突出的算力与带宽瓶颈。

在芯片架构上,该加速器采用 2 颗光罩极限级 2nm 计算裸晶与 1 颗独立 I/O 裸晶的组合方案,并配备 12 个 48GB HBM4E 内存堆栈。所谓光罩极限级,意味着单颗裸晶的面积已经逼近光刻掩模版所能容纳的上限,必须通过多裸晶协同的方式来完成整体设计。与上一代 RGND 相比,新款芯片的物理尺寸约为其 8 倍,这一变化直观反映出其在计算与存储资源上的扩张幅度。

性能指标方面,FuriosaAI 给出的数据相当激进。该芯片算力可达 32 PFLOPS,是第二代芯片 RGND 的 32 倍;HBM 内存容量达到 576GB,为 RGND 的 12 倍;HBM 内存带宽达到 48TB/s,同样是 RGND 的 32 倍。算力与内存带宽同步提升 32 倍,说明设计团队并未单纯堆叠计算单元,而是在计算与访存之间保持了相对均衡的配比,以避免大模型推理过程中计算单元因等待数据而闲置。

在系统层面,该加速器在机架内采用 SUE 全连接拓扑,并支持 PCIe Gen7 高速互联。全连接拓扑让机架内的加速器之间以更短的路径交换数据,配合新一代 PCIe 标准,有望降低多卡协同推理时的通信开销,这对于需要跨卡切分的大规模模型推理尤为关键。

从技术路线来看,这款产品的几个选择值得关注。一是用独立 I/O 裸晶承载高速互联与外部接口,把计算裸晶的晶体管预算集中留给矩阵运算单元;二是大规模引入 HBM4E,把内存容量与带宽同时拉高到新量级;三是通过 2nm 先进制程与多裸晶封装突破单芯片的面积限制。这三条路径叠加,构成了当前 AI 推理芯片冲击更高性能的主流思路。

对于开发者与推理服务提供方而言,内存容量与带宽的跃升意味着更大的模型可以更少地依赖跨节点切分,单机架即可承载更高的并发与更长的上下文。具体的软件栈支持、量产时间与能效表现,还有待 FuriosaAI 后续公布。

# FuriosaAI # AI推理加速器 # HBM4E # 博通 # 2nm

来源:Heooo AI工具导航