晶圆级AI推理芯片升级 词元容量提升十倍
「Cerebras推出新一代晶圆级AI推理芯片WSE-3 Turbo及CS-4系统,集成90万核心和44GB SRAM,算力、带宽等关键指标翻倍,词元容量较上代提升10倍,速度提升2倍,在OpenAI GPT-OSS模型上实现4465 Token/s的交付速度。」
晶圆级AI推理加速器制造商Cerebras于当地时间8月18日宣布推出新一代芯片WSE-3 Turbo和基于该芯片的CS-4系统。与上一代CS-3相比,CS-4带来了10倍的词元容量和2倍的速度,标志着AI推理硬件在算力密度与处理能力上的又一次显著跃升。
WSE-3 Turbo与此前的WSE-3类似,集成了90万个核心和44GB SRAM片上缓存,但其FP16稀疏AI算力、内存带宽、片上互联带宽和I/O带宽均实现了翻倍。这些增强使得WSE-3 Turbo能够在保持超大核心规模的同时,大幅提升数据吞吐效率,从而满足日益复杂的生成式AI推理需求。
基于WSE-3 Turbo打造的新一代CS-4系统,最多可集成3块这样的晶圆级芯片,进一步提升了单位空间内的算力密度。Cerebras公布的数据显示,CS-4在OpenAI GPT-OSS模型上拥有4465 Token/s的词元交付速度,是GPU方案的30倍,同时较CS-3提升了93%。这意味着在相同的推理任务中,CS-4能够以更高的速度生成文本,显著降低用户等待时间。
面对超高参数模型,CS-4的2微秒低延迟晶圆间互连技术发挥了关键作用。Cerebras表示,在10万亿参数规模的模型推理场景下,该互连架构能够实现超过1000 Token/s的词元输出,为业界极大规模模型的实时应用提供了可能。
在架构设计上,CS-4原生支持推理负载拆分,可作为专用解码单元与异构的预填充硬件配套使用。这种灵活的部署方式能够充分发挥不同硬件架构在推理链路各阶段的差异化优势,帮助用户根据实际场景优化整体效率与成本。
这一算力硬件基于Cerebras全新的Nexus机架式平台。在该平台中,计算、电源和互连三大方面被重新设计为独立的子系统,整体组件数量减少了50%,制造自动化比例大幅提升。同时,CS-4几乎完全消除了板级供电功率损耗,为WSE-3 Turbo提供了双倍的电力供给,确保了高负载运行下的稳定性和能效表现。
来源:Heooo AI工具导航