行业资讯

国内首个GPU与类脑混合推理系统发布

Heooo 09月13日20时34分 33 阅读

「移动云联合中国电子科技南湖研究院、北京灵汐科技、上海天数智芯、清华大学、北京大学打造的国内首个国产GPU加类脑芯片大模型异构混合推理系统发布。经Deepseek V4实测,其相较同类国产GPU算力集群性价比提升一倍以上,业务运营成本降低40%以上。」

在2026中国算力大会上,由移动云公司联合中国电子科技南湖研究院、北京灵汐科技、上海天数智芯、清华大学、北京大学共同打造的国内首个国产GPU与类脑芯片大模型异构混合推理系统正式发布。该成果把国产通用GPU与类脑芯片两类异构算力纳入同一条推理链路,为大模型推理提供了一条全新的国产化技术路线。

根据官方公布的数据,经Deepseek V4实测,该系统相较同类国产GPU算力集群性价比提升一倍以上,业务运营成本降低40%以上。这意味着在同等硬件投入下,用户可以拿到翻倍以上的推理产出,同时把长期运营开支显著压低,对大规模推理业务而言意义直接。

技术层面,这套系统的核心思路是“分而治之,协同增效”。研发团队将大模型推理过程做PD与AF拆分,把不同模块部署到最擅长的芯片上:Attention计算交给国产GPU,充分发挥其通用计算优势;FFN(MOE专家)这类延时敏感模块则交给类脑芯片,利用其存算一体、片上大容量SRAM的架构优势。通过自研模型编译器、高速互联协议和统一推理引擎,系统实现了两类算力的任务拆解、协同调度与结果聚合,突破了传统单GPU推理的固有瓶颈。

从适用场景看,官方表示该成果可广泛适配Token工厂、AI代码生成、多智能体协同、智能制造等高实时性场景;同时面向金融、安防、通信等安全敏感行业,提供全栈国产化推理底座,兼顾性能与自主可控需求。

此次发布的更大价值在于架构思路的示范效应。过去异构算力往往停留在“堆卡”层面,而这次是把模型结构本身拆开,按计算特性匹配芯片特长,再靠编译器与互联协议把碎片重新拼成完整推理链路。对于正在寻找国产算力性价比拐点的开发者和企业来说,这种软硬件协同的拆分调度方式,可能比单纯提升单芯片峰值算力更具参考价值。

# 国产GPU # 类脑芯片 # 异构推理 # 大模型

来源:Heooo AI工具导航