华为开源盘古505B参数MoE模型
「华为正式开源openPangu-2.0-Pro模型及技术报告,该模型基于昇腾NPU训练,参数规模约505B,采用MoE架构,支持512k上下文,训练数据达34T tokens。模型在架构、优化器等方面全面升级,旨在为业界提供昇腾原生训练与推理的最佳实践参考,推动AI技术生态发展。」
华为在AI开源领域再迈出重要一步。今日,华为正式宣布开源盘古openPangu-2.0-Pro模型,包括模型权重、基础推理代码及技术报告,这一举措兑现了此前华为常务董事余承东在开发者大会上的承诺。openPangu-2.0-Pro作为盘古开源系列的最新成员,其参数规模达到约5050亿,成为当前开源社区中备受瞩目的大规模语言模型之一。
openPangu-2.0-Pro是基于昇腾NPU训练的大规模混合专家(MoE)语言模型,其设计充分体现了华为在AI基础设施领域的深厚积累。模型每token激活参数规模约18B,支持512k的上下文长度,训练数据总量约34T tokens。这些技术指标意味着模型在处理长文本和复杂任务时具备更强的能力,同时也对训练和推理效率提出了更高要求。
在模型架构上,openPangu-2.0-Pro实现了全面升级。Attention架构沿用高效的MLA,并采用DSA+SWA独立分层混合架构,层配比为1:2。其中SWA层负责局部窗口建模,DSA层负责稀疏全局聚合,这种设计在保持精度的同时显著降低了长序列推理的计算、显存与访存开销,为实际应用中的性能优化提供了新思路。
此外,模型在拓扑架构上将传统残差连接升级为4支流mHC架构,提升了表征多样性与泛化能力。自投机模块采用3头MTP架构,一次额外预测3个token,显著提升了推理速度。训练阶段则采用Muon优化器,使模型收敛速度更快。这些技术创新不仅提升了openPangu-2.0-Pro的性能,也为昇腾生态的开发者提供了可借鉴的实践范例。
在后训练阶段,openPangu-2.0-Pro完成了快慢合一微调(SFT)、多专项强化学习(RL),并通过在线蒸馏(OPD)完成能力合一,确保模型在多种任务场景下都能保持稳定输出。这一系列技术细节在随模型一并开源的技术报告中均有详细说明,便于研究者和开发者深入理解模型的设计思路。
华为开源盘古openPangu系列旨在通过昇腾原生训练与推理技术,为业界用好昇腾提供最佳实践参考。此前,92B参数的openPangu-2.0-Flash模型已于6月30日开源上线,而本次开源的Pro版本在参数规模和能力上更进一步。余承东曾解释,模型总参数设定为505B,是考虑到算力资源需大量支持国内其他企业需求,同时AI算力成本高昂,华为更聚焦于时延和吞吐率的提升,这一策略体现了华为在资源分配上的务实考量。
目前,openPangu-2.0模型的相关组件已陆续上线开源平台,开发者可通过华为提供的开源地址获取模型权重和推理代码。这一开源举措不仅丰富了全球AI开源生态,也为基于昇腾平台的AI应用开发提供了强有力的支持,有望推动更多企业和研究机构在昇腾架构上进行创新探索。
来源:Heooo AI工具导航