华为开源5050亿参数openPangu-2.0-Pro大模型
「华为正式开源openPangu-2.0-Pro大模型,总参数规模达5050亿,基于昇腾NPU训练,采用MoE架构,每Token激活18B参数,支持512K上下文。同步开放权重、推理代码和技术报告,推动昇腾AI生态建设,为开发者提供原生训练与推理的最佳实践。」
华为近日正式开源了盘古AI模型品牌openPangu旗下的openPangu-2.0-Pro大模型,这一举措标志着昇腾AI生态建设迈出了重要一步。此次开源不仅包含了模型权重,还同步提供了基础推理代码和技术报告,为开发者和企业提供了基于昇腾原生训练与推理技术的最佳实践参考。
openPangu-2.0-Pro是一款基于昇腾NPU训练的大规模混合专家(MoE)语言模型,其总参数规模约505B(5050亿),但每个Token激活的参数仅为约18B,这种设计在保持强大能力的同时,有效控制了推理时的计算开销。模型支持512K的上下文长度,能够处理超长文本,训练数据规模达到了约34T Tokens,为模型提供了丰富的知识基础。
在后训练阶段,openPangu-2.0-Pro采用了多项先进技术。模型完成了快慢合一监督微调(SFT),结合了快速与慢速训练策略,提升了微调效率。同时,通过多专项强化学习(RL)对模型进行了针对性优化,增强了模型在特定任务上的表现。此外,模型还通过在线蒸馏(OPD)实现了能力融合,进一步提升了综合性能。这些技术的综合应用,使得openPangu-2.0-Pro在性能上表现出色。
此次开源是华为openPangu2.0开源计划的重要组成部分。在今年6月举行的HDC2026开发者大会上,华为常务董事、产品投资评审委员会主任、终端BG董事长余承东宣布,openPangu2.0将自6月30日起陆续开源7大组件,包括预训练代码、后训练代码和训练算子等核心能力。此前,92B参数的openPangu-2.0-Flash模型已于6月30日率先开源,而此次openPangu-2.0-Pro的开源则进一步丰富了开源生态。
针对openPangu-2.0-Pro总参数规模为505B,余承东曾表示,华为将大量AI算力资源支持国内产业生态,自身可用算力相对有限,同时AI训练成本持续高企,因此华为更注重模型在时延、吞吐率等推理效率上的优化。这一策略在openPangu-2.0-Pro的设计中得到了体现,通过MoE架构和激活参数优化,模型在推理效率上具有显著优势。
随着openPangu2.0持续开放核心模型与训练能力,昇腾原生AI开发生态有望进一步完善。此次开源不仅为开发者提供了高性能的模型,还为国产大模型研发提供了宝贵的开源参考。开发者可以通过Ascend Tribe开源社区获取相关资源,进一步探索和利用昇腾平台的潜力。
来源:Heooo AI工具导航