华为昇腾超节点训练星辰29B代码智能体大模型
「中电信人工智能科技有限公司发布新一代星辰大模型 Xing4.0-29B-A4B,总参数 29B、激活参数仅 4B,是国内首个基于昇腾 Atlas 900 A3 SuperPoD 液冷超节点与昇思 MindSpore 框架完成训练的百亿参数大模型,面向长程智能体与代码生成深度优化。」
中电信人工智能科技有限公司正式发布新一代星辰大模型 Xing4.0-29B-A4B,华为中国随后披露了该模型的训练细节。这款模型总参数为 29B,激活参数仅 4B,聚焦复杂任务理解、任务规划、工具调用和自主执行等能力,支持长上下文处理,可应用于代码开发、数据分析、办公自动化及生活服务等场景。
值得关注的是,Xing4.0-29B-A4B 是国内首个基于昇腾 Atlas 900 A3 SuperPoD 液冷超节点与昇思 MindSpore 框架完成训练的百亿参数大模型,面向复杂工程任务进行了深度优化。模型采用新一代架构设计,进一步提升长程任务处理和多步骤执行能力,能够根据用户提出的目标自主规划任务路径、调用工具并完成复杂任务。华为官方表示,中高阶代码生成与智能体执行,是对长程上下文理解、复杂推理规划、工具调用协同的综合考验,华为团队与中电信团队从数据体系、模型架构、训练工程到强化学习进行了系统性攻坚。
在数据基座方面,团队围绕预训练与后训练全生命周期,建设涵盖数十万亿词元的数据体系。预训练阶段完成 PB 级多源异构数据清洗,引入海量智能体行为轨迹与结构化知识图谱;后训练阶段搭建高并发沙箱容器,构建端到端长程任务合成数据,并建立自动化校验机制保障数据正确性。
在架构设计上,模型专为长程 Agent 任务打造,采用 MLA 多头潜变量注意力压缩 KV 缓存,MT 多 Token 预测增强生成连贯性,mHC 流形约束超连接解决训练数值不稳定问题,并以 Muon 与 QK-Clip 优化器保障训练稳定。训练采用分阶段递进策略,序列长度从 4K 逐步扩展至 32K、128K、256K,系统性构建长程能力。
工程优化是此次发布的另一亮点。模型在昇腾超节点集群上通过多层次软硬件协同优化,实现训练性能提升 96%,接近翻倍。基于 MindSpore 全栈适配 mHC 多残差连接与 DSA 长序列机制,针对细粒度 MoE 的 64 路由与 Top4 激活,通过专家负载均衡、Grouped GEMM、通信计算重叠及 DVM 图算融合,吞吐提升 32%;层级与算子级选择性重计算再提升 19%;自研 Ascend C mHC 融合算子解决 Sinkhorn 碎片化问题,计算效率提升 30%,整网吞吐再提升 25%。
在多专家强化学习方面,团队基于昇腾生态完成 Slime 强化学习框架适配,面向 Agent、Coding、Reasoning 开展多专家强化学习训练,并通过 MOPD 技术实现多专家能力高效融合,进一步提升复杂推理与智能体任务表现。
据了解,目前昇腾已支持 40 余个业界头部模型完成原生训练,也是国内唯一支持商用大规模预训练并训练落地 SOTA 大模型的厂商。Xing4.0-29B-A4B 的模型权重已在 HuggingFace 与魔搭社区开放下载,开发者可直接获取并在此基础上开展智能体与代码生成方向的二次开发。
来源:Heooo AI工具导航