ZGCM-1发布:7B小模型比肩超大前沿模型
「研究团队发布完全开源的70亿参数稠密基础模型ZGCM-1,从零训练并支持256K上下文。它采用门控滑动窗口与全注意力交错架构及FP8 Muon优化器,在数学推理与智能体搜索上与Qwen3-235B-A22B、GLM-5.1等超大模型竞争,预训练时间到损失效率提升约4.2倍,并开源权重、代码与数据配方。」
在arXiv最新收录的一篇论文中,研究团队提出了ZGCM-1,一个完全开源的70亿参数稠密基础模型。该模型从零开始训练,并在数据、系统与算法三个维度上追求极致的效率。其背后的核心假设颇具启发性:紧凑型模型无法被动地记忆整个开放网络,但可以通过将深思熟虑的内部思考与主动的外部工具调用相结合,突破参数容量带来的能力天花板。
为了在256K上下文长度下支撑这一范式,团队构建了一套端到端的高效率开源训练配方。在架构与系统协同设计层面,ZGCM-1采用了交错式的门控滑动窗口注意力与全注意力混合结构,并引入稳定的FP8 Muon优化器,从而在长序列建模与训练稳定性之间取得平衡。在训练流程层面,模型经历了渐进式课程学习与基于马尔可夫决策过程的中间训练:上下文从16K、64K一路扩展至256K,同时把智能体与环境之间的交互轨迹重新形式化为马尔可夫决策过程,使模型在学习工具调用时拥有更清晰的优化目标。
值得注意的是,研究团队还建立了一套AI原生的研发工作流。在该流程中,智能体集群自主承担集群运维、数据治理与快速诊断评估等任务,大幅压缩了人工介入的环节。这种把智能体用于训练智能体自身的方式,也呼应了模型强调外部工具调用的整体设计思路。
评测结果显示,ZGCM-1-7B在通用基准上处于7B模型家族中有竞争力的水平。而在一系列高难度数学推理与智能体搜索测试集上,它的表现可以与参数量高出自身上百倍的前沿模型相抗衡,论文中列举的参照对象包括Qwen3-235B-A22B与GLM-5.1。考虑到二者的参数规模差距,这一结果对开源小模型的能力边界给出了新的注解。
效率方面的收益同样可以量化。团队表示,其预训练设计在16K预训练的时间到损失指标上带来了约4.2倍的效率提升,这意味着在相同算力预算下达到目标损失所需的时间大幅缩短。对于算力资源有限的团队而言,这类系统级与算法级的优化往往比单纯扩大参数规模更具现实意义。
论文还沉淀了贯穿整个开发生命周期的八条可操作经验发现,覆盖架构扩展规律、监督微调的数据质量剪枝、长上下文泛化能力以及智能体协同训练的动态特性等方向。这些发现并非局限于单一模型的调参记录,而是试图为同类紧凑模型的训练提供可复用的方法论。
在开放程度上,ZGCM-1的发布力度相当罕见。团队开源了预训练、中间训练与后训练三个阶段的模型权重,并附带中间检查点、训练代码、分阶段数据与数据配方,以及W&B日志。对于希望复现或在其基础上继续研究长上下文、工具调用与数学推理的开发者而言,这套材料提供了从数据到权重再到训练过程的完整链条,也让外界的审查与改进成为可能。
从更宏观的视角看,ZGCM-1所代表的路线是:与其一味堆叠参数,不如让模型学会思考与调用工具。当参数量不再是唯一答案,架构协同设计、训练课程编排与智能体协同训练这些工程与算法细节,就重新成为决定模型上限的关键变量。而完全开源的做法,则让这条路线可以被更多人验证、质疑与延续。
来源:Heooo AI工具导航