蚂蚁百灵开源Ling-3.0系列基础模型
「蚂蚁百灵本月陆续开源Ling-3.0-tiny和flash模型,并正式开放tiny-base与flash-base的多个checkpoints,涵盖预训练、中期训练及WSM合并阶段,共6个checkpoints。模型在代码、推理和长上下文方面表现突出,适合持续预训练、微调、强化学习等研究场景。」
蚂蚁百灵近期在开源社区动作频繁,继本月陆续发布Ling-3.0-tiny和Ling-3.0-flash模型之后,官方昨日又宣布正式开源Ling-3.0-tiny-base与Ling-3.0-flash-base。此次开源不仅包含最终的Base checkpoint,还同步开放了预训练和中期训练的权重checkpoints,共计6个checkpoints,覆盖模型训练过程中的多个关键节点。
具体来看,预训练checkpoint已完成大规模预训练,但尚未进行中期训练、WSM合并和后训练;中期训练checkpoint则已完成中期训练,仍未进行WSM合并和后训练;而WSM合并checkpoint已基于中期训练checkpoint完成合并,但尚未进行后训练。这种分阶段开放训练权重的方式,为研究者提供了观察模型演化过程的宝贵窗口,有助于深入理解不同训练阶段对模型能力的影响。
官方强调,Base模型是指未经特定任务微调的基础预训练模型,旨在平衡性能和资源消耗。这些checkpoints适合用于持续预训练、领域监督微调、偏好优化、强化学习后训练、蒸馏,以及长上下文和MoE系统研究。不过,官方也特别提醒,Base Model并不是已经完成指令对齐的聊天模型,不建议未经后训练便直接部署为面向终端用户的聊天服务,也不建议未经额外对齐和评估便用于安全关键型应用。任何生产使用都应完成面向具体任务的后训练、评估与验证。
值得关注的是,在中期训练结束后,蚂蚁百灵将传统学习率衰减改写为checkpoints加权合并,即WSM(Warmup-Stable and Merge)。由于没有了学习率衰减,该Base Model更适合持续预训练和动态扩展数据,且支持训练后离线探索不同学习率“衰减曲线”。这一设计创新为后续研究提供了更灵活的训练范式。
从模型参数来看,Ling-3.0-tiny-base总参数7.9B,激活参数1.3B,以相比前代约50%的总参数量,在大多数评测中取得更高结果;在与同等规模模型对比中,展现出更具竞争力的代码能力。Ling-3.0-flash-base总参数124B,激活参数5.1B,具备更充足的参数容量与稀疏激活设计,为研究者和开发团队提供了一个可继续训练、拓展并适配真实场景的开放底座。评测显示,模型在代码、复杂推理和长上下文方向表现突出,相比总参数量约为其2至3倍的base model,整体表现仍具优势。
目前,相关模型权重已开放至ModelScope等平台,开发者可便捷获取。蚂蚁百灵此举不仅降低了前沿模型的研究门槛,也推动了开源大模型生态的多元化发展,为社区提供了更多可探索的训练中间态资源。
来源:Heooo AI工具导航