蚂蚁开源 Ling 3.0 flash VL 原生多模态大模型
「蚂蚁开源团队发布并开源百灵系列首个原生多模态大模型 Ling 3.0 flash VL,基于 MoE 架构,总参数 124B、单次推理激活 5.5B,原生支持图像、文本与视频输入,上下文窗口达 256K Token。训练实践表明多模态联合训练反而拉升了文本智能,模型还引入视觉反馈闭环,兼具质量与执行效率。」
蚂蚁开源团队正式发布并开源了百灵系列的首个原生多模态大模型 Ling 3.0 flash VL。该模型基于 Ling 3.0 flash 的 MoE 架构拓展而来,总参数量达到 124B,单次推理仅激活 5.5B 参数,原生支持图像、文本与视频三种模态输入,上下文窗口达到 256K Token。
从这个参数配置可以看出,模型走的是稀疏激活的技术路线:总参数规模足够大以保证容量与知识储备,而单次推理只唤醒其中一小部分参数,从而在效果与成本之间取得平衡。再加上原生支持视频输入与 256K 的超长上下文,模型可以一次性处理较长的图文混排材料或连续的视频片段,不必依赖外部拼接与切分,这为复杂的真实任务提供了基础条件。
在研发过程中,团队重点探索的是如何让大模型更可靠、更高效地完成真实任务。业界长期存在一种顾虑:给大模型加上视觉能力,可能会拉低它原本的文本智能。而 Ling 3.0 flash VL 的实际训练实践给出了相反的结论——原生多模态联合训练不仅拓展了应用边界,反而进一步拉升了文本智能。也就是说,视觉与语言并非互相牵制的两套能力,在原生统一训练下,它们可以互相促进。
为了获得更精准的执行效果,模型引入了创新的视觉反馈机制。通过观察执行结果、对比目标、发现偏差、持续修正的完整闭环,模型把传统的一次性生成转变为具备自我纠错能力的动态过程,从而大幅提升最终结果的可靠性。对于需要多步操作、结果可被直观检验的任务而言,这种闭环式执行方式尤为关键。
此外,该模型继承了 Ling 3.0 flash 在 Agent 工作流中作为高效执行节点的核心优势。在视觉反馈的闭环运行中,它能够兼顾输出质量与执行效率,以更低的成本和更短的时间推进并完成复杂任务。对开发者来说,这意味着可以在开源基础上构建更贴近真实场景的多模态应用,而不必在响应速度与结果质量之间反复取舍。
来源:Heooo AI工具导航