蚂蚁开源百灵原生多模态模型Ling-3.0-flash-VL
「蚂蚁集团发布并开源百灵系列首个原生多模态大模型Ling-3.0-flash-VL。该模型基于MoE架构,总参数124B,单次推理激活5.5B参数,支持图像、文本与视频输入,上下文窗口256K Token,引入视觉反馈闭环机制,在医疗报告解读、前端代码生成等场景中持续修正输出,提升任务可靠性。」
蚂蚁集团近日宣布推出并开源百灵系列首个原生多模态大模型Ling-3.0-flash-VL。该模型在Ling-3.0-flash的MoE混合专家架构基础上拓展而来,总参数量达124B,单次推理仅激活5.5B参数,原生支持图像、文本与视频输入,上下文窗口扩展至256K Token,为长文档与长视频分析提供了技术基础。
围绕“更可靠、更高效完成真实任务”的设计方向,Ling-3.0-flash-VL引入了视觉反馈闭环机制。与传统一次性的“看图生成”模式不同,该机制将任务执行过程推进为“观察→行动→验证→修正”的持续闭环。在医疗报告解读、前端代码生成及GUI自动化等场景中,模型能够依据视觉反馈不断调整自身执行结果,从而提升复杂任务的完成质量与稳定性。
在训练层面,蚂蚁集团透露,通过原生多模态联合训练,视觉信息的引入对模型文本能力产生了正向增益。在Artificial Analysis Intelligence Index v4.1.1评测中,Ling-3.0-flash-VL相比纯文本版本Ling-3.0-Flash得分提升了4分,显示出多模态学习对语言理解能力的反哺效应。
实际应用测试中,Ling-3.0-flash-VL在图片转网页任务中可深度理解布局与组件关系并生成对应代码,且能够通过渲染结果对比进行自我修正。在Image-to-WebDev Arena官方评测中,该模型的代号linthium得分高于GPT-5.4,展现出强大的视觉转代码能力。作为GUI Agent使用时,模型能够识别界面结构并完成跨工具操作;在医疗报告解读场景里,它支持跨文档数据整合与风险标识,进一步拓展了专业领域的应用边界。
技术架构层面,Ling-3.0-flash-VL引入了任意分辨率视觉编码器与VideoRoPE,语言主干保持42层混合架构,交替排列KDA与Gated MLA,比例为5:1。凭借较低的激活参数,模型在实时视频对话、多轮视觉交互及长时任务中均能保持低延迟响应。目前,该模型已在Ling Studio上线并提供免费体验,BF16与FP8版本同步在Hugging Face及ModelScope平台开源,FP4和INT4量化版本计划于近期发布,方便不同算力环境下的开发者灵活部署与二次开发。
来源:Heooo AI工具导航