行业资讯

蚂蚁百灵开源Ling-3.0-flash高效混合推理模型

Heooo 08月08日10时00分 26 阅读

「蚂蚁集团旗下百灵大模型正式开源新一代原生混合推理模型Ling-3.0-flash,采用124B总参数、5.1B激活参数的MoE架构,提供FP8、FP4、INT4等版本,支持API、单机私有化及高性能部署,输出速度最高超1100 tokens/s,并限时提供2.5折优惠。」

蚂蚁集团旗下百灵大模型近日宣布,新一代原生混合推理模型Ling-3.0-flash已正式开源。该模型采用124B总参数、5.1B激活参数的MoE架构,在保持强大推理能力的同时,显著降低了推理阶段的算力消耗。官方同步提供基础版本以及FP8、FP4、INT4等多个量化版本,为不同场景的开发者与团队提供了灵活部署选项。

在部署方式上,Ling-3.0-flash给出了三种落地路径。第一种是API调用,面向希望快速接入、无需自建推理服务的开发者,可通过云端API直接调用,门槛最低,适合快速验证产品原型或上线Agent应用。第二种是单机私有化,面向数据不能出域的企业和团队,其MXFP4与INT4版本可在单台NVIDIA DGX Spark上完成端到端推理,兼顾数据安全与性能需求。第三种是高强度性能部署,面向对单请求时延敏感的高性能服务场景,在指定GPU测试配置下,平均输出速率可突破1100 tokens/s,满足大规模实时应用要求。

在第三方评测中,Ling-3.0-flash表现同样亮眼。在Artificial Analysis榜单中,其输出速度达到353 tokens/s。在AA Intelligence Index榜单中,Ling-3.0-flash每项任务的加权平均调用成本约为0.04美元,加权平均解码时间约为1.4分钟,同时进入“智能水平—任务成本”和“智能水平—任务耗时”的优势区域,体现了较高的性价比与效率。

为促进开源生态推广,官方宣布在2026年8月7日00:00至8月31日24:00期间,Ling-3.0-flash在Ling Studio限时享受2.5折优惠,自9月1日00:00起恢复原价。模型权重已同步上传至Hugging Face和ModelScope平台,开发者可自由下载、微调与商用。此次开源将进一步丰富国产开源大模型生态,为混合推理与高效部署提供新的技术参考。

# 蚂蚁集团 # 百灵大模型 # 开源模型 # MoE架构 # Ling-3.0-flash

来源:Heooo AI工具导航