开源项目

蚂蚁百灵发布Ling-3.0-tiny开源模型

Heooo 08月11日20时02分 28 阅读

「蚂蚁百灵今日在Hugging Face平台开源Ling-3.0-tiny模型,总参数7.9B,每Token仅激活1.3B参数。该模型采用KDA与MLA按3比1交替堆叠的混合架构,配合128路由专家的稀疏MoE,支持多种量化版本,已在苹果M4 Pro MacBook上实现约86到90 Token每秒的推理速度,峰值内存约8.34GiB。」

蚂蚁百灵今日在Hugging Face平台正式开源了Ling-3.0-tiny模型,这是一款专为本地化部署设计的轻量级混合推理模型。该模型采用稀疏混合专家架构,总参数量达到7.9B,但每次推理仅激活1.3B参数,实现了高效的计算资源利用。

在技术层面,Ling-3.0-tiny引入了创新的组合方式,将KDA(Kimi Delta Attention)与MLA(多头潜在注意力)按3比1的比例交替堆叠,形成高效的混合线性注意力机制。其前馈网络部分采用了包含128个路由专家的稀疏MoE设计,在保证强大上下文处理能力的同时,有效控制了推理成本。

为了适应不同硬件环境,官方提供了BF16、FP8和INT4三种权重版本。模型支持快速响应和多步骤推理两种模式,尤其适合本地部署场景。根据官方验证,该模型在英伟达DGX Spark以及苹果Silicon MacBook和Mac mini上均可流畅运行。在M4 Pro版本的MacBook上,实测推理速度约为每秒86至90 Token,在8K上下文长度下,峰值内存占用约为8.34 GiB。

Ling-3.0-tiny的开源,进一步降低了高性能AI模型的本地部署门槛。对于开发者而言,轻量化激活参数意味着更低的硬件需求和功耗,而多种精度版本则提供了灵活的选择空间。这一举措也有望推动混合推理架构在端侧设备上的普及,为后续更复杂的应用场景奠定基础。

# 蚂蚁百灵 # Ling-3.0-tiny # 开源模型

来源:Heooo AI工具导航