LFM2.5 DSpark草稿模型发布,推理提速3.18倍 封面图
技术进展

LFM2.5 DSpark草稿模型发布,推理提速3.18倍

Heooo 08月21日15时34分 26 阅读

「Liquid AI与Hugging Face联合发布LFM2.5系列DSpark草稿模型,通过投机解码路径在不改变输出质量的前提下大幅提升推理吞吐量。GPU端吞吐量最高提升3.18倍,端侧最高提升2.87倍,端侧智能体函数调用延迟平均降低57%,并已兼容SGLang和llama.cpp,相关权重在Hugging Face开源。」

Liquid AI 与 Hugging Face 正式发布了 LFM2.5 系列三款核心模型的 DSpark 草稿模型检查点,包括 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 以及 LFM2.5-8B-A1B。该系列通过引入全新的投机解码路径,在完全不改变模型输出质量的前提下,大幅提升了推理吞吐量,为云端和端侧的大模型部署提供了新的高效方案。

在实际测试中,DSpark 草稿模型展现出了显著的加速效果。在 GPU 端,整体吞吐量最高可提升 3.18 倍;在端侧设备上,最高提升幅度也能达到 2.87 倍。特别值得注意的是,在端侧智能体(Agent)推理场景中,LFM2.5-2.6B 的函数调用延迟平均降低了 57%。以 M4 Max MacBook Pro 作为端侧测试平台时,其输出速度最高可达每秒 139 个 token,这使得本地运行智能体应用的门槛大幅降低,用户体验甚至超越了部分专有云模型。

DSpark 的性能提升源于其独特的工作原理。传统的大语言模型推理阶段主要受限于内存带宽,绝大部分延迟来自于将模型权重从 DRAM 流式加载到 SRAM 的过程。投机解码的出现正是为了解决这一痛点,它利用一个轻量级的草稿模型快速生成候选 token,再由目标模型在单次前向传播中对其进行统一验证,从而将加载权重的成本有效分摊。

LFM2.5 DSpark草稿模型发布,推理提速3.18倍

DSpark 在现有方法的基础上进行了深度融合,主要包含三个核心组件。首先是并行主干网络,它采用类 DFlash 的风格,以目标模型的上下文特征为条件,在单次前向传播中为所有草稿 token 统一生成隐藏状态。其次是顺序头(Markov 头),通过模拟相邻 token 之间的马尔可夫链增加依赖关系,从而有效提高了后续位置的接受率。最后是置信度调度验证器,它负责预测每个 token 的存活概率,并在验证成本高于节省成本时,自动剪除低置信度的后缀。

在模型训练方面,该草稿模型采用了包含 SFT、聊天、代码和函数调用在内的大规模且多样化的数据混合。经过严格的消融实验,最终确定的初始版本为仅注意力(attention-only)架构,包含 5 层和 9 个块,整体参数量控制在大约 3 亿左右。这种轻量化设计使其非常适合作为投机解码中的草稿模型。

由于投机解码机制的特性,在贪心解码下,草稿 token 只有在与目标模型分布完全一致时才会被接受,一旦被拒绝就会由目标模型自身的 token 取代。因此,生成的输出序列在结构上与基线贪心解码完全保持一致,各项基准测试的准确率没有任何下降。这意味着开发者可以放心使用 DSpark 获得加速,而无需担心生成质量受损。

LFM2.5 DSpark草稿模型发布,推理提速3.18倍

生态支持方面,DSpark 在发布首日便实现了对主流推理框架的兼容。SGLang 通过专门的集成与启动配置,支持在加速器上运行;llama.cpp 实现了官方构建支持,并可通过命令行加载相应的 GGUF 权重与草稿模型文件。目前,相关的 Safetensors 和 GGUF 格式检查点均已在 Hugging Face 平台上开源,为开发者在从云端大规模加速器到端侧边缘设备的广泛部署提供了强有力的支持。

LFM2.5 DSpark 的发布,不仅展示了投机解码在推理加速上的巨大潜力,也为大模型在资源受限设备上的落地应用铺平了道路。随着开源社区进一步适配和优化,这项技术有望成为大模型推理基础设施中的标准组件。

# LFM2.5 # DSpark # 投机解码 # 推理加速 # 开源模型

来源:Heooo AI工具导航