技术进展

小米公开MiMo-V3核心架构HySparse2

Heooo 09月24日22时02分 31 阅读

「小米 MiMo 公开面向 MiMo-V3 的核心架构 HySparse2,瞄准下一代长上下文 Agent。新架构引入两级 KV 共享、token 级稀疏选择与统一的局部信息访问,让模型以更低成本处理网页、文件和工具调用记录。在 49 层模型中,Prefill 只需执行前 25 层,模型权重存储接近减半。」

小米 MiMo 团队正式公开面向 MiMo-V3 的核心架构 HySparse2。官方介绍显示,这一新架构瞄准下一代长上下文 Agent,目标是让模型以更低成本处理网页、文件、代码与工具调用记录,并能从不断增长的任务历史中更准确地检索关键信息。

HySparse2 的出发点,是长程多轮 Agent 任务对注意力机制提出的三重需求。
高效读入,减少处理长输入所需的计算,让模型尽快进入下一轮生成;
节省显存,降低 KV Cache 占用,让不断增长的历史更容易保留;
精准检索,从长历史中找出相关证据,完成跨轮次的信息整合。

回顾技术路线,从 Xiaomi MiMo-V2 系列开始,团队持续探索模型能力与计算效率的共同提升。MiMo-V2 系列采用的 Hybrid SWA 混合注意力架构,将全注意力 Full Attention 与滑动窗口注意力 Sliding Window Attention 结合,在保持模型效果的同时让训练和推理更加高效。过去半年,团队持续推进强化学习技术的探索与试验,并将积累的训练经验应用于近期发布的 MiMo-V2.6 系列。此前公开的 HySparse,正是这条探索路线上的第一步。

第一代 HySparse 用少量 Full Attention 层提供 KV Cache 与重要位置的选择结果,让后续 Sparse Attention 层直接复用,从而降低注意力计算与缓存开销。但在该架构中,Prefill 仍然需要执行所有层,面对多轮、长距离的信息检索,块级选择在精度上也有进一步提升的空间。

HySparse2 围绕这些问题引入三项关键改动。其一是两级 KV 共享,借鉴 YOCO 的设计,模型被分成前后两部分,前半部分 Self-Decoder 采用 Full Attention 与 SWA 的混合结构,后半部分 Cross-Decoder 采用 Full Attention 与 Sparse Attention 的混合结构。KV 共享分为 KV Bridging 与 KV Reuse 两个层次。后半部分每个 Full Attention 层都从前半部分对应 Full Attention 层的输入隐藏状态中生成自己的 KV Cache,并保留独立的 K/V 投影,因此即使使用同一份源隐藏状态也可以构建不同的 KV,缓存不必等到输入逐层经过它们之后才能得到。而在每个由一层 Full Attention 与随后多层 Sparse Attention 组成的 Hybrid Block 内,全注意力层在完成自身计算时同步选出重要位置,后续稀疏层直接复用它的 KV Cache 与选择索引,无需额外训练一个独立的选择器。

其二是从块级选择走向 token 级选择。Agent 所需的线索可能分散在不同轮次的对话、工具结果与代码片段中,块级稀疏为了选中一个重要 token,往往会把周围一整块内容一并纳入计算。HySparse2 改为 token 级选择,让同样的注意力预算更精细地分配到这些位置。官方数据显示,在相同全局 token 预算下,token 级选择在 RULER-v2、多轮检索 MRCR-v2 与图推理 GraphWalks 上均获得提升,验证了更细粒度选择对这类任务的价值。

其三是局部窗口与全局检索的合并。HySparse2 会强制选中最近的 128 个 token,再从窗口外选择 1024 个全局 token,两部分共同读取 Full Attention 层提供的共享 KV Cache。稀疏层因此不再需要单独的 SWA 分支与局部 KV Cache,原本由独立分支承担的局部信息访问,被合并到同一次稀疏注意力计算里。这也解除了一项关键依赖:独立 SWA 分支的缓存原本来自该层自己的隐藏状态,构建它需要继续执行后半部分 Cross-Decoder 的计算;合并后,局部与全局信息都能使用在 Self-Decoder 阶段就已准备好的 KV。消融实验显示,强制局部窗口在多项长文任务上保持竞争力,部分指标也存在取舍,同时省去了独立 SWA 分支的投影参数与 KV Cache 开销。

这些改动带来了 Prefill 的提前退出。在 49 层的模型中,Prefill 只需执行前 25 层 Self-Decoder 以及桥接 KV 投影,其中只有一层 Full Attention。在 Prefill 与 Decode 分离部署时,Prefill 节点只需部署这部分 Self-Decoder 网络,所需的模型权重存储接近减半。生成阶段仍然保留完整网络,继续使用后半部分的全局检索与建模能力。这让优化从减少注意力计算,进一步延伸到缩短长输入经过模型的计算路径。

官方还在 80B-A3B MoE 模型上,使用相同的数据与训练流程,对比了 Hybrid SWA、HySparse 与 HySparse2 三种方案,三者采用相同的 MoE 设计。这一对比从计算成本、推理速度与长文表现等维度,检验新架构在真实规模模型上的收益。

# 小米MiMo # HySparse2 # 长上下文 # 注意力架构

来源:Heooo AI工具导航