小米MiMo-V3采用全新架构
「小米MiMo大模型负责人罗福莉宣布,MiMo-V3即将采用全新架构,核心HySparse 2正式发布。在1M Token长度下,预填充计算量降低5.02倍,KV缓存缩小4.5倍,MRCRv2与RULER-v2评分更高,AgentPPL与LongPPL更低,面向智能体推理优化长上下文成本与检索准确率。」
小米 MiMo 大模型负责人罗福莉发文宣布,MiMo-V3 即将采用全新架构,其核心组件 HySparse 2 于今日正式发布。官方表示,新架构带来更少的预填充、更小的 KV 缓存以及更出色的长上下文检索能力。
从公开数据看,HySparse 2 的优化幅度相当可观:
在 1M(100 万)Token 长度下,预填充计算量(FLOPs)降低 5.02 倍;
在 1M Token 长度下,KV 缓存缩小 4.5 倍;
同时取得更高的 MRCRv2 和 RULER-v2 评分,AgentPPL 与 LongPPL 则更低。
罗福莉指出,智能体(Agentic)推理是一种截然不同的工作负载。每一轮交互中,一个简短的动作可能返回需要进行预填充的长文本观察结果,同时上下文还在不断增长。这使得预填充成本、KV 缓存大小和检索准确率同时处于关键路径上,也解释了为何 MiMo-V3 要在架构层面重新设计注意力与缓存机制。
HySparse 2 采用了两项关键设计。其一是 KV 桥接(KV Bridging),遵循 YOCO 思路,交叉解码器(cross-decoder)中的全注意力层利用自解码器(self-decoder)的隐藏状态构建其 K/V。其二是 KV 重用(KV Reuse),在每个混合块内,稀疏层复用前一层全注意力层的 KV 缓存和选择索引。
此外还有两项改进:采用 Token 级别的选择来替代块(block)级别的选择,并用近期 Token 的强制窗口来替代独立的 SWA 分支,从而让本地和全局 Token 共享同一个 KV 缓存。由于所有交叉解码器 KV 缓存现在都来自自解码器,因此预填充在自解码器完成时即可停止,这进一步压缩了长上下文场景下的端到端延迟。
在此之前,小米刚刚发布并开源了全新的 Xiaomi MiMo-V2.6 系列,包含 Pro 与 Flash 两个原生全模态模型。小米称这是其探索 RSI(递归自我改进)路径的关键一步,通过规模化扩展强化学习算力,让模型在持续的探索与反馈中拓展智能边界。从全模态开源模型到长上下文稀疏架构,小米 MiMo 团队正在同时推进模型能力与底层效率两条路径,而 HySparse 2 在预填充算力与显存占用上的收益,也为智能体场景下的长程交互提供了更具可行性的技术基础。
来源:Heooo AI工具导航