MoE模型层间敏感性研究揭示深度感知掩蔽策略
「一项针对Qwen3.6-35B-A3B混合专家模型的系统性研究发现,MoE层对专家掩蔽的敏感性呈显著深度依赖性:晚期层容忍激进掩蔽,而早期层高度脆弱。在XLCoST基准上,仅掩蔽极晚期层640个专家即可保留419/500个高质量输出,为深度感知的MoE模型压缩提供了实证基础。」
混合专家(Mixture-of-Experts,MoE)架构通过稀疏激活机制在扩展大语言模型参数规模的同时保持计算效率,已成为大规模模型部署的主流技术路线之一。然而,MoE模型中不同层对模型整体性能的贡献差异尚未得到充分刻画,这为模型压缩和结构化剪枝带来了额外的复杂性。近日,一篇发表在arXiv上的研究论文以Qwen3.6-35B-A3B模型为对象,系统性地探索了MoE模型各层在高强度专家掩蔽下的行为差异,提出了一种基于幅度感知的深度相关敏感性分析框架。
该研究选用的Qwen3.6-35B-A3B模型包含40个MoE层,每层配置256个专家,采用top-8路由机制。研究团队基于XLCoST跨语言代码翻译基准进行多阶段实验,分别在100、300和500条提示的评估规模下展开分析,并使用三台H100 GPU服务器支撑整个实验流程。通过幅度化专家掩蔽技术,研究者能够精确控制被遮蔽的专家集合,从而量化每一层对模型输出质量的贡献弹性。
实验结果显示,MoE层的敏感性呈现出高度显著的深度依赖性。从整体趋势看,位于网络前端的早期层(第0至第9层)以及中段层(第10至第29层)对专家掩蔽极为敏感,即使在较低掩蔽率下也会导致输出质量的明显下降。相比之下,深层区域,尤其是第35至第39层的极晚期层,展现出较强的鲁棒性,能够容忍对低幅度专家的大规模遮蔽而几乎不损失性能。
这一结论在对比实验中得到了更加直观的体现。当对全部40层统一施加30%的专家掩蔽时,在300条提示的评估规模下,模型仅能保留150个被标记为Good或Similar的质量输出。而采用晚期聚焦策略时,研究团队在掩蔽640至1,145个专家的条件下,成功保留了249至255个高质量输出,性能表现远超全层均匀掩蔽方案。进一步在500条提示的保留验证集上进行测试后,极晚期窄带策略(仅处理第35至第39层,掩蔽比例为50%)展示了最佳的“质量保持与专家掩蔽数量”权衡,在掩蔽全部10,240个专家中的640个时,依然能留下419个Good或Similar输出。
除专家掩蔽实验外,研究团队还对top-k路由宽度缩减进行了初步探索。将每token激活的专家数从8个削减至6个,在100条提示的探针测试中观察到了显著的墙钟时间下降,且未出现Good或Similar输出的数量损失。不过,作者也指出,这一路由宽度缩减方案目前尚无法与激进的专家掩蔽策略进行无缝组合,两者之间的协作机制仍需要更深入的探索和优化。
该研究的意义不仅在于揭示了MoE模型层间敏感性的非均匀分布,更在于为后续的实体权重手术、基于激活的专家打分及训练恢复等实践路径提供了实证基础。通过识别哪些层更适合承担激进压缩,研究者可以设计出更具针对性的模型剪枝与量化方案,从而在维持生成质量的同时大幅降低推理开销。这一深度感知的MoE专家掩蔽框架,有望为下一代大语言模型的高效部署提供一条结构化的技术路径。
来源:Heooo AI工具导航