熵感知路由革新无分词器大模型
「最新研究提出EntropyMoE架构,将混合专家模型应用于无分词器的字节级大语言模型。该架构利用补丁熵作为路由坐标,动态分配专家计算资源,在字节级模型上实现最低的每字节比特数,同时保持下游任务准确率,为稀疏条件计算开辟了新路径。」
近年来,字节级大语言模型通过将字节动态分组为可变大小的补丁,使无分词器建模逐渐具备了与传统分词器模型相当的竞争力。然而,现有字节补丁架构对所有补丁采用相同的稠密前馈计算,这种统一计算方式无法根据补丁的语义和粒度差异灵活调整模型容量,造成了计算资源的浪费。
针对这一局限,研究团队提出了EntropyMoE架构,一种专为动态字节补丁设计的混合专家(MoE)模型。EntropyMoE的核心创新在于,用Top-K专家层替换了全局补丁Transformer中的稠密前馈模块,每个动态补丁作为专家路由的基本单元,其字节覆盖范围决定了工作量贡献的统计方式。路由器的选择依据直接来自补丁熵,即驱动动态补丁构建的同一种粒度信号,从而以统一的逻辑组织稀疏计算。
这一设计的巧妙之处在于,补丁熵和补丁长度共同定义了用于调控专家专业化的特征空间。补丁熵反映了该补丁内信息的复杂程度,高熵补丁可能包含丰富的语义变化,低熵补丁则相对规则。通过将熵作为路由坐标,模型能够将语义相关的补丁分配给相同的专家,使不同专家天然地形成对不同复杂度模式的专门处理能力。这种基于熵的路由机制,绕过了传统分词器对文本的固定切分,直接从原始字节流中学习自适应计算分配策略。
实验结果表明,EntropyMoE在保持与基线相当的下游任务准确率的同时,取得了最低的保留每字节比特数。这一指标是衡量字节级语言模型对数据压缩和预测能力的关键参考,更低的比特数意味着模型能够更高效地建模字节序列的内在结构。稀疏基线方法虽然降低了计算开销,但往往在建模精度上有所牺牲;稠密基线虽然精度较高,但计算成本居高不下。EntropyMoE则通过熵感知的稀疏路由,在两者之间取得了更优的平衡。
该研究的价值在于,它首次验证了补丁熵可以作为一种有效的路由坐标,用于指导稀疏条件计算。传统混合专家模型通常依赖于分词器产生的词元表示,而EntropyMoE将这一范式拓展到了无分词器的字节表示上。这不仅为字节级模型引入了动态计算分配的潜力,也为未来设计更高效、更可扩展的无分词器语言模型提供了新的思路。
随着模型规模不断增大,如何合理分配计算资源成为大语言模型发展的关键挑战。EntropyMoE通过将动态补丁构建与专家路由统一在熵这一单一信号之下,为模型自适应计算提供了优雅而简洁的解决方案。未来,这一方法有望与更多动态神经网络架构结合,推动字节级建模向更高效、更智能的方向演进。
来源:Heooo AI工具导航