技术进展

分词边界的压缩代价与预测权衡

Heooo 09月30日12时29分 19 阅读

「研究量化了预分词的边界压缩代价,通过有无正则边界规则夹逼最小词元数,并以最短路径与线性规划松弛给出可验证证书。英语维基百科上边界使最优词元数增加28.3%至36.8%,字节对编码比不受限下界高出10.9%。研究还发现压缩与预测偏好不同词典,并提出边界许可证机制。」

在大型语言模型的训练流程中,预分词往往被视为一个不起眼却影响深远的前置步骤。它决定了哪些文本片段有资格成为预测单元,从而在源头上限定了模型所能操作的基本单位。以往的研究大多在相同的边界设定下比较不同分词器,这使得边界本身带来的压缩代价被掩盖。一篇最新提交到arXiv的论文《The Price of Token Boundaries: Compression Certificates and Prediction》尝试把这份代价单独剥离出来,并给出可验证的量化结论。

研究者的思路是从两侧同时逼近最小词元数量:一侧允许文本片段自由切分,另一侧则施加正则表达式定义的边界规则。通过对词元出现位置赋予非负价格,可以借助最短路径构造出一个下界;在词表预算的约束下对全部价格取最大值,恰好恢复线性规划松弛的解,而一个独立的整数检查器则负责认证所报告的数值。这套证书机制的意义在于,它让压缩代价的估计不再是经验性的观察,而是带有可证明边界的结论。

在英语维基百科的语料上,实验给出的数字相当直观:边界规则使最优词元数量上升了28.3%到36.8%。作为最常用的子词算法,字节对编码的表现介于两个下界之间,它比受约束的下界高出2.1%,但比不受约束的下界高出10.9%。这组对比说明,常用分词器在边界约束下已经接近理论极限,可一旦解除边界限制,其压缩效率仍有明显的提升空间。

更值得关注的是论文揭示的一处张力:压缩与预测偏好不同的词典。在非嵌入参数为85M、训练词元预算相匹配的条件下,不受约束的拟合方式在同一个不受约束解码器下,于配对研究的全部12种语言中都取得了更低的平均留出比特每字节;而在独立调优与评估的设置下,这一优势出现在12种语言中的11种。换言之,把边界放开虽然能带来更好的压缩率,但压缩率的改善并不自动等同于预测质量的提升,两者需要分开评估。

为了探索介于两者之间的中间策略,作者引入了边界许可证的概念。这一机制限定哪些词表条目被允许跨越切分点,并且同样可以给出上述形式的证书。在独立的英语与中文拟合语料上,仅仅许可10%的词表预算,就能分别恢复从去除所有切分中所获得词元数量减少量的85.2%和100.0%。其中中文语料上的完全恢复尤其引人注意,暗示不同语言对边界约束的敏感程度存在差异。

从工程实践的角度看,这项工作把分词器设计中长期存在的一对矛盾清晰化了:更自由的切分有利于压缩,却未必有利于预测。论文提供的证书框架为评估分词方案提供了新的标尺,也让边界政策从一种默认的工程约定,变成可以按比例调节并且可被独立验证的设计变量。对于正在构建多语言模型、需要在词表规模与训练效率之间做取舍的团队而言,这类可量化的权衡依据具有直接的参考价值。

# 分词 # 压缩 # 语言模型 # 词表 # 技术研究

来源:Heooo AI工具导航