技术进展

门控衰减在线蒸馏提升OCR转写忠实度

Heooo 10月01日12时01分 13 阅读

「视觉语言模型常把图像中的异常文本改写成通顺表述,损害OCR转写忠实度。论文提出GAD-RL,依据学生当前任务表现与局部分布自适应调节教师监督,高水平响应组直接关闭蒸馏并随组平均奖励上升持续衰减力度,还用学生对教师Top-1词元的概率加权前向KL。在Qwen3.5-2B上,CHAOS-Bench微平均召回达59.92%,较GRPO与GRPO+OPD分别高8.45和4.43个百分点,OmniDocBench v1.6总体得分91.18。」

视觉语言模型在文档理解与文字识别任务中展现出越来越强的能力,但它们也带来一个隐蔽的问题:当图像中的文字本身存在异常、拼写错误或不符合语言习惯时,模型往往会顺手把它改写成读起来通顺的表述。这种改写虽然让输出更符合语言直觉,却直接损害了OCR转写的忠实度——用户拿到的文本不再等同于图像中真实存在的内容。围绕这一问题,一篇来自arXiv的论文提出了名为GAD-RL的训练方法,试图在保持模型语言能力的同时,让转写结果更忠实于原图。

论文指出了一个关键矛盾:序列级任务奖励与局部教师指导在联合后训练中具有互补性,但来自同一个固定教师的监督,并不会随着学生模型的进步而始终同样有效。离线分析显示,无论是跨越不同的训练检查点,还是在任务奖励各异的响应组之间,固定教师提供的监督都会随着学生能力的提升而逐渐变得不那么有利。换句话说,学生越强,教师手把手的指导反而可能成为限制。

基于这一观察,作者提出GAD-RL,在联合后训练过程中,依据学生当前的任务表现与局部分布,自适应地调节教师监督的力度。具体做法上,一个冻结的教师模型以参考转写和学生生成的前缀为条件进行指导。当某个响应组中出现任务奖励至少达到0.95的输出时,GAD-RL会直接关闭该组的蒸馏;随着组平均奖励的上升,蒸馏强度被持续衰减,让学生逐步摆脱对教师的依赖。此外,方法还用学生对教师Top-1词元的预测概率对前向KL散度进行加权,当学生对该候选词元的支持度较低时,缓和局部辅助更新的幅度,避免强行把学生拉向教师分布。

实验结果验证了这种动态调度的有效性。在Qwen3.5-2B模型上,GAD-RL在CHAOS-Bench上取得了59.92%的微平均召回率,分别比GRPO和采用固定权重的GRPO+OPD高出8.45和4.43个百分点;在OmniDocBench v1.6上,其总体得分为91.18。

从技术思路看,GAD-RL的价值不只是刷新了几个基准数字,而在于它把教师该在什么时候退出变成了一个可以依据训练信号动态决策的问题。传统的在线策略蒸馏通常使用固定权重,教师的影响贯穿整个训练过程,这在学生已经接近甚至超过教师在特定样本上的水平时会造成不必要的约束。门控与衰减机制则提供了一种更细粒度的控制方式:对已经做得很好的响应组停止蒸馏,对整体表现提升的组逐步减弱指导,对个别词元上的分歧保持谨慎。这种设计让强化学习信号与蒸馏信号之间的配比随训练进程变化,而不是事先写死。

对于文档解析、票据识别、表格与公式抽取等多模态应用而言,转写忠实度是下游数据质量的基础。任何一次自作聪明的改写,都可能在后续的检索、审核或结构化流程中被放大。GAD-RL所代表的思路,即用学生的实时表现来决定监督强度,为这类场景提供了一个可借鉴的训练范式,也提示研究者:在联合后训练中,教师并非越强越好、越久越好,如何安排监督的生命周期同样值得深入研究。

# OCR # 在线策略蒸馏 # 视觉语言模型

来源:Heooo AI工具导航