技术进展

冻结大模型加轻量纠错模块,兼顾能力保持

Heooo 09月16日12时58分 23 阅读

「研究团队提出轻量纠错模块CRN v2,仅约3400万可训练参数,占46.5亿文本模块的0.73%,叠加在完全冻结的Gemma 4 E2B之上。在83400对纠错数据上训练后,它修正53.3%的基座错误且能力基准无退化,而LoRA基线纠错率达83.3%却损失30%到75%能力。」

当一个语言模型已经部署上线,我们还能修正它的输出错误吗?这是一个非常实际的问题:如果为了让模型少犯错而重新训练它,往往会连带破坏它原本已经掌握的能力。最新发布在arXiv上的一项研究,围绕一个具体的设计原则展开验证:用一个小型纠错模块去修正在冻结基座上产生的错误,同时通过损失约束把基座能力牢牢锁住。论文题目为Safe Error Correction for Language Models:Frozen-Base Adjustment with Capability Preservation。

研究团队提出的方案名为CRN v2,是一个工作在词元概率层面的轻量纠错模块,可训练参数约3400万,仅占其下层4.65B文本模块的0.73%。它的宿主是被完全冻结的Gemma 4 E2B模型,基座参数自始至终不参与更新,只有纠错模块在学习。训练流程分为两步:先做监督微调,随后在83400对纠错样本上进行无参考DPO。整个方案的核心思想可以概括为三点:冻结基座、只在词元概率层面纠错、用KL散度锚定原始分布。

评测结果给出了一个相当克制的数字。在名为CEHRI、即Certified Human-Robot Intelligence的60题领域考试中,题目覆盖事实、算术与隐式目标推理三类,CRN v2能够修正基座模型53.3%的错误,改写变体下为43.3%。与此同时,在MMLU与BoolQ这两项能力基准上采样200题、在car-wash任务上采样8题,模型均未出现退化。纠错有效、能力不塌,这正是该方案想要证明的两点。

对比实验揭示了更值得注意的现象。一个预算与CRN v1持平的LoRA基线,参数量660万、秩为19,纠错率高达83.3%,看似远胜CRN v2,但它在同一批能力基准上损失了30%到75%的能力。论文把这一现象称为纠错与能力之间的权衡:如果不加约束地让适配器去拟合错误样本,模型会以牺牲原有知识为代价换取表面上的高纠错率。CRN v2选择了更保守的路线,用更低的纠错率换取能力的完整保留。

消融实验进一步说明约束项的重要性。论文中的KL保持项取λ等于0.1时效果最佳,一旦把它降到0.01,纠错率立刻跌到35.0%。这说明纠错模块并不是参数越多越好,而是需要一条足够强的绳索把它拴在基座分布附近。团队还尝试了多种替代配置:在较早层做隐藏态注入的变体只有160万参数且仅用监督微调,成绩为50.0%与55.8%,仍未能超过词元概率层面的纠错;注入层数更浅、位于第4层时跌到30.0%与28.3%;多深度词元概率纠错约3500万参数,只达到40%;把训练拉长到5000步监督微调加2000步DPO,成绩依旧停在53.3%。所有测试过的替代配置都没有超越秩为128的词元概率纠错结果,这与约53%属于已达成的最佳结果而非能力下限的判断一致。

论文作者特意强调,这项工作的价值在于验证一种设计原则,即冻结基座加词元概率纠错再加KL锚定,而不是宣称架构层面的新颖性。这种表述方式在当下的AI研究里并不常见,却让结论更可信:约53%的纠错率、零能力退化、加上一条清晰的权衡曲线,构成了一个可复现的工程结论。对于需要在已部署模型上做安全纠错的开发者来说,这意味着一条低风险的改造路径。

可复现性方面,团队释放了全部代码、主结果权重以及评测脚本,深度变体部分只提供代码、不提供训练好的检查点。这一安排在保证主结论可验证的同时,也把更激进的实验留给社区自行探索。后续值得关注的方向包括:把纠错模块扩展到更大规模的基座模型上是否依然有效,KL保持项的最优取值是否会随基座规模变化,以及词元概率层面的纠错能否与工具调用、检索增强等其他外部机制协同工作。

# 大模型纠错 # 参数高效微调 # 能力保持 # DPO # 开源模型

来源:Heooo AI工具导航