强化学习重塑大模型数学推理表征
「最新研究揭示,强化学习(RL)微调的大语言模型在数学推理任务上优于监督微调(SFT)模型,其机制在于RL模型内部形成了更线性可分的表征结构,且深层网络层级更为关键。该发现为理解推理能力起源提供新视角,并指出token分配差异受训练流程整体影响。」
在人工智能领域,大语言模型的推理能力一直是研究热点。近期,一项来自arXiv的研究《Probing the Origins of Reasoning Performance: Representational Quality for Mathematical Problem-Solving in RL vs. SFT Fine-Tuned Models》深入探讨了强化学习(RL)与监督微调(SFT)在数学问题求解上的性能差异根源。研究发现,RL训练能够从根本上重塑模型内部对推理问题的表征方式,从而带来更优的解题表现。
研究团队通过线性探针(linear probes)技术,对模型各层的隐藏状态进行分析。实验结果显示,RL微调模型在预测答案正确性方面,其线性探针的准确率显著高于SFT模型。这意味着RL模型内部形成了更加线性可分、结构化的表征,使得答案的正确与否在表征空间中更容易被区分。这种结构化的表征可能源于RL训练过程中,模型通过试错学习不断优化策略,从而在内部状态中编码了更清晰的解题线索。
进一步的均值消融(mean ablation)实验揭示了模型架构层面的差异。研究发现,RL模型展现出一种层级化的架构特性:深层网络层在推理过程中扮演着越来越关键的角色,而SFT模型则将重要性较为均匀地分布在所有层。这表明RL训练促使模型将推理能力集中到深层抽象特征上,而SFT可能更倾向于利用浅层模式匹配。这种架构上的差异,可能解释了为何RL模型在处理复杂数学问题时更具鲁棒性和泛化能力。
除了表征质量,研究还关注了模型在重复采样下的token分配可变性,以评估自适应计算分配能力。结果显示,部分RL模型在token使用上表现出较高的变异性,而另一些则与SFT模型相当。这一现象暗示,token分配策略可能更多取决于整体训练流程(如数据分布、奖励设计等),而非单纯由RL或SFT方法决定。研究团队认为,这种变异性反映了模型在策略上的确定性程度,有助于识别哪些模型拥有稳定的推理策略,哪些则存在欠定、甚至不可识别的解题行为。
这项研究为理解大模型推理能力的内部机制提供了重要实证。通过对比RL与SFT在表征结构和计算分配上的差异,研究者不仅揭示了RL优势的潜在来源,也为未来优化推理模型提供了方向。例如,若能在SFT阶段引入类似RL的表征约束,或许能提升其推理性能。此外,对token分配变异的分析,也为评估模型策略稳定性提供了新工具。
尽管该研究聚焦于数学推理任务,但其方法论和结论可能推广到其他需要复杂推理的领域,如代码生成、科学问题求解等。随着大模型在更多高价值场景中的应用,理解其内部推理机制将变得越来越重要。这项研究无疑为这一探索迈出了扎实的一步。
来源:Heooo AI工具导航