自对弈微调突破电子表格公式生成瓶颈
「研究人员提出FormulaSPIN框架,通过自对弈微调突破自然语言生成电子表格公式的精度瓶颈。该框架利用公式可执行性作为隐式监督信号,解决传统自对弈方法因执行等价变体而产生矛盾梯度的问题。通过将训练建模为双人博弈,并引入ExecVote投票机制,FormulaSPIN在NL2FORMULA基准上达到74.9%精确匹配率和87.1%执行准确率,超越传统监督微调与前沿闭源模型,展示了自对弈在数据稀缺任务中的潜力。」
电子表格应用在全球拥有数亿用户,但编写公式仍然是许多人的主要障碍。现有方法依赖静态监督数据,这种数据在有限的标注样本上会迅速饱和,导致模型性能难以持续提升。针对这一问题,来自学术界的研究团队提出了FormulaSPIN——一种自对弈微调框架,通过迭代自我改进打破监督微调的天花板,且无需额外数据。
传统自对弈方法(Vanilla SPIN)在此任务上表现不佳:它会对每一个不匹配的输出施加统一惩罚,导致执行上等价的替代方案在一个样本中被当作负例,而在另一个样本中却作为真实答案出现,从而产生相互矛盾的梯度信号。FormulaSPIN的核心创新在于充分利用公式生成任务的独特优势:公式的二进制可执行性提供了隐式监督,能够将语义错误与有效的风格变体区分开来。
具体而言,研究人员将训练过程建模为一个双人博弈:主玩家学习优先选择真实公式而非其先前版本生成的公式,同时执行反馈将输出按不同粒度进行排序——从而实现一种自适应课程学习策略,该策略从语义正确性逐步过渡到风格优化。为了进一步提升准确率,框架还引入了ExecVote机制,这是一种语义级别的投票机制,能够自然地处理多种有效的公式表述。
在多个基准上的实验表明,FormulaSPIN达到了当前最优性能:在NL2FORMULA数据集上,其精确匹配率达到了74.9%,执行准确率高达87.1%。这一表现与使用额外偏好标注训练的模型相当,同时显著优于传统监督微调方法和前沿闭源模型。这些结果强调了自对弈在应对数据稀缺任务方面的潜力,并为将其扩展到可执行领域之外打开了大门。
从技术演进的角度看,FormulaSPIN的提出具有多重意义。首先,它解决了自然语言到代码生成任务中一个长期存在的痛点:即如何在不依赖大量人工标注的情况下持续提升模型质量。传统监督微调依赖于静态数据集,一旦模型在这些数据上达到饱和,性能便难以突破。而自对弈方法通过让模型与自身历史版本对抗,能够不断发现并修正自身弱点,从而实现持续进化。
其次,FormulaSPIN巧妙利用了电子表格公式的“可执行性”这一天然优势。在一般代码生成任务中,判断两个输出是否语义等价往往需要复杂的语义分析或测试用例。而对于电子表格公式,只需执行即可验证其是否产生相同结果。这种二进制反馈信号为自对弈训练提供了清晰、无歧义的指导,避免了传统方法中因风格差异而产生的矛盾梯度。
ExecVote机制的引入也值得关注。在实际应用中,同一个自然语言描述往往对应多个正确的公式写法,例如使用不同函数实现相同计算。ExecVote通过聚合多个候选公式的执行结果,能够自动识别出语义等价的不同表述,从而更准确地评估模型输出质量。这种机制不仅提升了最终准确率,也为模型提供了更丰富的学习信号。
从实用角度看,FormulaSPIN的高执行准确率意味着用户可以用自然语言描述需求,系统就能可靠地生成正确公式。这有望大幅降低电子表格的使用门槛,让非技术用户也能高效完成数据处理任务。同时,由于框架无需额外标注数据,企业可以基于现有历史数据快速部署定制化公式生成模型,降低落地成本。
研究团队表示,FormulaSPIN的成功不仅限于电子表格领域,其核心思想——利用任务内在的可执行性作为隐式监督信号——可以推广到其他具有可验证输出的场景,如SQL查询生成、数学公式推导或配置脚本编写。这为自对弈方法在更广泛的AI应用中发挥作用提供了新的可能性。
来源:Heooo AI工具导航