Grokking泛化转变时间符合幂律标度规律
「一项发表于arXiv的研究在模运算任务上扫描384种两层感知机配置,首次为Grokking泛化出现时间拟合出幂律标度关系,决定系数达0.732。结果显示数据复杂度而非模型容量主导转变,权重衰减约1.0处存在尖锐相边界。」
深度学习理论中长期存在一个引人注目的现象:神经网络在训练数据上早已实现近乎完美的记忆,却要经过漫长的时间才突然转向泛化,这一延迟转变被称为Grokking。尽管研究者已经对转变为何发生提出了多种理论解释,但转变究竟何时发生、在超参数空间中呈现出怎样的定量结构,一直缺乏系统刻画。一篇发表于arXiv的最新论文给出了答案。
该研究在模运算任务上系统扫描了384种配置的两层隐藏层多层感知机,覆盖隐藏层宽度、数据复杂度、学习率与权重衰减四个关键维度,并首次为泛化出现时间拟合出幂律标度关系:泛化时间与隐藏层宽度的负0.27次方、数据复杂度的负2.04次方、学习率的负0.50次方以及权重衰减的负0.64次方成正比,决定系数为0.732;在引入变量之间的交互项后,决定系数提升至0.821。
更值得关注的是各指数之间的层级关系。数据复杂度以负2.04的指数成为状态转变的主导驱动因素,而模型容量的指数仅为负0.27。研究给出的直观换算十分清晰:数据规模翻倍可以让泛化提前约4倍,而隐藏层宽度翻倍只能带来约1.2倍的加速。这一结果对“更大的模型自然更快泛化”的直觉构成了直接挑战,说明在Grokking这类结构化任务上,训练数据的丰富程度远比参数规模更能决定模型何时跨过泛化门槛。
研究还揭示了一个尖锐的相边界:当权重衰减超过约1.0时,配置会从非Grokking区域突变为Grokking区域,边界清晰而非渐变。与此同时,权重范数轨迹在转变过程中呈现单调压缩,这与隐式正则化倾向于选择低复杂度解的解释高度一致。作者由此认为,泛化转变不仅是优化动力学的产物,更是复杂度控制机制在起作用的结果,网络在训练中被逐步压向更简洁的求解方案。
从方法论角度看,这项工作的价值在于把定性现象转化为可预测的定量规律。既然泛化出现时间可以写成超参数的幂律函数,实践者就能够据此估算训练预算、设计学习率与权重衰减的调度策略,甚至主动控制模型在记忆与泛化之间切换的时点。对于在过参数化网络上开展训练的研究者与工程团队而言,这提供了一套可操作的预测与调控基础,也为判断某组超参数究竟会落入记忆区还是泛化区给出了明确的判据。
当然,该结论建立在小规模两层感知机与模运算任务之上,幂律指数能否迁移到Transformer架构、大规模预训练以及自然语言任务,尚待进一步验证。不同任务的数据复杂度度量方式如何定义,也可能影响标度关系的普适性。但幂律形式的成立本身已经表明,Grokking并非随机的训练巧合,而是具有稳定标度结构的相变现象,值得在更广泛的模型与任务上继续检验。
来源:Heooo AI工具导航