训练数据划定能力上限:LittleLearner新发现
「LittleLearner项目通过构建仅含美国小学课程内容的88B词元语料,训练从零开始的0.6B至5B模型,并设置未过滤对照组。实验表明,扩展规模、后训练及上下文学习均能提升课程内能力,却无法突破课程外的能力边界,证实预训练数据过滤决定了模型能力的有效天花板。」
大语言模型的能力边界究竟由什么决定?主流观点认为,只要模型规模足够大、训练数据足够多,就能涌现出超越训练分布的能力。然而,LittleLearner项目给出了一项反直觉的实证:当训练数据本身被严格限制在小学五年级水平时,无论后续如何扩展模型规模或进行后训练,模型都难以掌握超出这一知识范围的能力。
该项目构建了一个名为LittleCurriculum的语料库,包含880亿词元,全部来自FineWeb-Edu,并经过五阶段过滤流程,严格对齐美国Common Core标准的K至五年级课程。任何五年级以上教授的概念、事实和词汇都被明确排除。在此基础上,研究者从零训练了三个规模的小模型:0.6B、1.3B和5B参数,每个模型都配备一个使用相同架构、词元和训练配方但使用未过滤语料的对照模型,从而实现了对知识边界的精准控制。
实验的核心问题是:标准干预手段能否让模型突破预训练数据所划定的边界?答案是否定的。研究者分别测试了三种干预方式。首先是模型规模扩展:增加参数量能够显著提升模型在课程范围内的任务表现,也能在一定程度上改善同一学习轨迹上的问题,但对于需要五年级以上能力的任务,规模扩展带来的收益微乎其微。其次是后训练,特别是基于GRPO的数学专项训练。这种后训练方法能大幅提升K至五年级范围内的数学能力,但即使使用超纲数据进行训练,也无法恢复超出K至五年级的能力差距。最后是上下文学习:在测试的提示条件下,上下文学习并没有为5B LittleLearner模型解锁任何超出五年级的推理能力。
这一结果揭示了“激发”与“习得”的根本区别。现代语言模型通常一次性接触所有数据,因此很难判断一个新技能是真实习得还是仅仅被激发。LittleLearner通过将训练分布本身作为受控变量,提供了一个干净的实验环境。研究表明,预训练过滤器设定了模型能力的有效上限,而扩展、后训练和上下文学习实质上只是放大课程内已学到的能力,无法凭空创造超纲能力。
该项目的意义不仅在于理论验证。由于LittleLearner的暴露范围被精确描述,研究者可以将行为变化和表征变化直接归因于所引入的具体概念。项目团队提出了一个激动人心的后续方向:在预训练先验被限制在K至五年级的前提下,如果强化学习过程中涌现出超出该范围的能力,那么这些能力将可以明确归因于强化学习机制本身。这为研究强化学习如何创造能力提供了可控的探针。
目前,LittleLearner已发布三个规模的基础模型、GRPO数学专项变体以及Chatty对话变体,所有模型均可在浏览器中直接体验。对于AI安全、可解释性以及教育领域的研究者而言,这一资源提供了一种前所未有的方式,用来观察知识注入如何塑造模型的行为边界。
来源:Heooo AI工具导航