技术进展

上海AI Lab提出NCP预训练新范式

Heooo 09月22日19时35分 36 阅读

「上海人工智能实验室与上海交通大学LUMIA Lab提出全新预训练任务下一个概念预测(NCP),并发布89亿参数离散隐空间基座模型NCP-ArchPreview。该模型仅用约51%的Token预算就追平OLMo-3-7B的预训练Loss,下游综合表现领先2分以上,GSM8K涨近6分,全部资产已开源。」

逐词预测长期占据大模型预训练任务的主流位置,而上海人工智能实验室与上海交通大学人工智能学院LUMIA Lab团队提出了一种新的思路:下一个概念预测(NCP)。团队同时发布了首个89亿参数规模的离散隐空间基座模型NCP-ArchPreview,为预训练效率提供了一个新的参考坐标。

从训练账本看,这组数字颇具说服力。NCP-ArchPreview基于约5万亿Token的Dolma-3语料进行预训练,却只消耗约51%的Token预算,就追平了OLMo-3-7B的最终预训练Loss,等效收敛速度提升接近两倍,计算帕累托效率提升超过七成。到了下游任务上,模型综合表现领先2分以上,其中GSM8K数学推理成绩提升近6分。换句话说,别人烧完一整箱算力才能到达的位置,它半箱油就到了。

模型的骨架是一条三段式隐空间概念处理流水线。它先用乘积量化构建起一个超大的离散概念表征空间,再通过可微的下一个概念预测、因果防泄漏反馈机制和分层残差路由,实现对未来概念的显式建模。也就是说,模型不再是盯着下一个词硬猜,而是先想清楚下一个概念长什么样。这种转向隐空间概念预测的做法,从机制层面改变了逐词预测的范式。

惊喜并不止于预训练阶段。团队发现,只微调1700万隐空间参数就能超越LoRA,而且没有遗忘的老毛病;训练吞吐量提升的同时,显存占用反而下降。把这个概念表征注入草稿模型后,推测解码的平均接受长度提升超过4%,在代码任务上更是涨到7%以上,为推理加速打开了一条新路。

技术报告中,团队还大方分享了踩坑经验与相应解决方案,构建了千亿级代理指标筛选机制,并把包含全程阶段性Checkpoint、评测框架在内的全部资产一并开源。对于希望在模型微调和推理加速上寻找新突破口的研究者而言,这套隐空间思路相当于一份刚出炉的路线图,既给出了可复现的技术细节,也指出了后续可以继续探索的方向。

# NCP # 隐空间模型 # 预训练范式 # 开源

来源:Heooo AI工具导航