行业资讯

字节跳动讨论训练超五万亿参数模型

Heooo 08月06日23时33分 35 阅读

「据晚点LatePost消息,字节跳动正讨论训练参数规模超5万亿的模型,超过阿里和月之暗面的现有超大模型,成为国内已知最大规模。该项目由项亮主导,与沈科合作。张一鸣在Seed全员会上安抚团队,反对蒸馏,强调追求智能上限。」

国内大模型竞赛再度升级。据晚点LatePost爆料,字节跳动正在讨论训练一个参数规模超过5万亿的模型,这一数字远超阿里Qwen 3.8-Max的2.4万亿参数和月之暗面K3的2.8万亿参数,成为目前国内已知参数规模最大的模型。通常而言,模型规模越大,智能水平往往越高,不过这一计划目前仍处于早期阶段,尚未进入实质性训练环节。

据悉,该项目将由Seed Foundation负责人项亮主导,并与大语言模型预训练数据负责人沈科合作。项亮本科毕业于中国科学技术大学,博士就读于中国科学院自动化研究所,2016年加入字节跳动,曾负责机器学习中台AML团队,后调任豆包大模型Foundation团队任负责人。沈科2018年从清华大学毕业,同年加入字节跳动,现主要负责大语言模型预训练数据。二人均是字节跳动AI及大模型研发体系内的核心骨干,且都出自字节的“搜广推”体系,在技术积累和工程实践方面拥有深厚基础。

多位字节跳动人士透露,上半年多个Seed团队已开始不断反思,这也是字节讨论训练超5万亿参数模型的原因之一。其中一人直言,把参数规模一次推到同行的数倍来争取领先位置的举措“像一场赌博”。这一评价折射出超大模型训练背后高昂的成本与不确定性,也体现出字节内部对技术路线的复杂心态。

两周前的Seed全员会上,字节跳动创始人张一鸣安抚了团队成员。他认为,训大模型本就是一件很难的事,团队不必过度焦虑。他明确表示,一段时间内可接受模型落后于行业,希望大家以追求智能上限为目标,期待Seed模型能力能跻身世界第一梯队。这一表态在一定程度上缓解了团队的业绩压力,也传递出对长期技术探索的耐心。

值得注意的是,张一鸣还明确表态反对蒸馏。在他看来,蒸馏能在短期内改善模型表现,但本质上仍是在复制Claude已有的能力。沿着这条路走,最多只能不断逼近对方,很难真正实现超越。这一观点反映出字节跳动追求原始创新、避免跟随式发展的战略取向,也预示着未来训练超大规模模型时,团队将更加依赖自研的数据、算法与算力体系。

如果这一计划顺利推进,字节跳动将在模型规模维度上树立新的标杆,但也面临算力供给、训练稳定性和数据质量等一系列挑战。目前业内对超大模型的争论仍在持续,规模是否能直接带来质的飞跃尚无定论,但字节的这一讨论无疑将把国内大模型的竞赛推向新的高度。

# 字节跳动 # 大模型 # 5万亿参数

来源:Heooo AI工具导航