技术进展

马斯克:Grok 4.8 本周完成训练,参数达 2.5 万亿

Heooo 09月14日15时34分 43 阅读

「马斯克在 X 平台透露,Grok 4.8 参数量达 2.5 万亿,由一套全新 C++ 软件栈训练而成,将在本周完成训练并随即启动强化学习阶段。此前 Grok 4.7 曾因强化学习回复长度惩罚过重导致延期,该权衡成为后训练阶段的关键难点。」

xAI 首席执行官埃隆·马斯克在 X 平台透露,新一代模型 Grok 4.8 的参数量达到 2.5 万亿,并且是用一套全新的 C++ 软件栈训练出来的。按照他给出的时间节点,Grok 4.8 将在本周完成训练,随后立即启动强化学习阶段。

2.5 万亿参数量在当下的大模型竞赛中属于第一梯队的规模。参数规模的抬升意味着模型具备更强的容量去吸收训练语料中的模式,但同时也把训练框架的效率、显存调度与并行通信推到了更严苛的位置。马斯克特意强调全新 C++ 软件栈,指向的正是这一层:训练框架的底层实现长期以 Python 接口加高性能内核的组合为主,把更多环节下沉到 C++ 侧,通常是为了降低调度开销、提升算子执行与通信效率,让大规模集群的算力尽可能落在有效计算上,而不是消耗在框架本身。

值得关注的是训练与强化学习的衔接节奏。Grok 4.8 完成预训练后直接进入强化学习阶段,说明基础模型的能力定型已经让位给后训练的对齐与推理能力打磨。而在这一环节上,xAI 此前已经踩过一次坑。

马斯克此前曾公开表示 Grok 4.7 会在 9 月 12 日发布,随后又改口称可能需要再过几天才能正式推出。他给出的延期原因颇为具体:强化学习阶段的回复长度惩罚设置得过重,模型因此倾向于过早放弃困难任务,也学不会严谨地回查自己的工作。这等于在训练流程里卡了一道必须调通的坎。

这条信息其实揭示了大模型后训练中的一个典型权衡。长度惩罚的初衷是抑制冗长、啰嗦的输出,但一旦权重压得过重,模型会把少说当成最优策略,遇到需要多步推理、反复验证的难题时选择提前收尾。对于以推理能力为卖点的模型而言,这种倾向会直接削弱其在复杂任务上的表现。把它调回合理区间,同时保留对冗余输出的约束,正是强化学习阶段最需要精细打磨的部分。

从 Grok 4.7 的延期到 Grok 4.8 的训练收尾,这条产品线眼下正处在密集迭代的状态。参数量与软件栈的同步升级,加上强化学习阶段的反复调参,也让外界对 Grok 4.8 的实际表现有了更多观察点。

# Grok # xAI # 大模型训练

来源:Heooo AI工具导航