GLM-5.3发布:后训练Scaling登顶开源编程 封面图
技术进展

GLM-5.3发布:后训练Scaling登顶开源编程

Heooo 08月14日15时35分 25 阅读

「智谱发布GLM-5.3,基座模型不变,仅通过后训练阶段的Scaling显著提升性能。新模型在多项编程与智能体基准测试中表现亮眼,成为当前最强开源编程模型,并将在两周后开放完整权重。」

智谱今日正式推出 GLM-5.3,这一版本的最大亮点在于——未更换基座模型,所有性能提升均来自后训练阶段的 Scaling 策略。通过数十倍规模的长程任务环境、更丰富的环境类型以及超长的后训练时间,团队成功在同一基座上显著抬高了模型的智能上限。


内部评测显示,GLM-5.3 的编程体感相较 GLM-5.2 提升约 50%,一跃成为当前开源领域中编程能力最强的模型。在多个权威公开基准测试中,其成绩同样令人瞩目:Terminal-Bench 3.0 得分从 4.6 跃升至 28.3,DeepSWE v1.1 从 46.2 升至 66.9,Agents' Last Exam 从 23.8 提高到 28.5,GDPval-AA v2 更是达到了 1769 分。


GLM-5.3发布:后训练Scaling登顶开源编程

尤为值得注意的是,GLM-5.3 在 Terminal Bench 3.0 与 Agents' Last Exam(CLI)两项测试中拿下开源第一,其整体编程与智能体能力已接近闭源旗舰模型 Claude Fable 5,体感明显优于其他国产模型。


智谱强调,上述全部提升均源于后训练优化,而非更换模型架构或扩大参数量。依托 IndexShare、SAO 及新一代 Slime 框架,团队在与 GLM-5.2 完全相同的基座上高效推进强化学习,并指出“可能远未开发出这个基座的智能上界”。这一思路为大模型发展提供了新路径:不必一味堆参数,把已有底座“练透”同样能逼近技术前沿。


GLM-5.3发布:后训练Scaling登顶开源编程

在安全能力方面,GLM-5.3 在白盒代码审查与漏洞发现等任务中表现与 Mythos 5 持平,展现出在网络防御场景中的应用潜力。智谱表示,将在发布两周后开放完整模型权重,但前提是完成安全评估与模型加固,以限制潜在攻击能力、保留防御价值。


与此同时,新模型已上线官方编程工具 ZCode、AutoClaw 及 GLM Coding Plan,并面向 Trae、扣子、WorkBuddy / CodeBuddy、Qoder 等主流编码平台开放抢先体验。随着开源模型在编程赛道逼近闭源旗舰,国产大模型的竞争焦点正从“谁更会说话”转向“谁更会干活”。

# GLM-5.3 # 开源模型 # 后训练Scaling # 编程能力 # 智谱AI

来源:Heooo AI工具导航