智谱发布GLM-5.3:后训练驱动性能大幅跃升 封面图
技术进展

智谱发布GLM-5.3:后训练驱动性能大幅跃升

Heooo 08月14日17时03分 28 阅读

「智谱正式发布大模型GLM-5.3,基座参数仍为7400亿,未实现万亿升级,但通过后训练使性能较上代提升50%。在多项基准测试中刷新开源模型纪录,编程与智能体能力逼近Fable 5,已上线官方工具并开放第三方平台抢先体验。」

智谱于近日正式发布大模型GLM-5.3。与外界此前预期的万亿参数升级不同,这一版本的基座参数量仍然保持在7400多亿,与GLM-5.2共用同一套基础架构。但智谱凭借后训练策略,硬是将GLM-5.3的整体性能较上一代提升了50%,在多项主流基准测试中拿下当前开源模型的最高排名,其编程与智能体能力已接近Claude Fable5,编程体感更是超过其他国产模型。

关键基准测试的成绩跃升颇具说服力。在衡量模型于真实终端环境中完成复杂任务的Terminal-Bench3.0上,GLM-5.3的得分从4.6一口气蹿升至28.3;聚焦长程软件工程与持续代码修改能力的DeepSWE v1.1,得分从46.2涨至66.9;覆盖多类真实专业场景、强调跨工具协作与长程任务的Agents' Last Exam,也从23.8提升到28.5。在覆盖44种职业、考察真实高价值知识工作的GDPval-AA v2中,GLM-5.3拿到1769分,展现出基于编程能力涌现出的专业任务执行力。整体来看,GLM-5.3在复杂软件工程、终端操作和更广泛的真实世界Agent任务上均实现了显著进步。

智谱发布GLM-5.3:后训练驱动性能大幅跃升

最能说明问题的是智谱自研的Z.ai Code Bench——这套评估体系将模型塞进真实的本地开发环境,在不同思考档位下执行端到端任务,尽可能还原开发者实际使用Coding Agent时的体感。测试结果显示,GLM-5.3在效果和Token利用率之间找到了更好的平衡:High档位下准确率达到31.4%,超过Claude Opus4.8最高档位的29.5%;而每项任务平均仅输出约5万tokens,Opus4.8则需要约12万tokens——这意味着GLM-5.3能用更短的执行路径完成同样的事。

智谱发布GLM-5.3:后训练驱动性能大幅跃升

产品落地方面,GLM-5.3即日起上线智谱官方编程工具ZCode和效率工具AutoClaw,同步开放给GLM Coding Plan全量用户及订阅用户。TraeWork、TraeCode、扣子、WorkBuddy、CodeBuddy、Qoder、QwenWork、CatPaw、JoyCode、OpenCode等第三方编码平台也开放了抢先体验。API很快上线,完整模型权重将在两周内完成必要的安全加固后开源——智谱的策略是尽可能限制模型的潜在攻击能力,同时保留其防御价值。今天13:00,GLM Coding Plan全员额度已经重置,所有用户后台的用量统计均可看到额度回满。

# GLM-5.3 # 智谱 # 大模型 # 编程能力 # 后训练

来源:Heooo AI工具导航