智谱发布GLM-5.3:最强开源编程模型
「智谱正式推出GLM-5.3,基于相同基座模型通过后训练Scaling显著提升性能,在多项编程与智能体基准测试中登顶开源榜首,两周内将开源模型权重。」
智谱今日正式发布其最新大语言模型 GLM-5.3,该版本在不更换基座模型的前提下,通过大规模后训练 Scaling 实现了显著的能力跃升。据官方介绍,GLM-5.3 是当前编程能力最强的开源模型,在内部评测中较前代 GLM-5.2 提升达 50%,并在多个权威公开基准测试中取得开源模型第一的成绩。
在具体性能指标方面,GLM-5.3 在 Terminal-Bench 3.0 上得分从 4.6 大幅提升至 28.3;在 DeepSWE v1.1 中得分由 46.2 提高到 66.9;在 Agents' Last Exam 测试中也从 23.8 提升至 28.5。此外,在 GDPval-AA v2 职业能力评估中获得 1,769 分,展现出强大的专业任务执行能力。
尤为值得关注的是,GLM-5.3 在真实编程场景中的综合表现优异。基于智谱自研的 Z.ai Code Bench 评估体系,模型在 High 档位下准确率达 31.4%,超越 Claude Opus 4.8 的 29.5%。同时,GLM-5.3 平均每项任务仅输出约 5 万 tokens,远低于 Opus 4.8 的 12 万 tokens,体现出更高的 Token 利用效率和更短的任务执行路径。
除编程能力外,GLM-5.3 在网络安全领域亦有突出表现,其在白盒代码审查与漏洞发现等任务中已持平 Mythos 5,具备面向安全防御场景的应用潜力。所有这些提升均源自后训练阶段的技术优化,依托 IndexShare、SAO 及新一代 Slime 框架,智谱在相同基座上高效推进强化学习,暗示该基座仍有巨大未开发潜能。
目前,GLM-5.3 已上线智谱官方工具 ZCode 与 AutoClaw,并向 GLM Coding Plan 全量用户开放。包括 TraeWork、扣子、Qoder、CatPaw 等多家编码平台也已支持抢先体验。API 即将上线,完整模型权重将在两周内开源,前提是完成必要的安全评估与加固,以限制潜在攻击面并保留其防御价值。
来源:Heooo AI工具导航