技术进展

智谱GLM公开首个递归自我改进工程实践

Heooo 09月17日22时01分 41 阅读

「智谱 GLM 公开递归自我改进方向首个工程化实践,由 GLM-5.3 驱动的 Infra Agent 在超 10 万张国产芯片集群上从零搭建生产级推理服务,不到两周把端到端吞吐提升至基线 3 倍,硬件利用效率与单 Token 成本达到主流 NVIDIA GPU 水平,6 天 Token 调用量超 62 万亿。」

智谱 GLM 团队近日披露了递归自我改进(简称 RSI)方向上的首个工程化实践进展。所谓递归自我改进,就是让 AI 自己动手改进自己的运行系统,而这一次的主角是一个由 GLM-5.3 驱动的 Infra Agent,它完成了 GLM-5.3-Flash 推理基础设施的设计、调试与优化,实现了模型对自身运行系统的反向改进。

据官方博客介绍,Infra Agent 在超过 10 万张国产芯片组成的集群上,从零开始完成了生产级推理服务的搭建。整个过程不到两周,端到端吞吐就被提升至初始基线的 3 倍,硬件利用效率与单 Token 成本也达到了主流 NVIDIA GPU 的相当水平。这一结果表明,AI 参与基础设施工程已经不再停留于实验演示层面,而是真正跑通了一条可复用的工程闭环。

更值得关注的是这套系统的落地状态。官方表示,该系统已经投入真实使用,GLM-5.3-Flash 以匿名模型 Ox-Alpha 的身份在 OpenCode、OpenRouter 上线,6 天时间 Token 调用量超过 62 万亿。匿名上线的方式,让模型在真实流量与真实负载下接受检验,也为推理系统的稳定性与成本控制提供了直接的验证场景。

从技术路径上看,这件事的意义并不只是“AI 写代码”这么简单。传统的 AI 辅助开发,通常聚焦在代码补全、脚本生成等单点环节,而 Infra Agent 面对的是推理服务这一完整工程对象:它需要理解集群拓扑与硬件约束,处理并行策略、显存占用、通信开销、调度与容错等一系列系统级问题,并在反复的调试与压测中给出优化方案。换言之,AI 从“写一段代码”走向了“交付一套系统”。

过程本身的难度也不容小觑。超 10 万张芯片规模的集群,任何一处配置偏差都可能被放大成全局性的性能损失;推理服务的端到端吞吐,往往由最慢的那一环决定。在不到两周的时间内把吞吐拉到基线的 3 倍,并且保持硬件利用效率与单 Token 成本的优势,说明 Infra Agent 具备跨层级的分析与迭代能力,而不是靠某一处参数调优取巧。

智谱方面将这一进展定位为国内大模型厂商首次公开把“AI 自我改进”用于生产环境。它带来的想象空间在于效率:当模型能够参与自身推理系统的工程闭环,基础设施的迭代速度、人力投入与试错成本都将被重新定义。与此同时,递归自我改进也提出了新的命题,例如如何评估 AI 做出的系统级决策、如何在自动化流程中保持可控性与可观测性,这些问题会随着实践的深入逐步显现。

从行业视角来看,推理成本与吞吐效率始终是大模型规模化应用的核心变量。如果 AI 能够持续优化承载自身的运行系统,那么模型能力的提升与基础设施的改进就可能形成互相加速的正向循环。智谱 GLM 的这次披露,为这一方向提供了第一份可参照的工程样本。

# 智谱GLM # 递归自我改进 # 推理基础设施 # Infra Agent

来源:Heooo AI工具导航