智谱上线GLM-5.3-FlashX,提速至每秒200tokens
「智谱宣布推出GLM-5.3-FlashX模型并上线API,推理速度最高可达每秒200 tokens。官方称该系列此前以Ox Alpha之名亮相,调用量持续攀升,此次在10万张国产芯片算力基础上加大Infra投入与推理优化,形成智能、价格、速度的全面竞争力,定价高于GLM-5.3-Flash。」
智谱宣布推出 GLM-5.3-FlashX 模型,并同步上线其 API,面向企业与开发者提供更快、更流畅的模型体验。官方给出的数据显示,新模型的推理速度最高可达每秒 200 tokens,相比此前的版本在响应效率上有了明显提升。
智谱方面介绍,GLM-5.3-Flash 此前曾以“Ox Alpha”之名与全球开发者见面,并获得了海内外开发者的广泛认可,调用量持续攀升。面对快速增长的需求,智谱在 10 万张国产芯片所提供的推理算力基础上,进一步加大了对 Infra 侧的投入与推理优化力度,从而支撑起更高吞吐、更低延迟的模型服务。
官方强调,GLM-5.3-Flash 长期保持同尺寸模型中最强的智能水平,本次提速则让其在智能、价格、速度三个维度上形成更全面的竞争力。对于需要高并发与实时交互的开发者场景而言,这样的组合意味着可以在不牺牲输出质量的前提下,获得更顺滑的体验。在智能体、代码补全、长文档摘要等对响应速度敏感的应用中,单位时间内可完成的请求量提升,往往会直接影响产品能否落地。
从接入方式来看,GLM-5.3-FlashX 的 API 已经上线,Model Key 为 GLM-5.3-FlashX,开发者可以直接在智谱开放平台的对话补全接口中完成调用与调试。价格方面,官方表示 GLM-5.3-FlashX 相比 GLM-5.3-Flash 会更贵一些,这意味着不同档位的模型将覆盖不同需求:对成本更敏感的业务可以继续使用标准版,而追求极致响应速度的业务则可以选择提速版本。
从整个 Flash 系列的演进路径来看,先以实验性代号面向社区开放、在开发者真实调用中验证模型能力,再以正式型号上线并提供多档速度选择,已经成为一种较为常见的产品节奏。这种路径的好处在于,模型的能力边界和性能瓶颈能够在真实负载下被快速暴露,进而推动底层的推理框架、算子优化与调度策略持续改进。此次从算力储备到 Infra 优化的表态,也说明在同等模型参数规模下,工程侧的优化空间依然可观,推理效率正在成为衡量大模型服务竞争力的关键指标之一。
对开发者来说,接下来值得关注的是两款模型在实际业务负载下的延迟分布、并发上限以及单位成本表现,这些指标将直接决定提速版本是否值得为更高的单价买单。
来源:Heooo AI工具导航