智谱发布GLM-5.3-FlashX,推理速度大幅提升
「智谱AI在BigModel平台上线GLM-5.3-FlashX大模型,API同步开放,最高输出速度达每秒200tokens。该模型前身GLM-5.3-Flash曾以Ox Alpha匿名亮相海外,此次依托10万张国产芯片算力底座完成推理提速,面向企业与开发者提供高吞吐、低延迟推理服务。」
智谱AI旗下BigModel平台正式推出GLM-5.3-FlashX大模型,API同步上线,模型标识为“GLM-5.3-FlashX”。新版本最高输出速度达到每秒200tokens,主打“智能、价格、速度”三位一体的竞争力,面向企业与开发者提供高吞吐、低延迟的推理服务。
从命名不难看出,FlashX是Flash系列的提速版本。该模型的前身GLM-5.3-Flash曾以“Ox Alpha”的匿名身份亮相海外,凭借同尺寸模型中最强的智能水平与极高的性价比迅速积累口碑,调用量持续攀升。匿名测试往往是模型在正式定名前观察真实反馈的常见做法,而GLM-5.3-Flash在这一阶段获得的关注度,也为后续的正式发布与迭代打下了用户基础。
值得注意的是,此次提速并非单纯依靠扩大算力堆叠。为支撑不断增长的调用需求,智谱依托10万张国产芯片构建的算力底座,持续加大推理侧的优化投入,最终推出提速版FlashX。对推理服务而言,速度、成本与稳定性三者相互制约,如何在既有硬件条件下挖掘效率空间,是决定模型能否真正走向大规模商用的关键。
在能力与价格层面,FlashX保持了原有Flash版本的智能水准与亲民定价,同时把生成速度拉到更高水平,进一步巩固了其在高并发场景下的商用优势。对于需要批量处理请求、实时响应用户的应用来说,每秒输出token数的提升意味着单位时间可承载的请求量增加,也更利于在交互式产品中压低等待感。
接入方式上,开发者可通过官方API文档完成对接,非技术用户也可以在体验中心直接试用,无需额外部署即可感受新版本的生成速度。这种“开发者走API、普通用户走体验中心”的双通道设计,降低了模型能力触达的门槛。
整体来看,此次升级是国产大模型在推理效率与普惠化落地上迈出的又一步。在模型能力逐渐趋同的阶段,推理速度、单位成本与并发承载能力,正在成为开发者选择模型时的重要考量维度,而FlashX的推出,正是对这一趋势的直接回应。
来源:Heooo AI工具导航