国产大模型周调用量连续21周领先美国
「据OpenRouter数据,9月14日至20日全球AI大模型总调用量达129万亿Token,其中国产大模型为67.46万亿Token,环比增长10.28%,连续21周超过美国。DeepSeek V4.1-Flash以15.8万亿Token跃居全球第一,环比增长219%,智谱、腾讯混元等多款国产模型同列前五。」
据OpenRouter最新统计数据,9月14日至20日这一周,全球AI大模型总调用量达到129万亿Token,环比增长1.57%。其中,中国大模型周调用量达67.46万亿Token,环比增长10.28%;美国大模型周调用量为14.21万亿Token,环比下降34.7%。这意味着中国大模型的周调用量已连续21周超过美国,两者之间的差距进一步拉大。
从榜单结构看,上周全球调用量排名前五的模型中,有4款来自中国,国产模型在开发者实际使用层面已经形成集群优势。其中,DeepSeek V4.1-Flash以15.8万亿Token跃居全球第一,环比增长219%,成为拉动整体调用量上行的主要力量。
DeepSeek V4.1-Flash于9月10日发布,重点提升了Coding、Agent以及多模态理解能力,采用Causal-Encoder-Decoder架构,全局KV Cache降至V4-Flash的约四分之一,在长上下文场景下的显存占用与推理开销显著降低。价格方面,其闲时每百万Token输入缓存命中、未命中及输出价格分别为0.02元、1元和4元,较前代分别下降60%、33.3%和11.1%。
不过,单价的下降并不等于单项任务成本的同步下降。Artificial Analysis的测试显示,V4.1-Flash平均每项任务需使用约8.9万输出Token,明显高于V4Flash0731的约6.2万Token,并被评价为输出较为冗长。这也提醒开发者,评估模型成本时需要同时关注Token单价与任务实际消耗量,单一指标并不足以反映真实开销。
其他国产模型同样表现突出:智谱GLM5.3Flash以14.1万亿Token排名第二,腾讯混元Hy4preview以12.5万亿Token位列第三,DeepSeek-V4-Flash-0731则以9.44万亿Token排在第五。多款模型同时上榜,说明国内厂商在推理效率、价格策略与能力覆盖上的竞争正持续升温,开发者可选择的方案也更为丰富。
总体来看,调用量的高速增长反映出大模型正加速进入真实生产环境,Coding与Agent等高Token消耗场景成为主要驱动力。随着推理成本继续下探与架构优化持续推进,模型之间的竞争将从单纯的参数与榜单比拼,转向单位任务成本、输出效率与工程可用性的综合较量。
来源:Heooo AI工具导航