AI大模型周榜更新:Anthropic新模型霸榜,国产生力军稳中有进
「Arena平台发布最新一周AI大模型盲测排名,Anthropic多款Claude新模型密集入榜并包揽综合榜前三,国产kimi-k3-max升至综合榜第12位,前端开发榜稳居第二,qwen3.8-max首次进入智能体榜前十,国产模型在多个细分领域持续缩小与海外头部差距。」
本周AI大模型竞技场再掀波澜。Arena平台公布的第33周盲测排名显示,Anthropic凭借新一代Claude Opus 4系列模型的密集发布,在综合能力、代码生成等多个核心榜单上形成压倒性优势。与此同时,国产模型在细分领域展现出强劲韧性,月之暗面的kimi-k3-max与阿里的qwen3.8-max成为本期最值得关注的两大亮点。
在综合榜单中,Anthropic的新模型几乎包揽了头部位置。claude-fable-5以1506分蝉联榜首,两款新入榜的claude-opus-4-6-high和claude-opus-4-7-high分别以1505分和1502分紧随其后,前三名分差均在5分以内,被判定为误差范围内的并列。谷歌的gemini-3.7-flash-high作为新模型首次入榜即位列第9,表现亮眼。国产模型方面,kimi-k3-max排名上升两位至第12名,ELO分数达到1489分,继续领跑国产阵营;阿里的qwen3.8-max以1491分位列第8,虽然较上周下滑两位,但仍处于榜单前列;qwen3.7-max-preview则排名第26。
代码榜单的格局同样由Anthropic新模型主导。claude-fable-5以1554分守住榜首,新入榜的claude-opus-4-7-high和claude-opus-4-6-high分列第二、第三,分数仅差1分。值得关注的是,kimi-k3-max稳定在第六名,ELO分数上涨2分至1544分,依然是排名最高的国产代码模型。此外,Meta的muse-spark-1.2(xHigh)排名上升7位至第八名,成为本周涨幅最大的头部模型。国产模型在代码榜中占据多个中上游席位,小米的mimo-v2.5-pro也提升3位至第25名。
前端开发榜是国产模型表现最为亮眼的赛道。claude-opus-5-max以1692分蝉联第一,而kimi-k3-max以1674分保持第二名,仅落后18分,对榜首形成持续紧逼。阿里的qwen3.8-max上升1位至第三名,深度求索的deepseek-v4-pro-high-20260813作为新模型首次入榜即拿到第10名,展现了国产模型在前端开发领域的整体竞争力。智谱glm-5.2-max、深度求索deepseek-v4-flash-high也分别位列第9和第11名。
在AI生图与视频赛道,微软的mai-image-2.6-preview首次入榜即拿下生图榜第二,Black Forest Labs的flux-3-video也在视频榜取得亚军。国产模型seedream-5.0-pro和qwen-image-3.0-pro在生图榜分列第八、第九,分数几乎持平;视频榜中,dreamina-seedance-2.0-720p保持第三名。
智能体榜单本期迎来两员新将:国产Qwen3.8 Max首次入榜即排名第11位,净提升度达到7.61%,任务确认成功率12.54%,工具幻觉率仅0.11%,表现相当亮眼;Anthropic的Claude Opus 4.8(High)排名第六。Kimi K3(Max)稳定在第五名,净提升度10.6%,任务确认成功率15.55%,已经跻身全球智能体第一梯队。
综合来看,本周榜单最显著的特征是Anthropic集中发布的新模型迅速占据各榜头部,验证了其技术迭代的积累速度;而国产模型在综合、代码、前端开发及智能体等领域均保持中上游位置,且在新赛道不断取得突破。随着下周更多国产新模型完成版本迭代,榜单头部的竞争有望进一步加剧,国产模型与海外头部水平的差距正在稳步缩小。
来源:Heooo AI工具导航