行业资讯

国产模型榜单突破 阿里视频新模型入前三

Heooo 09月08日00时34分 32 阅读

「Arena平台发布最新AI大模型盲测排名,综合榜头部竞争胶着。多款国产模型在细分领域实现突破:阿里wan3.0首次入榜即冲进视频榜前三,前端开发榜国产模型扎堆入榜,qwen3.8-max-0902位居第四,代码榜智谱模型排名上升,国产模型整体与头部差距持续缩小。」

日前,Arena平台公布了最新一周的AI大模型盲测排名。本期榜单迎来了多款重量级新模型,其中以国产模型在细分领域的表现最为亮眼。榜单基于匿名盲测投票,通过ELO分数或百分比信号计算,反映的是用户主观偏好而非绝对能力测试。不同分榜相互独立,分差在误差范围内视为并列。

综合榜单方面,头部格局整体稳定。claude-fable-5以1507分蝉联榜首,claude-opus-4-6-high以1505分紧随其后,两者分差仅有2分。新入榜的Anthropic claude-fable-5.1-max直接冲至第三,得分1504分;谷歌gemini-3.8-flash-high位列第八,得分1494分。前十名得分均在1492分以上,分差全部小于30分,竞争十分胶着。国产模型中,月之暗面kimi-k3-max以1489分位列第十二名,为国产最高;智谱glm-5.3-max下降五位至第二十名,阿里qwen3.8-max下降两位至第二十二名。

代码榜中,Anthropic包揽前三名,其两款模型同以1552分并列第一。谷歌gemini-3.8-flash-high首次入榜便位居第七,OpenAI gpt-5.5-high则位列第二十八。国产模型方面,智谱glm-5.3-flash上升两位至第九名,表现亮眼;月之暗面kimi-k3-max保持第六名;智谱glm-5.3-max和阿里qwen3.8-max虽有小幅下滑,但仍位列前三十。

前端开发榜是本期国产模型最集中的突围阵地。OpenAI gpt-6-astra-max首次登榜即拿下榜首,Anthropic claude-fable-5.1-max位列第二。国产方面,阿里qwen3.8-max-0902首次入榜即冲到第四名,ELO得分1686分,仅次于三款海外头部模型;阿里qwen3.8-flash-next、腾讯hy4-preview、智谱glm-5.3-flash均首次入榜便杀入前十五,分别位列第九、第十二和第十五名。此外,月之暗面kimi-k3-max排名第五,阿里qwen3.8-max排名第六。

智能体榜中,claude-fable-5.1-max首次登榜即登上榜首,净提升度达到15.87%%。原榜首Claude Opus 5降为第二。信号指标方面,claude-opus-4.8工具幻觉率仅0.24%%,为头部最低;国产模型kimi-k3-max任务确认成功率达到16.58%%,在国产模型中领先。腾讯hy4-preview首次入榜位列第十,智谱glm-5.2上升四位至第十二,阿里qwen3.8-max位列第十六。

AI生图榜方面,gpt-image-2继续位居榜首,微软mai-image-2.6首次入榜即获得第二名。国产模型seedream-5.0-pro保持第八,qwen-image-3.0-pro位列第九,整体变化不大。

AI视频榜是本期最大的突破点。阿里wan3.0首次入榜即冲进前三,ELO得分1494分,仅次于谷歌两款模型,并与第四名同分并列。国产dreamina-seedance-2.5-720p升至第六,minimax-h3位列第八,国产模型占据了多个中上游位置。

本期榜单呈现出两大趋势:一是多款新模型集中发布并迅速进入盲测榜单,可见行业迭代节奏持续加快;二是国产模型在前端开发、视频生成等细分场景中的排名大幅跃升,与头部海外模型的分差不断收窄。随着更多新模型完成投票积累,下一期排名格局或将进一步变化,值得持续关注。

# AI大模型 # 模型榜单 # 国产大模型 # 阿里wan3.0 # Arena

来源:Heooo AI工具导航