国产大模型多榜突围表现亮眼
「Arena平台发布新一期AI大模型盲测排名,阿里qwen3.8-max冲入综合榜第六,Meta新模型位列第四。国产模型在代码、前端开发、生图、视频等榜单均实现突破,多款新模型首次入榜,整体竞争力持续提升。」
本周Arena平台公布的AI大模型盲测排名显示,头部竞争格局出现新变化。阿里全新推出的qwen3.8-max以1497分位列综合榜第六,与第五名同分,在统计误差范围内并列。Meta发布的muse-spark-1.2 (xHigh)首秀即拿下第四名,成为海外阵营的亮点。综合榜前10名分数均在1488分以上,头部模型之间差距极小,竞争十分激烈。
在代码榜中,Anthropic旗下模型依旧占据前三,但国产模型表现同样出色。月之暗面kimi-k3-max从第八位上升至第六位,ELO分数上涨11分,成为代码榜排名最高的国产模型。阿里qwen3.8-max位列第八,也成功进入前十。此外,智谱、小米等厂商的模型均进入前30,显示出国产模型在编程领域的整体进步。
前端开发榜方面,月之暗面kimi-k3-max稳定保持第二位,与榜首的claude-opus-5-max差距极小。阿里qwen3.8-max首次入榜即拿下第四名,深度求索deepseek-v4-flash-high也首次进入前十。国产模型在前端开发榜多个top10位置占据席位,竞争力持续提升。
智能体榜出现头部更替,Anthropic Claude Opus 5 (High)升至第一,月之暗面Kimi K3 (Max)稳定保持第五,任务确认成功率达到14.97%,跻身第一梯队。深度求索Deepseek V4 Flash (High)首次入榜排名第21,表现符合预期。AI生图榜中,阿里qwen-image-3.0-pro和字节跳动seedream-5.0-pro均进入前十,与OpenAI、SpaceXAI的模型同处第一梯队。
AI视频榜方面,谷歌gemini-omni-flash继续领跑,字节跳动dreamina-seedance-2.0-720p保持第二,MiniMax全新minimax-h3首次入榜即排名第四,阿里happyhorse-1.0位列第五。国产模型已占据前五中的三个席位,优势明显。整体来看,本周多款新模型入榜,国产大模型在综合、代码、前端开发、生图、视频等多个维度均实现了突破。
来源:Heooo AI工具导航