行业资讯

B站上线AI无限竞技场,百大模型同台竞技

Heooo 09月20日18时02分 41 阅读

「B站上线“AI无限竞技场”大模型测评榜并公布首轮排名:GPT-6 Astra在10个UP主测评中拿下榜首,击败GLM-5.3成为“榜首次数冠军”,前五名中国产大模型占据三席。榜单涵盖DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、千问等上百个模型的真实场景实测,排名实时更新并持续开放UP主报名。」

B站宣布上线“AI无限竞技场”大模型测评榜,并同步公布首轮模型排行榜。据B站介绍,这是一个汇集UP主AI大模型测评的竞技广场,由来自各领域的UP主对上百个大模型进行真实场景实测,测评主题覆盖代码、推理、协作、知识等多种方向。

与传统跑分评测最大的不同在于,“AI无限竞技场”不设主题或测评维度限制。
来自各个分区的UP主可以围绕真实工作流、专业应用乃至趣味脑洞自主命题,在同题PK中直观呈现各模型的实际表现差异。这种方式更接近用户日常使用AI的真实场景,也让评测结果具备更强的参考价值,而不是单纯比拼某一项标准化基准分数。

从榜单构成看,竞技场已涵盖DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、千问、Hy、MiniMax等主流模型的对比测评,排名实时更新,并持续面向全站UP主开放报名。

首轮排行榜的结果颇具看点。
GPT-6 Astra在10个UP主测评中拿下榜首,并击败GLM-5.3获得“榜首次数冠军”。
值得注意的是,前五名中国产大模型占据三席,多款国产模型在真实工作流场景下展现出强劲的竞争力,这一分布也说明国内模型在代码、推理、协作等细分任务上的可用度正在被社区用户直接验证。

榜单背后是B站持续增长的AI内容生态。公开信息显示,过去一年B站AI知识内容消费时长同比增长72%,月均观看AI内容的用户超过1.9亿。平台涌现出大量覆盖不同领域、维度与主题的测评内容,形成了从发布到讨论、测评、使用、求助再到共建的完整内容生态。

对于开发者与普通用户而言,这种由社区驱动的评测体系提供了一个新的观察窗口:模型能力不再只由单一基准分数定义,而是在真实工作流、跨模型协作与具体任务中被反复检验。同题PK的形式也让不同模型的边界更加清晰,用户可以根据自己的实际需求而非厂商宣传来选择工具。

随着更多UP主加入报名,榜单的样本量与覆盖面仍将扩大,排名变化也将持续反映各家模型在真实场景中的迭代速度与适配能力。

# B站 # 大模型测评 # AI竞技场 # 榜单

来源:Heooo AI工具导航