开源与闭源模型能力差距缩至4.4个月
「Mozilla 发布第二版《开源 AI 现状》报告,指出开放权重模型与前沿闭源模型的能力差距已缩短至 4.4 个月。报告以月之暗面 Kimi K3 为例,其智能指数得分仅比 Fable 5 低三分,成本却只有约 30%。METR 数据显示开放模型可处理 7 小时任务,闭源模型约 12 小时。」
Mozilla 发布第二版《开源 AI 现状》报告,将此前偏宏观的判断进一步落到具体模型、具体任务时长与单任务成本上。报告指出,开放权重模型与前沿闭源模型之间的能力差距已缩短至 4.4 个月,这一变化正在重塑开发者与企业选择模型的逻辑。
报告重点提及月之暗面的 Kimi K3。在 Artificial Analysis 智能指数上,Kimi K3 的得分仅比 Anthropic 的 Fable 5 低三分,而调用成本只有后者的约 30%。这意味着在多数通用场景下,开放权重模型已经能够以极低的价格提供接近前沿水平的智能。
能力边界的衡量方式来自 METR 提出的时间范围指标,即以模型能以 50% 可靠成功率完成的任务时长作为标准。目前最佳开放模型可处理约 7 小时的任务,最佳闭源模型可处理约 12 小时,两者相差 1.7 倍。Mozilla 首席技术官 Raffi Krikorian 认为,这种差异取决于具体任务场景,闭源模型的溢价主要体现在需要 8 到 12 小时才能完成的专业型任务上,而开放模型则能以极低的价格处理日常工作。
Krikorian 还给出了对未来趋势的预估:4 个月后,开放模型可处理 12 小时任务,闭源模型可处理约 20 小时任务。换言之,8 至 12 小时任务目前仍是闭源模型可完成、开放模型尚难处理的区间,但这一区间正在被逐步填补。
这种能力与成本的错位已经开始重塑企业使用行为。DoorDash 目前采用 Kimi 处理日常任务,同时将 Fable 保留用于更复杂的工作。在路由平台 OpenRouter 上,按 token 用量排名前十的模型中已有八个为开放模型,开放权重模型的实际调用份额正在快速上升。
从第一版到第二版报告,Mozilla 的观察视角也从趋势判断转向可量化的坐标:模型得分差多少分、成本差多少倍、可靠完成任务的时间差几个小时。对开发者而言,这种颗粒度更细的对比,比单纯的排行榜更能指导生产环境中的模型选型,也让开源与闭源两条路线各自的优化方向变得更加清晰。
来源:Heooo AI工具导航