按预算挑选大模型,性价比前沿榜单更新
「一个名为best model for your budget的开源项目,把Artificial Analysis智能指数与模型混合API价格画在同一张图上,标出性价比前沿,并按预算档位给出首选与备选模型。数据每日自动抓取更新,还会列出新增、移除以及重新评分或调价的模型变化。」
大模型的迭代速度很快,价格调整也很频繁,开发者往往需要在更强的模型和更低的调用成本之间做取舍。一个名为best model for your budget的开源项目试图把这道选择题变成一张可查的表。它把Artificial Analysis智能指数上的每一个模型,与自己的混合API价格放在同一坐标系里对照展示,从而画出一条所谓的性价比前沿。
所谓性价比前沿,指的是这样一组点:在它们所处的价格上,找不到既更便宜又更聪明的模型。换句话说,只要一个模型在价格和智能两个维度上同时被前沿线上的某个点击败,它就会被排除在这条线之外。这个定义看似简单,却相当实用,因为它把便宜和聪明这两件经常打架的事情压缩成一条可以直观比较的曲线。
在默认视图里,页面只显示每个模型表现最好的那个变体,同时隐藏得分较低的模型,避免图上过于拥挤。如果希望看到更宽的模型范围,可以通过滤镜调整筛选条件。横轴是每百万token的混合成本,按输入与输出三比一的配比折算,并采用对数刻度;纵轴则是智能指数得分。把光标悬停或通过键盘切换到某个点上,就能看到该模型的详细信息。
除了散点图,项目还提供了一张前沿查询表。使用者只需找到自己预算落在的那一行,该行给出的就是在这个价位上能买到得分最高的模型,同时还会附上一个同样在预算之内、得分次高的备选方案。此外,页面还提供了完全不考虑成本的视角,方便想知道当前最高分模型是谁的人快速查看。
为了应对模型世界的快速变化,这个工具每天都会抓取一次数据,并展示相邻两次抓取之间的差异,包括新加入的模型、被移除的模型,以及被重新评分或重新定价的模型。表格支持点击列头排序,模型名称会链接到它在Artificial Analysis上的详情页面。数据来自Artificial Analysis的免费数据API,由GitHub Actions的定时任务每天自动拉取,代码与数据均以开源形式放在GitHub上的bestvaluemodel仓库中。
对于需要在成本和效果之间做权衡的团队来说,这类自动化榜单的价值在于把分散的评测数据和定价信息集中到一处,并且保持更新。模型不断发布、不断调价,靠人工维护的对比表很容易过期,而由定时任务驱动的抓取流程可以让前沿线始终贴近当下的真实情况。
不过也要注意,它衡量的是API调用成本,本地部署开销、推理延迟、上下文长度、许可证条款等因素并未纳入其中。最稳妥的做法仍然是先看前沿榜单缩小候选范围,再针对自己的真实任务做一轮小规模评测,最后决定把哪一个模型放进生产环境。
来源:Heooo AI工具导航