一次提示词对比十一款模型结果迥异 封面图
行业资讯

一次提示词对比十一款模型结果迥异

Heooo 08月13日21时59分 22 阅读

「Netlify与OpenRouter合作,通过AI Gateway开放更多模型,并在Agent Runners中加入Kimi K3、GLM 5.2等前沿模型。其开源评测工具AXIS对十一款模型进行同题测试,结果显示不同模型在功能实现、成本控制上差异显著,为用户选择模型提供参考。」

如何挑选合适的AI模型?Netlify近期发布的一份实测报告给出了一种答案。该公司与OpenRouter达成合作,通过AI Gateway使其平台能够调用OpenRouter上的任意模型,并在Agent Runners中加入了Kimi K3、GLM 5.2、DeepSeek V4等备受关注的开源模型。为了帮助用户理解这些模型之间的差异,Netlify用完全相同的提示词对十一款模型进行了评测,结果差异十分明显。

Agent Runners是Netlify内置的对话式编程入口,用户可以在其中从零构建新项目,或对已有项目进行迭代。此前该工具仅支持Claude Agent、OpenAI Codex和Gemini CLI,这些代理针对各自供应商的模型做了优化。随着模型选择范围扩大,Netlify引入了流行的开源代理OpenCode,以便更好地驱动多样化的新模型。同时,Netlify为这些代理注入了额外的技能和当前项目的上下文信息,使代理能够准确了解哪些Netlify能力可用,以及何时使用、如何使用,例如Netlify Database、AI Gateway或Identity服务。

一次提示词对比十一款模型结果迥异

面对越来越多的模型选择,开发者难免产生困惑:哪一款模型最适合自己的任务?会不会错过性能更好或成本更低的选项?市场的热烈讨论也加剧了这种焦虑。Netlify希望用数据回应这些疑问,于是公开了其在内部评测中的方法和发现。所有参与测试的模型现在都可以在Netlify平台上直接使用,完整报告也已公开发布。

内部评测依靠的是Netlify最近开源的工具AXIS。AXIS能够自动评估模型性能,它会接收一系列测试用例,这些用例要求模型从零构建网站并迭代修改。Netlify会指定测试所用的代理和模型,并定义AXIS需要执行的检查和评分标准。评分关注生成网站的功能正确性,而非视觉设计。例如,当用户需求需要数据库支持时,模型是否正确使用Netlify Database;在简单静态网站即可满足需求的情况下,模型是否过度设计、多余地配置了数据库。

一次提示词对比十一款模型结果迥异

如果某款模型的测试分数落后,Netlify便不会将其在Agent Runners中上架。如果模型频繁无法正确应用某项技能,或者功能虽然正常但积分成本显得过高,Netlify会优先检查技能本身是否存在问题并加以优化。这种以功能实现和实际成本为核心的质量门槛,确保了最终提供给用户的模型都经过实战检验。

本次公开报告的特别之处在于,Netlify将评测结果以更直观的形式呈现,方便开发者对比同一提示词在不同模型下的表现差异。测试覆盖了多种代理和模型组合,既包括原有供应商绑定的代理,也包括基于OpenCode驱动的开源模型。从结果来看,不同模型在任务成功率、生成代码的规范性、以及对Netlify特定能力的调用准确性上呈现明显分化。例如,有些模型能够在需要时正确接入Netlify Database,而另一些模型则会忽略这一需求,生成不完整或过于简化的方案。

一次提示词对比十一款模型结果迥异

成本也是评测中的关键维度。Netlify使用积分系统计量AI调用消耗,不同模型处理相同任务可能消耗截然不同的积分额度。测试发现,部分新加入的开源模型在性能接近专有模型的同时,积分成本显著更低,这为预算有限的开发者提供了更具性价比的选择。但低成本并非唯一考量,模型输出的稳定性和对复杂技能的掌握程度同样重要。

一次提示词对比十一款模型结果迥异

对于开发者而言,这份报告提供了实用的选型参考。如果你正在构建需要AI推理功能的Web应用,通过AI Gateway可以按需接入OpenRouter上的数百款模型,不必再被单一供应商绑定。而如果你在Netlify平台上使用Agent Runners进行项目开发,除了已有的Claude、Codex、Gemini等成熟选项,现在也可以尝试Kimi K3、GLM 5.2、DeepSeek V4等新兴开源模型,根据任务类型和预算灵活切换。

一次提示词对比十一款模型结果迥异

Netlify强调,Agent Runners之所以叫“Agent”,是因为其中运行的是完整编码代理,而非精简版。代理具备项目上下文感知能力,能够自主决定调用哪些Netlify功能。这种设计让不同模型在同样的代理框架下表现差异被放大,模型本身的决策能力成为决定结果质量的关键因素。因此,评测结果不仅是对模型性能的检验,也是对代理技能编排能力的验证。

一次提示词对比十一款模型结果迥异

从行业趋势看,模型选择正在从“唯一最好”转向“按需匹配”。Netlify此举降低了开发者尝试新模型的成本,而AXIS这样的开源评测工具也能帮助社区更客观地理解模型能力。未来模型生态会越来越丰富,如何高效评估和选用模型,将成为AI工程实践中的常见课题。

一次提示词对比十一款模型结果迥异

Netlify表示,凡是测试成绩达标的模型都会在Agent Runners中提供,并且后续会持续利用AXIS对新模型进行动态评估,确保上架模型的品质。对于开发者来说,现在可以更加放心地尝试不同模型,在同一代理框架下比较它们的真实表现。毕竟,只有实测数据才能消除FOMO,做出理性选择。

一次提示词对比十一款模型结果迥异

总体而言,Netlify的这次测试展示了模型评测的复杂性:同一提示词,不同模型会走出完全不同的技术路径。有的优先追求功能完整,有的倾向简洁实现,有的在成本控制上表现出色。开发者需要结合自身场景,权衡性能、成本与功能需求。随着AI工具链的成熟,这类透明、可复现的评测将会越来越有价值。

# 模型评测 # Netlify # 开源工具

来源:Heooo AI工具导航