推理努力的API合约定价研究揭示成本与精度权衡
「最新研究通过配对实验对比了AI模型API在高推理努力合约与默认合约下的表现,发现高努力合约使每次调用成本增加约0.01美元,但精度提升不显著,提示API购买者需要根据任务需求审慎选择推理努力参数。」
在人工智能服务日益商品化的今天,API购买者面对的早已不是简单的模型名称选择,而是一份包含多重条款的“合约”。最新研究《思考的代价:作为模型特定API合约的推理努力》指出,API合约中的推理努力条款虽然常被忽视,却直接关系到成本与输出质量的平衡。
该研究通过注册的配对对比实验,针对Sonnet 5模型,在显式高推理努力合约与省略该条款的默认合约之间展开测试。实验使用30道AIME 2026数学题,每个题目重复调用五次,每次付费尝试均被分配一个冻结的终态类别,推断过程在保留重复调用的情况下对题目进行重采样。
结果显示,在显式高推理努力合约下,每次调用的平均交付成本比省略合约高出0.01031美元,置信区间为[+0.00204, +0.01974]。然而,对应的准确率差异仅为+0.0133,置信区间为[-0.0267, +0.0467]。研究者表示,虽然未能检测到统计显著的准确率差异,但区间上限显示高努力可能带来最高4.67个百分点的提升,这一可能被实验设计排除,但无法完全否定。
从成本效率角度看,高推理努力合约下每道正确题目的成本为0.08665美元,而省略合约下为0.07662美元,两者均为注册的点估计值。这意味着在当前实验条件下,选择高推理努力并未带来更经济的正确答案。
研究进一步对多个模型API的合约文档进行了普查,利用模型元数据和预注册的原始响应探针,揭示了推理努力条款在不同模型甚至同一提供商内部存在差异化的省略语义。当原始响应结构不足以确定具体行为时,相关结论仅停留在文档级别。
值得强调的是,该研究的请求注册表、解析器、终态分类法、统计方案和分析流水线均在查看结果之前冻结,确保了结论的客观性。但研究结果严格限定于所测试的模型、任务和收集日期,不能直接推广到其他场景。
这一研究为API用户提供了重要参考:推理努力并非越高越好,它更像是一个模型特定的合约选项,需要根据实际任务需求平衡成本与精度。对于日常任务,省略推理努力可能更划算;对于复杂问题,高推理努力或许能带来边际收益,但需付出更高的单次调用成本。
来源:Heooo AI工具导航