技术进展

System-1决策模型智能体配对评测

Heooo 10月05日13时01分 3 阅读

「一项针对LLM智能体框架中System-1决策模型的配对评测显示,托管模型Jev在11个决策点中的9个上显著优于开源模型Laya,提升10.8至46.0个百分点;两者在零样本模型路由上均未超过随机水平。作者同时自审计发现多处分析错误曾夸大部署收益。」

在大语言模型智能体框架中,每一项任务都会触发大量细小而带类型的决策:该调用哪个模型、该使用哪个工具、检索回来的文本是否真正相关、输入中是否夹带了提示注入。若每一种判断都要发起一次完整的模型调用,成本与延迟都会迅速累积。System-1 决策模型正是为这类场景提出的方案——它不生成自然语言,而是在单次前向传播中直接输出类别概率,从而承诺相较常规调用大幅节省开销。

一篇新近公开的研究工作对这种承诺做了系统检验。作者选取了一个开放权重模型 Laya 与一个托管模型 Jev,围绕由 18 个公开来源构建的 11 个智能体决策点展开配对评测,共包含 7283 个基础用例以及 6640 个鲁棒性变体。评测在字节级完全一致的输入上进行,采用配对检验,并额外做了跨硬件与跨日期的可复现性核查。这种设计的意义在于:两个模型面对的是同一批问题、同一批候选答案,差异因此更难被数据切分或提示格式的变化所掩盖。

结果显示,托管模型 Jev 在 11 个决策点中的 9 个上准确率显著更高,提升幅度从 10.8 个百分点一直到 46.0 个百分点。不过差距并非在所有环节都成立:在零样本模型路由这一项上,两个模型都没有超过随机水平,也就是说它们并不能可靠地判断某个任务该交给哪个模型;在 RAG 相关性门控这一项上,两者则基本打平。这个结果提示,System-1 决策模型的能力高度依赖具体决策点的性质,是否可用需要逐点验证,而不能笼统地宣称可用或不可用。

鲁棒性测试揭示了更值得警惕的现象。当候选选项的顺序被反转时,Laya 有 30% 的答案发生了变化——同一道题、同样的选项,仅仅调换排列就得出不同结论,说明其判断在相当程度上依赖位置信息而非语义内容。当候选数量变多或候选之间高度相似时,Laya 的表现急剧下滑:在 50 个最近邻工具的设定下准确率仅 31%,而 Jev 在存在唯一正确工具的同类项目上达到 98%。对于真实智能体系统而言,工具池往往包含数十上百个语义相近的接口,这类退化会直接转化为错误的工具调用链条。

该工作更引人注目的部分,是作者对自身评测流水线的审计。他们发现,三处分析错误与一处设计混杂因素曾显著扭曲了关于部署收益的结论。其一,遗漏了预筛选环节的成本,导致报告的节省率为 23.9%,而实际只有 4.3%;其二,把门控环节的准确率当作端到端质量来呈现,两者分别为 58% 与 98%,差距巨大;其三,阈值在样本内调优,目标为 5% 的失效率,而在留出集上最高出现 17% 的未命中;其四,关于注入检测误报的所谓通道效应,在改用通道原生内容后便消失了。此外还有两处疑似混杂因素,经核查未改变最终结论。

对开发者而言,这项研究给出的启示是方法论层面的。System-1 决策模型在成本与延迟上确实具备吸引力,尤其适合作为智能体框架中的轻量判别器,用以替代一部分高频的模型调用。但单次前向传播输出的概率并不等于端到端可用性:门控准确率与最终任务质量之间可能隔着数十个百分点,阈值在留出集上会漂移,候选顺序与候选规模都可能成为隐藏的失效面。作者将全部用例、原始输出与分析代码一并公开,为社区复现和进一步评测提供了基础,也提醒后续工作在报告收益时同步披露预筛选成本与留出集表现。

# 智能体 # 模型评测 # 决策模型

来源:Heooo AI工具导航