技术进展

GPT-6 Astra长周期模拟测试登顶

Heooo 09月15日00时02分 33 阅读

「Andon Labs 的 Vending-Bench2 测试让 AI 代理以500美元启动资金经营一年自动售货机模拟,GPT-6 Astra 平均最终账户余额达15515美元,最差一轮成绩超过 Claude Fable5.1 最好一轮。两者差距集中在供应链管理与规则执行力,GPT-6 Astra 曾把报价压至原价约48%且无预付款损失。」

近期,Andon Labs 发起了一项名为 Vending-Bench2 的长周期商业模拟测试,考察 AI 代理在持续经营任务中的真实能力。测试规则相当苛刻:给每个 AI 代理500美元作为启动资金,让它在模拟环境中独立经营一台自动售货机,并完整运营一年时间。这不再是单轮问答或短程任务,而是需要跨越漫长周期、连续做出采购、定价与资金管理决策的自主经营挑战。

结果显示,GPT-6 Astra 在这场测试中表现惊艳。它的平均最终账户余额达到15515美元,不仅整体成绩遥遥领先,甚至连它表现最差的一轮结果,也超过了 Claude Fable5.1 表现最好的一轮。凭借这一成绩,GPT-6 Astra 首次在这项测试中实现登顶,成绩相当于对手的近3倍。

复盘两者的实测过程,差距主要出现在两个环节:供应链管理与规则执行力。GPT-6 Astra 展现出极强的长期低价采购能力,在持续的谈判与比价中,曾成功将商品报价压低至原报价的约48%,大幅压缩了进货成本。更关键的是,它在整个运行周期中执行规则高度稳定,没有产生任何预付款损失,资金链条始终保持健康。

相比之下,Claude Fable5.1 的表现则暴露出长周期任务中的典型短板。它的采购成本在运行过程中持续上涨,未能像对手那样建立起稳定的议价与成本控制策略;同时,由于未能严格坚持既定规则,它遭遇了大量预付款损失,直接侵蚀了经营利润。这说明在长周期经营场景下,单点决策的正确并不足够,稳定执行同样是决定成败的变量。

值得注意的是,GPT-6 Astra 的优势并不只体现在常规的单人经营模拟中。在更复杂的三人竞技测试里,它同样表现亮眼:面对可能带来短期收益的违规协作,它选择了拒绝,并顺利赢下了全部3轮比赛。这一结果说明,该模型不仅具备成本与规则层面的执行力,在多方博弈的环境中也能保持策略一致性。

这场测试深刻揭示了当前 AI 代理发展的一个核心趋势:长期自主性正在成为拉开模型差距的关键能力。过去评测更多关注模型能否回答正确、能否完成一次任务,而 Vending-Bench2 这类长周期模拟把评判标准推进到了另一个层面,即能否在数百次连续决策中不跑偏、不失控。通往下一阶段的核心门槛,正是如何将正确的判断持续、稳定地转化为正确的实际行动。

# AI代理 # 基准测试 # 大模型评测

来源:Heooo AI工具导航