技术进展

GPT-6 Astra 售货机长测登顶榜单

Heooo 09月15日15时34分 35 阅读

「在 Andon Labs 的 Vending-Bench2 测试中,AI 以500美元启动资金经营模拟售货机整整一年。GPT-6 Astra 平均最终余额达15515美元首次登顶,最差一轮仍高于 Claude Fable 5.1 最好一轮。Astra 靠压低采购价与稳定执行规则取胜,全程无预付款损失,并在三人竞技测试中拒绝违规协作赢下全部三轮。」

在 Andon Labs 设计的 Vending-Bench2 测试中,AI 需要拿着500美元启动资金,独立经营一台模拟自动售货机,并持续整整一年。这项测试并不考察单次回答的正确率,而是把模型放进一个漫长的经营周期里,观察它能否持续做出正确的采购、定价与执行决策。

结果显示,GPT-6 Astra 的平均最终账户余额冲到15515美元,首次登顶该榜单。更值得关注的是,它表现最差的一轮成绩,依然高于 Claude Fable 5.1 表现最好的一轮。这意味着两者的差距并非偶然波动,而是已经出现了明显的分层。

差距的来源也不只是赚多赚少,而是经营方式的根本不同。Astra 能长期把采购价压在低位,曾把商品报价一路砍到原报价的约四成八;同时它的规则执行极其稳定,全程没有出现预付款损失。反观 Fable,采购成本持续上涨,还因为没能坚持既定规则而产生了大量预付款损失,账面上的钱就这样从执行力的缝隙里漏掉了。

在三人竞技测试中,Astra 还拒绝了违规协作的邀请,并赢下全部三轮。这说明它不仅能算清眼前的收益,还能在多方博弈中守住底线,把长期规则置于短期诱惑之上。

这场测试的真正看点,是 Agent 长期自主性的价值。聪明只是其中一面,能不能在漫长周期里持续守住规则,把正确的判断转化成正确的行动,才是下一道门槛。对开发者而言,评估一个智能体是否可靠,或许不只该看它在单轮任务中的表现,更该看它在一年、上百次决策之后,账户里还剩多少。

# AI Agent # Vending-Bench2 # 长期自主性

来源:Heooo AI工具导航