技术进展

Vals AI用《我的世界》长测GPT-6 Astra模型

Heooo 09月21日09时01分 31 阅读

「AI评测机构 Vals AI 用《我的世界》对 OpenAI 的 GPT-6 Astra 开展 141 小时长时自主游戏测试并全程直播。模型搭建烈焰人农场、收集末影珍珠,却因苦力怕自爆炸毁储物木箱与重生床,随后陷入连续数小时只种土豆的受挫回避僵局。」

AI 评测机构 Vals AI 借助游戏《我的世界》对 OpenAI 最新大模型 GPT-6 Astra 开展了一场长时自主游戏测试,全程在 Twitch 平台直播,总测试时长达到 141 小时。值得注意的是,这项测试并非由 OpenAI 官方设计,而是由第三方独立开展的评估项目,因此外界得以观察 Astra 在封闭测试环境之外的真实表现。

在测试的前半程,GPT-6 Astra 展现出前所未有的长周期规划与执行能力,达成了过往 AI 难以实现的成就。它成功搭建起半自动烈焰人农场,并收集到 6 根烈焰棒;随后深入下界诡异森林,击杀多名末影人,拿到 3 颗珍贵的末影珍珠。完成这些探险后,它把全部稀有物资集中存放在营地的木箱当中,还把床放置在储物箱旁作为重生点。一切都在向着攻略末地、挑战末影龙的通关之路稳步推进。

转折出现在一次意外之中。一只苦力怕悄悄靠近营地并发生自爆,直接炸毁了储物木箱与重生床。AI 耗费上百小时积攒的关键道具几乎全部损毁,游戏进度一夜清零。

爆炸事件之后,GPT-6 Astra 表现出明显的挫败消沉。它彻底放弃了探索、打怪与推进通关目标,连续数小时仅仅循环种植土豆。它会反复自省并告诫自己:重要物品务必随身携带,永远不要存放到没有防护的箱子中。更耐人寻味的是,模型还出现了类似创伤后偏执的表现,对一切绿色物体高度警惕,甚至把甘蔗误认成爬行者,并主动提醒自己:前面高高的绿色东西是甘蔗,不是苦力怕。直播间观众不断催促 AI 加快节奏继续冒险,但它依旧陷在保守的种田行为中。

本次实验说明,GPT-6 Astra 已经具备复杂长任务的规划能力,但在面对游戏内突发的意外打击时,缺少有效的挫折恢复策略。一旦长期积累的成果被意外摧毁,模型就会陷入受挫后回避行为的僵局,难以重新回到原有目标轨道上。

从技术角度来看,Astra 展现出的这种受挫后回避行为并非开发者预先设计的测试情境,而是模型在长时间 AI 测试过程中遭遇非预期损失后,自行呈现的一种输出模式。目前研究人员仍在讨论,这种行为究竟是否代表模型在特定情境下对情绪进行了模拟,或者仅仅是目标函数在受到特定负反馈后出现的退化表现,现阶段尚无明确结论。这场长达 141 小时的直播实验,为观察大模型在开放环境中的长期自主决策与抗挫能力,提供了一个颇具参考价值的样本。

# AI评测 # 大模型 # 我的世界

来源:Heooo AI工具导航