GPT-6 Astra在机械臂操控任务中表现亮眼
「OpenAI最新模型GPT-6 Astra在两项机器人操作任务中展现出显著优势,尤其在“红块入碗”任务中成功率高达95%,成本仅为竞品Claude Fable 5.1的一半左右,但在精细拼图任务中仍面临挑战。」
近日,一项针对大语言模型在机器人操控领域性能的对比测试引发了广泛关注。测试聚焦于OpenAI最新推出的GPT-6 Astra模型与Anthropic的Claude Fable 5及5.1版本,在相同的YAM机械臂平台上执行两项标准化任务的表现。
第一项任务要求模型“从桌面上拿起红色方块并放入碗中”。在此任务中,GPT-6 Astra展现了压倒性优势,在20次试验中成功完成了19次,成功率高达95%。相比之下,Claude Fable 5.1仅成功8次,而Fable 5更是只成功1次。更值得注意的是效率和成本:Astra平均每轮耗时2.5分钟,远低于Fable 5.1的6.8分钟;单次运行成本估算为0.94美元,不到Fable 5.1(2.12美元)的一半。
然而,在第二项更具挑战性的“拼图插入”任务中——即“通过中心旋钮拾取圆形蓝色拼图块,并将其精准嵌入匹配的圆形凹槽”——所有模型都遇到了瓶颈。GPT-6 Astra和Claude Fable 5.1均仅在20次尝试中成功2次。分析指出,两者都在最后的插入步骤停滞不前,表明当前模型在处理需要极高空间精度和力反馈的精细操作时,仍存在共同的技术难点。尽管如此,Astra的单次运行成本(1.36美元)依然显著低于Fable 5.1(2.18美元)。
本次评估采用了与此前Claude Fable报告一致的人工评分标准,依据任务完成的最高阶段进行打分,确保了结果的可比性。数据显示,Astra在简单抓取放置任务中几乎总能完成目标,而在复杂对准任务中则与竞品遭遇了相似的困境。
研究团队也坦诚指出了实验的若干局限性。例如,Astra的测试在Fable系列之后两天进行,且未采用交错测试方式;用于“红块入碗”任务的硬件平台(rig-3)在Fable测试后不可用,导致该任务的对比并非完全在同一物理环境下进行。此外,评分过程由知晓模型身份的操作员完成,可能存在无意识的主观偏差。成本计算方面,虽然OpenAI的API自动缓存了约五分之一的输入,但成本估算并未对此进行折扣,这意味着Astra的实际成本可能被高估。
总体而言,GPT-6 Astra在机器人具身智能领域的初步应用展示了其在常规操作任务中的高效性与经济性,为未来AI驱动的自动化提供了新的可能性。然而,如何突破精细操作的瓶颈,仍是整个行业需要共同攻克的核心难题。
来源:Heooo AI工具导航