GPT-6 Astra成功实现真实车辆驾驶
「DrivingBench平台测试显示,GPT-6 Astra在真实丰田卡罗拉上完成固定锥桶赛道驾驶任务,三次尝试中有两次达成100%进度,最快用时5分22秒,显著领先于Claude、Grok等其他前沿模型。」
近日,AI驾驶能力评测平台DrivingBench发布了一项引人注目的实验结果:OpenAI最新模型GPT-6 Astra已具备操控真实汽车的能力。该实验将多个前沿大语言模型接入一辆丰田卡罗拉的控制系统,赋予其对方向盘、油门和刹车的直接控制权限,并要求模型在一条预设的锥桶赛道中完成驾驶任务。
DrivingBench的测试机制设计严谨:每轮测试允许模型进行最多三次连续尝试,所有操作均通过自然语言交互完成。系统会记录模型发出的运动指令(如set_motion和stop_now),并基于GPS轨迹评估其表现。评判标准包括“进度”(即沿赛道中心线行驶的距离占比,且需保持在4米范围内)、总行驶距离、完成时间以及所消耗的计算资源(以token数量和成本计)。
在此次评测中,GPT-6 Astra表现尤为突出。其代号为“Codex · medium”的版本在三次尝试中两次达成100%赛道进度,其中一次用时仅5分22秒,成功完成全程。另一次虽因中途碰撞未能计入完成时间,但仍达到了49%的进度。相比之下,Anthropic的Claude Fable 5.1最佳成绩仅为45%,而xAI的Grok 4.6和GPT-5.6 Sol的表现则更为有限,分别仅达到11%和6%的进度。
值得注意的是,GPT-6 Astra不仅在任务完成度上遥遥领先,其指令调用效率也较高。系统日志显示,它能有效规划路径、调整车速,并在接近障碍物时及时减速或停车,体现出较强的环境感知与决策能力。尽管整个系统仍依赖人类监督(例如初始启动和紧急干预),但这一成果标志着大语言模型在具身智能(embodied AI)领域的重大突破。
DrivingBench强调,所有测试均在封闭场地进行,确保安全。该平台旨在为AI社区提供一个标准化的真实世界驾驶评测基准,推动模型从纯文本推理向物理世界交互演进。目前,DrivingBench已开放模型提交接口,鼓励开发者将更多AI系统接入测试。
此次GPT-6 Astra的成功,不仅验证了超大规模语言模型在复杂物理任务中的潜力,也为未来自动驾驶技术的发展提供了新思路——即通过通用AI而非专用模块来实现驾驶智能。尽管距离实际道路应用仍有巨大差距,但这一里程碑式进展无疑为AI驱动的具身智能研究注入了强劲动力。
来源:Heooo AI工具导航