Figure发布Helix2.5,零样本成功率升至56%
「Figure发布人形机器人神经网络Helix2.5,基于Index人类行为数据集预训练,在旧金山湾区30户未采集数据的陌生家庭测试中,将零样本成功率从9%提升至56%,并仅用此前一半的适应性数据达到相当水平,同时展现出全身自我纠正能力。」
人形机器人公司 Figure 于 9 月 17 日发布新一代人形机器人神经网络 Helix2.5。该模型基于公司自建的 Index 人类行为数据集进行预训练,并在旧金山湾区 30 户此前从未采集过数据的陌生家庭中完成测试。结果显示,相比从零开始训练的同条件策略,Index 预训练将零样本成功率从 9% 提升至 56%,提升幅度超过六倍。
陌生环境下的全身动作能力
Helix2.5 建立在单一 Index 预训练基础模型之上,支持整理客厅、折叠毛巾和铺床三类全身动作。值得注意的是,评估过程中所涉及的家庭环境以及玩具、毛巾、床上用品等物品,均未出现在任务规范数据中。也就是说,机器人面对的是完全陌生的房间与从未见过的物件。评估标准也相当严苛,所有任务都必须完整完成才计为成功,不存在部分完成的折中判定。
更少数据,相当表现
Figure 还表示,Helix2.5 仅使用此前 Helix02 一半的适应性数据,即可取得相当的成功率。与此同时,模型展现出明显的全身自我纠正能力,包括后退调整位置、改变站姿以及在床上移动等动作。这些行为并非针对单一关节的微调,而是涉及整体身体协调的实时修正,说明模型在陌生环境中具备一定的鲁棒性与适应性。
隔离预训练贡献的对照实验
为了把预训练的贡献从其他变量中隔离出来,Figure 保持模型架构、优化方式、超参数、下游数据及评估条件完全一致,仅改变初始化方式。公司称,Index 数据集中没有任何一项评估任务占比超过 1.90%,因此上述结果直接体现了预训练对泛化能力的贡献,而非某一任务数据的堆叠效应。
测量人形机器人的数据缩放规律
进一步实验显示,随着 Index 数据量每翻一倍,动作预测损失均呈可预测的下降趋势。Figure 据此测量了人形机器人领域的数据缩放规律,为后续模型规模与数据规模的配比提供了可参考的经验曲线。这类规律此前在语言模型领域被广泛验证,而在具身智能方向上的系统测量仍不多见。
Index 数据集与算力投入
Index 于 8 月 25 日正式推出,目前累计下载 26.4 万次,每周活跃用户超过 4.4 万,已收集超过 1600 万个视频,并向数据贡献者支付了 1500 万美元。Figure 同时透露,公司已投入 35 亿美元计算资源用于训练 Helix 系列模型。从数据采集、社区激励到算力投入,Figure 正在构建一条覆盖数据与模型的完整技术链路,而 Helix2.5 的零样本表现,正是这条链路阶段性成果的一次集中展示。
来源:Heooo AI工具导航