30 栋陌生房子零样本做家务:Figure 把「预训练数据」这件最无聊的事,变成了最贵的护城河
Figure 用 30 栋从没见过的房子测 Helix 2.5:Index 人类行为数据预训练把任务成功率从 8% 拉到 56%,背后是最高 60 亿美元的算力合同。家务这件事,正在变成数据基础设施的军备竞赛。
- 实验设计:在旧金山湾区租赁 30 栋陌生房子,搭载 Helix 2.5 的 Figure 03 未经任何环境适配,零样本执行整理客厅、折毛巾、整理床铺三种长时序行为。
- 核心数字:引入 Index 人类行为数据集预训练后,在任务数据、架构、训练与评测均不变的前提下,任务成功率从 8% 提升到 56%。
- 数据效率:相比前代 Helix 02,Helix 2.5 只用一半的任务专用数据,就把行为泛化到了 30 个前所未见的新环境。
- 算力投入:Figure 已承诺投入价值 35 亿美元的算力,本月与 Nscale 签多年期协议锁定约 10 万块英伟达 Vera Rubin 系列 GPU,合同总规模最高 60 亿美元。
- 自纠错行为:机器人能在陌生环境中后退重新定位、改变站姿、绕床修正折叠——从错误中恢复被官方归因于 Index 预训练。
这次演示的设置故意做得很朴素:租 30 栋旧金山湾区的陌生房子,让 Figure 03 进门就干活——整理客厅、折毛巾、整理床铺,三种长时序行为。关键约束只有一条:Figure 从未针对这些房子内部的环境或物体做过任何数据采集、微调或适配。
这对机器人是三重叠加的难题。房子布局没见过,家具位置没见过,光线和杂物分布也没见过。机器人必须把穿行环境本身当作任务的一部分:在狭小、杂乱的空间里调整身体位置,才能观察、够取并操作物体。
结果层面,官方给出两组数字。第一组是总账:引入 Index 人类行为数据集预训练后,任务成功率从 8% 提升到 56%——而且这中间任务专用数据、模型架构、训练流程、评测方法全部保持不变,唯一的变量就是预训练数据。第二组是效率账:相比前代 Helix 02,Helix 2.5 只用了一半的任务专用数据,就把行为泛化到了 30 个前所未见的新环境。
报道里最容易被略过的一段,其实是自纠错行为:搭载 Helix 2.5 的机器人在陌生环境中会后退以重新定位、改变站姿,或者绕着整张床移动以修正折叠。Figure 把这种从错误中恢复、持续推进任务的能力归因于 Index 预训练。
为什么这条重要?因为长时序任务的失败从来不是单点失败,而是级联失败:一步抓偏,后面全乱。能否在失败后不重置、不返场,自己把局面捡回来,是「演示视频」和「能交付的产品」之间最硬的一条分界线。8% 到 56% 的提升说的是「做对的比例」,自纠错说的是「做错之后的下限」——后者对商业化可能更关键。
把视线从房子挪开,这次发布真正的重量级信息是算力合同:Figure 已承诺投入价值 35 亿美元的算力资源用于训练 Helix,本月与 AI 基础设施供应商 Nscale 签订多年期协议,锁定约 10 万块英伟达 Vera Rubin 系列 GPU 的算力供应,并预留扩展空间,合同总规模最高有望达到 60 亿美元。
这笔钱买的不是「更聪明的模型」,而是数据到能力的转化管道。Figure 的逻辑链条很直白:Index 每天都在产生新的人类行为数据 → 预训练数据直接决定零样本泛化的成功率 → 成功率决定机器人能不能进家庭 → 进家庭又产生更多真实场景数据。官方那句「是时候扩大规模了」,翻译过来就是:既然数据规模对成功率的转化已被验证,那就把烧钱的方向从调架构改成铺数据。