研究解读 · 神机百见-具身解读

30 栋陌生房子零样本做家务:Figure 把「预训练数据」这件最无聊的事,变成了最贵的护城河

Figure 用 30 栋从没见过的房子测 Helix 2.5:Index 人类行为数据预训练把任务成功率从 8% 拉到 56%,背后是最高 60 亿美元的算力合同。家务这件事,正在变成数据基础设施的军备竞赛。

一分钟速览
  1. 实验设计:在旧金山湾区租赁 30 栋陌生房子,搭载 Helix 2.5 的 Figure 03 未经任何环境适配,零样本执行整理客厅、折毛巾、整理床铺三种长时序行为。
  2. 核心数字:引入 Index 人类行为数据集预训练后,在任务数据、架构、训练与评测均不变的前提下,任务成功率从 8% 提升到 56%。
  3. 数据效率:相比前代 Helix 02,Helix 2.5 只用一半的任务专用数据,就把行为泛化到了 30 个前所未见的新环境。
  4. 算力投入:Figure 已承诺投入价值 35 亿美元的算力,本月与 Nscale 签多年期协议锁定约 10 万块英伟达 Vera Rubin 系列 GPU,合同总规模最高 60 亿美元。
  5. 自纠错行为:机器人能在陌生环境中后退重新定位、改变站姿、绕床修正折叠——从错误中恢复被官方归因于 Index 预训练。
数据来源与边界
素材时间窗为 2026-09-18 09:00 → 19:00。事件本体(Figure 发布 Helix 2.5 及 30 栋房屋实验)发生在当地时间 2026-09-17,属窗口外;本窗口内的新增量是科创板日报 2026-09-18 09:32 的中文报道及国内扩散,本篇以此为核查锚点。需标注的边界:其一,实验由 Figure 自行设计、自测并发布,30 栋房屋的选取标准、成功率的判分规则均未独立核验,「8%→56%」为厂商单方口径;其二,「Index 每秒生成约 35 分钟人类行为数据」的表述来自报道转述,量纲上存在张力,本文照录不采信;其三,算力合同金额为 Figure 与 Nscale 之间的商业条款,经科创板日报转述,属单一信源。文中对数据护城河与行业影响的推论为作者判断,已用「判断:」标注。
本文事实信息来自上方标注的公开来源;解读、判断与延伸部分为作者个人见解,写作过程使用了 AI 工具辅助整理,已由作者人工核实,不代表信息来源方立场。如有雷同纯属巧合;如涉及版权或权益问题,请联系 shenjibailian@shenjibailian.com,我们将在核实后及时删除或更正。
实验本身没什么花活,难的是「没见过」三个字

这次演示的设置故意做得很朴素:租 30 栋旧金山湾区的陌生房子,让 Figure 03 进门就干活——整理客厅、折毛巾、整理床铺,三种长时序行为。关键约束只有一条:Figure 从未针对这些房子内部的环境或物体做过任何数据采集、微调或适配。

这对机器人是三重叠加的难题。房子布局没见过,家具位置没见过,光线和杂物分布也没见过。机器人必须把穿行环境本身当作任务的一部分:在狭小、杂乱的空间里调整身体位置,才能观察、够取并操作物体。

结果层面,官方给出两组数字。第一组是总账:引入 Index 人类行为数据集预训练后,任务成功率从 8% 提升到 56%——而且这中间任务专用数据、模型架构、训练流程、评测方法全部保持不变,唯一的变量就是预训练数据。第二组是效率账:相比前代 Helix 02,Helix 2.5 只用了一半的任务专用数据,就把行为泛化到了 30 个前所未见的新环境。

零样本实验的关键数字依据科创板日报报道整理
陌生房屋
30 栋
任务成功率(无预训练)
8%
任务成功率(Index 预训练)
56%
算力合同上限
最高 60 亿美元
成功率为厂商单方口径,判分规则未独立核验;条形为示意比例。
比成功率更值得注意的是「从错误里爬出来」

报道里最容易被略过的一段,其实是自纠错行为:搭载 Helix 2.5 的机器人在陌生环境中会后退以重新定位、改变站姿,或者绕着整张床移动以修正折叠。Figure 把这种从错误中恢复、持续推进任务的能力归因于 Index 预训练。

为什么这条重要?因为长时序任务的失败从来不是单点失败,而是级联失败:一步抓偏,后面全乱。能否在失败后不重置、不返场,自己把局面捡回来,是「演示视频」和「能交付的产品」之间最硬的一条分界线。8% 到 56% 的提升说的是「做对的比例」,自纠错说的是「做错之后的下限」——后者对商业化可能更关键。

一个需要标注的量纲疑点:报道称「Index 每秒都会生成约 35 分钟的全新人类行为数据」,照字面理解是每秒产出 35 分钟数据,量纲上明显有张力,更可能是「每秒采集的行为折算为 35 分钟等效数据」之类的口径。本文照录不采信,等 Figure 原始新闻稿核对。
真正的消息在实验之外:60 亿美元买的是数据管道

把视线从房子挪开,这次发布真正的重量级信息是算力合同:Figure 已承诺投入价值 35 亿美元的算力资源用于训练 Helix,本月与 AI 基础设施供应商 Nscale 签订多年期协议,锁定约 10 万块英伟达 Vera Rubin 系列 GPU 的算力供应,并预留扩展空间,合同总规模最高有望达到 60 亿美元。

这笔钱买的不是「更聪明的模型」,而是数据到能力的转化管道。Figure 的逻辑链条很直白:Index 每天都在产生新的人类行为数据 → 预训练数据直接决定零样本泛化的成功率 → 成功率决定机器人能不能进家庭 → 进家庭又产生更多真实场景数据。官方那句「是时候扩大规模了」,翻译过来就是:既然数据规模对成功率的转化已被验证,那就把烧钱的方向从调架构改成铺数据。

判断:Figure 这次发布把行业竞争的焦点又往回挪了一格——从「模型架构创新」挪向「预训练数据资产」。8%→56% 这个数字的含义是:在架构和任务数据都不动的前提下,单纯换血预训练数据就能带来七倍的成功率提升,这是对「数据飞轮」路线最直接的商业验证。对国内同行的含义有两层:其一,只卷模型参数、不沉淀自有行为数据管道的团队,零样本泛化这条线会越落越远;其二,60 亿美元的算力合同意味着这条路线的门票价格已经从「融到 A 轮」涨到了「锁得起十万卡」,国内数据基建类公司(数采、评测、仿真)被资本密集下注,逻辑与此完全同源。要保留的怀疑是:全部数字出自厂商自测,30 栋房子的判分规则未公开,56% 离「可交付」仍有距离——它证明的是路线有效,不是产品成型。
来源:Figure 官方发布(当地时间 2026-09-17),经科创板日报 2026-09-18 09:32 中文报道;素材时间窗:2026-09-18 09:00 → 19:00,窗口内增量为该中文报道及国内扩散;实验为厂商自测,成功率判分规则与算力合同细节均未独立核验。