# 30 栋陌生房子零样本做家务：Figure 把「预训练数据」这件最无聊的事，变成了最贵的护城河

> Figure 用 30 栋从没见过的房子测 Helix 2.5：Index 人类行为数据预训练把任务成功率从 8% 拉到 56%，背后是最高 60 亿美元的算力合同。家务这件事，正在变成数据基础设施的军备竞赛。

### TLDR

- **实验设计**：在旧金山湾区租赁 **30 栋陌生房子**，搭载 Helix 2.5 的 Figure 03 未经任何环境适配，零样本执行整理客厅、折毛巾、整理床铺三种长时序行为。
- **核心数字**：引入 Index 人类行为数据集预训练后，在任务数据、架构、训练与评测均不变的前提下，任务成功率从 **8% 提升到 56%**。
- **数据效率**：相比前代 Helix 02，Helix 2.5 只用**一半的任务专用数据**，就把行为泛化到了 **30 个前所未见的新环境**。
- **算力投入**：Figure 已承诺投入价值 **35 亿美元**的算力，本月与 Nscale 签多年期协议锁定约 **10 万块英伟达 Vera Rubin 系列 GPU**，合同总规模最高 **60 亿美元**。
- **自纠错行为**：机器人能在陌生环境中后退重新定位、改变站姿、绕床修正折叠——从错误中恢复被官方归因于 Index 预训练。

### SRC

素材时间窗为 2026-09-18 09:00 → 19:00。事件本体（Figure 发布 Helix 2.5 及 30 栋房屋实验）发生在当地时间 2026-09-17，属窗口外；本窗口内的新增量是科创板日报 2026-09-18 09:32 的中文报道及国内扩散，本篇以此为核查锚点。需标注的边界：其一，实验由 Figure 自行设计、自测并发布，30 栋房屋的选取标准、成功率的判分规则均未独立核验，「8%→56%」为厂商单方口径；其二，「Index 每秒生成约 35 分钟人类行为数据」的表述来自报道转述，量纲上存在张力，本文照录不采信；其三，算力合同金额为 Figure 与 Nscale 之间的商业条款，经科创板日报转述，属单一信源。文中对数据护城河与行业影响的推论为作者判断，已用「判断：」标注。

### BODY

<div class="sec">
<div class="eyebrow">实验本身没什么花活，难的是「没见过」三个字</div>

这次演示的设置故意做得很朴素：租 **30 栋旧金山湾区的陌生房子**，让 Figure 03 进门就干活——整理客厅、折毛巾、整理床铺，三种长时序行为。关键约束只有一条：Figure 从未针对这些房子内部的环境或物体做过任何数据采集、微调或适配。

这对机器人是三重叠加的难题。房子布局没见过，家具位置没见过，光线和杂物分布也没见过。机器人必须把穿行环境本身当作任务的一部分：在狭小、杂乱的空间里调整身体位置，才能观察、够取并操作物体。

结果层面，官方给出两组数字。第一组是总账：引入 Index 人类行为数据集预训练后，任务成功率从 **8% 提升到 56%**——而且这中间任务专用数据、模型架构、训练流程、评测方法全部保持不变，唯一的变量就是预训练数据。第二组是效率账：相比前代 Helix 02，Helix 2.5 只用了**一半的任务专用数据**，就把行为泛化到了 30 个前所未见的新环境。

<div class="jx">
  <div class="jx-h"><span>零样本实验的关键数字</span><span class="jx-note">依据科创板日报报道整理</span></div>
  <div class="jx-bars">
    <div class="jx-bar-row"><div class="jx-bar-lab">陌生房屋</div><div class="jx-bar-track"><div class="jx-bar-fill" style="background:#0a749a" data-w="100%"></div></div><div class="jx-bar-val">30 栋</div></div>
    <div class="jx-bar-row"><div class="jx-bar-lab">任务成功率（无预训练）</div><div class="jx-bar-track"><div class="jx-bar-fill" style="background:#b85c0a" data-w="8%"></div></div><div class="jx-bar-val">8%</div></div>
    <div class="jx-bar-row"><div class="jx-bar-lab">任务成功率（Index 预训练）</div><div class="jx-bar-track"><div class="jx-bar-fill" style="background:#0d8a5f" data-w="56%"></div></div><div class="jx-bar-val">56%</div></div>
    <div class="jx-bar-row"><div class="jx-bar-lab">算力合同上限</div><div class="jx-bar-track"><div class="jx-bar-fill" style="background:#6d3fd4" data-w="85%"></div></div><div class="jx-bar-val">最高 60 亿美元</div></div>
  </div>
  <div class="cap">成功率为厂商单方口径，判分规则未独立核验；条形为示意比例。</div>
</div>

</div>

<div class="sec">
<div class="eyebrow">比成功率更值得注意的是「从错误里爬出来」</div>

报道里最容易被略过的一段，其实是自纠错行为：搭载 Helix 2.5 的机器人在陌生环境中会**后退以重新定位**、**改变站姿**，或者**绕着整张床移动以修正折叠**。Figure 把这种从错误中恢复、持续推进任务的能力归因于 Index 预训练。

为什么这条重要？因为长时序任务的失败从来不是单点失败，而是级联失败：一步抓偏，后面全乱。能否在失败后不重置、不返场，自己把局面捡回来，是「演示视频」和「能交付的产品」之间最硬的一条分界线。8% 到 56% 的提升说的是「做对的比例」，自纠错说的是「做错之后的下限」——后者对商业化可能更关键。

<div class="jx-note">一个需要标注的量纲疑点：报道称「Index 每秒都会生成约 35 分钟的全新人类行为数据」，照字面理解是每秒产出 35 分钟数据，量纲上明显有张力，更可能是「每秒采集的行为折算为 35 分钟等效数据」之类的口径。本文照录不采信，等 Figure 原始新闻稿核对。</div>

</div>

<div class="sec">
<div class="eyebrow">真正的消息在实验之外：60 亿美元买的是数据管道</div>

把视线从房子挪开，这次发布真正的重量级信息是算力合同：Figure 已承诺投入价值 **35 亿美元**的算力资源用于训练 Helix，本月与 AI 基础设施供应商 Nscale 签订多年期协议，锁定约 **10 万块英伟达 Vera Rubin 系列 GPU** 的算力供应，并预留扩展空间，合同总规模最高有望达到 **60 亿美元**。

这笔钱买的不是「更聪明的模型」，而是**数据到能力的转化管道**。Figure 的逻辑链条很直白：Index 每天都在产生新的人类行为数据 → 预训练数据直接决定零样本泛化的成功率 → 成功率决定机器人能不能进家庭 → 进家庭又产生更多真实场景数据。官方那句「是时候扩大规模了」，翻译过来就是：既然数据规模对成功率的转化已被验证，那就把烧钱的方向从调架构改成铺数据。

<div class="keypoint">判断：Figure 这次发布把行业竞争的焦点又往回挪了一格——从「模型架构创新」挪向「预训练数据资产」。8%→56% 这个数字的含义是：在架构和任务数据都不动的前提下，单纯换血预训练数据就能带来七倍的成功率提升，这是对「数据飞轮」路线最直接的商业验证。对国内同行的含义有两层：其一，只卷模型参数、不沉淀自有行为数据管道的团队，零样本泛化这条线会越落越远；其二，60 亿美元的算力合同意味着这条路线的门票价格已经从「融到 A 轮」涨到了「锁得起十万卡」，国内数据基建类公司（数采、评测、仿真）被资本密集下注，逻辑与此完全同源。要保留的怀疑是：全部数字出自厂商自测，30 栋房子的判分规则未公开，56% 离「可交付」仍有距离——它证明的是路线有效，不是产品成型。</div>

<div class="srcline">来源：Figure 官方发布（当地时间 2026-09-17），经科创板日报 2026-09-18 09:32 中文报道；素材时间窗：2026-09-18 09:00 → 19:00，窗口内增量为该中文报道及国内扩散；实验为厂商自测，成功率判分规则与算力合同细节均未独立核验。</div>
</div>

---

*来源：神机百见-具身解读 · https://www.shenjibailian.com/jiedu/article/figure-helix25-zero-shot-homes/*
