# 1600 万条家务视频、1500 万美元：Figure 把数据采集外包给了普通人

> Figure 8 月 25 日上线的 Index App，四个月收了 1600 万条家务视频、付给创作者 1500 万美元。这条新闻真正的看点不是规模，是它把数据的单位成本压到了一美元以下——以及这个价格背后放弃了什么。

### TLDR

- **上线时间与代号**：Index 于 **2026 年 8 月 25 日**公开上线，内部代号 Project Go-Big，开发周期 **4 个月**。
- **规模**：收到超过 **1600 万条**视频，来自 **108 个国家**；累计下载 **26.4 万次**，周活跃用户 **4.4 万**。
- **密度**：官方口径称每 **1000 小时**数据覆盖 **373 个**不同任务、**1146 个**被操作物体、**116 个**环境。
- **钱**：已向创作者支付 **1500 万美元**，并承诺投入超过 **10 亿美元**用于扩大数据采集与算力，目标一年内扩张 **100 倍**。
- **流向**：原始视频经**五阶段**清洗流水线处理后，喂给 Helix——驱动 Figure 03 的 VLA 模型。
- **成本推论（本文推算）**：1500 万美元 ÷ 1600 万条 ≈ **不足 1 美元/条**，但这个摊薄口径掩盖了一个问题——拿到钱的很可能只是周活里的一小部分人。

### SRC

本文核心数字来自 FutureX Physical AI Daily Issue 111（2026-09-06，载于 dev.to，原站 archive.futurexon.com）的条目整理，其原始出处标注为 Crypto Briefing 于 2026 年 9 月初的报道（https://cryptobriefing.com/figure-ai-index-app-humanoid-robots/）。截至抓取时（2026-09-07），**未检索到 Figure 官方公告、官方博客或新闻稿对这组数字的直接确认**，因此本文按「单一信源 + 二手转述」处理，所有数字均不宜直接用于正式判断。

已核查的不一致与缺失：报道未说明 1600 万条视频中通过五阶段清洗的**合格率**；未说明 1500 万美元的分配规则（按条、按时长还是按任务）；未公布单条视频平均有效时长。关联事实「Figure 与 Nscale 达成 35 亿美元算力协议」由同篇提及，时间上早于 Index 发布约一周。文中「不足 1 美元/条」「周活人均约 364 条」等换算为本文基于公开数字的推算，非官方口径，已明确标注。

### BODY

<div class="sec"><div class="eyebrow"><span class="num">1</span>这个产品是什么</div>
<h2>不是 App，是一条数据管道的前端</h2>

<p>Figure 在 2026 年 8 月 25 日上线的 Index，表面看是一个让人上传家务视频的手机应用；实际上它是 Figure 数据供应链的最前端——用现金换取普通人手机里已经存在、但从未被结构化的操作影像。</p>

<p>内部代号 Project Go-Big，开发周期四个月。这个节奏本身就说明问题：它不是长期规划的产品，是<strong>为解一个具体瓶颈而临时搭的管道</strong>。当一家机器人公司用四个月赶出一个面向消费者的 App，通常意味着原有的数据采集速度已经跟不上模型训练需求。</p>

<div class="jx">
  <div class="jx-h"><span>Index 的关键数字</span><span class="jx-note">均为单一信源转述，未经 Figure 官方确认</span></div>
  <div class="jx-bars">
    <div class="jx-bar-row"><div class="jx-bar-lab">累计收到视频</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:100%;background:#0a749a"></div></div><div class="jx-bar-val">1600 万条</div></div>
    <div class="jx-bar-row"><div class="jx-bar-lab">覆盖国家</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:55%;background:#00a6d6"></div></div><div class="jx-bar-val">108 个</div></div>
    <div class="jx-bar-row"><div class="jx-bar-lab">累计下载</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:22%;background:#0d8a5f"></div></div><div class="jx-bar-val">26.4 万次</div></div>
    <div class="jx-bar-row"><div class="jx-bar-lab">周活跃用户</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:10%;background:#2563eb"></div></div><div class="jx-bar-val">4.4 万人</div></div>
    <div class="jx-bar-row"><div class="jx-bar-lab">已付创作者</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:63%;background:#b85c0a"></div></div><div class="jx-bar-val">1500 万美元</div></div>
    <div class="jx-bar-row"><div class="jx-bar-lab">承诺投入（采集+算力）</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:96%;background:#6d3fd4"></div></div><div class="jx-bar-val">超 10 亿美元</div></div>
  </div>
  <div class="jx-legend"><div class="jx-lg">条形长度按各类别相对量级示意，纵向不可比；1500 万美元与 10 亿美元不同单位，仅按数值映射到同一区间比较。</div></div>
  <div class="cap">「已付」和「承诺」要分开读：前者是已经发生的现金流出，后者是意向。这两栏之间隔着一整个融资环境。</div>
</div>

<p>数据流向是清晰的：原始视频经<strong>五阶段清洗流水线</strong>处理后，喂给 Helix，也就是驱动 Figure 03 的 VLA 模型。五个阶段具体做什么，报道没有展开——这是最该被追问却没被追问的一节。</p>

<div class="keypoint">
  <strong>判断：</strong>这条新闻的读法不是「Figure 很聪明地众包了数据」，而是<strong>机器人公司第一次把数据采集的成本结构公开化</strong>。过去数据成本是黑箱：多少台采集设备、多少名训练师、每小时产多少条，都藏在融资 PPT 里。现在有了 1500 万美元 / 1600 万条这组数，行业第一次能拿它当标尺去比对自己那条采集线的单位成本。
</div>
</div>

<div class="sec"><div class="eyebrow"><span class="num">2</span>单位成本这笔账</div>
<h2>不足一美元一条，是怎么做到的</h2>

<p>1500 万美元 ÷ 1600 万条 ≈ <strong>0.94 美元/条</strong>（本文推算）。再按周活 4.4 万人摊，人均贡献约 364 条（本文推算）。这两个数字放在一起，会推出一个不太舒服的结论。</p>

<p>364 条/人，如果按每条 10 秒算是一个多小时的素材；按每条 30 秒算是三小时。这意味着活跃用户不是随手拍一条，而是<strong>成批地翻出相册里的家务影像上传</strong>。换句话说，Index 拿到的很可能不是「为机器人采集的规范化演示」，而是<strong>存量生活素材</strong>。</p>

<div class="jx">
  <div class="jx-h"><span>三种数据采集通道的成本结构</span><span class="jx-note">Index 一列为本文据公开数字推算，其余为通用行业分类</span></div>
  <div class="tbl-wrap">
  <table>
    <tr><th>通道</th><th>单位成本量级</th><th>数据质量特征</th><th>主要风险</th></tr>
    <tr><th>真机遥操作采集场</th><td>最高（设备+场地+训练师）</td><td>带力/位姿真值，与本体同构</td><td>场景单一、扩张慢</td></tr>
    <tr><th>UMI 手持夹具</th><td>中（硬件一次性+人力）</td><td>末端轨迹准确，视角与人眼接近</td><td>无本体动力学信息</td></tr>
    <tr><th>众包视频（Index）</th><td>最低（&lt;1 美元/条量级）</td><td>任务与物体多样性极高</td><td>无动作标注、无真值、合格率未知</td></tr>
  </table>
  </div>
  <div class="cap">三种通道不是替代关系。低成本通道买的是<strong>多样性的长尾</strong>，高成本通道买的是<strong>可监督的真值</strong>。把众包数据当主粮，模型会见过万物但不会动手。</div>
</div>

<p>再看密度口径：每 1000 小时覆盖 373 个任务、1146 个被操作物体、116 个环境（官方口径，单一信源）。这组数字值得肯定——<strong>它说明 Figure 在度量自己数据的多样性，而不是只报总量</strong>。行业里绝大多数数据发布只报小时数，小时数是最容易造假也最没有信息量的指标：一百万小时同一个动作重复拍摄，和一千小时覆盖三百个任务，价值完全不同。</p>

<p>但换算一下会发现另一个问题：1000 小时 ÷ 373 个任务 ≈ 每个任务平均 2.7 小时；1146 个物体摊到 373 个任务上约 3 个/任务（本文推算）。这是一个<strong>宽而浅</strong>的分布。对预训练有用，对让机器人稳定完成某一个具体任务，帮助有限。</p>
</div>

<div class="sec"><div class="eyebrow"><span class="num">3</span>五阶段清洗</div>
<h2>整条链路里最值钱、也最没被说清的一段</h2>

<p>报道只说了「五阶段清洗流水线」，没有说这五个阶段是什么。基于常识与同类实践，可以推断它至少要解决四件事，但这四件事的难度差异极大：</p>

<div class="jx">
  <div class="jx-h"><span>众包视频必须过掉的关卡</span><span class="jx-note">四道关卡为本文推断，非 Figure 公开流程</span></div>
  <div class="jx-tl">
    <div class="jx-tl-row"><div class="jx-tl-t">第 1 关 · 去重与去重影</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#0a749a">同一段素材被多终端上传、平台搬运、AI 生成内容混入</div></div></div>
    <div class="jx-tl-row"><div class="jx-tl-t">第 2 关 · 隐私与合规</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#00a6d6">108 个国家意味着 108 套个人信息与肖像权规则，家庭内部影像尤其敏感</div></div></div>
    <div class="jx-tl-row"><div class="jx-tl-t">第 3 关 · 任务切分与标注</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#0d8a5f">把连续长视频切成有语义的动作片段，并给出语言指令</div></div></div>
    <div class="jx-tl-row"><div class="jx-tl-t">第 4 关 · 视角与本体对齐</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#b85c0a">手持手机视角不是机器人头部相机视角，这一步的落差决定数据能不能直接用</div></div></div>
  </div>
  <div class="cap">第 4 关是众包路线最难也最少被讨论的一环。人的手有五指、有触觉、有本体感觉；机器人的夹爪没有。同样的动作，人的可行性不等于机器人的可行性。</div>
</div>

<p>这里藏着众包路线真正的成本：<strong>采集便宜，清洗昂贵</strong>。付出去的 1500 万美元只是入门费，后面把 1600 万条原始视频变成可训练样本的计算与人工成本，没有被披露，而且很可能高于采集端。</p>

<p>还有一个被跳过的环节是<strong>动作真值</strong>。视频里只有像素，没有关节角度，没有力矩，没有接触力。用这样的素材训练 VLA，模型能学到「看到这个场景应该往这个方向伸手」，学不到「用多大力」。这就是为什么众包数据几乎不可能单独支撑精细操作——它补的是语义与场景先验，不是控制。</p>

<div class="keypoint">
  <strong>判断：</strong>把 Index 理解成「Figure 找到了便宜数据」是读错了方向。更准确的理解是：<strong>Figure 用一笔可控的现金，买了模型预训练所需的场景长尾，把自己那套昂贵的真机采集资源全部腾出来做后训练与精细操作</strong>。这是一个资源再分配决策，不是成本削减决策。同理，国内厂商如果手上只有一条采集通道，无论是真机还是仿真，都应该先问一句：这条通道现在做的活，是不是本可以用更便宜的方式替代掉。
</div>
</div>

<div class="sec"><div class="eyebrow"><span class="num">4</span>对国内厂商</div>
<h2>三条能立刻用的结论，和一条不能抄的</h2>

<div class="jx">
  <div class="jx-h"><span>可迁移 / 不可迁移</span><span class="jx-note">适配性判断为本文观点</span></div>
  <div class="jx-split">
    <div style="flex:50">
      <div class="eyebrow">可迁移</div>
      <p><strong>1 · 报密度不报总量。</strong>「每千小时覆盖多少任务/物体/环境」这个口径值得抄，它比小时数诚实得多，也更容易被客户与投资人核验。</p>
      <p><strong>2 · 分层采购数据。</strong>长尾语义用低成本通道，精细操作用真机通道，两条线分开预算、分开考核，不要混在一口锅里算平均成本。</p>
      <p><strong>3 · 把清洗当成主成本项。</strong>做采集预算时，清洗与标注的占比应该显著高于采集激励，否则交付的是一堆不能训练的素材。</p>
    </div>
    <div style="flex:50">
      <div class="eyebrow">不可迁移</div>
      <p><strong>众包 App 这条路本身。</strong>有两个前提国内不具备：一是跨境数据合规——108 个国家的素材意味着 108 套规则，国内做同等规模会立刻撞上数据出境与个人信息保护的硬约束；二是付费意愿结构——1500 万美元换 1600 万条，依赖的是创作者对「AI 公司会为我的素材付钱」的预期，这个预期在国内尚未形成。</p>
      <p>更现实的路径是方案里写的那条：<strong>整机企业与下游真实场景方合作采集工作数据</strong>。场景有限，但每一条都带真值和付费方。</p>
    </div>
  </div>
  <div class="cap">左栏三条今天就能用，右栏一条是环境差异造成的硬约束，别硬抄。</div>
</div>

<p>最后留一个需要持续盯的信号：报道称 Figure 承诺投入超 10 亿美元扩大数据采集与算力，目标一年内扩张 100 倍，且与 Nscale 的 35 亿美元算力协议仅相隔一周。<strong>这两笔钱的兑现节奏，比 Index 的用户数更值得跟踪</strong>——前者是承诺，后者是已经发生的支出。如果 12 个月后投入没有跟上，说明众包路线的清洗成本超出了预期。</p>

<div class="srcline">
  <div class="h">本文的边界</div>
  Index 的全部数字（8 月 25 日上线、Project Go-Big 代号、4 个月开发周期、1600 万条视频、108 个国家、26.4 万次下载、4.4 万周活、每千小时 373 个任务 / 1146 个物体 / 116 个环境、已付 1500 万美元、承诺超 10 亿美元、100 倍目标、五阶段清洗、喂给 Helix、Nscale 35 亿美元协议）均来自 FutureX Physical AI Daily Issue 111（2026-09-06）对 Crypto Briefing 报道的转述，<strong>为单一信源，且未经 Figure 官方确认</strong>。Crypto Briefing 为主营加密资产的媒体，非机器人行业一手信源，其数据准确性本文无法独立核验。<br><br>
  所有换算（0.94 美元/条、人均约 364 条、每任务约 2.7 小时、每任务约 3 个物体）为本文基于上述公开数字的算术推算，非官方口径，且建立在「1500 万美元分摊至全部 1600 万条视频」这一假设上，实际分配规则未公开，因此该推算仅用于量级判断。<br><br>
  「五阶段清洗的四道关卡」「三种采集通道成本结构对比」「可迁移三条」为<strong>本文分析与判断</strong>，非 Figure 公开信息。<br><br>
  解读时间：2026-09-07。
</div>
</div>

---

*来源：神机百见-具身解读 · https://www.shenjibailian.com/jiedu/article/figure-index-crowdsourced-data/*
