1600 万条家务视频、1500 万美元:Figure 把数据采集外包给了普通人
Figure 8 月 25 日上线的 Index App,四个月收了 1600 万条家务视频、付给创作者 1500 万美元。这条新闻真正的看点不是规模,是它把数据的单位成本压到了一美元以下——以及这个价格背后放弃了什么。
- 上线时间与代号:Index 于 2026 年 8 月 25 日公开上线,内部代号 Project Go-Big,开发周期 4 个月。
- 规模:收到超过 1600 万条视频,来自 108 个国家;累计下载 26.4 万次,周活跃用户 4.4 万。
- 密度:官方口径称每 1000 小时数据覆盖 373 个不同任务、1146 个被操作物体、116 个环境。
- 钱:已向创作者支付 1500 万美元,并承诺投入超过 10 亿美元用于扩大数据采集与算力,目标一年内扩张 100 倍。
- 流向:原始视频经五阶段清洗流水线处理后,喂给 Helix——驱动 Figure 03 的 VLA 模型。
- 成本推论(本文推算):1500 万美元 ÷ 1600 万条 ≈ 不足 1 美元/条,但这个摊薄口径掩盖了一个问题——拿到钱的很可能只是周活里的一小部分人。
不是 App,是一条数据管道的前端
Figure 在 2026 年 8 月 25 日上线的 Index,表面看是一个让人上传家务视频的手机应用;实际上它是 Figure 数据供应链的最前端——用现金换取普通人手机里已经存在、但从未被结构化的操作影像。
内部代号 Project Go-Big,开发周期四个月。这个节奏本身就说明问题:它不是长期规划的产品,是为解一个具体瓶颈而临时搭的管道。当一家机器人公司用四个月赶出一个面向消费者的 App,通常意味着原有的数据采集速度已经跟不上模型训练需求。
数据流向是清晰的:原始视频经五阶段清洗流水线处理后,喂给 Helix,也就是驱动 Figure 03 的 VLA 模型。五个阶段具体做什么,报道没有展开——这是最该被追问却没被追问的一节。
不足一美元一条,是怎么做到的
1500 万美元 ÷ 1600 万条 ≈ 0.94 美元/条(本文推算)。再按周活 4.4 万人摊,人均贡献约 364 条(本文推算)。这两个数字放在一起,会推出一个不太舒服的结论。
364 条/人,如果按每条 10 秒算是一个多小时的素材;按每条 30 秒算是三小时。这意味着活跃用户不是随手拍一条,而是成批地翻出相册里的家务影像上传。换句话说,Index 拿到的很可能不是「为机器人采集的规范化演示」,而是存量生活素材。
| 通道 | 单位成本量级 | 数据质量特征 | 主要风险 |
|---|---|---|---|
| 真机遥操作采集场 | 最高(设备+场地+训练师) | 带力/位姿真值,与本体同构 | 场景单一、扩张慢 |
| UMI 手持夹具 | 中(硬件一次性+人力) | 末端轨迹准确,视角与人眼接近 | 无本体动力学信息 |
| 众包视频(Index) | 最低(<1 美元/条量级) | 任务与物体多样性极高 | 无动作标注、无真值、合格率未知 |
再看密度口径:每 1000 小时覆盖 373 个任务、1146 个被操作物体、116 个环境(官方口径,单一信源)。这组数字值得肯定——它说明 Figure 在度量自己数据的多样性,而不是只报总量。行业里绝大多数数据发布只报小时数,小时数是最容易造假也最没有信息量的指标:一百万小时同一个动作重复拍摄,和一千小时覆盖三百个任务,价值完全不同。
但换算一下会发现另一个问题:1000 小时 ÷ 373 个任务 ≈ 每个任务平均 2.7 小时;1146 个物体摊到 373 个任务上约 3 个/任务(本文推算)。这是一个宽而浅的分布。对预训练有用,对让机器人稳定完成某一个具体任务,帮助有限。
整条链路里最值钱、也最没被说清的一段
报道只说了「五阶段清洗流水线」,没有说这五个阶段是什么。基于常识与同类实践,可以推断它至少要解决四件事,但这四件事的难度差异极大:
这里藏着众包路线真正的成本:采集便宜,清洗昂贵。付出去的 1500 万美元只是入门费,后面把 1600 万条原始视频变成可训练样本的计算与人工成本,没有被披露,而且很可能高于采集端。
还有一个被跳过的环节是动作真值。视频里只有像素,没有关节角度,没有力矩,没有接触力。用这样的素材训练 VLA,模型能学到「看到这个场景应该往这个方向伸手」,学不到「用多大力」。这就是为什么众包数据几乎不可能单独支撑精细操作——它补的是语义与场景先验,不是控制。
三条能立刻用的结论,和一条不能抄的
1 · 报密度不报总量。「每千小时覆盖多少任务/物体/环境」这个口径值得抄,它比小时数诚实得多,也更容易被客户与投资人核验。
2 · 分层采购数据。长尾语义用低成本通道,精细操作用真机通道,两条线分开预算、分开考核,不要混在一口锅里算平均成本。
3 · 把清洗当成主成本项。做采集预算时,清洗与标注的占比应该显著高于采集激励,否则交付的是一堆不能训练的素材。
众包 App 这条路本身。有两个前提国内不具备:一是跨境数据合规——108 个国家的素材意味着 108 套规则,国内做同等规模会立刻撞上数据出境与个人信息保护的硬约束;二是付费意愿结构——1500 万美元换 1600 万条,依赖的是创作者对「AI 公司会为我的素材付钱」的预期,这个预期在国内尚未形成。
更现实的路径是方案里写的那条:整机企业与下游真实场景方合作采集工作数据。场景有限,但每一条都带真值和付费方。
最后留一个需要持续盯的信号:报道称 Figure 承诺投入超 10 亿美元扩大数据采集与算力,目标一年内扩张 100 倍,且与 Nscale 的 35 亿美元算力协议仅相隔一周。这两笔钱的兑现节奏,比 Index 的用户数更值得跟踪——前者是承诺,后者是已经发生的支出。如果 12 个月后投入没有跟上,说明众包路线的清洗成本超出了预期。
所有换算(0.94 美元/条、人均约 364 条、每任务约 2.7 小时、每任务约 3 个物体)为本文基于上述公开数字的算术推算,非官方口径,且建立在「1500 万美元分摊至全部 1600 万条视频」这一假设上,实际分配规则未公开,因此该推算仅用于量级判断。
「五阶段清洗的四道关卡」「三种采集通道成本结构对比」「可迁移三条」为本文分析与判断,非 Figure 公开信息。
解读时间:2026-09-07。