具身数据工厂:训练师、270 台套、年产 2000 万条,采集到底多贵
有效采集时薪 70 元,中介渠道 15 元;专业遥操员干 8 小时产 2–3 小时有效数据;真机数据报价每小时 500–1000 元。把这些数字排在一起,具身数据工厂这门生意的真实形状就出来了——它卖的从来不是数据。
本篇目录
- 缺口的两个数字差了两万倍:行业称训练通用具身智能需要 100 亿小时真实交互数据,而国内合规可用的真实物理交互数据仅 50 万小时。
- 采集员的价差极大:企业直招的有效采集时薪 70 元;部分中介渠道每小时 15 元,日结、扣保险后一天到手 147 元。
- 产能系数是这门生意的核心:专业遥操员工作 8 小时,平均只能产出 2–3 小时有效数据;京东科技的口径是「一年前带本体干 8 小时只产 1 小时」。
- 真机数据的报价:约每小时 500–1000 元;要求技术背景或驻场的采集员月薪 8000–15000 元。
- 规模化基建的产能:石景山一、二、三期共近 270 台(套)机器人满负荷运转,年产高质量数据近 2000 万条;二期百余台双足人形年产出超 600 万条。
- 最反常识的一条:「有效」不是数据的属性,是数据与某个模型、某副身体、某项任务的匹配关系。这意味着「我有 X 万小时数据」这句话本身没有信息量。
100 亿小时和 50 万小时,这两个数不能相减
基元智航 CEO 高少龙给出的两个数字被广泛引用:训练通用型具身智能机器人需要 100 亿小时多场景真实交互数据,而目前国内合规可用的真实物理交互数据仅 50 万小时。
按 50 万小时现有存量计算,差距约 20000 倍。
即使按最乐观的产能扩张速度,这个缺口也不可能在可预见周期内靠「采集」填平。
「合规可用」是限定条件——大量已采集数据因格式不一、标注缺失、授权不清而无法进入训练集。
分母里的水,比分子里的更不好估。
做排期时把它当目标,会得出「永远做不完」;做预算时把它当分母,会得出「投多少都值」。两种用法都是错的。
70 元和 15 元,同一份劳动
据北京日报客户端调查,企业给具身智能数据采集员的薪酬标准是每小时 70 元(按有效采集时长计),部分地区叠加专项补贴。可调动的兼职数采员规模已接近百万级,分布在东北、新疆、贵州、安徽等地的三四线城市与乡镇。
但同一份劳动在不同渠道的价差极大:部分人力公司直招岗位每日工作 5–8 小时,日薪 200–300 元;而通过中介接单的从业者,时薪只有 15 元。报道中的一位从业者 7 月起经中介兼职,日结,一天录制下来扣除保险到手 147 元。
还有一个容易被忽略的成本:这份工作并不轻松。报道中提到,从业者需要头戴较重的摄像设备(不能大幅晃动头部,否则采集无效)、手上使用模拟机器人抓握动作的机械抓夹,手臂长时间悬空,同一动作重复几十次甚至上百次。有从业者形容「累过进厂打螺丝」。
这直接影响数据质量:一个疲劳的采集员做出来的动作,与真实场景里的自然动作分布是有偏差的,而这种偏差会被模型学进去。
8 小时里只有 2–3 小时算数
这是数据工厂最该被记住的一个数字:一名专业遥操员工作 8 小时,平均只能产出 2–3 小时有效数据(公开信息估算)。京东科技集团副总裁何贺给的口径更狠——一年前,员工带着机器人本体干 8 小时,往往只能产出 1 小时有效数据。
仿真最便宜这个默认假设,可能已经不成立
过去两年行业的默认成本顺序是:仿真 < 无本体(UMI)< 真机。采购策略也是按这个顺序做的——先买便宜的仿真数据铺量,再补真机数据做适配。
觅蜂科技(智元机器人孵化)董事长兼 CEO 姚卯青在新华财经 9 月 3 日的采访里给了一个会颠覆这个顺序的说法:无本体数据的单小时成本,甚至已经低于仿真数据。同一批信息里还有:觅蜂第 2 万套 MEgo 无本体采集设备下线,累计生产的无本体数据已超 100 万小时。
| 路线 | 成本项 | 优势 | 代价 |
|---|---|---|---|
| 仿真 | 算力、场景建模、引擎授权 | 可无限扩量,可造失败样本 | sim-to-real 差距,物理保真度不足 |
| 无本体(UMI) | 轻量设备、人力、场景协调 | 真实人类操作分布,成本快速下降 | 缺力控与触觉,无本体动力学信息 |
| 真机遥操作 | 本体折旧、场地、专业操作员 | 数据与目标本体完全对齐 | 产能系数低(8h→2–3h),单价最高 |
英伟达那个被广泛引用的例子说明了配比的可能性:用少量人类演示生成 78 万条合成轨迹,相当于 6500 小时人工示范数据,整个生成过程只用了 11 小时。这就是「用昂贵的真机/人工做种子,用仿真或无本体做扩量」的标准打法。
Figure 的经历则从反面说明了配比失败的样子:它曾向外部供应商采购数据,后来发现这些数据很难同时满足自家模型对规模、多样性和质量的三重要求,于是转向自建 Index 平台做众包采集,目前已向创作者支付 1500 万美元。
数据回购条款,暴露了真实商业模式
中国信通院人工智能所联合发布的《具身智能训练场研究报告(2026 年)》给出了一句很关键的判断:训练场属于重资产投入,数据产品出售虽然最快形成收入,但仅依靠卖数据难以覆盖重资产投入,回本周期较长。
配合另一条信息看,商业模式就清楚了:多名从业者透露,一些地方愿意出钱购买机器人、建设训练场,但在项目谈判时会要求机器人公司回购数据。回购条款本质上是给这笔重资产投资做的一张保单。
· 一、二、三期共近 270 台(套)机器人满负荷训练
· 年产高质量数据近 2000 万条
· 二期百余台全尺寸双足人形,年产超 600 万条
· 三期聚焦触觉及多模态感知
· 支持 百台终端并行采集
· 覆盖 50–100 类任务场景
· 预计降低 30%–50%初期研发成本
· 同时建 UMI 与高保真遥操作两类数据
最后回到那个最反常识、也最该被记住的判断。虎嗅·降噪 NoNoise 的报道里有一句说得非常准:「有效」很难成为数据自身的固定属性,它取决于数据能否与某个模型、某副身体和某项任务匹配。
这句话的推论很硬:供应商交付 1000 小时有效数据,可能只是完成了前两层;客户期待的却是机器人能力随之增长。从拍下一段动作,到机器人真正学会,中间存在一条数据折损链。宇树创始人王兴兴的说法是,机器人每进行一次输入和输出,都可能产生偏差和损失。
所以产业链上出现了一种根深蒂固的错位:供应商按设备、人工和采集时长投入成本,客户却只愿意为模型效果付钱。中间的损耗由谁承担,是这门生意至今没算清的一笔账。
换句话说,这门生意的真实形态不是卖数据,是卖「提升某个具体成功率的工程服务」。按小时报价的公司会死,按成功率提升报价的公司才活得下去。
如果你要采数据,先算这五笔
产能系数(8h→2–3h)、真机数据报价(500–1000 元/小时)、驻场月薪(8000–15000 元)在原报道中标注为「根据公开信息估算」,非实测统计。觅蜂科技的「无本体成本已低于仿真」、2 万套设备与 100 万小时数据,均为企业自述的单一信源,本文已标注需打折对待。
《具身智能训练场研究报告(2026 年)》的具体发布机构表述为「中国信通院人工智能所联合发布」,本文未获取到报告原文,仅转述媒体的引述内容。
解读时间:2026-09-04。