实战记录 · 神机百见解读

具身数据工厂:训练师、270 台套、年产 2000 万条,采集到底多贵

有效采集时薪 70 元,中介渠道 15 元;专业遥操员干 8 小时产 2–3 小时有效数据;真机数据报价每小时 500–1000 元。把这些数字排在一起,具身数据工厂这门生意的真实形状就出来了——它卖的从来不是数据。

本篇目录6 节 · 12 分钟
一分钟速览
  1. 缺口的两个数字差了两万倍:行业称训练通用具身智能需要 100 亿小时真实交互数据,而国内合规可用的真实物理交互数据仅 50 万小时
  2. 采集员的价差极大:企业直招的有效采集时薪 70 元;部分中介渠道每小时 15 元,日结、扣保险后一天到手 147 元。
  3. 产能系数是这门生意的核心:专业遥操员工作 8 小时,平均只能产出 2–3 小时有效数据;京东科技的口径是「一年前带本体干 8 小时只产 1 小时」。
  4. 真机数据的报价:约每小时 500–1000 元;要求技术背景或驻场的采集员月薪 8000–15000 元。
  5. 规模化基建的产能:石景山一、二、三期共近 270 台(套)机器人满负荷运转,年产高质量数据近 2000 万条;二期百余台双足人形年产出超 600 万条。
  6. 最反常识的一条:「有效」不是数据的属性,是数据与某个模型、某副身体、某项任务的匹配关系。这意味着「我有 X 万小时数据」这句话本身没有信息量。
数据来源与边界
薪酬与从业规模数据(有效采集时薪 70 元、兼职规模近百万级、中介 15 元/小时、日薪 200–300 元)来自北京日报客户端记者调查,经北京市政府门户网站 2026 年 9 月 4 日转载,为可核查的官方渠道;其中基元智航 CEO 高少龙给出的「100 亿小时需求 / 50 万小时存量」为行业估算的单一信源,非统计口径数据。产能系数(8 小时产 2–3 小时有效数据)、真机数据报价(每小时 500–1000 元)、驻场采集员月薪(8000–15000 元)来自虎嗅·降噪 NoNoise 与 CBNData 的同题报道,标注为「根据公开信息估算」。《具身智能训练场研究报告(2026 年)》引述自中国信通院人工智能所联合发布版本。石景山训练中心的 270 台(套)与年产 2000 万条,来自北京市政府门户网站 2026 年 9 月 1 日石景山区公告,为官方口径。觅蜂科技 2 万套设备、100 万小时数据与「无本体成本低于仿真」的表述来自新华财经 2026 年 9 月 3 日采访,为企业自述的单一信源。
1先算缺口

100 亿小时和 50 万小时,这两个数不能相减

基元智航 CEO 高少龙给出的两个数字被广泛引用:训练通用型具身智能机器人需要 100 亿小时多场景真实交互数据,而目前国内合规可用的真实物理交互数据仅 50 万小时

需求与存量行业估算,单一信源,非统计量
目标 · 100 亿小时

按 50 万小时现有存量计算,差距约 20000 倍

即使按最乐观的产能扩张速度,这个缺口也不可能在可预见周期内靠「采集」填平。

存量 · 50 万小时

「合规可用」是限定条件——大量已采集数据因格式不一、标注缺失、授权不清而无法进入训练集。

分母里的水,比分子里的更不好估。

两个数字来自同一位业内人士的估算,缺口的量级本身就是估算的。它可以说明方向,不能用来做产能规划。
判断:「100 亿小时」不是一个工程指标,是一句用来募资和招商的话。没有任何人验证过通用具身智能到底需要多少小时——这个数字是按语言模型的 token 量级外推出来的类比,不是实验结论。复旦肖仰华教授的表述更诚实:他给出的是「数据鸿沟至少两个数量级」这个保守估计,而不是一个确切终点。

做排期时把它当目标,会得出「永远做不完」;做预算时把它当分母,会得出「投多少都值」。两种用法都是错的。
2采集员的账

70 元和 15 元,同一份劳动

据北京日报客户端调查,企业给具身智能数据采集员的薪酬标准是每小时 70 元(按有效采集时长计),部分地区叠加专项补贴。可调动的兼职数采员规模已接近百万级,分布在东北、新疆、贵州、安徽等地的三四线城市与乡镇。

但同一份劳动在不同渠道的价差极大:部分人力公司直招岗位每日工作 5–8 小时,日薪 200–300 元;而通过中介接单的从业者,时薪只有 15 元。报道中的一位从业者 7 月起经中介兼职,日结,一天录制下来扣除保险到手 147 元。

采集侧的三组价格北京日报调查,2026-09-04
企业直招 · 有效时薪
70 元/小时
直招折算 · 日薪 200–300 元
约 25–60 元/小时
中介渠道 · 时薪
15 元/小时
最高与最低相差 4.7 倍。价差本身说明这个行业的用工价格发现机制还没建立,也说明「采集成本」这个数字在不同公司嘴里不是一个东西。

还有一个容易被忽略的成本:这份工作并不轻松。报道中提到,从业者需要头戴较重的摄像设备(不能大幅晃动头部,否则采集无效)、手上使用模拟机器人抓握动作的机械抓夹,手臂长时间悬空,同一动作重复几十次甚至上百次。有从业者形容「累过进厂打螺丝」。

这直接影响数据质量:一个疲劳的采集员做出来的动作,与真实场景里的自然动作分布是有偏差的,而这种偏差会被模型学进去。

3产能系数

8 小时里只有 2–3 小时算数

这是数据工厂最该被记住的一个数字:一名专业遥操员工作 8 小时,平均只能产出 2–3 小时有效数据(公开信息估算)。京东科技集团副总裁何贺给的口径更狠——一年前,员工带着机器人本体干 8 小时,往往只能产出 1 小时有效数据。

有效数据的折损链每一环都在漏
工时
8 小时在岗
− 准备
设备穿戴、场景布置、标定、热身
− 无效
动作越界、遮挡、超视角、姿态抖动
− 废片
质检不过、标注不合格、格式错误
= 有效
2–3 小时(专业遥操员);带本体场景曾低至 1 小时
报价时如果按工时算,会低估成本 3–8 倍。所有数据采购合同都应该按有效时长结算,而不是按人天。
判断:这个系数决定了数据这门生意的毛利结构。按每小时 500–1000 元的真机数据报价、一个遥操员 8 小时产 2.5 小时有效数据来算,单人单日的产值上限在 1250–2500 元,而成本是薪酬 + 场地 + 设备折旧 + 电费。这中间的余量,比外界想象的薄得多。所谓「数据生意暴利」,在这个系数面前站不住。
4成本顺序在翻转

仿真最便宜这个默认假设,可能已经不成立

过去两年行业的默认成本顺序是:仿真 < 无本体(UMI)< 真机。采购策略也是按这个顺序做的——先买便宜的仿真数据铺量,再补真机数据做适配。

觅蜂科技(智元机器人孵化)董事长兼 CEO 姚卯青在新华财经 9 月 3 日的采访里给了一个会颠覆这个顺序的说法:无本体数据的单小时成本,甚至已经低于仿真数据。同一批信息里还有:觅蜂第 2 万套 MEgo 无本体采集设备下线,累计生产的无本体数据已超 100 万小时。

三条路线的成本结构「无本体 < 仿真」为单一信源企业自述,需打折
路线成本项优势代价
仿真算力、场景建模、引擎授权可无限扩量,可造失败样本sim-to-real 差距,物理保真度不足
无本体(UMI)轻量设备、人力、场景协调真实人类操作分布,成本快速下降缺力控与触觉,无本体动力学信息
真机遥操作本体折旧、场地、专业操作员数据与目标本体完全对齐产能系数低(8h→2–3h),单价最高
三条路不是替代关系,是分工关系。真正的问题不是哪条最便宜,而是按什么比例配

英伟达那个被广泛引用的例子说明了配比的可能性:用少量人类演示生成 78 万条合成轨迹,相当于 6500 小时人工示范数据,整个生成过程只用了 11 小时。这就是「用昂贵的真机/人工做种子,用仿真或无本体做扩量」的标准打法。

Figure 的经历则从反面说明了配比失败的样子:它曾向外部供应商采购数据,后来发现这些数据很难同时满足自家模型对规模、多样性和质量的三重要求,于是转向自建 Index 平台做众包采集,目前已向创作者支付 1500 万美元

判断:Figure 这条经验值得所有打算采购数据的团队抄下来:外部数据最常见的失败模式不是质量差,而是三个维度里只满足两个——量大且便宜的往往同质化严重,多样且真实的往往量上不去,量足且多样的往往标注粗糙。采购前先想清楚自己当前缺的是哪一维,不要用「全都要」的标书去招标。
5训练场到底在卖什么

数据回购条款,暴露了真实商业模式

中国信通院人工智能所联合发布的《具身智能训练场研究报告(2026 年)》给出了一句很关键的判断:训练场属于重资产投入,数据产品出售虽然最快形成收入,但仅依靠卖数据难以覆盖重资产投入,回本周期较长

配合另一条信息看,商业模式就清楚了:多名从业者透露,一些地方愿意出钱购买机器人、建设训练场,但在项目谈判时会要求机器人公司回购数据。回购条款本质上是给这笔重资产投资做的一张保单。

规模化数据基建的产能参照官方口径与建设方口径并列
北京石景山(官方口径)

· 一、二、三期共近 270 台(套)机器人满负荷训练
· 年产高质量数据近 2000 万条
· 二期百余台全尺寸双足人形,年产超 600 万条
· 三期聚焦触觉及多模态感知

深圳「具宝盆」(建设方口径)

· 支持 百台终端并行采集
· 覆盖 50–100 类任务场景
· 预计降低 30%–50%初期研发成本
· 同时建 UMI 与高保真遥操作两类数据

左栏为北京市政府门户网站的官方数字,右栏为建设方预期值。两组数字口径不同(条 vs 类/台),不可直接比较,仅作量级参照。

最后回到那个最反常识、也最该被记住的判断。虎嗅·降噪 NoNoise 的报道里有一句说得非常准:「有效」很难成为数据自身的固定属性,它取决于数据能否与某个模型、某副身体和某项任务匹配。

这句话的推论很硬:供应商交付 1000 小时有效数据,可能只是完成了前两层;客户期待的却是机器人能力随之增长。从拍下一段动作,到机器人真正学会,中间存在一条数据折损链。宇树创始人王兴兴的说法是,机器人每进行一次输入和输出,都可能产生偏差和损失。

所以产业链上出现了一种根深蒂固的错位:供应商按设备、人工和采集时长投入成本,客户却只愿意为模型效果付钱。中间的损耗由谁承担,是这门生意至今没算清的一笔账。

判断:这决定了具身数据暂时不可能像普通商品一样被标准化交易。客户很难只下单买「1000 小时数据」,更常见的需求是:某款机器人执行特定任务的成功率只有 60%,供应商需要判断缺哪些场景和动作,再设计采集、清洗、训练和补采方案。

换句话说,这门生意的真实形态不是卖数据,是卖「提升某个具体成功率的工程服务」。按小时报价的公司会死,按成功率提升报价的公司才活得下去。
6可操作清单

如果你要采数据,先算这五笔

数据采购/自建的五笔账面向本体厂商与集成商
第一笔
按有效时长报价,不按工时。遥操场景按 8 小时产 2–3 小时折算,带本体的保守按 1:3 到 1:8 折算。
第二笔
先定义缺哪一维——规模、多样性、质量——三选一做主指标。全都要的标书拿不到好数据。
第三笔
确认数据格式能否接入你的训练链路。格式不对齐,再多的小时数也只是文件体积。
第四笔
把采集员疲劳导致的分布偏差算进质量折扣。长期重复同一动作的样本,多样性会衰减。
第五笔
把验收指标写成「某任务成功率从 X% 提到 Y%」,而不是「交付 N 小时数据」。前者可验收,后者可扯皮。
第五笔最重要。它同时也是把你自己从「卖数据」变成「卖效果」的那一步。
本文的边界
薪酬、从业规模、中介价差来自北京日报客户端记者调查(经北京市政府门户网站 2026-09-04 转载),为可核查渠道,但样本为个案,不代表全行业分布。「100 亿小时需求 / 50 万小时存量」为高少龙个人估算的单一信源,非统计口径,本文已明确其性质。

产能系数(8h→2–3h)、真机数据报价(500–1000 元/小时)、驻场月薪(8000–15000 元)在原报道中标注为「根据公开信息估算」,非实测统计。觅蜂科技的「无本体成本已低于仿真」、2 万套设备与 100 万小时数据,均为企业自述的单一信源,本文已标注需打折对待。

《具身智能训练场研究报告(2026 年)》的具体发布机构表述为「中国信通院人工智能所联合发布」,本文未获取到报告原文,仅转述媒体的引述内容。

解读时间:2026-09-04。