# 具身数据工厂：训练师、270 台套、年产 2000 万条，采集到底多贵

> 有效采集时薪 70 元，中介渠道 15 元；专业遥操员干 8 小时产 2–3 小时有效数据；真机数据报价每小时 500–1000 元。把这些数字排在一起，具身数据工厂这门生意的真实形状就出来了——它卖的从来不是数据。

### TLDR

- **缺口的两个数字差了两万倍**：行业称训练通用具身智能需要 <strong>100 亿小时</strong>真实交互数据，而国内合规可用的真实物理交互数据仅 <strong>50 万小时</strong>。
- **采集员的价差极大**：企业直招的有效采集时薪 <strong>70 元</strong>；部分中介渠道每小时 <strong>15 元</strong>，日结、扣保险后一天到手 147 元。
- **产能系数是这门生意的核心**：专业遥操员工作 8 小时，平均只能产出 <strong>2–3 小时</strong>有效数据；京东科技的口径是「一年前带本体干 8 小时只产 1 小时」。
- **真机数据的报价**：约每小时 <strong>500–1000 元</strong>；要求技术背景或驻场的采集员月薪 8000–15000 元。
- **规模化基建的产能**：石景山一、二、三期共近 <strong>270 台（套）</strong>机器人满负荷运转，年产高质量数据近 <strong>2000 万条</strong>；二期百余台双足人形年产出超 600 万条。
- **最反常识的一条**：「有效」不是数据的属性，是数据与某个模型、某副身体、某项任务的<strong>匹配关系</strong>。这意味着「我有 X 万小时数据」这句话本身没有信息量。

### SRC

薪酬与从业规模数据（有效采集时薪 70 元、兼职规模近百万级、中介 15 元/小时、日薪 200–300 元）来自北京日报客户端记者调查，经北京市政府门户网站 2026 年 9 月 4 日转载，为可核查的官方渠道；其中基元智航 CEO 高少龙给出的「100 亿小时需求 / 50 万小时存量」为<strong>行业估算的单一信源</strong>，非统计口径数据。产能系数（8 小时产 2–3 小时有效数据）、真机数据报价（每小时 500–1000 元）、驻场采集员月薪（8000–15000 元）来自虎嗅·降噪 NoNoise 与 CBNData 的同题报道，标注为「根据公开信息估算」。《具身智能训练场研究报告（2026 年）》引述自中国信通院人工智能所联合发布版本。石景山训练中心的 270 台（套）与年产 2000 万条，来自北京市政府门户网站 2026 年 9 月 1 日石景山区公告，为官方口径。觅蜂科技 2 万套设备、100 万小时数据与「无本体成本低于仿真」的表述来自新华财经 2026 年 9 月 3 日采访，为企业自述的单一信源。

### BODY

<div class="sec"><div class="eyebrow"><span class="num">1</span>先算缺口</div>
<h2>100 亿小时和 50 万小时，这两个数不能相减</h2>

<p>基元智航 CEO 高少龙给出的两个数字被广泛引用：训练通用型具身智能机器人需要 <strong>100 亿小时</strong>多场景真实交互数据，而目前国内合规可用的真实物理交互数据<strong>仅 50 万小时</strong>。</p>

<div class="jx">
  <div class="jx-h"><span>需求与存量</span><span class="jx-note">行业估算，单一信源，非统计量</span></div>
  <div class="jx-split">
    <div style="flex:44">
      <div class="eyebrow">目标 · 100 亿小时</div>
      <p>按 50 万小时现有存量计算，差距约 <strong>20000 倍</strong>。<br><br>
      即使按最乐观的产能扩张速度，这个缺口也不可能在可预见周期内靠「采集」填平。</p>
    </div>
    <div style="flex:56">
      <div class="eyebrow">存量 · 50 万小时</div>
      <p>「合规可用」是限定条件——大量已采集数据因格式不一、标注缺失、授权不清而无法进入训练集。<br><br>
      分母里的水，比分子里的更不好估。</p>
    </div>
  </div>
  <div class="cap">两个数字来自同一位业内人士的估算，缺口的量级本身就是估算的。它可以说明方向，不能用来做产能规划。</div>
</div>

<div class="keypoint">
  <strong>判断：</strong>「100 亿小时」不是一个工程指标，是一句用来募资和招商的话。没有任何人验证过通用具身智能到底需要多少小时——这个数字是按语言模型的 token 量级外推出来的<strong>类比</strong>，不是实验结论。复旦肖仰华教授的表述更诚实：他给出的是「数据鸿沟至少两个数量级」这个<strong>保守估计</strong>，而不是一个确切终点。<br><br>
  做排期时把它当目标，会得出「永远做不完」；做预算时把它当分母，会得出「投多少都值」。两种用法都是错的。
</div>
</div>

<div class="sec"><div class="eyebrow"><span class="num">2</span>采集员的账</div>
<h2>70 元和 15 元，同一份劳动</h2>

<p>据北京日报客户端调查，企业给具身智能数据采集员的薪酬标准是<strong>每小时 70 元（按有效采集时长计）</strong>，部分地区叠加专项补贴。可调动的兼职数采员规模已接近<strong>百万级</strong>，分布在东北、新疆、贵州、安徽等地的三四线城市与乡镇。</p>

<p>但同一份劳动在不同渠道的价差极大：部分人力公司直招岗位每日工作 5–8 小时，日薪 200–300 元；而通过中介接单的从业者，时薪只有 <strong>15 元</strong>。报道中的一位从业者 7 月起经中介兼职，日结，一天录制下来扣除保险到手 147 元。</p>

<div class="jx">
  <div class="jx-h"><span>采集侧的三组价格</span><span class="jx-note">北京日报调查，2026-09-04</span></div>
  <div class="jx-bars">
    <div class="jx-bar-row"><div class="jx-bar-lab">企业直招 · 有效时薪</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:100%;background:#0a749a"></div></div><div class="jx-bar-val">70 元/小时</div></div>
    <div class="jx-bar-row"><div class="jx-bar-lab">直招折算 · 日薪 200–300 元</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:43%;background:#00a6d6"></div></div><div class="jx-bar-val">约 25–60 元/小时</div></div>
    <div class="jx-bar-row"><div class="jx-bar-lab">中介渠道 · 时薪</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:21%;background:#b85c0a"></div></div><div class="jx-bar-val">15 元/小时</div></div>
  </div>
  <div class="jx-legend"><div class="jx-lg">最高与最低相差 <strong>4.7 倍</strong>。价差本身说明这个行业的用工价格发现机制还没建立，也说明「采集成本」这个数字在不同公司嘴里不是一个东西。</div></div>
</div>

<p>还有一个容易被忽略的成本：这份工作并不轻松。报道中提到，从业者需要头戴较重的摄像设备（不能大幅晃动头部，否则采集无效）、手上使用模拟机器人抓握动作的机械抓夹，手臂长时间悬空，同一动作重复几十次甚至上百次。有从业者形容「累过进厂打螺丝」。</p>

<p>这直接影响数据质量：一个疲劳的采集员做出来的动作，与真实场景里的自然动作分布是有偏差的，而这种偏差会被模型学进去。</p>
</div>

<div class="sec"><div class="eyebrow"><span class="num">3</span>产能系数</div>
<h2>8 小时里只有 2–3 小时算数</h2>

<p>这是数据工厂最该被记住的一个数字：<strong>一名专业遥操员工作 8 小时，平均只能产出 2–3 小时有效数据</strong>（公开信息估算）。京东科技集团副总裁何贺给的口径更狠——一年前，员工带着机器人本体干 8 小时，往往只能产出 <strong>1 小时</strong>有效数据。</p>

<div class="jx">
  <div class="jx-h"><span>有效数据的折损链</span><span class="jx-note">每一环都在漏</span></div>
  <div class="jx-tl">
    <div class="jx-tl-row"><div class="jx-tl-t">工时</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#4b5f8a">8 小时在岗</div></div></div>
    <div class="jx-tl-row"><div class="jx-tl-t">− 准备</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#566781">设备穿戴、场景布置、标定、热身</div></div></div>
    <div class="jx-tl-row"><div class="jx-tl-t">− 无效</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#b85c0a">动作越界、遮挡、超视角、姿态抖动</div></div></div>
    <div class="jx-tl-row"><div class="jx-tl-t">− 废片</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#2563eb">质检不过、标注不合格、格式错误</div></div></div>
    <div class="jx-tl-row"><div class="jx-tl-t">= 有效</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#0d8a5f">2–3 小时（专业遥操员）；带本体场景曾低至 1 小时</div></div></div>
  </div>
  <div class="cap">报价时如果按工时算，会低估成本 3–8 倍。所有数据采购合同都应该按<strong>有效时长</strong>结算，而不是按人天。</div>
</div>

<div class="keypoint">
  <strong>判断：</strong>这个系数决定了数据这门生意的毛利结构。按每小时 500–1000 元的真机数据报价、一个遥操员 8 小时产 2.5 小时有效数据来算，单人单日的产值上限在 1250–2500 元，而成本是薪酬 + 场地 + 设备折旧 + 电费。<strong>这中间的余量，比外界想象的薄得多。</strong>所谓「数据生意暴利」，在这个系数面前站不住。
</div>
</div>

<div class="sec"><div class="eyebrow"><span class="num">4</span>成本顺序在翻转</div>
<h2>仿真最便宜这个默认假设，可能已经不成立</h2>

<p>过去两年行业的默认成本顺序是：<strong>仿真 &lt; 无本体（UMI）&lt; 真机</strong>。采购策略也是按这个顺序做的——先买便宜的仿真数据铺量，再补真机数据做适配。</p>

<p>觅蜂科技（智元机器人孵化）董事长兼 CEO 姚卯青在新华财经 9 月 3 日的采访里给了一个会颠覆这个顺序的说法：<strong>无本体数据的单小时成本，甚至已经低于仿真数据</strong>。同一批信息里还有：觅蜂第 2 万套 MEgo 无本体采集设备下线，累计生产的无本体数据已超 100 万小时。</p>

<div class="jx">
  <div class="jx-h"><span>三条路线的成本结构</span><span class="jx-note">「无本体 &lt; 仿真」为单一信源企业自述，需打折</span></div>
  <div class="tbl-wrap">
  <table>
    <tr><th>路线</th><th>成本项</th><th>优势</th><th>代价</th></tr>
    <tr><th>仿真</th><td>算力、场景建模、引擎授权</td><td>可无限扩量，可造失败样本</td><td>sim-to-real 差距，物理保真度不足</td></tr>
    <tr><th>无本体（UMI）</th><td>轻量设备、人力、场景协调</td><td>真实人类操作分布，成本快速下降</td><td>缺力控与触觉，无本体动力学信息</td></tr>
    <tr><th>真机遥操作</th><td>本体折旧、场地、专业操作员</td><td>数据与目标本体完全对齐</td><td>产能系数低（8h→2–3h），单价最高</td></tr>
  </table>
  </div>
  <div class="cap">三条路不是替代关系，是分工关系。真正的问题不是哪条最便宜，而是<strong>按什么比例配</strong>。</div>
</div>

<p>英伟达那个被广泛引用的例子说明了配比的可能性：<strong>用少量人类演示生成 78 万条合成轨迹，相当于 6500 小时人工示范数据，整个生成过程只用了 11 小时</strong>。这就是「用昂贵的真机/人工做种子，用仿真或无本体做扩量」的标准打法。</p>

<p>Figure 的经历则从反面说明了配比失败的样子：它曾向外部供应商采购数据，后来发现这些数据很难同时满足自家模型对<strong>规模、多样性和质量</strong>的三重要求，于是转向自建 Index 平台做众包采集，目前已向创作者支付 <strong>1500 万美元</strong>。</p>

<div class="keypoint">
  <strong>判断：</strong>Figure 这条经验值得所有打算采购数据的团队抄下来：外部数据最常见的失败模式不是质量差，而是<strong>三个维度里只满足两个</strong>——量大且便宜的往往同质化严重，多样且真实的往往量上不去，量足且多样的往往标注粗糙。采购前先想清楚自己当前缺的是哪一维，不要用「全都要」的标书去招标。
</div>
</div>

<div class="sec"><div class="eyebrow"><span class="num">5</span>训练场到底在卖什么</div>
<h2>数据回购条款，暴露了真实商业模式</h2>

<p>中国信通院人工智能所联合发布的《具身智能训练场研究报告（2026 年）》给出了一句很关键的判断：训练场属于<strong>重资产投入</strong>，数据产品出售虽然最快形成收入，但<strong>仅依靠卖数据难以覆盖重资产投入，回本周期较长</strong>。</p>

<p>配合另一条信息看，商业模式就清楚了：多名从业者透露，一些地方愿意出钱购买机器人、建设训练场，但在项目谈判时会<strong>要求机器人公司回购数据</strong>。回购条款本质上是给这笔重资产投资做的一张保单。</p>

<div class="jx">
  <div class="jx-h"><span>规模化数据基建的产能参照</span><span class="jx-note">官方口径与建设方口径并列</span></div>
  <div class="jx-split">
    <div style="flex:50">
      <div class="eyebrow">北京石景山（官方口径）</div>
      <p>· 一、二、三期共近 <strong>270 台（套）</strong>机器人满负荷训练<br>
      · 年产高质量数据近 <strong>2000 万条</strong><br>
      · 二期百余台全尺寸双足人形，年产超 <strong>600 万条</strong><br>
      · 三期聚焦触觉及多模态感知</p>
    </div>
    <div style="flex:50">
      <div class="eyebrow">深圳「具宝盆」（建设方口径）</div>
      <p>· 支持 <strong>百台终端</strong>并行采集<br>
      · 覆盖 <strong>50–100 类</strong>任务场景<br>
      · 预计降低 <strong>30%–50%</strong>初期研发成本<br>
      · 同时建 UMI 与高保真遥操作两类数据</p>
    </div>
  </div>
  <div class="cap">左栏为北京市政府门户网站的官方数字，右栏为建设方预期值。两组数字口径不同（条 vs 类/台），不可直接比较，仅作量级参照。</div>
</div>

<p>最后回到那个最反常识、也最该被记住的判断。虎嗅·降噪 NoNoise 的报道里有一句说得非常准：<strong>「有效」很难成为数据自身的固定属性，它取决于数据能否与某个模型、某副身体和某项任务匹配。</strong></p>

<p>这句话的推论很硬：供应商交付 1000 小时有效数据，可能只是完成了前两层；客户期待的却是机器人能力随之增长。<strong>从拍下一段动作，到机器人真正学会，中间存在一条数据折损链。</strong>宇树创始人王兴兴的说法是，机器人每进行一次输入和输出，都可能产生偏差和损失。</p>

<p>所以产业链上出现了一种根深蒂固的错位：<strong>供应商按设备、人工和采集时长投入成本，客户却只愿意为模型效果付钱。</strong>中间的损耗由谁承担，是这门生意至今没算清的一笔账。</p>

<div class="keypoint">
  <strong>判断：</strong>这决定了具身数据暂时不可能像普通商品一样被标准化交易。客户很难只下单买「1000 小时数据」，更常见的需求是：某款机器人执行特定任务的成功率只有 60%，供应商需要判断缺哪些场景和动作，再设计采集、清洗、训练和补采方案。<br><br>
  换句话说，这门生意的真实形态不是<strong>卖数据</strong>，是<strong>卖「提升某个具体成功率的工程服务」</strong>。按小时报价的公司会死，按成功率提升报价的公司才活得下去。
</div>
</div>

<div class="sec"><div class="eyebrow"><span class="num">6</span>可操作清单</div>
<h2>如果你要采数据，先算这五笔</h2>

<div class="jx">
  <div class="jx-h"><span>数据采购/自建的五笔账</span><span class="jx-note">面向本体厂商与集成商</span></div>
  <div class="jx-tl">
    <div class="jx-tl-row"><div class="jx-tl-t">第一笔</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#0a749a">按有效时长报价，不按工时。遥操场景按 8 小时产 2–3 小时折算，带本体的保守按 1:3 到 1:8 折算。</div></div></div>
    <div class="jx-tl-row"><div class="jx-tl-t">第二笔</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#2563eb">先定义缺哪一维——规模、多样性、质量——三选一做主指标。全都要的标书拿不到好数据。</div></div></div>
    <div class="jx-tl-row"><div class="jx-tl-t">第三笔</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#6d3fd4">确认数据格式能否接入你的训练链路。格式不对齐，再多的小时数也只是文件体积。</div></div></div>
    <div class="jx-tl-row"><div class="jx-tl-t">第四笔</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#b85c0a">把采集员疲劳导致的分布偏差算进质量折扣。长期重复同一动作的样本，多样性会衰减。</div></div></div>
    <div class="jx-tl-row"><div class="jx-tl-t">第五笔</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#0d8a5f">把验收指标写成「某任务成功率从 X% 提到 Y%」，而不是「交付 N 小时数据」。前者可验收，后者可扯皮。</div></div></div>
  </div>
  <div class="cap">第五笔最重要。它同时也是把你自己从「卖数据」变成「卖效果」的那一步。</div>
</div>

<div class="srcline">
  <div class="h">本文的边界</div>
  薪酬、从业规模、中介价差来自北京日报客户端记者调查（经北京市政府门户网站 2026-09-04 转载），为可核查渠道，但样本为个案，不代表全行业分布。「100 亿小时需求 / 50 万小时存量」为高少龙<strong>个人估算的单一信源</strong>，非统计口径，本文已明确其性质。<br><br>
  产能系数（8h→2–3h）、真机数据报价（500–1000 元/小时）、驻场月薪（8000–15000 元）在原报道中标注为「根据公开信息估算」，非实测统计。觅蜂科技的「无本体成本已低于仿真」、2 万套设备与 100 万小时数据，均为<strong>企业自述的单一信源</strong>，本文已标注需打折对待。<br><br>
  《具身智能训练场研究报告（2026 年）》的具体发布机构表述为「中国信通院人工智能所联合发布」，本文未获取到报告原文，仅转述媒体的引述内容。<br><br>
  解读时间：2026-09-04。
</div>
</div>

---

*来源：神机百见-具身解读 · https://www.shenjibailian.com/jiedu/article/embodied-data-factory-cost/*
