# 「零真机数据」站得住吗：深朴 HiFi-UMI 的 2 万小时与 3 毫米

> 深朴智能说它的 Omni-Simple-World 模型「预训练与后训练全程未使用任何一条真机数据」。这句话在技术上是成立的，但在传播上极其容易被读歪——它绕开的是机器人本体，不是真实世界。

### TLDR

- **融资与发布同日**：2026 年 9 月 3 日，深朴智能（Simple AI）宣布完成数亿元 Pre-A+ 轮，同时披露无本体数据生产引擎 HiFi-UMI。
- **引擎规模**：已处理超 **2 万小时**、**432 万段**操作数据，覆盖 **480 多个**场景；同步开源 **2000 小时**的 HiFi-UMI-2K 数据集。
- **硬件配置**：每只手上下两枚超广角鱼眼相机，加头部双目共 **6 路视觉**，单腕水平视场角约 **200°**、垂直超过 **200°**。
- **精度数字**：手写轨迹实验中末端轨迹误差约 **3 毫米**，全程不依赖任何外部定位设备（企业自述，单一信源）。
- **那句最容易读歪的话**：Omni-Simple-World 模型「预训练与后训练全程未使用任何一条真机数据」，准确含义是**零本体数据**，不是零真实数据。
- **2 万小时放在行业里是多大**：对照业内测算的「国内合规可用真实物理交互数据仅 50 万小时」，它约占 4%。

### SRC

融资与技术细节来自机器人前瞻（公众号 robot_pro）2026 年 9 月 3 日报道，为目前唯一的详细中文信源，属单一信源；文中所引 HiFi-UMI 处理时长、段落数、场景数、视场角、轨迹误差、开源数据集规模，以及 Omni-Simple-World 模型「全程未使用任何一条真机数据」的表述，均为深朴智能方面对外披露的企业自述，未见第三方复现或独立评测。文中关于「UMI 本体无关数据」的行业定义，参照了深圳市《推动智能机器人产业高质量发展工作方案（2026—2028 年）》及深圳「具宝盆」项目公开材料中的同类表述，用于交叉验证概念口径而非验证具体数字。截至抓取时（2026-09-04），未见 HiFi-UMI 的技术报告、论文或开源仓库链接的公开地址。

### BODY

<div class="sec"><div class="eyebrow"><span class="num">1</span>先拆那句话</div>
<h2>「零真机数据」到底绕开了什么</h2>

<p>深朴智能对自己模型的描述是：Omni-Simple-World 的<strong>预训练与后训练全程未使用任何一条真机数据</strong>，纯粹基于 HiFi-UMI 高保真无本体数据学习。</p>

<p>这句话在技术上站得住，但它绕开的那个东西，名字很容易被听错。</p>

<p>所谓「无本体」（UMI，Universal Manipulation Interface 这一路线的延伸），指的是采集时<strong>不依赖完整的机器人本体</strong>——不需要一台真机器人站在那儿被遥操作，而是让人戴上轻量设备（头戴相机、腕部相机、手持夹爪）直接在真实场景里干活，把人的操作过程录下来。</p>

<div class="jx">
  <div class="jx-h"><span>三种理解，两种是错的</span><span class="jx-note">概念口径校验</span></div>
  <div class="jx-split">
    <div style="flex:33">
      <div class="eyebrow">错解 A</div>
      <p>「不需要真实世界的数据，纯靠生成」<br><br>
      ——错。HiFi-UMI 采集的正是人在真实场景里的真实操作，属于真实物理交互数据。</p>
    </div>
    <div style="flex:33">
      <div class="eyebrow">错解 B</div>
      <p>「不需要人了，全自动」<br><br>
      ——错。无本体采集恰恰<strong>更依赖人</strong>，只是把人从「操作机器人」解放成「直接操作」。</p>
    </div>
    <div style="flex:34">
      <div class="eyebrow">正解</div>
      <p>「绕开了机器人本体这个采集载体」<br><br>
      ——对。省掉的是本体折旧、场地与遥操损耗，不是真实世界的物理交互本身。</p>
    </div>
  </div>
  <div class="cap">深圳市《智能机器人产业工作方案（2026—2028 年）》与「具宝盆」项目材料中对 UMI 的官方定性也是「本体无关具身数据」，强调「不绑定任何硬件、一次采集多方复用」——与本文口径一致。</div>
</div>

<div class="keypoint">
  <strong>判断：</strong>把「零真机数据」理解成「零真实数据」，是这轮传播里最危险的一次滑移。它一旦成立，读者会顺理成章地推出「以后训练机器人不用下真场景了」——而无本体采集的真实价值恰恰相反：它是为了<strong>让人可以在更多真实场景里、以更低成本采集</strong>，本质是把采集门槛从「有一台机器人」降到「有一双手」。
</div>
</div>

<div class="sec"><div class="eyebrow"><span class="num">2</span>硬件与数字</div>
<h2>6 路视觉、200° 视场角，和那个 3 毫米</h2>

<p>HiFi-UMI 的硬件配置有一个很明确的设计取向：在每只手部配置<strong>上下两枚超广角鱼眼相机</strong>，再加上头部双目，一共 6 路视觉。单腕的水平视场角约 200°、垂直视场角超过 200°。</p>

<div class="jx">
  <div class="jx-h"><span>HiFi-UMI 已披露参数</span><span class="jx-note">均为企业自述，单一信源，2026-09-03</span></div>
  <div class="tbl-wrap">
  <table>
    <tr><th>项目</th><th>数值</th><th>口径说明</th></tr>
    <tr><th>累计处理时长</th><td>超 2 万小时</td><td>引擎已处理，非单批次</td></tr>
    <tr><th>操作段落数</th><td>432 万段</td><td>与时长为同一批数据的两种统计口径</td></tr>
    <tr><th>覆盖场景数</th><td>480 多个</td><td>未披露场景分类标准</td></tr>
    <tr><th>视觉通道</th><td>6 路</td><td>每手 2 枚鱼眼 + 头部双目</td></tr>
    <tr><th>单腕视场角</th><td>水平约 200° / 垂直 &gt; 200°</td><td>超广角带来的畸变校正负担未披露</td></tr>
    <tr><th>末端轨迹误差</th><td>约 3 毫米</td><td>手写轨迹实验，不依赖外部定位设备</td></tr>
    <tr><th>开源数据集</th><td>2000 小时 HiFi-UMI-2K</td><td>约占累计处理量的 10%</td></tr>
  </table>
  </div>
  <div class="cap">3 毫米这个数字最容易被过度解读。它出自「手写轨迹实验」——一个高对比度、轨迹连续、目标明确的特定任务，不能直接外推到通用操作精度。</div>
</div>

<p>关于那个 3 毫米，需要补两句技术背景。手写轨迹实验的价值在于它是<strong>轨迹精度的天然标尺</strong>：笔尖走的是一条连续且可精确复现的曲线，重建出来的轨迹和真实轨迹之间的偏差可以被干净地量化。这类实验通常被用来验证采集系统的时空一致性，而不是操作能力。</p>

<p>换句话说，3 毫米说明的是「这套设备把人的手部运动记录得有多准」，不是「机器人按这份数据能操作得有多准」。中间还隔着本体适配、动力学可行性裁剪和力控重建三道关。</p>
</div>

<div class="sec"><div class="eyebrow"><span class="num">3</span>量级</div>
<h2>2 万小时在行业里算什么水平</h2>

<p>把 2 万小时放进大盘看，会得到一个更清醒的位置感。据基元智航 CEO 高少龙的表述（北京日报 2026-09-04 报道），行业普遍认为训练通用型具身智能机器人需要 <strong>100 亿小时</strong>多场景真实交互数据，而国内合规可用的真实物理交互数据<strong>仅有 50 万小时</strong>。</p>

<div class="jx">
  <div class="jx-h"><span>数据规模的量级对照</span><span class="jx-note">对数感受，非等比</span></div>
  <div class="jx-bars">
    <div class="jx-bar-row"><div class="jx-bar-lab">单公司引擎处理量（HiFi-UMI）</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:4%;background:#0a749a"></div></div><div class="jx-bar-val">2 万小时</div></div>
    <div class="jx-bar-row"><div class="jx-bar-lab">其中开源（HiFi-UMI-2K）</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:1%;background:#00a6d6"></div></div><div class="jx-bar-val">2000 小时</div></div>
    <div class="jx-bar-row"><div class="jx-bar-lab">国内可用真实物理交互数据</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:100%;background:#b85c0a"></div></div><div class="jx-bar-val">50 万小时</div></div>
  </div>
  <div class="jx-legend"><div class="jx-lg">2 万小时约占国内可用存量的 4%；而 100 亿小时的目标量级是这根满格条的 20000 倍，图中无法按同一比例画出。</div></div>
</div>

<p>这个对照既能说明 2 万小时不算小，也能说明它对整个行业缺口而言仍是零头。更重要的是：这 2 万小时是<strong>单一公司、单一设备体系</strong>产出的数据，其格式、坐标系、标定方式都绑定在 HiFi-UMI 上。它能喂饱自家模型，但能否被其他团队直接复用，取决于数据标准是否开放。</p>

<p>开源 2000 小时（约占总量的 10%）是一个值得注意的动作。按同一批报道，HiFi-UMI-2K 曾登顶 Hugging Face Daily Papers 日榜第一。开源十分之一、保留十分之九，是数据集换社区影响力的标准配比。</p>

<div class="keypoint">
  <strong>判断：</strong>对做本体或做集成的团队来说，这份数据集真正的价值不在那 2000 小时本身，而在于它<strong>定义了一种数据格式</strong>。如果你的采集体系能在格式层与它对齐，你就有机会把自采数据也接入同一条训练链路；如果不对齐，2000 小时对你只是 2000 小时。选型时先看格式，再看体量。
</div>
</div>

<div class="sec"><div class="eyebrow"><span class="num">4</span>场景那一段</div>
<h2>酒店 POC 是最容易做成、也最难算清账的一类</h2>

<p>本体的落地侧，深朴的「小朴」在 2026 年 5 月底进入中旅旗下北京丽都维景酒店首批试点，处于 POC 阶段，聚焦客房服务、公共区域巡检、物品配送、基础清洁四类任务。公司称结合记忆增强的智能体框架，小朴可完成送洗衣物这类完整超长程家务流程，以及柔性纸杯叠放这类高干扰精细操作。</p>

<div class="jx">
  <div class="jx-h"><span>酒店场景的四笔账</span><span class="jx-note">面向准备接同类项目的团队</span></div>
  <div class="jx-tl">
    <div class="jx-tl-row"><div class="jx-tl-t">频次</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#0a749a">客房配送有波峰波谷，峰值集中在退房/入住两小时，闲时设备闲置</div></div></div>
    <div class="jx-tl-row"><div class="jx-tl-t">替代成本</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#2563eb">被替代的多为低薪岗位，人力节省的绝对值有限，回本周期被拉长</div></div></div>
    <div class="jx-tl-row"><div class="jx-tl-t">长尾</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#b85c0a">客人行为不可预测——拦电梯、拽手臂、临时改需求，脚本写不完</div></div></div>
    <div class="jx-tl-row"><div class="jx-tl-t">验收</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#0d8a5f">POC 看演示效果容易过，看连续运行 30 天的成功率才算真验收</div></div></div>
  </div>
  <div class="cap">第三笔账最贵。酒店与工厂最大的差别是：工厂里的干扰是物，酒店里的干扰是人，而且人不会按你的脚本出错。</div>
</div>

<p>这与我们做商演项目时的经验是同一类问题：观众会突然伸手、会挡住定位标、会在机器人动作范围内穿行。区别在于，商演的干扰有时间边界（一场 30 分钟），酒店的干扰是全天候的。</p>

<div class="srcline">
  <div class="h">本文的边界</div>
  本文全部具体数字（2 万小时、432 万段、480 多个场景、6 路视觉、200° 视场角、3 毫米误差、2000 小时开源）均来自深朴智能 2026 年 9 月 3 日对外披露，经机器人前瞻单一信源转述，<strong>未见技术报告、论文或开源仓库地址</strong>，属企业自述口径，请按单一信源对待。文中「100 亿小时需求 / 50 万小时存量」为基元智航 CEO 高少龙在行业内的估算表述，同样是单一信源且为估算值，非统计口径数据。<br><br>
  本文对「无本体」「UMI」概念的界定，参照深圳市官方文件中的同类表述进行口径校验，但<strong>不意味着深朴的具体技术参数获得官方背书</strong>。<br><br>
  解读时间：2026-09-04。
</div>
</div>

---

*来源：神机百见-具身解读 · https://www.shenjibailian.com/jiedu/article/hifi-umi-zero-robot-data-claim/*
