研究解读 · 神机百见解读

「零真机数据」站得住吗:深朴 HiFi-UMI 的 2 万小时与 3 毫米

深朴智能说它的 Omni-Simple-World 模型「预训练与后训练全程未使用任何一条真机数据」。这句话在技术上是成立的,但在传播上极其容易被读歪——它绕开的是机器人本体,不是真实世界。

本篇目录4 节 · 10 分钟
一分钟速览
  1. 融资与发布同日:2026 年 9 月 3 日,深朴智能(Simple AI)宣布完成数亿元 Pre-A+ 轮,同时披露无本体数据生产引擎 HiFi-UMI。
  2. 引擎规模:已处理超 2 万小时432 万段操作数据,覆盖 480 多个场景;同步开源 2000 小时的 HiFi-UMI-2K 数据集。
  3. 硬件配置:每只手上下两枚超广角鱼眼相机,加头部双目共 6 路视觉,单腕水平视场角约 200°、垂直超过 200°
  4. 精度数字:手写轨迹实验中末端轨迹误差约 3 毫米,全程不依赖任何外部定位设备(企业自述,单一信源)。
  5. 那句最容易读歪的话:Omni-Simple-World 模型「预训练与后训练全程未使用任何一条真机数据」,准确含义是零本体数据,不是零真实数据。
  6. 2 万小时放在行业里是多大:对照业内测算的「国内合规可用真实物理交互数据仅 50 万小时」,它约占 4%。
数据来源与边界
融资与技术细节来自机器人前瞻(公众号 robot_pro)2026 年 9 月 3 日报道,为目前唯一的详细中文信源,属单一信源;文中所引 HiFi-UMI 处理时长、段落数、场景数、视场角、轨迹误差、开源数据集规模,以及 Omni-Simple-World 模型「全程未使用任何一条真机数据」的表述,均为深朴智能方面对外披露的企业自述,未见第三方复现或独立评测。文中关于「UMI 本体无关数据」的行业定义,参照了深圳市《推动智能机器人产业高质量发展工作方案(2026—2028 年)》及深圳「具宝盆」项目公开材料中的同类表述,用于交叉验证概念口径而非验证具体数字。截至抓取时(2026-09-04),未见 HiFi-UMI 的技术报告、论文或开源仓库链接的公开地址。
1先拆那句话

「零真机数据」到底绕开了什么

深朴智能对自己模型的描述是:Omni-Simple-World 的预训练与后训练全程未使用任何一条真机数据,纯粹基于 HiFi-UMI 高保真无本体数据学习。

这句话在技术上站得住,但它绕开的那个东西,名字很容易被听错。

所谓「无本体」(UMI,Universal Manipulation Interface 这一路线的延伸),指的是采集时不依赖完整的机器人本体——不需要一台真机器人站在那儿被遥操作,而是让人戴上轻量设备(头戴相机、腕部相机、手持夹爪)直接在真实场景里干活,把人的操作过程录下来。

三种理解,两种是错的概念口径校验
错解 A

「不需要真实世界的数据,纯靠生成」

——错。HiFi-UMI 采集的正是人在真实场景里的真实操作,属于真实物理交互数据。

错解 B

「不需要人了,全自动」

——错。无本体采集恰恰更依赖人,只是把人从「操作机器人」解放成「直接操作」。

正解

「绕开了机器人本体这个采集载体」

——对。省掉的是本体折旧、场地与遥操损耗,不是真实世界的物理交互本身。

深圳市《智能机器人产业工作方案(2026—2028 年)》与「具宝盆」项目材料中对 UMI 的官方定性也是「本体无关具身数据」,强调「不绑定任何硬件、一次采集多方复用」——与本文口径一致。
判断:把「零真机数据」理解成「零真实数据」,是这轮传播里最危险的一次滑移。它一旦成立,读者会顺理成章地推出「以后训练机器人不用下真场景了」——而无本体采集的真实价值恰恰相反:它是为了让人可以在更多真实场景里、以更低成本采集,本质是把采集门槛从「有一台机器人」降到「有一双手」。
2硬件与数字

6 路视觉、200° 视场角,和那个 3 毫米

HiFi-UMI 的硬件配置有一个很明确的设计取向:在每只手部配置上下两枚超广角鱼眼相机,再加上头部双目,一共 6 路视觉。单腕的水平视场角约 200°、垂直视场角超过 200°。

HiFi-UMI 已披露参数均为企业自述,单一信源,2026-09-03
项目数值口径说明
累计处理时长超 2 万小时引擎已处理,非单批次
操作段落数432 万段与时长为同一批数据的两种统计口径
覆盖场景数480 多个未披露场景分类标准
视觉通道6 路每手 2 枚鱼眼 + 头部双目
单腕视场角水平约 200° / 垂直 > 200°超广角带来的畸变校正负担未披露
末端轨迹误差约 3 毫米手写轨迹实验,不依赖外部定位设备
开源数据集2000 小时 HiFi-UMI-2K约占累计处理量的 10%
3 毫米这个数字最容易被过度解读。它出自「手写轨迹实验」——一个高对比度、轨迹连续、目标明确的特定任务,不能直接外推到通用操作精度。

关于那个 3 毫米,需要补两句技术背景。手写轨迹实验的价值在于它是轨迹精度的天然标尺:笔尖走的是一条连续且可精确复现的曲线,重建出来的轨迹和真实轨迹之间的偏差可以被干净地量化。这类实验通常被用来验证采集系统的时空一致性,而不是操作能力。

换句话说,3 毫米说明的是「这套设备把人的手部运动记录得有多准」,不是「机器人按这份数据能操作得有多准」。中间还隔着本体适配、动力学可行性裁剪和力控重建三道关。

3量级

2 万小时在行业里算什么水平

把 2 万小时放进大盘看,会得到一个更清醒的位置感。据基元智航 CEO 高少龙的表述(北京日报 2026-09-04 报道),行业普遍认为训练通用型具身智能机器人需要 100 亿小时多场景真实交互数据,而国内合规可用的真实物理交互数据仅有 50 万小时

数据规模的量级对照对数感受,非等比
单公司引擎处理量(HiFi-UMI)
2 万小时
其中开源(HiFi-UMI-2K)
2000 小时
国内可用真实物理交互数据
50 万小时
2 万小时约占国内可用存量的 4%;而 100 亿小时的目标量级是这根满格条的 20000 倍,图中无法按同一比例画出。

这个对照既能说明 2 万小时不算小,也能说明它对整个行业缺口而言仍是零头。更重要的是:这 2 万小时是单一公司、单一设备体系产出的数据,其格式、坐标系、标定方式都绑定在 HiFi-UMI 上。它能喂饱自家模型,但能否被其他团队直接复用,取决于数据标准是否开放。

开源 2000 小时(约占总量的 10%)是一个值得注意的动作。按同一批报道,HiFi-UMI-2K 曾登顶 Hugging Face Daily Papers 日榜第一。开源十分之一、保留十分之九,是数据集换社区影响力的标准配比。

判断:对做本体或做集成的团队来说,这份数据集真正的价值不在那 2000 小时本身,而在于它定义了一种数据格式。如果你的采集体系能在格式层与它对齐,你就有机会把自采数据也接入同一条训练链路;如果不对齐,2000 小时对你只是 2000 小时。选型时先看格式,再看体量。
4场景那一段

酒店 POC 是最容易做成、也最难算清账的一类

本体的落地侧,深朴的「小朴」在 2026 年 5 月底进入中旅旗下北京丽都维景酒店首批试点,处于 POC 阶段,聚焦客房服务、公共区域巡检、物品配送、基础清洁四类任务。公司称结合记忆增强的智能体框架,小朴可完成送洗衣物这类完整超长程家务流程,以及柔性纸杯叠放这类高干扰精细操作。

酒店场景的四笔账面向准备接同类项目的团队
频次
客房配送有波峰波谷,峰值集中在退房/入住两小时,闲时设备闲置
替代成本
被替代的多为低薪岗位,人力节省的绝对值有限,回本周期被拉长
长尾
客人行为不可预测——拦电梯、拽手臂、临时改需求,脚本写不完
验收
POC 看演示效果容易过,看连续运行 30 天的成功率才算真验收
第三笔账最贵。酒店与工厂最大的差别是:工厂里的干扰是物,酒店里的干扰是人,而且人不会按你的脚本出错。

这与我们做商演项目时的经验是同一类问题:观众会突然伸手、会挡住定位标、会在机器人动作范围内穿行。区别在于,商演的干扰有时间边界(一场 30 分钟),酒店的干扰是全天候的。

本文的边界
本文全部具体数字(2 万小时、432 万段、480 多个场景、6 路视觉、200° 视场角、3 毫米误差、2000 小时开源)均来自深朴智能 2026 年 9 月 3 日对外披露,经机器人前瞻单一信源转述,未见技术报告、论文或开源仓库地址,属企业自述口径,请按单一信源对待。文中「100 亿小时需求 / 50 万小时存量」为基元智航 CEO 高少龙在行业内的估算表述,同样是单一信源且为估算值,非统计口径数据。

本文对「无本体」「UMI」概念的界定,参照深圳市官方文件中的同类表述进行口径校验,但不意味着深朴的具体技术参数获得官方背书

解读时间:2026-09-04。