一边喊缺 99%,一边数据卖不动:具身数据的供需两头,用的不是同一种计价单位
国内合规真机交互数据约 50 万小时,商业化需要数千万小时,缺口超过 99%;但同一份报道承认,数据「又难卖」。缺口和滞销同时成立,说明病灶不在小时数,在计价单位:客户要「工位验收」,训练场卖「小时数」,两边算的不是同一笔账。
- 缺口超 99%:国内真实物理交互场景的合规数据约 50 万小时,机器人商业化落地需要数千万小时(贵州省大数据局 7 月口径,非 9 月新数据)。
- 百万小时军备赛:千寻智能已累计超 20 万小时、年内冲 100 万;星海图计划年内完成百万小时;黎曼动力称已过半——均为公司自述。
- 算一笔总账:中国信通院测算,「ChatGPT 时刻」需要 1.1 万亿 token 数据,全靠真机采集约需 2.12 万台机器人连续工作一整年。
- 成本差 10–50 倍:真机遥操作约 500–1000 元/小时,仿真数据约 20–50 元/小时(国盛证券口径)。
- 判断:供需矛盾的核心不是「缺数据」,是「验收口径错配」——客户按工位付费,训练场按小时计价,所以缺口和滞销能同时成立。
缺口 99%,但数据卖不动
上海证券报 9 月 19 日的报道把一对矛盾摆在了同一篇文章里:供给端,国内真实物理交互场景的合规数据存量约 50 万小时,而机器人商业化落地需要数千万小时,缺口超过 99%;需求端,这些数据「又难卖」——企业集体冲刺的百万小时,并没有转化成对应的收入。
如果只是缺数据,价格应该涨、数据应该抢手。缺口和滞销同时成立,只有一种解释:卖的东西和买的东西不是同一种东西。
百万小时军备赛,和它的成本曲线
三家公司在同一条赛道上冲刺:千寻智能称已累计获得超 20 万小时多类型真实交互数据、计划年内突破 100 万小时;星海图计划年内完成百万小时数据建设;昆仑万维孵化的黎曼动力称数据积累已过半、年底前达成。三家口径均为自述,注意这是「小时数」竞赛。
成本曲线决定了这场竞赛的天花板。真机遥操作采集约 500 到 1000 元一小时,仿真数据约 20 到 50 元一小时,差出 10 到 50 倍。中国信通院的测算把总账算得更直白:若机器人迎来「ChatGPT 时刻」需要 1.1 万亿 token 的数据,全部依靠真机采集,约需 2.12 万台机器人连续工作一整年。这意味着纯真机路线在数学上就不成立,最终的供给结构必然是真机打底、仿真放量、两者按任务类型配比。
一张工位验收单
需求侧的口径在 11 月 1 日之后会变得更硬:数据标准落地后,数据将按任务与工位计价,而不是按小时计价(本站 139 号稿已写过标准本身)。这让「验收口径」成为整个链条的关键节点——数据卖得动的前提,是买方能在合同里写清楚「什么算合格」。
所以判断一节数采中心的价值,该问的是两个数:卖出的数据里,有多少是客户按工位验收后复购的;有多少是本地国资或关联方回购的。前者是真实需求,后者是 146 号稿写过的「注水订单」问题的数据版。两个数的比例,比任何百万小时宣传都更能说明这家数据公司的成色。
谁先换计价单位,谁握住定价权
把三件事串起来:需求缺口是真实的(99%),军备赛是热烈的(三家冲百万小时),滞销也是真实的(卖不动)。链条上缺的不是数据,是把「小时数」翻译成「工位验收」的能力——谁能定义验收标准、谁的数据能被客户按工位复购,谁就握住了这门生意的定价权。