70 家训练场之后是 11 月 1 日:具身智能的数据生意,要换一种计价方式了
截至 6 月底全国建成启用超 70 家具身智能训练场,在建或规划还有 40 多家。11 月 1 日起,「具身智能数据集质量要求及评估方法」行业标准正式实施。当数据从按小时卖变成按质量等级卖,训练场这门刚起步的生意要重新算账。
- 家数与分布:中国信通院《具身智能训练场研究报告(2026年)》显示,截至 2026 年 6 月底全国建成启用超 70 家训练场,在建或规划 40 多家,覆盖 18 个省区市。浙江 14 个最多,江苏、北京、广东、山东各 8 个。
- 布局逻辑变了:信通院张蔚敏概括为「哪里有合适的场景,训练场就建到哪里」——从人才、资本驱动转向真实场景、数据供给和运营效率驱动,开始向三线、四线乃至五线城市延伸。
- 11 月 1 日:由中国信通院联合 40 余家单位共同起草的人工智能系列行业标准「具身智能数据集质量要求及评估方法」将于 2026 年 11 月 1 日起正式实施,填补该方向行业标准空白。
- 商业模式的坎:多数训练场以数据产品出售为主要收入来源,仅靠数据出售难以覆盖投入;深圳「具宝盆」联合发起人王茂林提出向覆盖数据生产、模型训练、应用验证的「训练即服务」转型。
- 判断:11 月 1 日的标准不是质量门槛,是计价方式的切换——数据集从「按小时、按条数」卖,变成「按质量等级」卖,训练场的存货估值会被重估,一批只采集不治理的场会先出清。
70 家已建成,40 多家在路上
中国信通院《具身智能训练场研究报告(2026年)》给出的最新截面是:截至 2026 年 6 月底,全国共建成启用超过 70 家具身智能训练场,在建或规划中的还有 40 多家。分布覆盖 18 个省区市,形成以长三角、京津冀和珠三角为核心的三大集群。
省份分布上,浙江已建成 14 个,数量最多;江苏、北京、广东、山东紧随其后,均为 8 个。这个分布和国内具身智能产业集群高度吻合,但真正值得注意的是信通院点出的另一个趋势:训练场建设正在突破传统人工智能产业高度集聚于一线城市的模式,向三线、四线乃至五线城市延伸,呈现多层级城市协同布局。
中国信通院人工智能研究所具身智能部副主任张蔚敏把这种布局逻辑概括成一句话——「哪里有合适的场景,训练场就建到哪里」。她还指出,这反映出训练场建设正从人才、资本驱动转向真实场景、数据供给和运营效率驱动。
11 月 1 日:从规模导向转向质量导向
由中国信息通信研究院联合 40 余家单位共同起草编制的人工智能系列行业标准——「具身智能数据集质量要求及评估方法」,将于 2026 年 11 月 1 日起正式实施。张蔚敏介绍,该标准的发布标志着具身智能数据集建设将从规模导向向质量导向转变,有效填补具身智能数据方向的行业标准空白。
这句「从规模导向转向质量导向」,是整篇通稿里分量最重的一句。它意味着行业主管部门对现有训练场产出的数据质量给出了一个明确判断:过去两年的主要问题不是采集得不够多,而是采集得不够好、不够可比较。
值得注意的是专项行动里的一条具体要求:省级地区至少遴选 20 个重点场景单元,按照「最小干预、利旧复用」原则开展作业环境适配改造。「最小干预、利旧复用」这八个字很关键——它明确否定了「为了采数据而新建场景」的做法,要求训练场在既有生产环境里做适配,而不是搭一个干净的实验室。
卖数据为什么覆盖不了投入
通稿直接点出了训练场自身的经营困境:当前多数训练场以数据产品出售为主要收入来源,但仅靠数据出售难以覆盖投入,商业模式的可持续性是训练场自身面临的考验。
要理解这个困境,需要看两个量级。第三方媒体转述的行业口径显示:规模化真机遥操作采集的有效数据成本约为每小时 275 元,小规模采集阶段甚至可能达到每小时数千元(该数字来自凤凰网 2026-09-15 转述,未获信通院报告原文直接确认);而一个大型训练场还需要投入机器人本体、场景建设、数据采集设备、算力,整体投入可能达到数千万元甚至更高。另一条第三方转述的估算更直接:以年产量 10 万小时数据、建设投入 5000 万元估算,回本周期在三年以上。
| 成本 / 收入项 | 量级 | 口径来源 |
|---|---|---|
| 规模化真机遥操作采集成本 | 约 275 元 / 小时 | 第三方媒体转述(未获报告原文确认) |
| 小规模采集阶段成本 | 可达数千元 / 小时 | 同上 |
| 大型训练场整体投入 | 数千万元甚至更高 | 新华社通稿引述 |
| 回本周期(按年产 10 万小时、投入 5000 万元估) | 三年以上 | 自媒体引信通院口径 |
| 行业累计高质量训练数据 | 约 50 万小时(行业估算) | 第三方估算,未确认 |
这组数字放在一起,矛盾就清楚了:采集成本是刚性的,而数据售价面临两个方向的挤压——一方面客户预算有限,另一方面公开数据集和自采数据在同时供给。当收入端是「按小时卖成品数据」这种一次性交易,而成本端是重资产摊销时,回本周期长是必然结果。
从「卖数据」到「训练即服务」,改的是哪一环
深圳「具宝盆」联合发起人王茂林给出的方向是:下一步将从单一数据供给向覆盖数据生产、模型训练、应用验证的「训练即服务」转型,构建多元收入结构,推动训练场从重资产投入走向可持续运营。
这个转型的实质,是把收入模型从「一次性交付」改成「持续性服务」。按小时卖数据,一单结一单;提供训练服务,则是按训练周期、按模型迭代次数、按验证任务收费,客户关系从交易变成订阅。
收入 = 数据条数或小时数 × 单价。客户买走数据后自己训练,训练场不参与后续。收入一次性确认,无法分享客户模型变好带来的收益。风险是价格竞争激烈,且客户需求高度定制时毛利率快速下滑。
收入 = 训练任务 / 验证任务 / 模型迭代的服务费。训练场同时提供算力、数据、场景和验证环境,客户在这里完成「数据生产→训练→验证」的闭环。收入可重复,但要求训练场具备模型工程能力,而不只是采集能力。
转型的难点也在这一段:「训练即服务」要求训练场具备模型工程能力——能做数据清洗、配比、训练、评测、迭代。这和「雇一批数据训练师做遥操作」是完全不同的能力栈,也是目前多数训练场最缺的一块。
标准落地之后,谁先承压
11 月 1 日标准实施后,最先受到影响的是三类主体。第一类是只做采集、不做治理的训练场——它们手上的存量数据可能达不到质量等级要求,面临减值。第二类是靠政府补贴和关联交易维持的训练场——此前已有公开质疑指出,部分训练中心的模式是「机器人公司把机器卖给政府支持的训练中心,训练中心采集数据后再把数据卖回给机器人公司」,这类循环在标准明确质量口径后更难维持。第三类是数据采购方——有了统一的质量评估方法,采购合同里可以写清楚质量等级,甲方第一次有了可执行的验收依据。
对真正做场景积累和工程化交付的训练场运营方,以及为它们提供数据采集硬件的供应商来说,标准反而是利好:它把「谁的数据更好」从口头争议变成了可测量项,先发者可以把积累兑现成定价权。