深度 · 神机百见-具身解读

70 家训练场之后是 11 月 1 日:具身智能的数据生意,要换一种计价方式了

截至 6 月底全国建成启用超 70 家具身智能训练场,在建或规划还有 40 多家。11 月 1 日起,「具身智能数据集质量要求及评估方法」行业标准正式实施。当数据从按小时卖变成按质量等级卖,训练场这门刚起步的生意要重新算账。

本篇目录5 节 · 11 分钟
一分钟速览
  1. 家数与分布:中国信通院《具身智能训练场研究报告(2026年)》显示,截至 2026 年 6 月底全国建成启用超 70 家训练场,在建或规划 40 多家,覆盖 18 个省区市。浙江 14 个最多,江苏、北京、广东、山东各 8 个。
  2. 布局逻辑变了:信通院张蔚敏概括为「哪里有合适的场景,训练场就建到哪里」——从人才、资本驱动转向真实场景、数据供给和运营效率驱动,开始向三线、四线乃至五线城市延伸。
  3. 11 月 1 日:由中国信通院联合 40 余家单位共同起草的人工智能系列行业标准「具身智能数据集质量要求及评估方法」将于 2026 年 11 月 1 日起正式实施,填补该方向行业标准空白。
  4. 商业模式的坎:多数训练场以数据产品出售为主要收入来源,仅靠数据出售难以覆盖投入;深圳「具宝盆」联合发起人王茂林提出向覆盖数据生产、模型训练、应用验证的「训练即服务」转型。
  5. 判断:11 月 1 日的标准不是质量门槛,是计价方式的切换——数据集从「按小时、按条数」卖,变成「按质量等级」卖,训练场的存货估值会被重估,一批只采集不治理的场会先出清。
数据来源与边界
本文事实以新华社通稿为主源(人民网云南频道 2026-09-16 转发,https://yn.people.com.cn/n2/2026/0916/c378440-41697356.html),核心数字(截至 2026 年 6 月底建成启用超 70 家、在建或规划 40 多家、覆盖 18 个省区市、浙江 14 个、江苏与北京与广东与山东各 8 个、标准由信通院联合 40 余家单位起草、2026 年 11 月 1 日实施)均出自该通稿引述的中国信通院报告与张蔚敏、江磊、王茂林等具名受访者表述,属具名可核的一手引述。另有三类数字来自第三方媒体转述而非通稿原文,本文单独标注:凤凰网 2026-09-15 转述称规模化真机遥操作采集有效数据成本约 275 元/小时、小规模阶段可达数千元/小时;自媒体「智财社」引信通院口径称以年产量 10 万小时数据、建设投入 5000 万元估算回本周期在三年以上;行业估算称全行业累计约 50 万小时高质量训练数据。这三类数字未获信通院报告原文直接确认,本文按「第三方转述」使用,不作为结论依据。本文未直接调阅信通院报告 PDF 原文。素材时间窗为 2026-09-15 18:00 → 2026-09-16 09:00:通稿于 9 月 16 日经人民网转发(窗口内),信通院报告本身发布于窗口外(2026 年 8 月),本稿按扩窗规则第 2 条收录,窗口内新增量为 9 月 16 日新华社通稿首次对「70 家」与「11 月 1 日标准」做并列报道,并首次公开训练场商业模式与「训练即服务」转型表述。本站 09-13 曾写过数采中心单价(15 万元一台机器人、120 元一小时数据)与国家数据局数据标准名单,本稿角度不同:前者讲单价,本稿讲标准实施后的计价方式切换与回本周期;无同事件重复。所有判断均已用「判断:」标注。
本文事实信息来自上方标注的公开来源;解读、判断与延伸部分为作者个人见解,写作过程使用了 AI 工具辅助整理,已由作者人工核实,不代表信息来源方立场。如有雷同纯属巧合;如涉及版权或权益问题,请联系 shenjibailian@shenjibailian.com,我们将在核实后及时删除或更正。
家数

70 家已建成,40 多家在路上

中国信通院《具身智能训练场研究报告(2026年)》给出的最新截面是:截至 2026 年 6 月底,全国共建成启用超过 70 家具身智能训练场,在建或规划中的还有 40 多家。分布覆盖 18 个省区市,形成以长三角、京津冀和珠三角为核心的三大集群。

省份分布上,浙江已建成 14 个,数量最多;江苏、北京、广东、山东紧随其后,均为 8 个。这个分布和国内具身智能产业集群高度吻合,但真正值得注意的是信通院点出的另一个趋势:训练场建设正在突破传统人工智能产业高度集聚于一线城市的模式,向三线、四线乃至五线城市延伸,呈现多层级城市协同布局。

浙江
14 个
江苏
8 个
北京
8 个
广东
8 个
山东
8 个
已建成训练场数量的省份分布(截至 2026 年 6 月底,来源:中国信通院,经新华社通稿引述)

中国信通院人工智能研究所具身智能部副主任张蔚敏把这种布局逻辑概括成一句话——「哪里有合适的场景,训练场就建到哪里」。她还指出,这反映出训练场建设正从人才、资本驱动转向真实场景、数据供给和运营效率驱动。

判断:向三四五线延伸不是产业下沉,是要素套利。判断:大模型时代的核心资源是人才和算力,所以产业必然集中在北上深杭;具身智能的核心资源是真实场景——工厂、仓库、医院、养老院。场景不能外迁,所以训练场必须跟着场景走。浙江 14 个不是因为政策更优惠,是因为它有全国最密集的制造业集群和电商物流网络。
标准

11 月 1 日:从规模导向转向质量导向

由中国信息通信研究院联合 40 余家单位共同起草编制的人工智能系列行业标准——「具身智能数据集质量要求及评估方法」,将于 2026 年 11 月 1 日起正式实施。张蔚敏介绍,该标准的发布标志着具身智能数据集建设将从规模导向向质量导向转变,有效填补具身智能数据方向的行业标准空白。

这句「从规模导向转向质量导向」,是整篇通稿里分量最重的一句。它意味着行业主管部门对现有训练场产出的数据质量给出了一个明确判断:过去两年的主要问题不是采集得不够多,而是采集得不够好、不够可比较。

2026 年 6 月
工信部、国务院国资委联合启动 2026 年度人形机器人与具身智能实景实训专项行动,要求省级地区至少遴选 20 个重点场景单元
2026 年 6 月底
全国建成启用超 70 家训练场,在建或规划 40 多家
2026 年 8 月
中国信通院发布《具身智能训练场研究报告(2026年)》
2026 年 9 月 16 日
新华社通稿首次并列报道「70 家」与「11 月 1 日标准」
2026 年 11 月 1 日
「具身智能数据集质量要求及评估方法」行业标准正式实施

值得注意的是专项行动里的一条具体要求:省级地区至少遴选 20 个重点场景单元,按照「最小干预、利旧复用」原则开展作业环境适配改造。「最小干预、利旧复用」这八个字很关键——它明确否定了「为了采数据而新建场景」的做法,要求训练场在既有生产环境里做适配,而不是搭一个干净的实验室。

判断:「最小干预、利旧复用」是对训练场建设方式的一次纠偏。判断:如果一个训练场的数据是在专门搭建的样板间里采的,那么它与真实产线的分布差异会让模型在落地时失效——这正是国家地方共建人形机器人创新中心首席科学家江磊所说的「卡在标准体系、工程管理、中试等环节,核心矛盾集中在场景适配」。标准的实施,等于把「场景真实性」从倡议变成了可考核项。
算账

卖数据为什么覆盖不了投入

通稿直接点出了训练场自身的经营困境:当前多数训练场以数据产品出售为主要收入来源,但仅靠数据出售难以覆盖投入,商业模式的可持续性是训练场自身面临的考验。

要理解这个困境,需要看两个量级。第三方媒体转述的行业口径显示:规模化真机遥操作采集的有效数据成本约为每小时 275 元,小规模采集阶段甚至可能达到每小时数千元(该数字来自凤凰网 2026-09-15 转述,未获信通院报告原文直接确认);而一个大型训练场还需要投入机器人本体、场景建设、数据采集设备、算力,整体投入可能达到数千万元甚至更高。另一条第三方转述的估算更直接:以年产量 10 万小时数据、建设投入 5000 万元估算,回本周期在三年以上。

成本 / 收入项量级口径来源
规模化真机遥操作采集成本约 275 元 / 小时第三方媒体转述(未获报告原文确认)
小规模采集阶段成本可达数千元 / 小时同上
大型训练场整体投入数千万元甚至更高新华社通稿引述
回本周期(按年产 10 万小时、投入 5000 万元估)三年以上自媒体引信通院口径
行业累计高质量训练数据约 50 万小时(行业估算)第三方估算,未确认
表:训练场成本与收入量级。除「大型训练场整体投入」出自新华社通稿引述外,其余均来自第三方转述或行业估算,本文未获信通院报告原文直接确认,仅作量级参考。

这组数字放在一起,矛盾就清楚了:采集成本是刚性的,而数据售价面临两个方向的挤压——一方面客户预算有限,另一方面公开数据集和自采数据在同时供给。当收入端是「按小时卖成品数据」这种一次性交易,而成本端是重资产摊销时,回本周期长是必然结果。

判断:问题不在于数据卖得便宜,而在于「卖数据」本身是把重资产投入换成了低毛利的一次性收入。判断:一条数据可以卖给多个客户,看起来像软件生意;但如果客户需要的是定制场景数据,那么每条数据的采集都要重新投入人力和真机时间——这时候它其实是项目制生意,却按软件生意在定价。这个错配是训练场亏损的结构性原因。
转型

从「卖数据」到「训练即服务」,改的是哪一环

深圳「具宝盆」联合发起人王茂林给出的方向是:下一步将从单一数据供给向覆盖数据生产、模型训练、应用验证的「训练即服务」转型,构建多元收入结构,推动训练场从重资产投入走向可持续运营。

这个转型的实质,是把收入模型从「一次性交付」改成「持续性服务」。按小时卖数据,一单结一单;提供训练服务,则是按训练周期、按模型迭代次数、按验证任务收费,客户关系从交易变成订阅。

卖数据(现在)

收入 = 数据条数或小时数 × 单价。客户买走数据后自己训练,训练场不参与后续。收入一次性确认,无法分享客户模型变好带来的收益。风险是价格竞争激烈,且客户需求高度定制时毛利率快速下滑。

训练即服务(方向)

收入 = 训练任务 / 验证任务 / 模型迭代的服务费。训练场同时提供算力、数据、场景和验证环境,客户在这里完成「数据生产→训练→验证」的闭环。收入可重复,但要求训练场具备模型工程能力,而不只是采集能力。

转型的难点也在这一段:「训练即服务」要求训练场具备模型工程能力——能做数据清洗、配比、训练、评测、迭代。这和「雇一批数据训练师做遥操作」是完全不同的能力栈,也是目前多数训练场最缺的一块。

判断:「训练即服务」能不能跑通,取决于客户愿不愿意为「模型变好」付费,而不是为「数据条数」付费。判断:这是两种完全不同的采购心理——条数可以比价,模型效果很难比价但也很难归因。训练场如果想走这条路,必须能拿出可验证的效果提升曲线,否则客户仍会退回到按条数砍价。
外溢

标准落地之后,谁先承压

11 月 1 日标准实施后,最先受到影响的是三类主体。第一类是只做采集、不做治理的训练场——它们手上的存量数据可能达不到质量等级要求,面临减值。第二类是靠政府补贴和关联交易维持的训练场——此前已有公开质疑指出,部分训练中心的模式是「机器人公司把机器卖给政府支持的训练中心,训练中心采集数据后再把数据卖回给机器人公司」,这类循环在标准明确质量口径后更难维持。第三类是数据采购方——有了统一的质量评估方法,采购合同里可以写清楚质量等级,甲方第一次有了可执行的验收依据。

对真正做场景积累和工程化交付的训练场运营方,以及为它们提供数据采集硬件的供应商来说,标准反而是利好:它把「谁的数据更好」从口头争议变成了可测量项,先发者可以把积累兑现成定价权。

判断:70 家这个数字本身不是泡沫的证据,40 多家在建才是需要观察的指标。判断:如果 11 月 1 日之后在建数量明显收缩,说明标准确实起到了筛选作用;如果继续增长,则说明地方政府的场景与补贴逻辑仍在主导,标准只会变成一纸合规文件。真正的分水岭不在 11 月 1 日当天,而在之后两个季度的在建数据里。
信源:新华社通稿(人民网云南频道 2026-09-16 转发,yn.people.com.cn/n2/2026/0916/c378440-41697356.html),引述中国信通院《具身智能训练场研究报告(2026年)》及张蔚敏、江磊、王茂林具名表述;本文未直接调阅信通院报告原文。第三方转述数字(275 元/小时、回本三年以上、50 万小时)已单独标注,未获报告原文确认。素材时间窗 2026-09-15 18:00 → 2026-09-16 09:00;信通院报告发布于窗口外,按扩窗规则第 2 条收录,窗口内新增量为 9 月 16 日通稿首次并列报道 70 家与 11 月 1 日标准、首次公开商业模式转型表述。核查时间 2026-09-16。