研究解读 · 神机百见-具身解读

15.4 小时导航数据换 8.39 个百分点:具脑磐石 Cog-WM 1.0 真正值得看的是 SR 与 SPL 的背离

具脑磐石在浦江创新论坛发布类脑认知世界模型 Cog-WM 1.0,用约 15.4 小时导航数据把成功率从 78.50% 提到 86.89%。但同期路径效率只涨了 0.65——「找到了」和「走得近」之间的这道缝,才是这份成绩单里最该被读的东西。

本篇目录5 节 · 11 分钟
一分钟速览
  1. 发布:2026-09-14 在浦江创新论坛类脑具身智能分论坛,上海具脑磐石发布类脑认知世界模型 Cog-WM 1.0,分 Nav(导航)与 Manip(操作)两个方向,方法均通过 arXiv 论文公开。
  2. 导航:HM3D-ObjectNav 子集上成功率(SR)由基线 BSC-Nav 的 78.50% 提升至 86.89%,绝对提升 8.39 个百分点、相对提升 10.69%;路径效率(SPL)由 47.70 升至 48.35
  3. 数据:导航侧使用 145 个场景、577 条轨迹、约 15.4 小时任务数据,模型参数约 1B,任务数据量约为对标方法的十分之一
  4. 操作:LIBERO 98.2%(π0.5 为 96.9%)、LIBERO-Plus 84.6%(π0.5 为 84.5%);消融从纯策略 80.0% 逐级到完整方法 84.6%
  5. 部署:已在四足机器人上完成部署并用于巡检/巡逻客户现场,此前在多款轮式人形本体完成验证。
  6. 判断:SPL 只涨 0.65 说明这套机制解决的是「找不找得到」,不是「绕不绕得远」;把 15.4 小时当成具身数据问题的解法是误读——它不含视觉编码器预训练。
数据来源与边界
本篇素材时间窗为前一日 18:00 → 当日 09:00。核心事实来自界面新闻 2026-09-14 18:24 发布的稿件(新浪新闻转载,落在本窗口内)与腾讯新闻 2026-09-14 的深度报道;事件本体(2026 浦江创新论坛类脑具身智能分论坛,论坛会期为 9 月 11 日至 14 日)发生在窗口外,窗口内的增量是界面新闻于 18:24 首次对外披露该模型的完整基准数据与数据规模,此前公开报道仅有定性描述。需要明确的边界:所有基准数字(78.50%、86.89%、47.70、48.35、98.2%、84.6%、消融四级)均为企业与算法团队自述口径,虽称已通过 arXiv 论文公开方法,但本篇未逐项比对 arXiv 原文数值;「全球首个」「超越 SOTA」为企业与论文表述。数据规模的两个关键限定来自腾讯新闻稿:15.4 小时仅指导航任务数据,不含视觉编码器预训练数据;「约为对标方法十分之一」为企业自述比较口径,未说明对标方法的具体构成。判断段落均以「判断:」开头,为作者观点。
本文事实信息来自上方标注的公开来源;解读、判断与延伸部分为作者个人见解,写作过程使用了 AI 工具辅助整理,已由作者人工核实,不代表信息来源方立场。如有雷同纯属巧合;如涉及版权或权益问题,请联系 shenjibailian@shenjibailian.com,我们将在核实后及时删除或更正。
先把这组数字摆正

8.39 个百分点与 0.65 的背离

具身导航有两个常用指标:SR(Success Rate)衡量「最后有没有找到目标、任务有没有完成」;SPL(Success weighted by Path Length)在此基础上再按路径效率打折——走冤枉路越多,得分越低。

Cog-WM Nav 1.0 在 HM3D-ObjectNav 子集上的成绩是:SR 从基线 BSC-Nav 的 78.50% 提到 86.89%,绝对提升 8.39 个百分点;SPL 从 47.70 提到 48.35,只涨了 0.65。

这两个数字放在一起读,比单看「提升超 10%」有意义得多。成功率的涨幅远大于路径效率的涨幅,说明这套机制真正改善的是「能不能找到」,而不是「走的路够不够短」。换句话说,机器人变得更擅长做对决策——在没有线索时判断该往哪个方向探索——而不是更擅长规划一条最优路径。

Cog-WM Nav 1.0 与 BSC-Nav 基线对比HM3D-ObjectNav 子集,企业自述口径
BSC-Nav 成功率 SR
78.50%
Cog-WM 成功率 SR
86.89%
BSC-Nav 路径效率 SPL
47.70
Cog-WM 路径效率 SPL
48.35
SR 提升 8.39 个百分点;SPL 仅提升 0.65
图注:基数为 Nature Communications 上的 BSC-Nav(Ruan et al., 2026)。数据经界面新闻 2026-09-14 18:24 与腾讯新闻 2026-09-14 报道转述,两处口径一致。
这个类比值得记住

SR 是「有没有找到」,SPL 是「绕没绕远」

用一个日常场景翻译这个背离:让你在一个陌生商场里找一家奶茶店。SR 衡量的是你最终有没有站在那家店门口;SPL 还要再问一句——你是一路直奔,还是先绕了三圈才摸过去。

Cog-WM 的改进明显落在前者。它的做法是把空间记忆与前瞻预测绑在一起:在记忆的隐空间里,结合任务目标与既有环境记忆预测后续的空间表征与探索子目标,再综合目标语义与路径代价选择下一步行动。当视野里没有目标时,它比基线更早判断出「该往哪探」——这正是 SR 提升的来源。

但一旦它决定往某处走,走得好不好、会不会折返,SPL 几乎没有变化,说明局部路径规划与运动执行这一段并没有被这套机制显著改善。对一个要真正上岗的巡检机器人来说,这意味着:它更不容易「找不到」,但一趟巡检的耗时未必明显下降。

判断:把 SR 涨、SPL 不涨当成负面结论是错的——先解决「找到」再解决「走近」,本来就是合理的工程次序。但反过来,把「成功率提升超 10%」直接翻译成「巡检效率提升 10%」则是误读。对采购方而言,这两句话对应的是完全不同的验收指标:前者是任务完成率,后者是单趟工时。
被反复引用的那个数字

15.4 小时的边界在哪里

这次传播最广的一个说法是「用约十分之一的数据取得了相近甚至更好的表现」。支撑它的具体数字是:145 个场景、577 条轨迹、约 15.4 小时导航任务数据,模型参数约 1B

但这个数字有两个必须同时说清的限定。第一,15.4 小时指的是导航任务数据,不包含视觉编码器的预训练数据。视觉编码器本身见过的数据量没有披露,这部分才是通常意义上的「海量」所在。第二,「约为对标方法十分之一」是企业自述的比较口径,没有说明对标方法的具体数据构成与筛选条件。

把这两条去掉,结论就会从「15.4 小时解决了具身数据问题」滑向一个站不住的说法。准确的表述应该是:在导航这一特定任务域内,通过改变模型对信息的组织与预测方式,有可能显著降低任务数据需求。腾讯新闻的那篇稿子用了「重要、但仍需要克制的结论」来形容,这个措辞是准确的。

可以说的

在 HM3D-ObjectNav 子集上,用约 15.4 小时导航任务数据,取得了高于基线 BSC-Nav 的成功率;机制上走的是隐空间预测 + 时空记忆,而非像素级重建。

不能说的

15.4 小时解决了具身智能的数据问题。它不含视觉编码器预训练数据,且仅限导航任务域,未覆盖操作侧的数据规模披露。

操作侧的消融

84.6% 是一层层叠出来的

操作分支 Cog-WM Manip 1.0 走的是多时间尺度预测加价值引导的经验学习:让模型在训练中同时学习近期动作后果与后续任务状态,建立「当前动作」与「任务进展」的联系;再利用有效执行轨迹学习环境变化,根据动作片段对任务推进的贡献引导策略改进。

公开的两个基准数字是:LIBERO 98.2%(π0.5 为 96.9%),LIBERO-Plus 84.6%(π0.5 为 84.5%)。前者高出 1.3 个百分点,后者只高出 0.1 个百分点——难度更高的基准上,优势几乎被抹平

比分数更有信息量的是消融实验,它把能力拆解成了四级:

纯策略
80.0%
基线
加局部预测
81.6%
+1.6
加多时域预测
82.0%
+0.4
完整方法
84.6%
+2.6
图注:LIBERO-Plus 上的消融结果,企业自述口径。四级的递进关系说明每一档提升都对应一个明确机制,但最后一档(+2.6)的来源未在公开材料中单独拆解。

值得注意的是,前两档各带来 1.6 和 0.4 个百分点,最后一档一次性给了 2.6——贡献最大的那一步,恰恰是公开材料描述最模糊的一步。这是复现时最需要盯的地方。

对落地方的参考

「低数据依赖」到底省下了什么

如果这套机制真的能把任务数据需求降一个数量级,它对产业的价值不在榜单,而在长尾场景的部署成本。陌生车间、非标工位这类场景的共同特点是:没法预先采一轮数据、也没法建一张高精地图。传统方案在这里的边际成本极高,而「无需预置地图先验」正是 Cog-WM Nav 1.0 强调的部署条件。

公司称该模型已在四足机器人上完成部署并应用于巡检/巡逻场景的客户现场,此前也在多款轮式人形本体完成验证。这一条比任何基准分数都关键——它把论文指标和真实现场第一次接上了。但公开材料没有给出现场运行的具体指标(运行时长、成功率、人工接管率),这几项才是判断「开箱即用」是否成立的依据。

判断:类脑机制在具身智能里的价值,目前能确证的是「可归因性」——消融实验能把每一档提升对应到一个明确机制,这比端到端黑箱的「又涨了两个点」更容易做工程调试。但它还没有被证明是「数据效率的一般解」:15.4 小时的口径限定、LIBERO-Plus 上 0.1 个百分点的微弱优势、以及最后一级消融的模糊来源,都是这个结论目前的边界。建议的观察点很具体:看它在非巡检类场景(比如开放世界的物品递送)能否复现同样的低数据表现。
信源:界面新闻 2026-09-14 18:24(新浪新闻转载)、腾讯新闻 2026-09-14 深度稿;发布场合为 2026 浦江创新论坛类脑具身智能分论坛(会期 9 月 11 日至 14 日)。所有基准数字为企业与算法团队自述口径,本篇未逐项比对 arXiv 原文;15.4 小时不含视觉编码器预训练数据;消融四级数据的最后一档来源未在公开材料中拆解。核查时间 2026-09-15,素材时间窗 2026-09-14 18:00 → 2026-09-15 09:00。