研究解读 · 神机百见-具身解读

朱军团队给世界模型定了五级台阶:Motus2 站在 L3,用 13 万小时第一视角学「动手前先想一遍」

朱军团队发布《General World Models from First-Principles》,把世界模型从名词变成 L1–L5 五级可检验路线;同场发布的 Motus2 用 13 万小时人类第一视角视频加 100 小时机器人数据,把策略、模拟器、评估器装进同一套参数。

本篇目录4 节 · 12 分钟
一分钟速览
  1. 论文框架:朱军及清华 TSAIL / 生数科技团队发布《General World Models from First-Principles》,将通用世界模型核心能力归纳为理解、想象、行动三环闭环,并给出 L1 生成世界 → L2 交互世界 → L3 在世界中行动 → L4 自主世界智能体 → L5 世界组织者五级路线。
  2. 论文判断现有系统已触及前三层,L4、L5 仍是开放问题,缺口集中在因果与物理接地、持久记忆、在线学习、高效部署、安全控制
  3. Motus2 三个接口:以一套共享参数的视频—动作模型同时暴露策略(提候选动作)、模拟器(预测后果)、评估器(判断好坏)三个控制接口,成功、次优、失败动作都能回流为学习依据。
  4. 训练数据:约 13 万小时人类第一视角视频 + 超过 100 小时机器人轨迹与人机对齐数据,另配独立轻量触觉专家预测接触后的力反馈,补「最后一厘米」。
  5. 判断:五级路线的最大价值不是分级本身,而是把「你的世界模型到第几级」变成一个可以逐条追问的问题——目前全行业都挤在 L3,且验证集中在特定本体与特定任务。
数据来源与边界
本文事实来自机器之心 2026 年 9 月 11 日 10:31 的授权深度拆解(36氪转载,作者杨文),该文系统梳理了朱军团队论文《General World Models from First-Principles》(生数科技官网公开 PDF)与 Motus2 架构细节;腾讯新闻 9 月 11 日 10:49 报道补充了 2026 Inclusion·外滩大会(9 月 10 日下午)见解论坛上生数科技 CEO 骆怡航现场发布 Motus2 的事实,以及王晓刚、马毅等与会专家观点。时间窗说明:论坛举行于 9 月 10 日(窗口外),但论文框架的系统性技术拆解于 9 月 11 日(本窗口内)发布,属窗口内新增量,本文据此成稿。论文链接与 MoT 架构描述均可回溯;Motus2 未公布任何任务成功率基准数字,本文不引用不可核验的性能数据;所有趋势判断为作者判断,已标注。素材时间窗:当日 09:00 → 19:00。
本文事实信息来自上方标注的公开来源;解读、判断与延伸部分为作者个人见解,写作过程使用了 AI 工具辅助整理,已由作者人工核实,不代表信息来源方立场。如有雷同纯属巧合;如涉及版权或权益问题,请联系 shenjibailian@shenjibailian.com,我们将在核实后及时删除或更正。
1先解决「世界模型是个筐」

理解、想象、行动的三环闭环

「世界模型」是 2026 年 AI 圈最没有共识的词:连续生成的视频叫世界模型,实时变化的数字环境叫世界模型,潜空间里预测未来状态的系统、直接输出机器人动作的策略,都在用这个名字。机器之心 9 月 11 日的拆解开篇就把这个问题摆上台面——**画面可以足够逼真却违背物理规律,机器人能完成一次抓取也可能只熟悉实验室的机位和轨迹**,仅靠 Demo 无法回答一个系统学到的是视觉相关性、物理结构,还是行动与结果之间的关系。

朱军团队的论文给出了一个收敛框架:通用世界模型要形成三项核心能力的闭环——**理解**(把视觉、语言、声音、触觉或机器人传感器信息整合成对当前世界的内部判断)、**想象**(从当前状态推演多个可能未来,尤其是「如果我做动作 A 而不是 B,结果会怎样」)、**行动**(把预测变成对环境的干预,并用新观测检验修正模型)。视频生成只是这个闭环里「想象」的一部分,回答不了带行动条件的因果预测。

这个框架不是凭空来的:从 Kenneth Craik 1943 年「头脑中的小尺度模型」,到强化学习的 POMDP 建模,再到李飞飞 World Labs 的渲染器/模拟器/规划器分类与 LeCun 的 V-JEPA 潜空间路线,论文把中美两条技术脉络都纳入了坐标,然后给出自己的五级台阶。

2五级台阶与一个玻璃杯

L1 到 L5,每级都有可检验的问题

论文用一只被推到桌边的玻璃杯解释五级路线:**L1** 生成杯子滑落、撞击、碎裂的连续画面;**L2** 在用户改变视角、改变推动方向后继续演化这个世界;**L3** 判断杯子是否要掉、预测伸手是否来得及,并输出机器人真正可执行的抓取动作;**L4** 不再等人指令,主动发现风险、补充信息、失败后修正策略;**L5** 面对多主体协作——谁去抓杯子、谁去避障、谁来调配工具。

论文的判断很冷静:**现有系统已触及前三层级,L4 和 L5 仍是开放问题**,主要缺口包括因果与物理接地、持久记忆、在线学习、高效部署和安全控制。数据侧则给出金字塔结构:底层是互联网规模视频(世界知识先验),向上依次是领域视频、第一视角人类视频、带动作记录的人类示范,顶层是真实机器人交互数据——越往上越稀缺,但动作与任务的对应关系越清楚。

L1 生成世界
已触及
L2 交互世界
已触及
L3 在世界中行动
已触及
L4 自主世界智能体
开放问题
L5 世界组织者
开放问题
论文对行业现状的判断:前三层已有系统触及,L4/L5 的持久记忆、在线学习、安全控制仍未解决
3Motus2 怎么落地这套框架

先心灵,再手巧

9 月 10 日下午的 2026 Inclusion·外滩大会「世界模型是 AI 走向物理世界的新大陆吗」见解论坛上,生数科技 CEO 骆怡航现场发布了面向灵巧操作的通用世界模型 **Motus2**。按机器之心的拆解,它的关键设计是**不做三套独立系统**:以一套共享参数的视频—动作模型,暴露三个控制接口——**策略**提出可执行的候选动作,**模拟器**预测这些动作在视觉世界中的后果,**评估器**判断哪种结果更接近任务目标并用于选择与改进。执行之后,成功、失败和不那么理想的结果都回流为下一轮建模与价值学习的证据。

数据路径是分层的:从单目第一视角视频扩展到同步双目第一视角数据,再用机器人数据完成本体适配——**约 13 万小时人类第一视角记录,加上超过 100 小时的机器人轨迹与人机对齐数据**。执行侧另配一个独立的**轻量触觉专家**,对即将执行的短动作做细化并预测接触后的力反馈:视觉看清物体在哪、世界怎么变,触觉补上压、碰、抓、旋的「最后一厘米」。此外引入记忆机制,应对遮挡、环境变化与连续操作中的状态保持。

架构底座是 **MoT(Mixture-of-Transformers)**:不同模态保留各自的专家参数,通过共享注意力机制交换上下文,避免海量视频数据压制稀缺的机器人信号。

4怎么看

分级是尺子,不是勋章

判断:五级路线图最大的贡献不是给生数自己贴了个 L3 标签,而是给全行业一把尺子——评价任何「世界模型」时可以逐条追问:它生成是否连贯(L1)?能否持续响应干预(L2)?能否输出可执行动作并接受真实结果检验(L3)?有没有主动探索与持续学习(L4)?能否组织多主体协作(L5)?大量号称世界模型的工作,诚实回答往往停在 L1.5。

对比看,本站此前写过的光象 Phi-WM(训练完就退场的世界模型,80.3% 留在部署之外)与小米 U0(生成模型而非策略模型)分别在尺子的不同位置:Phi-WM 验证了「预测准 ≠ 部署可用」,U0 明确只做 L1 的场景生成。Motus2 的差异化在于把**评估器**和**触觉反馈**塞进闭环,向「从失败中学习」迈了一步——但它自己承认仍处在 L3 向 L4 延伸的阶段,验证集中在特定机器人与操作任务,自主目标形成、持久记忆、开放环境泛化都还是欠条。

判断:外滩大会圆桌里最值得记的一句话来自杨言超——不能把生成准确等同于理解正确,画面的逼真程度并不必然对应机器人交互能力的提升。Motus2 的 13 万小时 vs 100 小时数据比也印证了这一点:人类视频提供广度,真正让模型「会干活」的仍是那 100 小时稀缺的真机数据。数据金字塔顶层有多薄,L4 就有多远。

来源:机器之心(36氪授权)2026-09-11;https://36kr.com/p/3977602492300290;论文:https://www.shengshu.com/assets/gwm-principles-and-roadmap.pdf