研究解读 · 神机百见解读

训练完就退场的世界模型:光象 Phi-WM 把 80.3% 留在了部署之外

光象科技与清华李升波课题组的 Phi-WM 1.0 ActEffect,让世界模型只在训练时上班、部署时退场。真正有意思的不是 80.3% 这个分数,是它的消融实验:去掉后果反馈,分布内只掉 1.8 个点,分布外掉 28.8 个点。

本篇目录4 节 · 8 分钟
一分钟速览
  1. 核心机制:策略一次产出三版候选动作——前馈版、粗修版、精修版;世界模型在冻结的 DINOv3 特征空间里预测各自后果,与真实未来比对,要求精修 > 粗修 > 前馈,把这个排序反向传播进策略权重。
  2. 训练后退场:训练结束时,世界模型与未来观测分支一起被剥离,执行阶段不做未来推演、不做候选动作搜索
  3. 分布外成绩:加入七类分布偏移的 LIBERO-PLUS 上平均成功率 80.3%,对比 Fast-WAM 的 51.5%
  4. 高维动作空间:29 维动作空间的 RoboCasa-GR1 上平均成功率 67.5%,比第二名 ABot-M0 高 9.2 个点
  5. 消融才是重点:去掉后果反馈后,LIBERO 从 98.8% 降到 97.0%——分布内只掉 1.8 个点,与分布外近 29 个点的差距形成鲜明对照。
  6. 省的是什么:生产线上每台设备、每一步推理的开销。这是把世界模型从部署链路里拿掉唯一说得通的理由。
数据来源与边界
本文事实以量子位 2026 年 9 月 5 日《这个世界模型训练完就"退场",机器人反而更能干了》一文(网易转载,https://www.163.com/dy/article/L62GTEAG0511DSSR.html )为主,并与 FutureX Physical AI Daily Issue 111(2026-09-06,载于 dev.to)的英文条目逐项对账,两组数字在 LIBERO-PLUS 80.3%、Fast-WAM 51.5%、RoboCasa-GR1 67.5%、领先 ABot-M0 9.2 点、LIBERO 消融 98.8%→97.0% 五处完全一致。 需明确的边界:截至抓取时(2026-09-07)未检索到该工作的 arXiv 编号、论文主页或官方代码仓库,FutureX 条目亦未提供论文链接,机构名称「光象科技」的英文转写(Guangxiang Technology)来自 FutureX 英译。LIBERO、LIBERO-PLUS、RoboCasa-GR1 均为公开 benchmark,但本文未独立复现其中的任务构成与评测协议,80.3% 与 51.5% 是否为同一协议下的对比,依赖报道口径。七类分布偏移的具体类型(FutureX 描述为更换相机视角、光照、背景并加入传感器噪声)未在原始报道中逐一列出。文中关于「分布内 vs 分布外收益差异」的解读为本文判断。
1反常识在哪

世界模型的通行做法,是在执行时陪机器人一起想

过去两年,世界模型在具身智能里的标准用法,是给机器人配一块「脑内沙盘」:决策之前先在模型里把未来几步预演一遍,挑一个看起来后果最好的动作再执行。这条路线的代价很直接——模型想得越多,推理链路越长

ActEffect 把顺序倒过来。它让世界模型只留在训练场里:不去预演未来,而是检查机器人自己提出的动作会造成什么后果,把这个检查变成策略优化的反馈。训练一结束,世界模型和未来观测分支一起被剥离,部署时什么都不剩。

两种世界模型用法对比框架为本文整理,非论文原图
常规做法 · 部署时在环

观测 → 世界模型推演 N 个候选未来 → 选择最优动作 → 执行 → 回到观测。

代价:每一步都要跑一次(或 N 次)世界模型前向;延迟随候选数线性增长。

ActEffect · 训练时在环

训练时:策略产出三版动作 → 世界模型预测后果 → 与真实未来比对 → 排序约束反传进策略。

部署时:观测 → 策略 → 动作。世界模型已剥离

右栏省下的不是一次性的工程量,是每台设备、每一步的持续推理开销。对年产万台、每天运行两班的产线,这个差额会直接出现在电费与硬件选型上。

这个取舍的关键前提是:世界模型的价值到底在于「执行时帮机器人想清楚」,还是在于「训练时把物理常识压进策略权重」。ActEffect 押的是后者。它给出的证据是下面这组数字。

2数字怎么读

98.8% 不重要,80.3% 才重要

报道披露的三组成绩均据量子位与 FutureX 报道,未见论文原文
LIBERO 平均成功率
98.8%
LIBERO-PLUS(七类偏移)
80.3%
Fast-WAM 同条件对照
51.5%
RoboCasa-GR1(29 维)
67.5%
第二名 ABot-M0
58.3%
消融:去掉后果反馈
97.0%
ABot-M0 的 58.3% 为本文据「67.5% 领先 9.2 个点」反推,非报道直接给出的数值。
第一行和最后一行放在一起看才有意义:LIBERO 上 98.8%,去掉后果反馈仍有 97.0%——这个模块在分布内几乎不贡献。

这是全文最值得琢磨的一处。消融实验显示,去掉后果反馈,LIBERO 只掉 1.8 个点。如果只看分布内成绩,会得出「这个方法没用」的结论。但 LIBERO-PLUS 上 ActEffect 是 80.3%,对照 Fast-WAM 是 51.5%,差距 28.8 个点。

两组数字合起来的含义是清楚的:后果监督不是用来提分的,是用来抗漂移的。它不教机器人怎么把动作做得更像示范,它教机器人识别「这个动作的后果不对」——而后果对不对,恰恰是分布内样本学不到的东西,因为分布内示范的后果全是对的。

判断:绝大多数机器人策略论文的消融表都只报分布内指标,于是「加上我的模块涨 1.8 个点」这类结果常常被当成弱贡献略过。ActEffect 这组数据说明,有些模块的收益只在分布外显形,用分布内分数去评价它们本身就选错了尺子。给客户做选型时同理:在标准工位上跑通不算数,换个光照、换个相机位、换个批次零件还能跑通才算数——而后者往往才是验收那天出事的场景。
3机制拆解

三版答案,和一个冻结的特征空间

ActEffect 的突破口藏在模仿学习最常见的训练目标里。当前大量通用机器人策略建立在 VLA 之上:摄像头告诉机器人眼前有什么,语言指令交代任务,模型照着演示数据生成动作。训练信号是「你的动作和示范动作像不像」

问题在于,动作接近和结果正确之间隔着一道物理的墙。夹爪早合上零点几秒,零件可能就没抓稳;手腕角度偏一点,原本顺滑的插接就会卡住。两段动作在数值上看着差不多,落到机械臂上结局完全相反

一次前向,三版动作据报道描述的机制整理
第 1 版 · 前馈
策略最原始的输出,未经过任何后果评估
第 2 版 · 粗修
在前馈基础上做一次修正,仍是策略自己的产物
第 3 版 · 精修
修正幅度更大的版本,应当对应最优后果
约束
世界模型在冻结的 DINOv3 特征空间预测三版后果,与真实未来比对,强制 精修 > 粗修 > 前馈,把这个序关系反传进策略权重
关键设计是「冻结的 DINOv3 特征空间」——世界模型不去重建像素,只在特征层面比对。这既省算力,也避开了像素级生成的误差累积。

「不去重建像素」是这一整个方案能成立的技术前提。像素级生成是世界模型最贵也最容易崩的一环:生成几帧未来图像,误差会随步数累积,而且大部分计算花在了和任务无关的背景细节上。在冻结的 DINOv3 特征空间里比对后果,等于只问「这个动作导致的状态变化对不对」,不问「未来的画面长什么样」。

这也是它能被安全剥离的原因:世界模型从来没被当作执行时的规划器,它只是一个训练期的评分器。评分器不属于部署链路,这是常识——只是此前没人把世界模型明确地放在评分器的位置上。

29 维动作空间的 RoboCasa-GR1 上拿到 67.5% 并领先第二名 9.2 个点,是这组结果里含金量最高的一项。动作空间维度越高,「动作接近」与「结果正确」的偏离越大——因为每个维度上一点点误差,会在高维空间里被放大。这个方法在高维上反而优势更明显,与它的机制是自洽的。

4对工程侧

省下的开销,该怎么折算成钱

把世界模型从部署链路里拿掉,工程上的收益可以拆成三笔账,按确定性从高到低排:

三笔账折算方法为本文提出,非论文结论
项目确定性折算方式
单步推理延迟省下每次决策前的 N 次世界模型前向,延迟降低的幅度与候选动作数成正比
单机算力配置部署时不再需要承载世界模型的显存与算力,BOM 上的计算单元可以直接降档
规模化后的电费与散热取决于运行时长与设备数;产线万台级、两班制时才显著
第一笔和第二笔是确定的,第三笔要乘上规模才看得见。报道里那句「工业机器人每多运行一步模型,都对应新的时延、算力和成本」正是这个意思。
判断:把世界模型当成一个可以「用完就拆」的脚手架,是 2026 年具身智能工程侧一个被低估的转向。过去大家默认能力越强越好、模型保留得越完整越好;现在开始有人在算「这个模块留在部署链路里,每台设备每年多花多少钱」。这个算法一旦成立,评测体系就得跟着变:以后不只要报成功率,还要报达成这个成功率所付出的部署期推理成本。对做交付的公司来说,这条比任何一个 benchmark 分数都更接近客户真正会问的问题。

需要提醒的是边界:上述结论全部建立在报道披露的数字与机制描述上,论文原文、代码与评测脚本截至抓取时未检索到。在看到可复现的仓库之前,80.3% 与 67.5% 只能当作参考量级,不宜写进任何对外的方案或报价依据。

本文的边界
成绩数字(LIBERO 98.8%、LIBERO-PLUS 80.3%、Fast-WAM 51.5%、RoboCasa-GR1 67.5%、领先 ABot-M0 9.2 点、消融 98.8%→97.0%)经量子位 2026-09-05 报道与 FutureX Issue 111(2026-09-06)英译条目交叉核对,五处一致。ABot-M0 的 58.3% 为本文反推,非报道原值。

本文未检索到该工作的 arXiv 编号、论文主页或代码仓库,机构英文名 Guangxiang Technology 为 FutureX 英译。LIBERO-PLUS 的「七类分布偏移」具体类型未在中文报道中逐一列出,FutureX 描述为相机视角、光照、背景变化与传感器噪声。各 benchmark 的评测协议未独立复现,跨论文对比的公平性依赖报道口径。

「两种世界模型用法对比」「三笔账」「分布内 vs 分布外收益差异的解读」均为本文的分析与判断,不代表论文作者主张。

解读时间:2026-09-07。