训练完就退场的世界模型:光象 Phi-WM 把 80.3% 留在了部署之外
光象科技与清华李升波课题组的 Phi-WM 1.0 ActEffect,让世界模型只在训练时上班、部署时退场。真正有意思的不是 80.3% 这个分数,是它的消融实验:去掉后果反馈,分布内只掉 1.8 个点,分布外掉 28.8 个点。
- 核心机制:策略一次产出三版候选动作——前馈版、粗修版、精修版;世界模型在冻结的 DINOv3 特征空间里预测各自后果,与真实未来比对,要求精修 > 粗修 > 前馈,把这个排序反向传播进策略权重。
- 训练后退场:训练结束时,世界模型与未来观测分支一起被剥离,执行阶段不做未来推演、不做候选动作搜索。
- 分布外成绩:加入七类分布偏移的 LIBERO-PLUS 上平均成功率 80.3%,对比 Fast-WAM 的 51.5%。
- 高维动作空间:29 维动作空间的 RoboCasa-GR1 上平均成功率 67.5%,比第二名 ABot-M0 高 9.2 个点。
- 消融才是重点:去掉后果反馈后,LIBERO 从 98.8% 降到 97.0%——分布内只掉 1.8 个点,与分布外近 29 个点的差距形成鲜明对照。
- 省的是什么:生产线上每台设备、每一步推理的开销。这是把世界模型从部署链路里拿掉唯一说得通的理由。
世界模型的通行做法,是在执行时陪机器人一起想
过去两年,世界模型在具身智能里的标准用法,是给机器人配一块「脑内沙盘」:决策之前先在模型里把未来几步预演一遍,挑一个看起来后果最好的动作再执行。这条路线的代价很直接——模型想得越多,推理链路越长。
ActEffect 把顺序倒过来。它让世界模型只留在训练场里:不去预演未来,而是检查机器人自己提出的动作会造成什么后果,把这个检查变成策略优化的反馈。训练一结束,世界模型和未来观测分支一起被剥离,部署时什么都不剩。
观测 → 世界模型推演 N 个候选未来 → 选择最优动作 → 执行 → 回到观测。
代价:每一步都要跑一次(或 N 次)世界模型前向;延迟随候选数线性增长。
训练时:策略产出三版动作 → 世界模型预测后果 → 与真实未来比对 → 排序约束反传进策略。
部署时:观测 → 策略 → 动作。世界模型已剥离。
这个取舍的关键前提是:世界模型的价值到底在于「执行时帮机器人想清楚」,还是在于「训练时把物理常识压进策略权重」。ActEffect 押的是后者。它给出的证据是下面这组数字。
98.8% 不重要,80.3% 才重要
这是全文最值得琢磨的一处。消融实验显示,去掉后果反馈,LIBERO 只掉 1.8 个点。如果只看分布内成绩,会得出「这个方法没用」的结论。但 LIBERO-PLUS 上 ActEffect 是 80.3%,对照 Fast-WAM 是 51.5%,差距 28.8 个点。
两组数字合起来的含义是清楚的:后果监督不是用来提分的,是用来抗漂移的。它不教机器人怎么把动作做得更像示范,它教机器人识别「这个动作的后果不对」——而后果对不对,恰恰是分布内样本学不到的东西,因为分布内示范的后果全是对的。
三版答案,和一个冻结的特征空间
ActEffect 的突破口藏在模仿学习最常见的训练目标里。当前大量通用机器人策略建立在 VLA 之上:摄像头告诉机器人眼前有什么,语言指令交代任务,模型照着演示数据生成动作。训练信号是「你的动作和示范动作像不像」。
问题在于,动作接近和结果正确之间隔着一道物理的墙。夹爪早合上零点几秒,零件可能就没抓稳;手腕角度偏一点,原本顺滑的插接就会卡住。两段动作在数值上看着差不多,落到机械臂上结局完全相反。
「不去重建像素」是这一整个方案能成立的技术前提。像素级生成是世界模型最贵也最容易崩的一环:生成几帧未来图像,误差会随步数累积,而且大部分计算花在了和任务无关的背景细节上。在冻结的 DINOv3 特征空间里比对后果,等于只问「这个动作导致的状态变化对不对」,不问「未来的画面长什么样」。
这也是它能被安全剥离的原因:世界模型从来没被当作执行时的规划器,它只是一个训练期的评分器。评分器不属于部署链路,这是常识——只是此前没人把世界模型明确地放在评分器的位置上。
29 维动作空间的 RoboCasa-GR1 上拿到 67.5% 并领先第二名 9.2 个点,是这组结果里含金量最高的一项。动作空间维度越高,「动作接近」与「结果正确」的偏离越大——因为每个维度上一点点误差,会在高维空间里被放大。这个方法在高维上反而优势更明显,与它的机制是自洽的。
省下的开销,该怎么折算成钱
把世界模型从部署链路里拿掉,工程上的收益可以拆成三笔账,按确定性从高到低排:
| 项目 | 确定性 | 折算方式 |
|---|---|---|
| 单步推理延迟 | 高 | 省下每次决策前的 N 次世界模型前向,延迟降低的幅度与候选动作数成正比 |
| 单机算力配置 | 高 | 部署时不再需要承载世界模型的显存与算力,BOM 上的计算单元可以直接降档 |
| 规模化后的电费与散热 | 中 | 取决于运行时长与设备数;产线万台级、两班制时才显著 |
需要提醒的是边界:上述结论全部建立在报道披露的数字与机制描述上,论文原文、代码与评测脚本截至抓取时未检索到。在看到可复现的仓库之前,80.3% 与 67.5% 只能当作参考量级,不宜写进任何对外的方案或报价依据。
本文未检索到该工作的 arXiv 编号、论文主页或代码仓库,机构英文名 Guangxiang Technology 为 FutureX 英译。LIBERO-PLUS 的「七类分布偏移」具体类型未在中文报道中逐一列出,FutureX 描述为相机视角、光照、背景变化与传感器噪声。各 benchmark 的评测协议未独立复现,跨论文对比的公平性依赖报道口径。
「两种世界模型用法对比」「三笔账」「分布内 vs 分布外收益差异的解读」均为本文的分析与判断,不代表论文作者主张。
解读时间:2026-09-07。