# 训练完就退场的世界模型：光象 Phi-WM 把 80.3% 留在了部署之外

> 光象科技与清华李升波课题组的 Phi-WM 1.0 ActEffect，让世界模型只在训练时上班、部署时退场。真正有意思的不是 80.3% 这个分数，是它的消融实验：去掉后果反馈，分布内只掉 1.8 个点，分布外掉 28.8 个点。

### TLDR

- **核心机制**：策略一次产出三版候选动作——前馈版、粗修版、精修版；世界模型在冻结的 **DINOv3** 特征空间里预测各自后果，与真实未来比对，要求**精修 &gt; 粗修 &gt; 前馈**，把这个排序反向传播进策略权重。
- **训练后退场**：训练结束时，世界模型与未来观测分支一起被剥离，执行阶段<strong>不做未来推演、不做候选动作搜索</strong>。
- **分布外成绩**：加入七类分布偏移的 LIBERO-PLUS 上平均成功率 **80.3%**，对比 Fast-WAM 的 **51.5%**。
- **高维动作空间**：29 维动作空间的 RoboCasa-GR1 上平均成功率 **67.5%**，比第二名 ABot-M0 高 **9.2 个点**。
- **消融才是重点**：去掉后果反馈后，LIBERO 从 **98.8%** 降到 **97.0%**——分布内只掉 1.8 个点，与分布外近 29 个点的差距形成鲜明对照。
- **省的是什么**：生产线上每台设备、每一步推理的开销。这是把世界模型从部署链路里拿掉唯一说得通的理由。

### SRC

本文事实以量子位 2026 年 9 月 5 日《这个世界模型训练完就"退场"，机器人反而更能干了》一文（网易转载，https://www.163.com/dy/article/L62GTEAG0511DSSR.html ）为主，并与 FutureX Physical AI Daily Issue 111（2026-09-06，载于 dev.to）的英文条目逐项对账，两组数字在 LIBERO-PLUS 80.3%、Fast-WAM 51.5%、RoboCasa-GR1 67.5%、领先 ABot-M0 9.2 点、LIBERO 消融 98.8%→97.0% 五处完全一致。

需明确的边界：<strong>截至抓取时（2026-09-07）未检索到该工作的 arXiv 编号、论文主页或官方代码仓库</strong>，FutureX 条目亦未提供论文链接，机构名称「光象科技」的英文转写（Guangxiang Technology）来自 FutureX 英译。LIBERO、LIBERO-PLUS、RoboCasa-GR1 均为公开 benchmark，但本文未独立复现其中的任务构成与评测协议，80.3% 与 51.5% 是否为同一协议下的对比，依赖报道口径。七类分布偏移的具体类型（FutureX 描述为更换相机视角、光照、背景并加入传感器噪声）未在原始报道中逐一列出。文中关于「分布内 vs 分布外收益差异」的解读为本文判断。

### BODY

<div class="sec"><div class="eyebrow"><span class="num">1</span>反常识在哪</div>
<h2>世界模型的通行做法，是在执行时陪机器人一起想</h2>

<p>过去两年，世界模型在具身智能里的标准用法，是给机器人配一块「脑内沙盘」：决策之前先在模型里把未来几步预演一遍，挑一个看起来后果最好的动作再执行。这条路线的代价很直接——<strong>模型想得越多，推理链路越长</strong>。</p>

<p>ActEffect 把顺序倒过来。它让世界模型<strong>只留在训练场里</strong>：不去预演未来，而是检查机器人自己提出的动作会造成什么后果，把这个检查变成策略优化的反馈。训练一结束，世界模型和未来观测分支一起被剥离，部署时什么都不剩。</p>

<div class="jx">
  <div class="jx-h"><span>两种世界模型用法</span><span class="jx-note">对比框架为本文整理，非论文原图</span></div>
  <div class="jx-split">
    <div style="flex:50">
      <div class="eyebrow">常规做法 · 部署时在环</div>
      <p>观测 → 世界模型推演 N 个候选未来 → 选择最优动作 → 执行 → 回到观测。<br><br>
      <strong>代价：</strong>每一步都要跑一次（或 N 次）世界模型前向；延迟随候选数线性增长。</p>
    </div>
    <div style="flex:50">
      <div class="eyebrow">ActEffect · 训练时在环</div>
      <p>训练时：策略产出三版动作 → 世界模型预测后果 → 与真实未来比对 → 排序约束反传进策略。<br><br>
      部署时：观测 → 策略 → 动作。<strong>世界模型已剥离</strong>。</p>
    </div>
  </div>
  <div class="cap">右栏省下的不是一次性的工程量，是每台设备、每一步的持续推理开销。对年产万台、每天运行两班的产线，这个差额会直接出现在电费与硬件选型上。</div>
</div>

<p>这个取舍的关键前提是：<strong>世界模型的价值到底在于「执行时帮机器人想清楚」，还是在于「训练时把物理常识压进策略权重」</strong>。ActEffect 押的是后者。它给出的证据是下面这组数字。</p>
</div>

<div class="sec"><div class="eyebrow"><span class="num">2</span>数字怎么读</div>
<h2>98.8% 不重要，80.3% 才重要</h2>

<div class="jx">
  <div class="jx-h"><span>报道披露的三组成绩</span><span class="jx-note">均据量子位与 FutureX 报道，未见论文原文</span></div>
  <div class="jx-bars">
    <div class="jx-bar-row"><div class="jx-bar-lab">LIBERO 平均成功率</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:98.8%;background:#0a749a"></div></div><div class="jx-bar-val">98.8%</div></div>
    <div class="jx-bar-row"><div class="jx-bar-lab">LIBERO-PLUS（七类偏移）</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:80.3%;background:#00a6d6"></div></div><div class="jx-bar-val">80.3%</div></div>
    <div class="jx-bar-row"><div class="jx-bar-lab">Fast-WAM 同条件对照</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:51.5%;background:#566781"></div></div><div class="jx-bar-val">51.5%</div></div>
    <div class="jx-bar-row"><div class="jx-bar-lab">RoboCasa-GR1（29 维）</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:67.5%;background:#0d8a5f"></div></div><div class="jx-bar-val">67.5%</div></div>
    <div class="jx-bar-row"><div class="jx-bar-lab">第二名 ABot-M0</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:58.3%;background:#4b5f8a"></div></div><div class="jx-bar-val">58.3%</div></div>
    <div class="jx-bar-row"><div class="jx-bar-lab">消融：去掉后果反馈</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:97%;background:#b85c0a"></div></div><div class="jx-bar-val">97.0%</div></div>
  </div>
  <div class="jx-legend"><div class="jx-lg">ABot-M0 的 58.3% 为本文据「67.5% 领先 9.2 个点」反推，非报道直接给出的数值。</div></div>
  <div class="cap">第一行和最后一行放在一起看才有意义：LIBERO 上 98.8%，去掉后果反馈仍有 97.0%——这个模块在分布内几乎不贡献。</div>
</div>

<p>这是全文最值得琢磨的一处。<strong>消融实验显示，去掉后果反馈，LIBERO 只掉 1.8 个点</strong>。如果只看分布内成绩，会得出「这个方法没用」的结论。但 LIBERO-PLUS 上 ActEffect 是 80.3%，对照 Fast-WAM 是 51.5%，差距 28.8 个点。</p>

<p>两组数字合起来的含义是清楚的：<strong>后果监督不是用来提分的，是用来抗漂移的</strong>。它不教机器人怎么把动作做得更像示范，它教机器人识别「这个动作的后果不对」——而后果对不对，恰恰是分布内样本学不到的东西，因为分布内示范的后果全是对的。</p>

<div class="keypoint">
  <strong>判断：</strong>绝大多数机器人策略论文的消融表都只报分布内指标，于是「加上我的模块涨 1.8 个点」这类结果常常被当成弱贡献略过。ActEffect 这组数据说明，<strong>有些模块的收益只在分布外显形，用分布内分数去评价它们本身就选错了尺子</strong>。给客户做选型时同理：在标准工位上跑通不算数，换个光照、换个相机位、换个批次零件还能跑通才算数——而后者往往才是验收那天出事的场景。
</div>
</div>

<div class="sec"><div class="eyebrow"><span class="num">3</span>机制拆解</div>
<h2>三版答案，和一个冻结的特征空间</h2>

<p>ActEffect 的突破口藏在模仿学习最常见的训练目标里。当前大量通用机器人策略建立在 VLA 之上：摄像头告诉机器人眼前有什么，语言指令交代任务，模型照着演示数据生成动作。训练信号是<strong>「你的动作和示范动作像不像」</strong>。</p>

<p>问题在于，动作接近和结果正确之间隔着一道物理的墙。夹爪早合上零点几秒，零件可能就没抓稳；手腕角度偏一点，原本顺滑的插接就会卡住。<strong>两段动作在数值上看着差不多，落到机械臂上结局完全相反</strong>。</p>

<div class="jx">
  <div class="jx-h"><span>一次前向，三版动作</span><span class="jx-note">据报道描述的机制整理</span></div>
  <div class="jx-tl">
    <div class="jx-tl-row"><div class="jx-tl-t">第 1 版 · 前馈</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#566781">策略最原始的输出，未经过任何后果评估</div></div></div>
    <div class="jx-tl-row"><div class="jx-tl-t">第 2 版 · 粗修</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#0a749a">在前馈基础上做一次修正，仍是策略自己的产物</div></div></div>
    <div class="jx-tl-row"><div class="jx-tl-t">第 3 版 · 精修</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#0d8a5f">修正幅度更大的版本，应当对应最优后果</div></div></div>
    <div class="jx-tl-row"><div class="jx-tl-t">约束</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#b85c0a">世界模型在冻结的 DINOv3 特征空间预测三版后果，与真实未来比对，强制 <strong>精修 &gt; 粗修 &gt; 前馈</strong>，把这个序关系反传进策略权重</div></div></div>
  </div>
  <div class="cap">关键设计是「冻结的 DINOv3 特征空间」——世界模型不去重建像素，只在特征层面比对。这既省算力，也避开了像素级生成的误差累积。</div>
</div>

<p>「不去重建像素」是这一整个方案能成立的技术前提。像素级生成是世界模型最贵也最容易崩的一环：生成几帧未来图像，误差会随步数累积，而且大部分计算花在了和任务无关的背景细节上。在冻结的 DINOv3 特征空间里比对后果，等于只问「这个动作导致的状态变化对不对」，不问「未来的画面长什么样」。</p>

<p>这也是它能被安全剥离的原因：<strong>世界模型从来没被当作执行时的规划器，它只是一个训练期的评分器</strong>。评分器不属于部署链路，这是常识——只是此前没人把世界模型明确地放在评分器的位置上。</p>

<p>29 维动作空间的 RoboCasa-GR1 上拿到 67.5% 并领先第二名 9.2 个点，是这组结果里含金量最高的一项。<strong>动作空间维度越高，「动作接近」与「结果正确」的偏离越大</strong>——因为每个维度上一点点误差，会在高维空间里被放大。这个方法在高维上反而优势更明显，与它的机制是自洽的。</p>
</div>

<div class="sec"><div class="eyebrow"><span class="num">4</span>对工程侧</div>
<h2>省下的开销，该怎么折算成钱</h2>

<p>把世界模型从部署链路里拿掉，工程上的收益可以拆成三笔账，按确定性从高到低排：</p>

<div class="jx">
  <div class="jx-h"><span>三笔账</span><span class="jx-note">折算方法为本文提出，非论文结论</span></div>
  <div class="tbl-wrap">
  <table>
    <tr><th>项目</th><th>确定性</th><th>折算方式</th></tr>
    <tr><th>单步推理延迟</th><td>高</td><td>省下每次决策前的 N 次世界模型前向，延迟降低的幅度与候选动作数成正比</td></tr>
    <tr><th>单机算力配置</th><td>高</td><td>部署时不再需要承载世界模型的显存与算力，BOM 上的计算单元可以直接降档</td></tr>
    <tr><th>规模化后的电费与散热</th><td>中</td><td>取决于运行时长与设备数；产线万台级、两班制时才显著</td></tr>
  </table>
  </div>
  <div class="cap">第一笔和第二笔是确定的，第三笔要乘上规模才看得见。报道里那句「工业机器人每多运行一步模型，都对应新的时延、算力和成本」正是这个意思。</div>
</div>

<div class="keypoint">
  <strong>判断：</strong>把世界模型当成一个可以「用完就拆」的脚手架，是 2026 年具身智能工程侧一个被低估的转向。过去大家默认能力越强越好、模型保留得越完整越好；现在开始有人在算<strong>「这个模块留在部署链路里，每台设备每年多花多少钱」</strong>。这个算法一旦成立，评测体系就得跟着变：以后不只要报成功率，还要报达成这个成功率所付出的部署期推理成本。对做交付的公司来说，这条比任何一个 benchmark 分数都更接近客户真正会问的问题。
</div>

<p>需要提醒的是边界：上述结论全部建立在报道披露的数字与机制描述上，<strong>论文原文、代码与评测脚本截至抓取时未检索到</strong>。在看到可复现的仓库之前，80.3% 与 67.5% 只能当作参考量级，不宜写进任何对外的方案或报价依据。</p>

<div class="srcline">
  <div class="h">本文的边界</div>
  成绩数字（LIBERO 98.8%、LIBERO-PLUS 80.3%、Fast-WAM 51.5%、RoboCasa-GR1 67.5%、领先 ABot-M0 9.2 点、消融 98.8%→97.0%）经量子位 2026-09-05 报道与 FutureX Issue 111（2026-09-06）英译条目交叉核对，五处一致。ABot-M0 的 58.3% 为本文反推，非报道原值。<br><br>
  <strong>本文未检索到该工作的 arXiv 编号、论文主页或代码仓库</strong>，机构英文名 Guangxiang Technology 为 FutureX 英译。LIBERO-PLUS 的「七类分布偏移」具体类型未在中文报道中逐一列出，FutureX 描述为相机视角、光照、背景变化与传感器噪声。各 benchmark 的评测协议未独立复现，跨论文对比的公平性依赖报道口径。<br><br>
  「两种世界模型用法对比」「三笔账」「分布内 vs 分布外收益差异的解读」均为<strong>本文的分析与判断</strong>，不代表论文作者主张。<br><br>
  解读时间：2026-09-07。
</div>
</div>

---

*来源：神机百见-具身解读 · https://www.shenjibailian.com/jiedu/article/phi-wm-acteffect-training-only-world-model/*
