# 运动误差降 90.4%，VLM 打分却反而输了：Hydra-0 把「世界模型该评什么」摆上了桌面

> Hydra-0 把机器人动作从关节空间搬到像素空间，夹爪运动误差从 34.28 像素降到 3.29 像素。但同一份表格里，VLM 打分有一栏没跑赢基线——这个反差比 90.4% 更值得读。

### TLDR

- **换的是接口的单位**：Hydra-0 不再把动作编码成末端 6D 位姿，而是编码成「动作流」——动作前后画面上哪些像素会动、往哪动，于是人类演示、UMI 数据与不同构型的机器人可以进同一锅训练。
- **误差掉了一个数量级**：在同一个数据集配比与骨干家族下对照，夹爪运动平均 EPE 从基线的 **34.28** 像素降到最佳配置的 **3.29** 像素，物体运动 EPE 从 **13.23** 降到 **5.27**；论文摘要口径为机器人运动误差降低 **90.40%**、物体运动误差降低 **60.16%**。
- **有一栏没赢**：换成动作流后，基于 Cosmos 2.5 的配置 VLM 打分为 **3.83**，反而低于基线的 **3.88**。VLM 评的是「画面对不对」，不是「手有没有按指令动」。
- **训练的料很实在**：语料来自 7 个来源、过滤后 **178,187** 条 episode、**2,201.7** 小时；骨干冻结，只训 DiT patch embedding 与 rank-64 LoRA。
- **判断**：90.4% 这个数字的量级是真的，但它衡量的是「预测得像不像」，不等于「控制得好不好」——论文自己也承认闭环没做。

### SRC

事实部分来自论文预印本《Hydra-0: Action Flow for Generalist World Modeling and Control》（arXiv 2608.18077，2026-08-18 上线，作者来自 NVIDIA、布朗大学、哥伦比亚大学、哈佛大学）、论文主页 nvidia-isaac.github.io/video_to_data/hydra-0 的评测表格，以及腾讯新闻 2026-09-20 的中文解读（news.qq.com/rain/a/20260920A06IXB00）。素材时间窗为「前一日 18:00 → 当日 09:00」：论文属窗口外旧事件（8 月 18 日上线），本窗口内的新增量是中文解读刊发与完整五档配置对照表的公开传播，本篇据此写成解读，不冒充当日新发论文。边界：90.40% / 60.16% 是相对作者自家 Cosmos 2.5 原生动作基线的比值，不是相对行业最优；论文明确未做闭环控制实验；由物体流反推机器人动作的部分作者自述为定性演示。表格中 Grepper/Gripper EPE 等指标为「显示的平均端点误差」，论文百分比按聚合误差定义计算，与单看平均值的简单比值不完全一致，本篇已分别列出。判断均为作者分析，已用「判断：」标注。

### BODY

<div class="sec"><div class="eyebrow"><span class="num">1</span>接口</div>
<h2>把「动作」翻译成画面上的一片流</h2>

<p>世界模型要回答的问题其实很朴素：我做一个动作之后，画面会变成什么样。难的是「动作」这两个字怎么喂给一个视频生成模型。</p>

<p>主流做法是把动作写成末端执行器的 6D 相对位姿。这套表示在工程上很自然，却有三个硬伤：不同本体的动作向量维度和语义不同，七自由度单臂和双臂人形根本拼不到一起训练；同样的末端轨迹可能对应完全不同的连杆姿态，视频模型还得额外学一遍从控制量到像素运动的映射；更麻烦的是大量人类演示、UMI 手持设备拍的视频根本没有 URDF、关节状态和精确相机标定，转换不成标准机器人动作。</p>

<p>Hydra-0 的解法是把中间层换掉。它不再喂关节量，而是把动作表示成<strong>图像平面上的稀疏运动轨迹</strong>——也就是动作执行前后，画面上哪些点会往哪个方向动。视频模型本来就擅长预测像素怎么动，这一改等于把「动作」翻译成了模型母语。论文里的说法是，这个统一的视觉接口让跨本体、跨任务、跨环境的世界建模与控制成为可能。</p>

<div class="sec"><div class="eyebrow"><span class="num">2</span>数字</div>
<h2>五档配置摆在一起，才看得出 90.4% 是怎么来的</h2>

<p>最有价值的部分不是那两个百分比，是论文给出的五档对照表。同一数据集配比、同一骨干家族下，只把动作表示从原生 6D 换成动作流，指标全线变化：</p>

<div class="jx"><div class="jx-h"><span>五档配置的平均评测指标</span><span class="jx-note">EPE 越低越好，PSNR/SSIM/VLM 越高越好</span></div>
<div class="tbl-wrap"><table>
<tr><th>配置</th><th>PSNR</th><th>SSIM</th><th>物体 EPE</th><th>夹爪 EPE</th><th>FVD</th><th>VLM</th></tr>
<tr><td>Cosmos 2.5 基线（原生 6D 动作）</td><td>15.62</td><td>0.668</td><td>13.23</td><td class="a">34.28</td><td>405.8</td><td>3.88</td></tr>
<tr><td>Hydra-0 + Cosmos 2.5</td><td>18.41</td><td>0.725</td><td>6.27</td><td>13.80</td><td>277.4</td><td class="c">3.83</td></tr>
<tr><td>Hydra-0 + Wan2.2 5B</td><td>19.64</td><td>0.770</td><td>6.61</td><td>3.88</td><td>248.8</td><td>3.90</td></tr>
<tr><td>Hydra-0 + Wan2.2 A14B</td><td>20.76</td><td>0.805</td><td>6.00</td><td>3.83</td><td>193.7</td><td>3.98</td></tr>
<tr><td>Hydra-0 + A14B，四步蒸馏</td><td class="b">21.84</td><td class="b">0.830</td><td class="b">5.27</td><td class="b">3.29</td><td class="b">155.9</td><td class="b">4.23</td></tr>
</table></div>
<div class="cap">表注：数据取自论文主页公开的评测表；VLM 一栏为语义/感知打分。注意第二行 VLM 3.83 低于基线的 3.88。</div>
</div>

<p>这张表里最该被反复看的是夹爪 EPE 那一列：34.28 → 13.80 → 3.88 → 3.83 → 3.29。换接口本身（第一行到第二行）就已经把误差砍掉六成，换更强的骨干再砍一个数量级。换句话说，<strong>接口的选择和骨干的选择，是两次独立的收益</strong>，不能混为一谈。</p>

<div class="sec"><div class="eyebrow"><span class="num">3</span>反差</div>
<h2>VLM 那一栏为什么输了</h2>

<p>第二行的 VLM 打分是 3.83，低于基线的 3.88。这不是论文的笔误，论文自己解释了这个现象：VLM 评委打的是「画面看起来物理上合不合理、时序上连不连贯、物体有没有穿模、运动真不真实」，而不是「机器人的手有没有精确移动到指令要求的位置」。</p>

<p>于是会出现一个很尴尬但很真实的情形：模型生成了一段流畅、逼真、物理上完全说得通的视频，但机器人手的实际落点跟指令差了十万八千里——VLM 看不出来，EPE 一测就露馅。反过来说，一个在 EPE 上极准的模型，也可能生成出观感一般的画面。</p>

<div class="keypoint"><strong>判断：</strong>单一评测指标永远不够。对做真机部署的团队来说，这张表的实用读法是：如果你想用世界模型做<strong>策略预筛</strong>（先在模拟里试一遍再上真机），盯 EPE 和 RoboLab 那类相关性指标；如果你想用它做<strong>数据增广或展示</strong>，盯 FVD 和 VLM。两个用途买的是两个东西，别用一张榜单的钱付两次。</div>

<p>论文在 RoboLab 基准上的开放环评估给了另一组更贴近工程的数字：对重放实验与参考实验成功率的预测，Pearson 相关系数 <strong>r = 0.96</strong>、Spearman ρ = 0.93、MAE 5.7 个百分点（300 条 episode）。这组数字的意义在于——世界模型可以当成一个「不用上真机的策略打分器」，而 0.96 的相关性意味着排序基本可信，但 5.7 个百分点的绝对误差意味着它不能替代真机验收。</p>

<div class="sec"><div class="eyebrow"><span class="num">4</span>迁移</div>
<h2>0% 数据时的那一点优势，可能比 90.4% 更值钱</h2>

<p>论文还测了一个工程上极其现实的问题：新任务只有很少数据时，这套框架能不能帮上忙。测试用 Interactive World Simulator 数据集的六个 held-out 任务（双臂搬箱子、双臂理绳子、单臂抓取等），训练数据比例从 1% 逐步加到 100%，对比两种起点：从原始 Wan2.2 权重直接训，以及先做多机身动作流中训再微调。</p>

<p>结果是，在<strong>零数据（0%）的情况</strong>下，经过多机身中训的模型在全部六个任务上，LPIPS、物体流误差和 FVD 三项指标都优于对照组；而主要增益通常在 20% 数据之前就出现了。</p>

<div class="jx"><div class="jx-h"><span>数据效率：增益集中在哪儿</span><span class="jx-note">六个 held-out 任务，示意</span></div>
<div class="jx-bars">
<div class="jx-bar-row"><div class="jx-bar-lab">0% 目标数据</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:100%;background:#0a749a"></div></div><div class="jx-bar-val">中训优势最大</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">20% 目标数据</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:62%;background:#00a6d6"></div></div><div class="jx-bar-val">主要增益已出现</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">100% 目标数据</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:24%;background:#566781"></div></div><div class="jx-bar-val">差距收敛</div></div>
</div>
<div class="jx-legend"><div class="jx-lg">条形长度表示「预训练相对无预训练的增益幅度」的示意，非论文原始数值；论文结论为 0% 时六项任务全部占优、主要增益出现在 20% 数据前。</div></div>
<div class="cap">图注：为避免误读，此处不把论文的相对优势换算成具体百分比；定性结论来自论文与中文解读。</div>
</div>

<p>这个发现的产业含义比 90.4% 更直接。国内具身团队最普遍的困境不是没有模型，是新场景没有数据。如果「先在跨本体数据上中训一遍动作流，再用少量数据微调」这条路径成立，那么数据稀缺场景的启动成本会被显著压低——而这条路径的前提条件恰恰是不依赖 URDF 和精确标定，也就是 Hydra-0 换接口换来的那个东西。</p>

<div class="sec"><div class="eyebrow"><span class="num">5</span>边界</div>
<h2>三处必须写清楚的局限</h2>

<p>第一，90.40% 与 60.16% 是相对作者自家 Cosmos 2.5 原生动作基线的比值，不是相对行业最优世界模型。把它读成「Hydra-0 比所有世界模型好一个数量级」，是对这张表的误读。</p>

<p>第二，论文没有做闭环控制实验。目前的证据链停在「预测得准」和「开放环打分与真机结果高度相关」，从这两点到「接上策略就能提升真机成功率」之间，还隔着一层工程验证。</p>

<p>第三，论文中由物体流反推机器人动作、实现「只指定物体怎么动，模型生成机器人怎么动」的部分，作者自述为概念验证，没有系统性验证其对大幅相机运动、移动操作或腕部相机分布的鲁棒性。</p>

<div class="keypoint"><strong>判断：</strong>这篇论文最可复用的不是模型权重，是它提出的那个接口——把动作表述成像素运动，让人类视频、手持设备数据、不同构型的本体进同一个训练池。对国内团队而言，值得立刻动手试的不是复现 A14B 那档配置（算力门槛太高），而是用小骨干验证「动作流 + 跨本体中训」在自己场景上的零样本迁移收益。</div>

<div class="srcline">信源：arXiv 2608.18077（2026-08-18 上线，NVIDIA / Brown / Columbia / Harvard）与论文主页评测表；腾讯新闻 2026-09-20 中文解读 news.qq.com/rain/a/20260920A06IXB00。素材时间窗：前一日 18:00 → 当日 09:00；本窗口内新增量为中文解读刊发与完整对照表传播，非论文首发。未核实项：各配置的百分比口径与表格平均值的换算关系；闭环效果论文未做。</div>
</div>
</div>
</div>
</div>
</div>

---

*来源：神机百见-具身解读 · https://www.shenjibailian.com/jiedu/article/hydra-0-action-flow-world-model-eval/*
