# 4 段真人视频放大成 256 段「没发生过但可能发生」：PRISM 把数据瓶颈从采集搬到了生成

> Amazon FAR 联合伯克利、CMU、斯坦福提出 PRISM：从 4 段真人搬运视频生成 256 段反事实视频，训练出的单一策略零样本迁移到 Unitree G1 真机，只用机载深度。真正值钱的不是 64 倍放大，是它证明了不完美的重建也能用——前提是拿接触信号当共同约束。

### TLDR

- **放大倍数**：从**仅 4 段**真人搬运箱子的真实视频，通过视频到视频（V2V）生成 **256 段**反事实视频——画面里的交互在原始视频中**没有发生过，但换一个物体就可能发生**。
- **真机零样本**：训练出的单一策略直接部署到 **Unitree G1**，**无真机微调**，只用头戴立体相机的**机载深度**，控制频率 **50 Hz**，不依赖动捕或参考动作。
- **域外泛化**：对生成视频里没有的物体类别（桌子、椅子、背包）也有较高成功率；并在 **35° 斜坡**与 **0.43 米**高台上零样本成功。
- **关键消融**：V2V 生成用**更少**的演示胜过几何增广——**80 条 vs 103 条**；域外物体成功率 **72.92% vs 22.92%**。
- **开放程度**：论文、代码与数据均已公开；作者来自 Amazon FAR、UC Berkeley、CMU、Stanford，含 Pieter Abbeel、Jitendra Malik、C. Karen Liu、Guanya Shi、Angjoo Kanazawa。

### SRC

本篇事实来自三条来源：① 论文原文 arXiv:2609.38172《Counterfactual Video Generation Enables Scalable Humanoid Loco-Manipulation》，2026-09-29 17:59 UTC 提交（v1），作者 Zihan Wang、Zhen Wu、Pieter Abbeel、Rocky Duan、Jitendra Malik、Carmelo Sferrazza、C. Karen Liu、Guanya Shi、Angjoo Kanazawa，机构为 Amazon FAR、UC Berkeley、Carnegie Mellon University、Stanford；摘要与第一节可直接核对 4 段→256 段、contact-anchored real-to-sim、Unitree G1、仅用机载深度、无真机微调、论文代码数据公开等表述；② AGI HUNT 2026-10-01 期，标注该工作被 CoRL 2026 收录，并给出「4→256、单一策略、无动捕、zero-shot sim-to-real」四句概括；③ 第三方论文摘要站 teahose.com 对论文的转述，给出 Unitree G1、50 Hz、头戴立体相机、域外物体（桌子/椅子/背包）、35° 斜坡与 0.43 米高台、以及消融数字 80 vs 103 与 72.92% vs 22.92%（标注出自 Appendix F 与 Table 9）。**时间窗说明**：本篇素材时间窗为**前一日（2026-09-30）18:00 → 当日（2026-10-01）09:00**；论文提交于 2026-09-29 17:59 UTC（北京时间 09-30 01:59），落在本窗口之外但处于「近 3 日」范围内，按扩窗规则第 2 条处理，窗口内新增量为 AGI HUNT 2026-10-01 期首次收录并标注 CoRL 2026。**不确定边界**：①35° 斜坡、0.43 米高台、50 Hz、域外物体成功率区间及两组消融数字均出自③的转述，属**单一信源 + 二手转述**，本文未逐项在论文正文中复核；②论文摘要未给出统一的成功率主表数字，本文不构造总分；③任务范围仅限「拿起—搬运—放下」这一类 loco-manipulation，不涉及精细装配或双臂协同。与本站既往稿件的差异：本站写过 π0.5 的数据杠杆序、RoboDawn 的真机落差、FailSafe 的失败数据补充，本篇只写**数据从哪来这一环**（生成替代采集），不重复训练配方与失败恢复话题。事实与判断分开，判断以「判断：」开头。

### BODY

<div class="sec">
<div class="eyebrow">数据瓶颈被换了个位置</div>
<p>具身智能这两年最常被提到的瓶颈是数据。主流解法是采集——建数采中心、招采集员、上动捕、做遥操作。PRISM 换了条路：<strong>不采更多，而是把已有的少数几段视频放大</strong>。</p>
<p>具体做法是视频到视频（V2V）生成。给模型 4 段真人搬运箱子的真实视频，生成 256 段新视频，画面里的物体换成球、桶、箱子、纸箱等不同几何与初始配置。作者给这些生成结果起的名字很准确——<strong>反事实视频</strong>：这些交互在原始视频中并没有发生，但换一个物体就可能发生。</p>

<div class="jx-bars">
<div class="jx-bar-row"><div class="jx-bar-lab">输入的真实视频</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:2%;background:#566781"></div></div><div class="jx-bar-val">4 段</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">生成的反事实视频</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:100%;background:#0a749a"></div></div><div class="jx-bar-val">256 段（64 倍）</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">动捕 / 参考动作需求</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:1%;background:#0d8a5f"></div></div><div class="jx-bar-val">0（仅机载深度）</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">真机微调</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:1%;background:#b85c0a"></div></div><div class="jx-bar-val">0（zero-shot）</div></div>
<div class="jx-legend"><div class="jx-lg">数据来源：arXiv:2609.38172 摘要与第一节；真机平台为 Unitree G1，控制频率 50 Hz（第三方转述，单一信源）</div></div>
</div>

<p>这个数字对比真正说明的不是「64 倍」这个倍数，而是<strong>瓶颈的位置变了</strong>。过去稀缺的是「采集量」——要多少小时真机数据、要多少采集员；现在稀缺的变成「种子视频的质量与覆盖面」——你给的 4 段视频覆盖了哪几种交互模式，决定了生成的 256 段能覆盖多大的行为空间。</p>

<div class="keypoint"><strong>判断：</strong>如果这条路走得通，数采中心这个生意的护城河要重画。采集量的稀缺性会被生成摊薄，真正稀缺的是<strong>种子交互的设计能力</strong>——哪几段视频最能代表一类行为，是一个需要领域知识的问题，不是堆人堆场地能解决的。但这只是方向判断，PRISM 只在单一任务类上验证，不足以支撑「数采中心要被取代」的结论。</div>

<div class="sec">
<div class="eyebrow">关键不在生成，在「生成出来的视频是错的」这件事怎么接住</div>
<p>用生成视频训练会立刻遇到一个问题：<strong>生成的画面在物理上是不可靠的</strong>。人体姿态可能有错、物体轨迹可能穿模、接触关系可能是假的。再加上单目重建本身就有误差，两重误差叠加，按传统 real-to-sim 的要求，这批数据根本不能用。</p>
<p>PRISM 的解法是把<strong>接触信号</strong>当成贯穿三个阶段的共同约束：重建阶段用人与物体的接触把两者的运动耦合起来——人的运动引导物体轨迹，物体的接触反过来修正重建出的人体姿态；重定向阶段用接触锚点规定机器人末端该作用在哪里，把含噪的重建结果打磨成物理上可信的轨迹；策略学习阶段继续用同一套接触约束做奖励。</p>

<div class="jx-tl">
<div class="jx-tl-row"><div class="jx-tl-t">第一阶段</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#0a749a">V2V 生成：4 段真实视频 → 256 段反事实视频<span class="m">交互在源视频中未发生，但换物体可能发生</span></div></div></div>
<div class="jx-tl-row"><div class="jx-tl-t">第二阶段</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#00a6d6">接触锚定的 real-to-sim：统一世界坐标系下重建人体、静态场景与动态物体几何运动<span class="m">接触耦合人与物体的运动，互相修正</span></div></div></div>
<div class="jx-tl-row"><div class="jx-tl-t">第三阶段</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#0d8a5f">重定向与策略学习：接触锚点规定末端作用位置，同一约束进入奖励<span class="m">把含噪重建打磨成物理可信轨迹</span></div></div></div>
<div class="jx-tl-row"><div class="jx-tl-t">第四阶段</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#b85c0a">真机部署：Unitree G1，仅机载深度，无微调<span class="m">零样本，控制 50 Hz</span></div></div></div>
</div>

<p>论文里有一句话值得单独摘出来：<strong>不完美的重建在单目 real-to-sim 阶段是不可避免的，因为现有流程都无法恢复物理上可信的人—物运动</strong>。承认这件事，然后绕过去，比追求高精度 4D 重建更务实。</p>

<div class="keypoint"><strong>判断：</strong>这是对 real-to-sim 路线的一次<strong>门槛下放</strong>。过去做这条路线的隐含前提是「先有一套高精度重建管线」，这把绝大多数没有动捕设备的团队挡在门外。PRISM 的做法等于宣布：重建只要「足够接近」就行，剩下的误差用接触约束和奖励去吸收。真正的技术含量从「重建得多准」转移到了「约束设计得多好」。</div>

<div class="sec">
<div class="eyebrow">消融里最有信息量的一组：生成 vs 几何增广</div>
<p>数据增广在机器人领域的常规做法，是对已有演示做几何变换——缩放、旋转、平移。PRISM 的消融把这两种增广放在同一条件下比了一次。</p>

<div class="tbl-wrap">
<table>
<thead><tr><th>对比项</th><th>V2V 生成</th><th>几何增广</th><th>说明</th></tr></thead>
<tbody>
<tr><td>所需演示条数</td><td>80</td><td>103</td><td>V2V 用更少数据</td></tr>
<tr><td>域外物体成功率</td><td>72.92%</td><td>22.92%</td><td>相差 50 个百分点</td></tr>
</tbody>
</table>
</div>
<div class="cap">表：V2V 生成与几何增广的对比。两组数字出自第三方摘要站 teahose.com 对论文的转述，分别标注为 Appendix F 与 Table 9，属单一信源 + 二手转述，本文未在论文正文中逐项复核，不作为独立核验结论。</div>

<p>差距来自两者改变的东西不同。几何增广改的是<strong>同一个交互的位置与视角</strong>——同一个箱子换个地方、转个角度；V2V 生成改的是<strong>交互本身</strong>——换成球，抓取方式就变了，换成桶，抱持姿态就变了。论文把这称为「难以通过几何层面的增广硬性编码」的行为级变化。</p>

<div class="jx-split">
<div style="flex:50">
<div class="eyebrow">几何增广能给的</div>
<p>位置、朝向、尺度、光照变化。<strong>策略看到的是同一类交互的不同观测</strong>，学到的是对观测扰动的鲁棒性。</p>
</div>
<div style="flex:50">
<div class="eyebrow">V2V 生成能给的</div>
<p>不同物体的可供性（affordance）——球要捧、桶要抱、箱要托。<strong>策略学到的是不同交互方式本身</strong>，这是新的行为而非新的观测。</p>
</div>
</div>

<div class="keypoint"><strong>判断：</strong>72.92% 对 22.92% 的差距，说明在物体类内泛化这件事上，<strong>「见过更多种交互」比「见过更多次同一交互」有效得多</strong>。这条结论对做真机微调的团队有直接含义：与其把同一个任务在不同位置采 100 遍，不如把任务换 10 种对象各采 10 遍——前提是你能付得起换对象的成本，而这恰恰是生成要解决的问题。</div>

<div class="sec">
<div class="eyebrow">边界：它证明了什么，没证明什么</div>
<p>把 PRISM 的适用范围划清楚，比复述它的数字更重要。</p>

<div class="jx-steps">
<div class="jx-step"><div class="jx-step-l">已验证：类内与部分类外泛化</div><div class="jx-step-bar"><div class="jx-step-v" style="width:75%;background:#0a749a"></div></div><div class="jx-step-ax">箱/球/桶/纸箱的新实例、新尺寸、新初始配置</div></div>
<div class="jx-step"><div class="jx-step-l">已验证：地形与高度的涌现泛化</div><div class="jx-step-bar"><div class="jx-step-v" style="width:50%;background:#00a6d6"></div></div><div class="jx-step-ax">35° 斜坡、0.43 米高台（论文归因于抓取高度与训练中高物体的重叠）</div></div>
<div class="jx-step"><div class="jx-step-l">未验证：精细操作</div><div class="jx-step-bar"><div class="jx-step-v" style="width:8%;background:#b85c0a"></div></div><div class="jx-step-ax">仅限拿起—搬运—放下，不含装配、插拔、双臂协同</div></div>
</div>

<p>还有一个容易被略过的限定：<strong>涌现出来的泛化是有条件的</strong>。论文自己把 35° 斜坡和 0.43 米高台的成功归因于「抓取高度与训练中的高物体存在重叠」——也就是说这不是凭空泛化，是训练分布恰好覆盖了关键维度。把这种「运气好的重叠」当成通用泛化能力，是读这类论文最常见的误读。</p>
<p>另外，论文、代码与数据均已公开，这一点值得单独肯定。具身智能领域大量工作只放权重或只放论文，数据不公开；PRISM 三者齐备，其他人可以直接复现这个 4→256 的流程，也可以直接在自己的任务上试。</p>

<div class="keypoint"><strong>判断：</strong>PRISM 最实际的贡献不是那台会搬东西的 G1，而是它给出了一条<strong>「没有动捕也能做 real-to-sim」的公开配方</strong>。对小团队，这意味着入场成本从「先建一套重建管线」降到了「先设计好 4 段种子视频」。但请把预期压在它验证过的范围内：这是一条搬运类任务的泛化路径，不是通用操作能力的解法。下一步该看的是，接触锚定这套约束能不能扛住需要力控的精细任务——那才是真正的分水岭。</div>

<div class="srcline">来源：arXiv:2609.38172《Counterfactual Video Generation Enables Scalable Humanoid Loco-Manipulation》（2026-09-29 17:59 UTC 提交，Amazon FAR / UC Berkeley / CMU / Stanford）；AGI HUNT 2026-10-01 期（CoRL 2026 收录）；teahose.com 论文摘要转述（50 Hz、35° 斜坡、0.43 米高台、80 vs 103、72.92% vs 22.92%，单一信源 + 二手转述）。素材时间窗为前一日 18:00 → 当日 09:00；论文提交于窗口外近 3 日内，按扩窗规则第 2 条处理，窗口内新增量为 10-01 期收录。论文、代码与数据公开。</div>
</div>
</div>
</div>
</div>

---

*来源：神机百见-具身解读 · https://www.shenjibailian.com/jiedu/article/prism-four-videos-256-counterfactual-real2sim2real/*
