研究解读 · 神机百见-具身解读

4 段真人视频放大成 256 段「没发生过但可能发生」:PRISM 把数据瓶颈从采集搬到了生成

Amazon FAR 联合伯克利、CMU、斯坦福提出 PRISM:从 4 段真人搬运视频生成 256 段反事实视频,训练出的单一策略零样本迁移到 Unitree G1 真机,只用机载深度。真正值钱的不是 64 倍放大,是它证明了不完美的重建也能用——前提是拿接触信号当共同约束。

一分钟速览
  1. 放大倍数:从仅 4 段真人搬运箱子的真实视频,通过视频到视频(V2V)生成 256 段反事实视频——画面里的交互在原始视频中没有发生过,但换一个物体就可能发生。
  2. 真机零样本:训练出的单一策略直接部署到 Unitree G1,无真机微调,只用头戴立体相机的机载深度,控制频率 50 Hz,不依赖动捕或参考动作。
  3. 域外泛化:对生成视频里没有的物体类别(桌子、椅子、背包)也有较高成功率;并在 35° 斜坡与 0.43 米高台上零样本成功。
  4. 关键消融:V2V 生成用更少的演示胜过几何增广——80 条 vs 103 条;域外物体成功率 72.92% vs 22.92%。
  5. 开放程度:论文、代码与数据均已公开;作者来自 Amazon FAR、UC Berkeley、CMU、Stanford,含 Pieter Abbeel、Jitendra Malik、C. Karen Liu、Guanya Shi、Angjoo Kanazawa。
数据来源与边界
本篇事实来自三条来源:① 论文原文 arXiv:2609.38172《Counterfactual Video Generation Enables Scalable Humanoid Loco-Manipulation》,2026-09-29 17:59 UTC 提交(v1),作者 Zihan Wang、Zhen Wu、Pieter Abbeel、Rocky Duan、Jitendra Malik、Carmelo Sferrazza、C. Karen Liu、Guanya Shi、Angjoo Kanazawa,机构为 Amazon FAR、UC Berkeley、Carnegie Mellon University、Stanford;摘要与第一节可直接核对 4 段→256 段、contact-anchored real-to-sim、Unitree G1、仅用机载深度、无真机微调、论文代码数据公开等表述;② AGI HUNT 2026-10-01 期,标注该工作被 CoRL 2026 收录,并给出「4→256、单一策略、无动捕、zero-shot sim-to-real」四句概括;③ 第三方论文摘要站 teahose.com 对论文的转述,给出 Unitree G1、50 Hz、头戴立体相机、域外物体(桌子/椅子/背包)、35° 斜坡与 0.43 米高台、以及消融数字 80 vs 103 与 72.92% vs 22.92%(标注出自 Appendix F 与 Table 9)。时间窗说明:本篇素材时间窗为前一日(2026-09-30)18:00 → 当日(2026-10-01)09:00;论文提交于 2026-09-29 17:59 UTC(北京时间 09-30 01:59),落在本窗口之外但处于「近 3 日」范围内,按扩窗规则第 2 条处理,窗口内新增量为 AGI HUNT 2026-10-01 期首次收录并标注 CoRL 2026。不确定边界:①35° 斜坡、0.43 米高台、50 Hz、域外物体成功率区间及两组消融数字均出自③的转述,属单一信源 + 二手转述,本文未逐项在论文正文中复核;②论文摘要未给出统一的成功率主表数字,本文不构造总分;③任务范围仅限「拿起—搬运—放下」这一类 loco-manipulation,不涉及精细装配或双臂协同。与本站既往稿件的差异:本站写过 π0.5 的数据杠杆序、RoboDawn 的真机落差、FailSafe 的失败数据补充,本篇只写数据从哪来这一环(生成替代采集),不重复训练配方与失败恢复话题。事实与判断分开,判断以「判断:」开头。
本文事实信息来自上方标注的公开来源;解读、判断与延伸部分为作者个人见解,写作过程使用了 AI 工具辅助整理,已由作者人工核实,不代表信息来源方立场。如有雷同纯属巧合;如涉及版权或权益问题,请联系 shenjibailian@shenjibailian.com,我们将在核实后及时删除或更正。
数据瓶颈被换了个位置

具身智能这两年最常被提到的瓶颈是数据。主流解法是采集——建数采中心、招采集员、上动捕、做遥操作。PRISM 换了条路:不采更多,而是把已有的少数几段视频放大。

具体做法是视频到视频(V2V)生成。给模型 4 段真人搬运箱子的真实视频,生成 256 段新视频,画面里的物体换成球、桶、箱子、纸箱等不同几何与初始配置。作者给这些生成结果起的名字很准确——反事实视频:这些交互在原始视频中并没有发生,但换一个物体就可能发生。

输入的真实视频
4 段
生成的反事实视频
256 段(64 倍)
动捕 / 参考动作需求
0(仅机载深度)
真机微调
0(zero-shot)
数据来源:arXiv:2609.38172 摘要与第一节;真机平台为 Unitree G1,控制频率 50 Hz(第三方转述,单一信源)

这个数字对比真正说明的不是「64 倍」这个倍数,而是瓶颈的位置变了。过去稀缺的是「采集量」——要多少小时真机数据、要多少采集员;现在稀缺的变成「种子视频的质量与覆盖面」——你给的 4 段视频覆盖了哪几种交互模式,决定了生成的 256 段能覆盖多大的行为空间。

判断:如果这条路走得通,数采中心这个生意的护城河要重画。采集量的稀缺性会被生成摊薄,真正稀缺的是种子交互的设计能力——哪几段视频最能代表一类行为,是一个需要领域知识的问题,不是堆人堆场地能解决的。但这只是方向判断,PRISM 只在单一任务类上验证,不足以支撑「数采中心要被取代」的结论。
关键不在生成,在「生成出来的视频是错的」这件事怎么接住

用生成视频训练会立刻遇到一个问题:生成的画面在物理上是不可靠的。人体姿态可能有错、物体轨迹可能穿模、接触关系可能是假的。再加上单目重建本身就有误差,两重误差叠加,按传统 real-to-sim 的要求,这批数据根本不能用。

PRISM 的解法是把接触信号当成贯穿三个阶段的共同约束:重建阶段用人与物体的接触把两者的运动耦合起来——人的运动引导物体轨迹,物体的接触反过来修正重建出的人体姿态;重定向阶段用接触锚点规定机器人末端该作用在哪里,把含噪的重建结果打磨成物理上可信的轨迹;策略学习阶段继续用同一套接触约束做奖励。

第一阶段
V2V 生成:4 段真实视频 → 256 段反事实视频交互在源视频中未发生,但换物体可能发生
第二阶段
接触锚定的 real-to-sim:统一世界坐标系下重建人体、静态场景与动态物体几何运动接触耦合人与物体的运动,互相修正
第三阶段
重定向与策略学习:接触锚点规定末端作用位置,同一约束进入奖励把含噪重建打磨成物理可信轨迹
第四阶段
真机部署:Unitree G1,仅机载深度,无微调零样本,控制 50 Hz

论文里有一句话值得单独摘出来:不完美的重建在单目 real-to-sim 阶段是不可避免的,因为现有流程都无法恢复物理上可信的人—物运动。承认这件事,然后绕过去,比追求高精度 4D 重建更务实。

判断:这是对 real-to-sim 路线的一次门槛下放。过去做这条路线的隐含前提是「先有一套高精度重建管线」,这把绝大多数没有动捕设备的团队挡在门外。PRISM 的做法等于宣布:重建只要「足够接近」就行,剩下的误差用接触约束和奖励去吸收。真正的技术含量从「重建得多准」转移到了「约束设计得多好」。
消融里最有信息量的一组:生成 vs 几何增广

数据增广在机器人领域的常规做法,是对已有演示做几何变换——缩放、旋转、平移。PRISM 的消融把这两种增广放在同一条件下比了一次。

对比项V2V 生成几何增广说明
所需演示条数80103V2V 用更少数据
域外物体成功率72.92%22.92%相差 50 个百分点
表:V2V 生成与几何增广的对比。两组数字出自第三方摘要站 teahose.com 对论文的转述,分别标注为 Appendix F 与 Table 9,属单一信源 + 二手转述,本文未在论文正文中逐项复核,不作为独立核验结论。

差距来自两者改变的东西不同。几何增广改的是同一个交互的位置与视角——同一个箱子换个地方、转个角度;V2V 生成改的是交互本身——换成球,抓取方式就变了,换成桶,抱持姿态就变了。论文把这称为「难以通过几何层面的增广硬性编码」的行为级变化。

几何增广能给的

位置、朝向、尺度、光照变化。策略看到的是同一类交互的不同观测,学到的是对观测扰动的鲁棒性。

V2V 生成能给的

不同物体的可供性(affordance)——球要捧、桶要抱、箱要托。策略学到的是不同交互方式本身,这是新的行为而非新的观测。

判断:72.92% 对 22.92% 的差距,说明在物体类内泛化这件事上,「见过更多种交互」比「见过更多次同一交互」有效得多。这条结论对做真机微调的团队有直接含义:与其把同一个任务在不同位置采 100 遍,不如把任务换 10 种对象各采 10 遍——前提是你能付得起换对象的成本,而这恰恰是生成要解决的问题。
边界:它证明了什么,没证明什么

把 PRISM 的适用范围划清楚,比复述它的数字更重要。

已验证:类内与部分类外泛化
箱/球/桶/纸箱的新实例、新尺寸、新初始配置
已验证:地形与高度的涌现泛化
35° 斜坡、0.43 米高台(论文归因于抓取高度与训练中高物体的重叠)
未验证:精细操作
仅限拿起—搬运—放下,不含装配、插拔、双臂协同

还有一个容易被略过的限定:涌现出来的泛化是有条件的。论文自己把 35° 斜坡和 0.43 米高台的成功归因于「抓取高度与训练中的高物体存在重叠」——也就是说这不是凭空泛化,是训练分布恰好覆盖了关键维度。把这种「运气好的重叠」当成通用泛化能力,是读这类论文最常见的误读。

另外,论文、代码与数据均已公开,这一点值得单独肯定。具身智能领域大量工作只放权重或只放论文,数据不公开;PRISM 三者齐备,其他人可以直接复现这个 4→256 的流程,也可以直接在自己的任务上试。

判断:PRISM 最实际的贡献不是那台会搬东西的 G1,而是它给出了一条「没有动捕也能做 real-to-sim」的公开配方。对小团队,这意味着入场成本从「先建一套重建管线」降到了「先设计好 4 段种子视频」。但请把预期压在它验证过的范围内:这是一条搬运类任务的泛化路径,不是通用操作能力的解法。下一步该看的是,接触锚定这套约束能不能扛住需要力控的精细任务——那才是真正的分水岭。
来源:arXiv:2609.38172《Counterfactual Video Generation Enables Scalable Humanoid Loco-Manipulation》(2026-09-29 17:59 UTC 提交,Amazon FAR / UC Berkeley / CMU / Stanford);AGI HUNT 2026-10-01 期(CoRL 2026 收录);teahose.com 论文摘要转述(50 Hz、35° 斜坡、0.43 米高台、80 vs 103、72.92% vs 22.92%,单一信源 + 二手转述)。素材时间窗为前一日 18:00 → 当日 09:00;论文提交于窗口外近 3 日内,按扩窗规则第 2 条处理,窗口内新增量为 10-01 期收录。论文、代码与数据公开。