π0.7 与组合泛化:机器人领域的「GPT-3 时刻」到底指什么
Physical Intelligence 的 π0.7 被称为机器人领域的「GPT-3 时刻」,关键词是组合泛化——模型见过「抓红杯」和「杯子烫就用夹子」之后,能组合出没练过的动作。它还首次把世界模型作为 Subgoal Image Provider 集成进 VLA。
- 两个首次:Physical Intelligence π0.7 首次在机器人领域实证「组合泛化」,并首次将世界模型作为 Subgoal Image Provider 集成进 VLA。
- 组合泛化是什么:模型见过 A 和 B,能处理没练过的 A+B 组合,而不是只会复现训练过的任务。
- 为什么叫 GPT-3 时刻:GPT-3 的关键不是会聊天,是展现出「没被专门训练过的能力」。π0.7 在机器人上展现出同类性质。
- Subgoal Image Provider:世界模型生成一张「任务完成后的样子」的图,作为中间目标交给 VLA 去执行——把长任务拆成一串可达成的视觉目标。
- 但要注意:多家报道都提到,这类能力目前仍局限在实验室环境,尚未大规模真实落地。
「没练过但会做」,为什么这么重要
先说清楚组合泛化(compositional generalization)是什么意思。
| 类型 | 含义 | 例子 |
|---|---|---|
| 插值泛化 | 训练见过的分布内,换个位置换个光照 | 练过抓红杯,能抓蓝色杯子 |
| 外推泛化 | 稍微超出训练范围 | 练过抓杯子,能抓碗 |
| 组合泛化 | 把学过的元素重新组合成没练过的任务 | 练过「抓杯子」和「杯子烫就用夹子」,能处理「用夹子把烫的杯子放进洗碗机」 |
你教一个孩子认字。他记住「火」、记住「山」,这是记忆;换个字体还认得,这是插值泛化;看到「火山」两个字能猜出意思,这是组合泛化——他从没被教过这个词,但他会把两个已知的概念拼起来。
语言模型做到这件事用了很多年,然后忽然在某一天涌现了,那天被称为 GPT-3 时刻。机器人领域在等自己的那一天。
世界模型在 VLA 里到底是干什么的
π0.7 的另一个「首次」,是把世界模型作为 Subgoal Image Provider(子目标图像生成器)集成进 VLA。
这个设计的巧妙之处在于:它把「长程任务规划」这个难题,转化成了「生成一张图」这个相对容易的问题。
传统 VLA 处理长任务很吃力,因为它要从当前画面直接跳到最终动作,中间隔着十几步。有了子目标图像,每一步都只需要「让画面朝目标图靠近一点」——这是一个短程问题,VLA 最擅长。
这像装修。直接让工人「把这套房子装好」,他很难下手。但如果你给他一张效果图,再给一张「水电走完的样子」「贴完砖的样子」,每一步他都知道要往哪走、做完了没。
Subgoal Image Provider 干的就是效果图设计师的活:把「最终要什么」翻译成一串「下一步长什么样」。
实验室与真实场景之间,还隔着什么
多家行业报道在提到 π0.7、GEN-1 这类前沿模型时,都加了一句限定:暂局限于实验室环境,尚未大规模真实落地。
| 坎 | 实验室里 | 真实场景 |
|---|---|---|
| 光照 | 可控,通常恒定 | 早晚、阴晴、逆光、频闪 |
| 物体 | 已知物体集,形状规整 | 任意物体,变形、遮挡、透明 |
| 时长 | 单次任务几分钟 | 连续运行数小时,热衰减 |
| 容错 | 失败可重来,成本为零 | 一次失败可能是摔碎一个花瓶 |
做落地的人该怎么读这类新闻
| 看到的说法 | 要追问的 | 落地相关度 |
|---|---|---|
| 「成功率 95%」 | 什么任务?什么物体?失败那 5% 是什么情况? | 高 |
| 「首次实现 XX」 | 在实验室还是真实场景?几台机器验证? | 中 |
| 「组合泛化」 | 是新能力的涌现,还是数据集变大了? | 中(影响未来,不影响当下选型) |
| 「超越人类」 | 哪个指标?什么条件?人类的可比数据是什么? | 低(多为宣传口径) |
原因很简单:你对客户承诺 95% 成功率,客户按 100% 期待。那 5% 发生的时候,赔的不是那次活动的钱,是后面所有单子。这个站里所有标「实战记录」的文章,数字都来自我们自己的项目,就是这个原因。