擦掉规划终点,成功率几乎不变:分层 VLA 的「规划器—执行器错位」被一篇论文摆上了台面
把规划器生成的路径点终点擦掉,任务成功率几乎不变——这篇论文用一次消融实验证明,很多分层 VLA 的执行器根本没有在用规划器的输出。真正的问题不是慢,是规划在整条链路上没有因果作用。
- 论文身份:arXiv 2609.30833,标题《Fast Plans, Faithful Actions: Closing the Planning-Execution Gap in Hierarchical Vision-Language-Action Models》,第一作者 Chuanliang Xie,2026 年 9 月 25 日提交,13 页 5 图,cs.RO。
- 被诊断的基线:一个从 π0.5 改造来的路径点分层流程——高层规划、底层动作专家。用 token 级自回归解码生成路径点计划,一次规划需要 57 次 VLM 前向。
- 关键消融:作者把路径点计划的终点擦掉,发现对任务成功率「几乎没有影响」。由此得出两个结论——规划器输出粒度过细,执行器把计划当作控制条件的程度不足。
- 两项修正:用路径点对齐的块自回归解码(Block-AR)解决延迟,用归一化目标调制(NGM)解决计划被忽视的问题;后者靠分阶段门控与反捷径训练,让路径点在不淹没其他信号的前提下影响动作生成。
- 效果边界:LIBERO 上最大 VLM 前向次数由 57 降到 8(含一次前缀预填充),Rokae 双臂机器人规划延迟降 8.7 倍;LIBERO-Long 成功率 91.0% → 96.2%,四套件平均 95.85% → 98.45%;但三个双臂真机任务成功率与基线持平。
- 判断:这篇的价值不在数字,而在它给出了一种可复用的验收动作——任何分层具身大脑上线前,都该做一次「擦掉规划输出看行为变不变」的消融。如果不变,那层规划就是装饰。
把计划擦掉,机器人还是把活干了
分层视觉—语言—动作(VLA)系统的基本结构是:高层视觉语言规划器负责「怎么分解任务」,底层动作专家负责「输出连续动作」。这套结构被广泛采用,理由也很直观——端到端模型在多步骤任务上容易逻辑断裂,分层能带来可解释性和可介入性。
这篇论文做的事情很朴素:拿一个从 π0.5 改造来的路径点分层流程,逐个环节砍一刀,看哪一刀真的影响了结果。
第一刀砍向速度。基线用 token 级自回归解码生成路径点计划,一次规划需要 57 次 VLM 前向传播。作者指出,这个量级「不满足实时控制的实用要求」。
第二刀砍向计划本身。作者把路径点计划的终点擦掉,再跑任务,结果是对成功率几乎没有影响。
这两刀合起来得到结论:规划器产出的粒度太细,而执行器几乎不把计划当控制条件用。用论文自己的话说,是「规划器—执行器错位」。
判断:这是分层架构里最难被发现的一类失效。它不会让任务失败,不会报错,不会掉分数——它只是让某一层变成纯装饰。系统跑得挺好,只是跑得好跟那层规划没什么关系。
Block-AR 与 NGM
针对两个问题,论文给了两套改法。
治慢的是路径点对齐的块自回归解码(Block-AR)。把逐 token 生成改成按路径点分块生成,VLM 前向次数从 57 降到 8(含一次前缀预填充),在 Rokae 双臂机器人上把规划延迟降到原来的 1/8.7。
治虚的是归一化目标调制(NGM)。名字听着绕,机制其实很具体:把目标是逐层注入动作生成过程,用分阶段门控控制注入强度,再用反捷径训练防止模型找到绕过目标信号的捷径。论文对它的定位写得很清楚——让「路径点在不淹没其他信号的前提下影响动作生成」。
反捷径训练这一步值得单独说。它意味着作者承认了一个隐含风险:即使把目标信号接进去,网络也可能学到一条不用它的通路,表面上指标漂亮,实际上目标仍然是装饰。所以要专门训练模型不得不依赖它。
| 诊断出的问题 | 对应技术 | 该技术要证明的事 |
|---|---|---|
| 一次规划 57 次 VLM 前向,达不到实时控制 | Block-AR 块自回归解码 | 前向次数降到 8,延迟降 8.7 倍 |
| 擦掉路径点终点,成功率几乎不变 | NGM 归一化目标调制 | 路径点真的影响动作生成,且不被其他信号淹没 |
| 网络可能学到绕过目标信号的捷径 | 反捷径训练 + 分阶段门控 | 模型无法在不用目标的情况下拿到同等分数 |
这套思路的价值超出这一篇论文。具身大脑的每一层抽象——任务分解、路径点、子目标、技能选择——都可以问同一个问题:如果我把它换掉或删掉,下游行为会不会变?不会变,就说明这一层没有承担它声称承担的职责。
仿真涨分,真机持平
论文自己也把边界写清楚了:改进之后,在 Rokae 双臂机器人的三个双臂任务上,各方法的成功率持平。
也就是说,Block-AR + NGM 带来的增益,主要体现在两处——仿真基准上的成功率(LIBERO-Long 91.0% 到 96.2%,四套件平均 95.85% 到 98.45%),以及规划延迟(8.7 倍)。真机任务的成功率并没有被这套方法推上去。
这不是否定论文,而是给出正确读法。把 57 次前向降到 8 次,本身就是工程价值——它把高层规划从「离线想」变成「在线可用」。而在真机上,成功率的天花板可能根本不在规划这一层,抓取的接触动力学、视觉误差、标定精度都会先顶上来,规划延迟降下来也换不成分数。
顺带提一句同批 arXiv 里值得对照的两条。InternW0-Δ 用超过 20,000 小时的开源异构数据(机器人演示、UMI、第一人称人类演示、Ego2Robot)预训练世界动作模型,并承诺在许可允许范围内开放训练代码、权重与处理数据;另一条 IMLE-VLA 把 π0.5 的 10 步流匹配动作头换成单步条件采样,推理速度从 15 Hz 提到 55 Hz,在 LIBERO 40 项任务上平均成功率 98.0%。判断:三条论文指向同一个方向——分层 VLA 的竞争焦点正从「模型有多大」转向「每一层的调用次数、因果贡献和实时性是否成立」。这个转向对做落地的团队是好消息:它把评价标准从榜单分数拉回到可测量的系统属性。