# 一个动作词 2 厘米：NUS 把 VLM 的「想」和机器人的「动」接在了一张接口上

> VLM 只输出 11 个无参数动作词，解释器统一按 2 厘米步长落地——同一接口零样本驱动 Franka 与 AgileX；把命名约定拆掉，成功率从 100% 崩到 5%，接口本身就是能力。

### TLDR

- **论文**：新加坡国立大学 Show Lab《Show-Harness: Just a VLM Agent Can Play Robots》（9 月上旬发布，代码 **Apache 2.0** 开源，GitHub 上线数日 **232** 星，附 LoRA 适配器与演示数据集）。
- **接口设计**：VLM 只输出**无参数语义动作单元**——MV_LEFT、GRASP、ROTATE_CW 等 11 个词，解释器统一按 **2 厘米**步长执行：同一接口无需改动即驱动 **7 自由度 Franka、6 自由度 AgileX 与仿真器**。
- **两条路线**：前沿闭源 VLM **零样本**直控真机；Qwen3.5（0.8B–9B）与 Gemma 4 E4B 仅需**几 GPU 小时** LoRA 微调即可上机，控制频率带 **12–33 Hz**（对照：π0.5 为 20 Hz、GR00T 为 24 Hz）。
- **消融最狠的一条**：移除语义命名与方向约定、让模型从交互中自己猜映射，成功率从 **100%** 崩到 **5%**，20 次试验 19 次超时；模型自述的方向映射正确率仅 **23.3%**（随机水平 16.7%），20 次里 11 次左右镜像混淆。
- **GUMI**：把同一动作空间搬到图形界面，人和 Agent 在 GUI 上「玩」机器人即可采集演示数据，**无需任何遥操作硬件**。

### SRC

本文事实来自三类信源：①新加坡国立大学 Show Lab 论文项目页（https://showlab.github.io/Show-Harness/），含全部消融数字（100%/90%/95%/5% 四组设定、23.3% 方向推断正确率、2 厘米步长约定、π0.5/GR00T 频率对照）；②Lab Index 收录页（labindex.ai/outputs/nus/show-harness，收录日期 2026-09-09），提供开源细节：Apache 2.0、rank 64 LoRA（视觉塔冻结）、Qwen3.5 0.8B–9B 与 Gemma 4 E4B 适配器、GitHub 首数日 232 星；③新浪机器人热点小时报 2026-09-27 07:30 收录的中文解读。素材时间窗为当日 09:00 → 19:00，本批于 10:25 执行；论文发布于 9 月上旬（窗口外），窗口内增量为 9/27 中文解读扩散（收录时间 07:30 早于窗口起点，按扩窗规则并入并在上文写明）。与本站 218 号稿（RoboDawn 评测揭示 VLM 真机接口落差）的差异：那篇指问题，本篇是同一问题域的接口工程解，无内容重叠。判断均以「判断：」开头。

### BODY

<div class="sec">
<div class="eyebrow">接口为什么放在「技能」和「关节」之间</div>
<p>让通用 VLM 控制机器人，行业里一直有两个极端都不好用。往上走，让模型直接输出「抓住那个物体」这样的完整技能，模型 seen 过的技能有限，场景一变就哑火；往下走，让模型输出连续关节控制量，语义智能被稀释成数值回归，模型既慢又容易飘。Show Lab 的选择是把接口架在中间：VLM 每一步只输出一个语义动作单元——MV_LEFT、MV_DOWN、GRASP、RELEASE、ROTATE_CW、STILL、DONE，一共 11 个词，每个词不带任何参数。</p>
<p>参数去哪了？在解释器里。每个动作词落地为固定 2 厘米的运动步长，执行器端的解释器负责把「向左」翻译成具体机型的关节运动。这一刀切下去，好处立刻显现：同一个模型、同一套词汇，不用改一个参数就能驱动 7 自由度的 Franka、6 自由度的 AgileX 和仿真器——因为「向左 2 厘米」在哪个机体上都是同一个意思。每步执行后，新的图像和状态送回模型，闭环推进直到 DONE。模型始终为细粒度物理决策负责，但它需要「说」的只是一个它本来就认识的词。</p>
</div>

<div class="sec">
<div class="eyebrow">消融实验：约定本身就是能力</div>
<p>项目页里最有信息量的不是成功率高低的排名，而是一组命名消融。四组设定下做同一个任务：用语义命名＋写明方向约定（谁定义「左」），20/20 全对，25 步完成；换成任意符号 A–F 但把约定写清楚，还能到 95%；只给语义名、不解释约定，掉到 90%；两者都去掉、让模型从自己的交互里推断映射，成功率崩到 5%，20 次试验 19 次超时。让模型把猜到的映射写下来核对：六个方向的正确率 23.3%，勉强高于 16.7% 的随机水平，20 次里 11 次把左右镜像搞反。</p>
<p>这组数字的价值在于把一个常被忽略的事实量化了：大模型对「左」「右」这类词的语义是现成的，但「图像里的左」和「机器人坐标系里的左」之间的约定，必须由系统显式给出。接口不是动作空间外面的装饰——约定本身构成了能力。这也解释了为什么这套零样本方案能直接跑通：它把模型需要「学」的东西压缩到了最少，剩下的全部用工程约定兜住。</p>
<div class="keypoint">判断：无参数语义动作换来的泛化是有代价的——每步 2 厘米的粒度和秒级决策周期，决定了这套方案天生不适合高频精细产线，它适合的是演示验证、跨本体评测和演示数据采集。项目页给出的频率对照也印证了这一点：微调后的小模型控制频率 12–33 Hz，与 π0.5（20 Hz）、GR00T（24 Hz）处在同一频带，但 VLA 走的是端到端回归路线，Show-Harness 走的是「语义推理＋确定性执行」，两条路线的误差模式完全不同，不可直接互摘性能标签。</div>
</div>

<div class="sec">
<div class="eyebrow">GUMI 才是对数采行业影响最直接的部分</div>
<p>论文配套的 GUMI（GUI Manipulation Interface）把同一套语义动作空间搬进了图形界面：采集员（或 Agent）在界面上点「向左」「抓取」，动作词直接驱动真机，演示数据同步落盘——整个过程不需要机械臂遥操作主从台、不需要 VR 设备、不需要专业操作培训。对一个数据采集员日产出 4–5 小时有效数据（本站 9 月 26 日人民网稿口径）的行业来说，把遥操作硬件门槛换成一套网页界面，意味着数采产能的扩张瓶颈从「设备和场地」松动为「界面和任务设计」。</p>
<p>开源策略也值得记录：Apache 2.0 协议，代码、Qwen3.5 与 Gemma 4 E4B 的 LoRA 适配器（rank 64、视觉塔冻结）、演示数据集全部公开，GitHub 上线数日 232 星。小模型几 GPU 小时的微调成本，把「让自家机器人跑一套 VLM 控制」的门槛压到了高校实验室级别。</p>
<div class="keypoint">判断：Show-Harness 与本站 218 号稿报道的 RoboDawn 评测是同一问题域的两半——RoboDawn 揭示通用 VLM 在真机接口上存在大幅能力落差，Show-Harness 给出的答案是：落差不在模型智能里，而在接口约定里。它无意取代 VLA，而是划出了一条清晰的分工线：语义推理交给 VLM，度量与执行交给确定性解释器。对做机器人二次开发与数采服务的团队，真正值得消化的是那句被消融实验反复验证的话——接口约定的质量，决定上层智能能兑现几成。</div>
</div>

<div class="srcline">来源：NUS Show Lab 项目页（https://showlab.github.io/Show-Harness/）；Lab Index 收录 2026-09-09（labindex.ai/outputs/nus/show-harness）；新浪机器人热点小时报 2026-09-27 07:30 收录。素材时间窗：当日 09:00 → 19:00。</div>

---

*来源：神机百见-具身解读 · https://www.shenjibailian.com/jiedu/article/show-harness-semantic-action-vlm-control/*
