RoboGesture 拆解:让机器人边说边比划,难点不是「会动」是「别乱动」
机器人会说话之后,最尴尬的是手不知道往哪放。银河通用联合六校的 RoboGesture 把自碰撞帧率从 4.16% 压到 0.13%——这项研究真正的工程难点,不是让动作像人,是让动作不伤到自己。
本篇目录
- 成果:银河通用联合清华大学、北京大学、北京理工大学、哈工大、上海期智研究院等推出 RoboGesture——让机器人根据实时语音自动生成语义匹配、动作自然、带安全约束的伴随手势,9 月 10 日亮相 ECCV 2026。
- 关键架构:直接在机器人运动学动作空间学习(41 自由度上半身:躯干双臂 17 DoF + 两只 BrainCo 灵巧手 24 DoF),绕开「人体骨骼→逆运动学重定向」的传统链路。
- 核心指标:在线 MPC 安全过滤器把上半身自碰撞帧比例从 4.16% 降至 0.13%;连续 DiT 生成器 120 FPS,1 秒动作约 250 毫秒生成。
- 数据打法:构建含 300+ 语义手势类别的数据集,用 LLM 写对话脚本 + TTS 合成,产出约 1000 小时机器人专用音频—动作数据。
- 已上真机:部署在宇树 G1 + 强脑(BrainCo)灵巧手上,200 次真实部署测试零摔倒、零急停。
- 判断要点:全文互动闭环约 2 秒,其中手势生成只占约 250ms——真正的延迟瓶颈在语音链路,不在动作。
机器人会说话了,但手不知道往哪放
过去两年人形机器人在走、跳、抓上进展神速,一旦进入对话场景就露怯:要么机械停顿、用毫无起伏的语调复述;要么不停挥动手臂,做着节奏固定、跟说话内容毫无关系的动作。语言模型负责「说什么」,但「怎么动」没有模型管——这是人形机器人进入接待、酒店、养老、舞台这些真实社交场景前必须补的短板。
RoboGesture 解决的就是这个问题:给定一段实时语音,为机器人生成语义匹配、节奏自然、并且物理安全的上半身伴随手势。它把「手势生成」从数字人领域搬到了真机领域——而真机和虚拟角色最大的区别是:虚拟角色动作再离谱也不会受伤,真机动错了会自撞、会打到人、会摔倒。
绕开人体骨架,直接在机器人自己的动作空间里学
传统做法的链路是:先在人类骨骼空间里生成手势,再用逆运动学(IK)+ PD 控制器把动作在线重定向到机器人身上。问题在于人形机器人与人的身体结构不一样,同一套动作映射过去,容易出现手撞胸口、手臂姿态异常、高频抖动。
RoboGesture 换了一条路:不先学人的动作再翻译,而是直接在机器人的运动学动作空间里学习。研究针对一套 41 自由度的上半身系统训练——躯干和双臂的 17 个自由度,加上两只 BrainCo 灵巧手提供的 24 个自由度。模型面对的是机器人的真实身体,推理阶段不再需要复杂的动作重定向。
这个选择有代价也有收益。代价是训练数据必须是「机器人坐标系」的,没法直接复用海量人类动捕数据;收益是部署链路短了一大截,而且从根上消除了「人体动作映射到机器人」这一层的结构性错误源。为了补数据,团队搭建了半合成数据流水线:用 LLM 生成对话脚本,用 TTS 合成语音,在 SeG、EgoGesture 分类体系上扩充,得到约 1000 小时机器人专用音频—动作配对数据、300 多种验证过的语义手势类别。
模态遮蔽、动作惯性、自碰撞:每个都有一个针对性设计
机甲觉醒的报道披露了项目组点名的三个隐蔽技术难点,每个都对应一个专门机制,这是 RoboGesture 里最值得读的部分。
第一,模态遮蔽。当模型同时看到「刚才怎么动」和「现在说了什么」,它会偷懒——上一帧动作天然连续,模型会顺着运动惯性继续做,而不是认真听新语音。结果是人已经换了话题,机器人的手还停在上一句。项目组用三层机制压制这种惯性:分层语义—声学对齐器直接对 Mimi Codec 编码的音频建模,浅层捕捉节奏、深层用 300 类手势分类器理解语义;反惯性 CFG Masking 以 15% 概率随机屏蔽历史动作,逼模型只看当前语音重新生成;再把历史动作延迟到深层 Transformer 才注入。目的只有一个:先听懂,再动手。
第二,动作提前量。真人说话不是「说完再比划」,是关键词还没出口身体已经动了。RoboGesture 让语义动作平均提前约 400 毫秒启动——比如准备说强调性词语之前手已经开始抬。这个细节决定了交互是否「像人」,也是多数数字人方案做不好的地方。
第三,物理安全。模型生成的 1 秒动作片段,要过一个基于凸二次规划(QP)的在线 MPC 安全过滤器逐帧检查,避免自碰撞。实测把上半身自碰撞帧比例从 4.16% 压到 0.13%,单帧过滤只要 5.6 毫秒——比生成器本身(1 秒动作约 250 毫秒、120 FPS)快一个量级,不是瓶颈。
2 秒闭环里,动作生成只占 250ms,瓶颈在别处
Galbot 给出的完整链路是「听懂—回答—做手势」,整个闭环约 2 秒。把 2 秒拆开看,会颠覆一个直觉:手势生成模块根本不拖后腿——DiT 生成 1 秒动作约 250 毫秒,MPC 过滤 5.6 毫秒/帧。真正吃掉时间的是上游对话系统:语音识别(ASR)要约 0.5 秒确认用户说完,微调后的 Qwen 生成回复约 0.14 秒,TTS 约 0.41 秒,音频 Token 化约 0.16 秒,加上首段动作推理约 250 毫秒。
结论很直白:机器人「反应慢」的锅,绝大多数在语音大模型链路,不在动作系统。这个拆解对做交互机器人的团队有普适意义——优化延迟时先做 profiling,别一上来就优化动作模块。
报道还点出了当前的能力边界:RoboGesture 目前负责静止状态下的上半身动作与灵巧手姿态,下半身平衡仍由原有站立控制器负责。如果未来要一边走路一边打手势、用重心变化配合表达,就涉及全身控制,是尚未解决的问题。另外,在 BEAT 标准指标上它的动作多样性(0.2075)低于对比方法 Semantic Gesticulator(0.2818)——团队的解释是多样性高不必然等于好,不稳定的抖动同样会拉高多样性。
为什么是 Galbot:ET1 预售与「会表达」的商用场景
RoboGesture 发布的时间点,恰好卡在银河通用从仓储物流向双足人形扩张的当口:本周 Galbot 刚开启双足人形 ET1 的预售,官方称京东旗舰店已售出超 200 台,瞄准门店接待、酒店服务和舞台表演。这些场景的共同点恰恰是「要会说话、更要会表达」——一个只会背词、手势乱飞的接待机器人,比没有手势更让人出戏。
把 RoboGesture 放进神机百炼的坐标系看,它与 K1 的手势控制研究是同一枚硬币的两面:我们的方向是「机器人读懂人的手势」,Galbot 的方向是「机器人打出自己的手势」。当两条路都成熟,人机交互就不再是单向指令,而是双向的肢体语言对话——这会是接待与表演机器人下一轮差异化的真正战场。
BEAT 分数存在口径差异:中文媒体写「评测 0.88、语义场景降至 0.13」,项目页/英文侧以 FGD 0.8452、碰撞率降至 0.13% 表述,本文采用后者并在正文标注。合作院校名单中「上海期智研究院」按英文项目页 Shanghai Qi Zhi Institute 采用,中文报道另有「上海启智研究院」写法。
完整闭环约 2 秒为项目组给出,各环节耗时来自媒体转述,未含端到端实测报告。「真正延迟瓶颈在语音链路」是本文基于该拆解的判断。ET1 预售超 200 台为官方宣布口径,单一信源。RoboGesture 数据集以英文 TTS 合成为主,中文迁移效果未经验证,为本文基于公开信息的推断。
解读时间:2026-09-08。