研究解读 · 神机百见-具身解读

不建地图、不用相机:单杠这道几何题,人形机器人靠原始点云过了

一根悬在半空、几何稀疏的细杆,会把感知和全身控制一起卡死。苏黎世联邦理工让一台众擎 PM-01 跳上单杠、双手交替摆荡、再落地,15 次试验成功 14 次。真正值得记的不是这个动作本身,而是它证明了「不建地形图」这条路在非结构化场景里更对。

本篇目录5 节 · 12 分钟
一分钟速览
  1. 结果:EngineAI PM-01 完成「跳上—摆荡—落地」全流程,15 次硬件试验成功 14 次,覆盖三种不同的单杠配置。
  2. 几何条件:杆高 1.69–1.75 米,杆间距 0.26–0.33 米,峰值摆动速度 0.5 m/s;其中一次试验支架本身还在晃
  3. 感知方案:头部 RoboSense E1R 固态激光雷达的原始点云直接喂给控制器,不建地形图、不做重建。视场 120°×90°10 Hz192×144 分辨率。
  4. 为什么不建图:高度场(heightfield)会丢掉的恰恰是「细的、悬空的、上下都是空气的杆」;体素网格又太吃内存。这是本文最值得记住的一条工程经验。
  5. 判断:这条路线对「临时结构、非标场景」的价值远高于结构化产线——工地、巡检、演出布景里到处都是细杆、线缆、栏杆,而这些恰恰是 elevation map 会直接抹掉的东西。
数据来源与边界
本文事实以 TechEBlog(2026-09-12)对 ETH Zürich Robotic Systems Lab 成果的报道为主,交叉 AGI Hunt 的转述与 FutureX Physical AI Daily Issue 118(09/13)的 Paper Progress 条目。论文题为《Learning Agile Perceptive Traversal of Sparse 3D Structures for Humanoids》,三方对成功率 14/15、杆高 1.69–1.75m、间距 0.26–0.33m、峰值 0.5 m/s、E1R 激光雷达、GRU 记忆、两阶段(专家→蒸馏)训练的口径一致。本文未获取到 arXiv 编号与论文原文,所有技术细节均来自上述二手报道,属单一信源的转述链条;雷达参数(120°×90°、10Hz、192×144)、AME-2 编码器、50Hz 关节位置指令、60mm 钩口、Isaac Lab 域随机化清单等细节仅见于 TechEBlog 一篇,未获第二来源印证,已在正文标注。素材时间窗为 2026-09-12 18:00 → 2026-09-13 09:00:FutureX Issue 118(09/13)在窗口内收录该成果并给出中文口径,构成本批纳入依据。「首个」「first reported」等表述为原报道方说法,本文不作独立认定。所有判断均已用「判断:」标注。
本文事实信息来自上方标注的公开来源;解读、判断与延伸部分为作者个人见解,写作过程使用了 AI 工具辅助整理,已由作者人工核实,不代表信息来源方立场。如有雷同纯属巧合;如涉及版权或权益问题,请联系 shenjibailian@shenjibailian.com,我们将在核实后及时删除或更正。
1为什么是单杠

一个专门用来卡死机器人的场景

单杠看起来是个 playground 玩具,但在机器人眼里它是个相当刁钻的几何题:

几何上

杆子悬空上下都是空气。它不属于「地面」这个概念的任何一部分。

控制上

跳上要准、摆荡要连续换手、落地要稳,三个阶段是三个不同的动力学问题,还得无缝接上。

苏黎世联邦理工(ETH Zürich)机器人系统实验室让一台 EngineAI PM-01(众擎机器人)完成了整套动作:跳上第一根杆、双手交替摆荡前进、再干净地落到地面,全程不中断。

硬件试验成功率
14 / 15
覆盖单杠配置
3 种
峰值摆动速度
0.5 m/s
杆高 1.69–1.75 m,杆间距 0.26–0.33 m;其中一次试验支架本身在晃动

0.5 m/s 这个速度,报道里说和人类玩同样器械时观察到的量级相当。更值得一提的是那次「架子还在晃」的试验——它说明这套控制不是靠精确已知的世界模型硬算出来的,而是对扰动有一定容忍度。

2关键选择

不建地形图,直接吃原始点云

这是整篇工作最有价值的一点,也是最容易被动作本身的视觉效果盖过去的一点。

腿足机器人的常规做法是先建地形图:把传感器数据压成高度场(heightfield / elevation map),控制器在这个图上规划落脚点。这个做法在野外、楼梯、碎石地上非常好用。

但它有一个致命的副作用:高度场只保留「每个 (x, y) 位置的最高点」。一根悬空的杆,在高度场里要么被记成「那个位置有 1.7 米高的东西」(于是机器人以为面前有堵墙),要么因为分辨率不够直接被抹掉。无论哪种,都跟「可以抓的横杆」这个语义完全对不上。

判断:这条经验可以直接迁移到工程现场。任何「悬空、细长、非承重面」的结构——线缆、护栏、脚手架横杆、吊装带、演出桁架——在高度场里都会失真。而这些恰恰是巡检、施工、演出场景里最常见的东西。如果一套移动操作方案默认依赖 elevation map,它在这些场景里的失败会非常突然且难以归因。

那为什么不用体素网格(voxel grid)保留三维信息?报道给出的理由是内存开销太大,跟不上实时控制。

ETH 的做法是跳过重建这一步:头部 RoboSense E1R 固态激光雷达的原始扫描直接进控制器。按 TechEBlog 的描述(此段细节仅见于该篇,未获第二来源印证),雷达视场 120°×90°、10 Hz、生成 192×144 的点阵;一个名为 AME-2 的注意力编码器先在这些点上铺 2D 网格、池化出全局图景,再聚焦到下一步真正重要的局部特征;GRU 记忆模块负责在目标杆移出视野后仍然记得它在哪;控制器输出 50 Hz 的关节位置指令给机载 PD 环。另有一个辅助头去预测梯子的中心线,作为额外训练信号。

「杆子移出视野了还知道它在哪」这件事,是摆荡动作能连续的前提——换手瞬间头部必然朝下或朝前,目标杆会离开视场。没有这段记忆,每次换手就等于重新找目标。
3怎么训出来的

三个专家,蒸馏成一个学生

阶段一
分别训练三个「专家」策略:跳上第一根杆、摆荡、落地。每个专家拥有完整特权信息(知道杆端在哪),各有自己的课程
阶段二
用相位调度器在三个专家之间交接控制权,跑通完整序列
阶段三
蒸馏成单一学生策略,学生只能看到自己传感到的东西(没有特权信息)
阶段四
PPO 精调,把模仿学习融入任务奖励,并逐步关掉模仿信号

训练在 Isaac Lab 中完成,域随机化的清单拉得很长(此段细节仅见于 TechEBlog):杆半径、宽度、倾斜、摩擦、质量、电池电压跌落执行器热限制,还有一个相当细致的激光雷达噪声模型——测距误差、边缘渗光、丢点、帧冻结

判断:这份随机化清单里最见功力的是「电池压降」和「执行器热限」。这两项都是真实硬件上才会出现、仿真里最容易漏掉的因素——机器人连续摆荡十几秒,电压会掉、电机会热,力矩输出跟着衰减。把它们提前放进随机化,是 sim-to-real 能一次过(14/15)的主要原因之一。这是任何做真机强化学习的团队都该抄的一条。

硬件侧还有个巧妙的简化(同样仅见于 TechEBlog):机器人末端装的不是手,而是不锈钢被动钩,开口 60mm 圆环。它靠腕关节扭转就能脱钩,对微小的接触误差不敏感;接触几何用简单形状搭建,仿真里的接触计算因此很轻。钩子的对称设计还允许机器人必要时反向摆荡。

4泛化信号

同一套控制器,钻过了 2 厘米余量的窄缝

更有说服力的是后续测试:同一个控制系统下,另一个独立训练的策略让机器人蹲着钻过头顶仅余 2 厘米的窄缝,然后恢复到稳定姿态。

这跟单杠是同一个几何难题的镜像版本——不是「上面悬着一根细杆」,而是「上面压下来一块板,只留两指宽的缝」。两者共同要求的都是:对稀疏悬空几何的精确感知 + 全身姿态的精细控制

报道还提到,注意力图在仿真和真机上「照亮的位置完全一致」——下一次落脚的杆、以及地面,出现的时机也恰好对得上。这说明学到的表征确实在跨 sim-real 迁移,而不是靠过拟合仿真里的某个伪影。

判断:如果这套「点云直连 + GRU 记忆」的范式在「细杆」和「窄缝」两类几何上都成立,那它的适用边界大概率不是「体育器械」,而是所有高度场会失真的非结构化空间。对做巡检和特种作业的团队,这意味着一条比「先建图再规划」更轻的技术路线——它省掉的重建步骤,在算力受限的机载平台上是很实在的收益。
5要保留的怀疑

这篇工作没说的事

缺口具体情况对判断的影响
论文原文未获取本文所有细节来自 TechEBlog / AGI Hunt / FutureX 的二手转述,未见 arXiv 编号与原文雷达参数、AME-2 结构、域随机化清单等细节无法逐条核对
失败样本只有 1 个15 次中 1 次失败,失败原因未披露93% 的成功率在小样本下置信区间很宽,不宜直接外推到批量部署
场景是受控的三种杆的几何都在很窄的范围内,光照、地面条件未说明变化「泛化」指的是杆几何泛化,不是环境泛化
无负载、无任务只做位移动作,不涉及携带物体或操作距离「能干活」还有明显距离
本体是 PM-01小型人形(约 1.2 米级、24 自由度),不是全尺寸结论能否迁移到全尺寸人形未经验证
报道称这是「首个」用自身激光雷达完成整套跳—荡—落序列的通用人形机器人。此前确有能摆荡的机器,但多数假设杆的位置已知——这个差别很大,一个是感知问题,一个只是控制问题。

把这些保留意见摆出来,不是要否定这项工作。恰恰相反:一篇能让你准确说出「它还没证明什么」的报道,通常比一篇全是惊叹号的更值得读。14/15 的硬件成功率、三种几何配置、一个跨任务复用的控制器,这三项已经足够说明技术方向是对的;至于它能走多远,要看后续有没有团队在非 ETH 的硬件上复现出来。

来源:ETH Zürich Robotic Systems Lab(Learning Agile Perceptive Traversal of Sparse 3D Structures for Humanoids)· TechEBlog(2026-09-12)· AGI Hunt · FutureX Physical AI Daily Issue 118(09/13)