纸杯被人为拆掉还能接着摞:清华 EMERGE-Policy 把「抗干扰」从 40% 提到 85% 以上的系统办法
一个主智能体加三类子智能体,用图结构调度 VLA 和世界模型,再用三个 Markdown 文件管记忆——清华团队的 EMERGE-Policy 在真机纸杯实验里扛住了人为拆毁和尺寸扰动,成功率保持 85% 到 94%。这可能是「系统编排」第一次在具身智能里正面击败「单个大模型」。
- 架构:清华深圳国际研究生院李秀团队联合多所高校发布 EMERGE-Policy,把 VLA(π0.5)、世界模型(Cosmos Policy)、验证器解耦为统一技能库,由 1 个主智能体加感知、验证、监控 3 类子智能体做图结构调度。
- 基准:Standard LIBERO 平均成功率 99.2%;LIBERO-Plus 扰动测试 93.9%,较单一底座提升 11.7 个百分点。
- 真机:多层纸杯叠放 100 次实验中,在人为拆毁、纸杯尺寸变化 5% 到 15%、颜色与相机视角变动等干扰下,成功率保持 85% 到 94%。
- 记忆:用 PLAN.md / HISTORY.md / MEMORY.md 三层文件管理长程状态——用工程师最熟悉的文件格式替代隐式向量状态。
- 判断:论文、代码、项目主页全公开,复现门槛低;但它证明的是「编排层的价值」,不是某个单一模型的能力上限,两条路线不该混为一谈。
具身智能的演示视频有个通病:环境永远配合。纸杯摆在该摆的位置、光照正常、没人捣乱。可真实部署里,最贵的故障往往来自「计划外」——人碰了一下半成品、物料尺寸变了 10%、相机被人挪了角度。行业里管这叫抗干扰能力,而目前主流的单体端到端模型在这里的表现普遍难看:环境一动,成功率断崖。
清华深圳国际研究生院李秀教授团队联合多所高校发布的 EMERGE-Policy,给出的是一套系统层答案。它不做一个新的「超级模型」,而是把现成的组件拆开重排:VLA 模型(π0.5)负责动作生成,世界模型(Cosmos Policy)负责推演,验证器负责把关,三者被解耦成统一技能库;之上由一个主智能体加感知、验证、监控三类子智能体,以图结构做异步并发调度。哪个组件在什么时刻被调用、结果由谁复核、异常由谁兜底,全部显式化。
基准层面,Standard LIBERO 平均成功率 99.2%;更难的 LIBERO-Plus 扰动测试拿到 93.9%,比单一底座高出 11.7 个百分点——这 11.7 个点基本就是「编排层」卖的东西。真机层面的实验设计更值得细看:多层纸杯叠放,连做 100 次,期间人为拆毁已叠好的部分、把纸杯尺寸做 5% 到 15% 的变化、改变颜色和相机视角,成功率仍保持在 85% 到 94% 区间。换句话说,系统不是靠「环境不变」活着,而是靠「环境变了能发现、能重规划、能回退」活着。
还有一个工程细节容易被略过:三层文件记忆。用 PLAN.md 存任务计划、HISTORY.md 存执行历史、MEMORY.md 存长期状态——这套命名对写过代码的人一目了然。它把长程任务的状态管理从黑箱向量搬进了可读、可改、可审计的文件里。判断:这个设计选择透露了团队的工程价值观——真实工位要的不是玄学,是出了问题能翻日志。
库内此前写过两篇同主题稿件,恰好可以拼出一张可靠性地图。055 号稿写的 VLA corrector 是动作层的方案:给 VLA 外挂一个 4000 万参数的纠偏器,扰动恢复率从 40% 提到 68.3%;093 号稿写的 ReactHuman 是感知层的警示:让 7 个多模态大模型直接当人形机器人的大脑,每三个突发危险就有一个判错。而 EMERGE-Policy 站在编排层:它不假设任何一个模型足够聪明,而是假设每个模型都会出错,用调度和验证把单点故障隔离开。三层方案并不互斥——真机系统最终可能三层都要。
第一,论文、代码与项目主页均已公开,是国内团队里少见的「全裸开源」姿态,复现门槛低,做集成交付的团队一周内就能判断它对自家场景是否可用。第二,它的架构假设——组件可替换——恰好契合国内多模型并存的现实:底座模型换血时,编排层不需要推倒重来。第三,给集成商的提醒:99.2% 的 LIBERO 成绩和 85%–94% 的真机抗干扰成绩是两回事,前者是理想基准,后者才是部署口径;评估任何「高成功率」宣传时,先问是哪一种。