# 纸杯被人为拆掉还能接着摞：清华 EMERGE-Policy 把「抗干扰」从 40% 提到 85% 以上的系统办法

> 一个主智能体加三类子智能体，用图结构调度 VLA 和世界模型，再用三个 Markdown 文件管记忆——清华团队的 EMERGE-Policy 在真机纸杯实验里扛住了人为拆毁和尺寸扰动，成功率保持 85% 到 94%。这可能是「系统编排」第一次在具身智能里正面击败「单个大模型」。

### TLDR

- **架构**：清华深圳国际研究生院李秀团队联合多所高校发布 **EMERGE-Policy**，把 VLA（π0.5）、世界模型（Cosmos Policy）、验证器**解耦为统一技能库**，由 1 个主智能体加感知、验证、监控 3 类子智能体做图结构调度。
- **基准**：Standard LIBERO 平均成功率 **99.2%**；LIBERO-Plus 扰动测试 **93.9%**，较单一底座提升 **11.7 个百分点**。
- **真机**：多层纸杯叠放 **100 次**实验中，在**人为拆毁**、纸杯尺寸变化 **5% 到 15%**、颜色与相机视角变动等干扰下，成功率保持 **85% 到 94%**。
- **记忆**：用 **PLAN.md / HISTORY.md / MEMORY.md** 三层文件管理长程状态——用工程师最熟悉的文件格式替代隐式向量状态。
- **判断**：论文、代码、项目主页全公开，复现门槛低；但它证明的是「编排层的价值」，不是某个单一模型的能力上限，两条路线不该混为一谈。

### SRC

本篇素材时间窗为当日 09:00 → 19:00，采用「窗口外论文 + 近 3 日报道跟进」处理：论文为 arXiv 2608.29896v2，中文聚合源「具身机器人-每日速递」于 9 月 13 日（窗口外一天、近 3 日内）跟进报道，本篇在窗口内完成核查与解读，SRC 写明与既有稿件差异：055 号稿（VLA corrector）写的是「外挂纠偏器」，093 号稿（ReactHuman）写的是「多模态大模型当大脑的失败率」，本篇写的是「多智能体调度架构」——三者同属可靠性主题，但介入层级分别是动作层、感知层、编排层，结论不重复。核查边界：全部数字（99.2%、93.9%、+11.7%、100 次真机、85%–94%）来自聚合日报对论文的转述，属二手口径，「单一聚合信源」，原论文数值未逐项复核；论文、代码与项目主页已公开可供验证。判断均为作者观点。

### BODY

<div class="sec">
<div class="eyebrow">先说清楚它解决的是什么问题</div>
<p>具身智能的演示视频有个通病：环境永远配合。纸杯摆在该摆的位置、光照正常、没人捣乱。可真实部署里，最贵的故障往往来自「计划外」——人碰了一下半成品、物料尺寸变了 10%、相机被人挪了角度。行业里管这叫抗干扰能力，而目前主流的单体端到端模型在这里的表现普遍难看：环境一动，成功率断崖。</p>
<p>清华深圳国际研究生院李秀教授团队联合多所高校发布的 EMERGE-Policy，给出的是一套系统层答案。它不做一个新的「超级模型」，而是把现成的组件拆开重排：VLA 模型（π0.5）负责动作生成，世界模型（Cosmos Policy）负责推演，验证器负责把关，三者被解耦成统一技能库；之上由一个主智能体加感知、验证、监控三类子智能体，以图结构做异步并发调度。哪个组件在什么时刻被调用、结果由谁复核、异常由谁兜底，全部显式化。</p>
</div>

<div class="jx-steps">
<div class="jx-step"><div class="jx-step-l">感知</div><div class="jx-step-bar"></div><div class="jx-step-v">子智能体持续比对环境状态与任务预期</div></div>
<div class="jx-step"><div class="jx-step-l">调度</div><div class="jx-step-bar"></div><div class="jx-step-v">主智能体按图结构编排 VLA 与世界模型的调用时序</div></div>
<div class="jx-step"><div class="jx-step-l">验证</div><div class="jx-step-bar"></div><div class="jx-step-v">验证器对每步结果把关，不达标触发回退与重试</div></div>
<div class="jx-step"><div class="jx-step-l">记忆</div><div class="jx-step-bar"></div><div class="jx-step-v">PLAN / HISTORY / MEMORY 三层文件管理长程任务状态</div></div>
</div>

<div class="sec">
<div class="eyebrow">数字怎么说</div>
<p>基准层面，Standard LIBERO 平均成功率 99.2%；更难的 LIBERO-Plus 扰动测试拿到 93.9%，比单一底座高出 11.7 个百分点——这 11.7 个点基本就是「编排层」卖的东西。真机层面的实验设计更值得细看：多层纸杯叠放，连做 100 次，期间人为拆毁已叠好的部分、把纸杯尺寸做 5% 到 15% 的变化、改变颜色和相机视角，成功率仍保持在 85% 到 94% 区间。换句话说，系统不是靠「环境不变」活着，而是靠「环境变了能发现、能重规划、能回退」活着。</p>
<p>还有一个工程细节容易被略过：三层文件记忆。用 PLAN.md 存任务计划、HISTORY.md 存执行历史、MEMORY.md 存长期状态——这套命名对写过代码的人一目了然。它把长程任务的状态管理从黑箱向量搬进了可读、可改、可审计的文件里。判断：这个设计选择透露了团队的工程价值观——真实工位要的不是玄学，是出了问题能翻日志。</p>
</div>

<div class="sec">
<div class="eyebrow">和两条既有路线摆在一起看</div>
<p>库内此前写过两篇同主题稿件，恰好可以拼出一张可靠性地图。055 号稿写的 VLA corrector 是动作层的方案：给 VLA 外挂一个 4000 万参数的纠偏器，扰动恢复率从 40% 提到 68.3%；093 号稿写的 ReactHuman 是感知层的警示：让 7 个多模态大模型直接当人形机器人的大脑，每三个突发危险就有一个判错。而 EMERGE-Policy 站在编排层：它不假设任何一个模型足够聪明，而是假设每个模型都会出错，用调度和验证把单点故障隔离开。三层方案并不互斥——真机系统最终可能三层都要。</p>
<div class="keypoint">判断：「一个模型打天下」和「一群模型互相盯梢」的路线之争，正在从学术分歧变成工程分水岭。EMERGE-Policy 的 85%–94% 说明在干扰密集的场景里，编排层的收益大于堆模型参数；但它也有代价——多组件系统的延迟、组件间接口的维护成本、以及「验证器自己错了怎么办」的递归问题，论文没有给出完整答案。</div>
</div>

<div class="sec">
<div class="eyebrow">对产业侧的三个落地提示</div>
<p>第一，论文、代码与项目主页均已公开，是国内团队里少见的「全裸开源」姿态，复现门槛低，做集成交付的团队一周内就能判断它对自家场景是否可用。第二，它的架构假设——组件可替换——恰好契合国内多模型并存的现实：底座模型换血时，编排层不需要推倒重来。第三，给集成商的提醒：99.2% 的 LIBERO 成绩和 85%–94% 的真机抗干扰成绩是两回事，前者是理想基准，后者才是部署口径；评估任何「高成功率」宣传时，先问是哪一种。</p>
<div class="srcline">论文：arXiv 2608.29896v2（清华深圳国际研究生院李秀团队等，代码与项目主页已公开）；中文报道：具身机器人-每日速递 2026-09-13 期。数字为聚合源转述的二手口径，未逐项复核原论文。</div>
</div>

---

*来源：神机百见-具身解读 · https://www.shenjibailian.com/jiedu/article/tsinghua-emerge-policy-multi-agent-robust/*
