# 让 7 个多模态大模型当人形机器人的大脑：每三个突发危险，就有一个判错

> 一份把 MLLM 放进 240Hz 刚体仿真、让它真的去接滑落的盘子的基准。7 个模型测下来约三分之一突发危险处置错误，而且错误不随模型规模缩小——这条结论对「等下一代模型就好了」是直接的否定。

### TLDR

- **测的是什么**：ReactHuman 让被测的多模态大模型充当**仿真人形机器人的决策大脑**，面对突发家庭危险（盘子滑落、刀掉落、衣柜倾倒）当场反应，覆盖 **17 类事件族**、**1000 多个**可逐位复现的场景。
- **怎么保证答案对**：真值来自 **240 Hz 刚体仿真**，无需人工标注；还专门放了**外观与物理属性冲突**的对抗物体——**泡沫做的砧板、钢做的苹果**。
- **结果**：**7 个代表性 MLLM**，大约**每三个危险就有一个处置错误**。
- **最扎心的一条**：这些失败**没有一个随模型规模增大而减少**。
- **判断：这份基准真正的贡献不是「三分之一」这个比例，而是它证明了安全问题不能用「等下一代模型」来回答**——失败是结构性的（按固定倾向行动、信外观不信运动、拦截点差到米级），不是能力不足。

### SRC

本文事实以 **arXiv:2609.10895**（2026 年 9 月 9 日 22:56 UTC 提交 v1，作者 Yizhan Li 等 8 人，单位含 Université de Montréal、Mila – Quebec AI Institute、McGill University、McMaster University、Meta Platforms）的摘要与正文 HTML 版为一手依据；**17 类事件族、1000+ 场景、240 Hz 刚体仿真、7 个被测 MLLM、约 1/3 处置错误、错误不随规模缩小**等数字均出自该文。数据集已发布在 Hugging Face（`huggingface.co/datasets/Alan123/reacthuman-benchmark-scaled`）。本文纳入本批的**窗口内依据**：**FutureX Physical AI Daily Issue 117（09/12）**在**素材时间窗 2026-09-11 18:00 → 2026-09-12 09:00 内**把该文列入 Research Progress 栏目，并给出中文口径的要点转述；英文侧另有 The Machine Press（09/12 前后）的独立摘要，与 arXiv 摘要一致，可互为交叉。**论文为预印本，未经同行评审**；「五指标三轴评分」的具体分值与各模型名称在本文可获取的摘要/HTML 段落中未逐项列出，故本文只转述总量结论，不列分模型排名。所有评价与推论为作者判断，已标注。

### BODY

<div class="sec"><div class="eyebrow"><span class="num">1</span>它在测一件没人测过的事</div>

<h2>不是问答，是「现在，接住它」</h2>

<p>现有的物理推理基准，大多是**被动**的：给你一段视频，问你「接下来会发生什么」，或者判断两个场景哪个更合理。 embodied AI 的基准则偏**长程慢思考**：导航、重排、收拾房间。这两类都不测一件事——**模型能不能把物理理解，在几百毫秒内变成一次安全的动作**。</p>

<p>ReactHuman 测的就是这件事。它的设定很直接：把被测的 MLLM 放进一个仿真人形机器人的决策回路里，让它面对突然发生的家庭危险——盘子从台面滑落、刀从架子上掉下来、衣柜朝人倒过来——然后**当场**做出反应决策。</p>

<p>它的评估协议叫 **freeze-and-predict**：完整物理仿真一路跑到**关键决策时刻**然后冻结，把此刻的观测交给模型；模型给出计划后，**仿真继续执行这个计划**，让决策产生可见的物理后果。</p>

<p>这一点是整篇工作里最重要的设计。大多数基准里，模型答错了就答错了；在这里，模型说「我去接点 A」，仿真就真的把手伸向 A 点，然后根据物体真实轨迹判定接没接住。</p>

</div><div class="jx-bars">
<div class="jx-bar-row"><div class="jx-bar-lab">事件族</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:17%;background:#0a749a"></div></div><div class="jx-bar-val">17 类</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">可复现场景</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:40%;background:#00a6d6"></div></div><div class="jx-bar-val">1000+</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">仿真频率</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:60%;background:#0d8a5f"></div></div><div class="jx-bar-val">240 Hz</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">被测 MLLM</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:14%;background:#6d3fd4"></div></div><div class="jx-bar-val">7 个</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">错误率（约）</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:33%;background:#b85c0a"></div></div><div class="jx-bar-val">1/3</div></div>
<div class="jx-legend"><div class="jx-lg">ReactHuman 基准规模与总体结果；数据来源 arXiv:2609.10895 摘要与正文</div></div>
</div>

<div class="sec"><div class="eyebrow"><span class="num">2</span>真值从哪来</div>

<h2>泡沫砧板与钢苹果</h2>

<p>这类基准最难的不是搭建，是**怎么判定对错**。ReactHuman 的做法是：真值直接来自 **240 Hz 刚体仿真**，不需要人工标注。场景可以**逐位（bit-for-bit）复现**——同一场景在任何机器上跑出来的物理轨迹完全一致。</p>

<p>更狠的是它放了**对抗性物体**：**外观与物理属性相冲突**的东西。论文举的两个例子是**泡沫做的砧板**和**钢做的苹果**。</p>

<p>这两个道具的设计意图很清楚：如果一个模型是靠「砧板 = 硬 = 重 = 砸下来会伤人」这种外观先验做判断，那它在泡沫砧板面前就会系统性出错。它测的正是模型是**在看运动**还是在**看图片**。</p>

<p>评分不是单一成功率。作者设计了**五指标套件**，从三个轴打分：**reasonable**（合理，是不是一个正常人会选择并能为之辩护的动作）、**safe**（安全，是否避免造成伤害）、**physically grounded**（物理上站得住，手是否真的及时到达了物体位置）。</p>

<p>这个三轴拆法值得国内做评测的团队直接抄。因为一个模型可以**选对动作但抓空半米**——在只有成功率的基准里，这跟完全没反应是一样的；在三轴评分里，它能被精确定位成「决策对了，物理预测错了」。</p>

</div><div class="jx-split">
<div style="flex:50">
<div class="jx-h"><span>传统物理推理基准</span><span class="jx-note">被动问答</span></div>
<p>给视频 → 问「接下来会怎样」→ 选 A/B。<strong>测的是判断，不是动作</strong>；答错没有物理后果。</p>
</div>
<div style="flex:50">
<div class="jx-h"><span>ReactHuman</span><span class="jx-note">freeze-and-predict</span></div>
<p>仿真跑到关键时刻冻结 → 模型出计划 → <strong>仿真真的执行</strong> → 按 240Hz 真值判定，分合理 / 安全 / 物理三轴打分。</p>
</div>
</div>
<div class="cap">协议对比依据 arXiv:2609.10895 正文；「答错没有物理后果」为本文对两类基准差异的概括表述。</div>

<div class="sec"><div class="eyebrow"><span class="num">3</span>结果</div>

<h2>三个失败模式，和一个否定</h2>

<p>**7 个代表性 MLLM** 测下来，结论一句话：**反应式安全远未解决**——大约**每三个危险就有一个被处置错**。</p>

<p>作者把失败拆成了三个模式：</p>

<p>**其一，按固定倾向行动，而不是按眼前场景行动。** 模型表现出一种「性格」——不管现场是什么情况，它倾向于重复同一类反应。这在工程上的含义是：这不是知识缺失，是策略僵化。</p>

<p>**其二，信外观不信运动。** 面对泡沫砧板与钢苹果这类对抗物体时，模型倾向于依据物体的**看起来像什么**而不是**正在怎么动**来判断危险等级。</p>

<p>**其三，动作选对了，拦截点差到米级。** 论文原文的表述是「miss interception points at meter scale even when the chosen action is correct」——即使动作选择正确，手伸到的位置与物体实际会经过的位置可以差出**米**的量级。</p>

<p>然后是最关键的一句：**none of these failures shrink with model scale**——**这些失败没有一个随模型规模增大而减少**。</p>

<p><div class="keypoint">判断：这条结论的杀伤力大于「三分之一」。行业里对安全问题的默认回答一直是「等下一代模型」——参数更大、数据更多、推理更强，安全自然跟上。ReactHuman 说的是：至少在突发物理危险这个子类上，规模不解决问题。如果这条能被后续工作复现，那么「把大模型直接当家庭机器人的决策核心」这条路径，就需要一层**不随模型升级而消失**的独立安全兜底——而不是靠模型迭代把它抹掉。</div></p>

</div><div class="sec"><div class="eyebrow"><span class="num">4</span>边界与用法</div>

<h2>它不能证明什么，和它能用来做什么</h2>

<p>先把边界说清楚，否则这份基准会被误读。</p>

<p>第一，**这是仿真，不是真机**。所有结论都建立在 240 Hz 刚体仿真的物理一致性上。作者自己在摘要里也留了这句话的等价表述：决策在仿真器内部产生后果，**但该基准不替代真实家庭机器人测试**。真机上的接触力学、柔性物体、传感器噪声，都不在这份评估范围内。</p>

<p>第二，**这是预印本**，2026 年 9 月 9 日提交，未经同行评审。分模型的具体分值与排名，在本文可获取的摘要与 HTML 段落中未逐项列出，所以本文只转述总量结论，不编造排名。</p>

<p>第三，**17 类事件族不等于 17 种真实危险**。家庭里的突发危险种类远超 17 类，而且真实场景的危险往往是连锁的（绊倒 → 撞到 → 掉落）。</p>

<p>但它的可用性是明确的。作者把基准定位成两样东西：一个**细粒度诊断工具**，和一个**可扩展的训练信号**。数据集已上架 Hugging Face。对做家庭机器人或具身安全兜底的团队，这份数据的用法不是「跑个分」，而是**把三个失败模式分别做成测试用例**：固定倾向测试（同一模型在不同场景是否给出同质反应）、外观对抗测试（泡沫砧板类道具）、拦截精度测试（动作对但位置差多少米）。</p>

<p><div class="keypoint">判断：对做真实场景交付的团队，这份基准可以直接改造成**交付前的验收清单**。现在行业里对「机器人安不安全」的验收基本停留在急停按钮 + 碰撞检测这类被动保护；ReactHuman 指出的是另一层——**主动反应式安全**，即机器人面对突发状况时的**主动**决策质量。这一层目前没有任何公开验收标准。谁先把这三层（被动保护 / 主动反应 / 处置精度）写成可执行的测试用例，谁在政企招标的技术规格书里就多一张牌。</div></p>

<div class="srcline">来源：arXiv:2609.10895《ReactHuman: A Physics-Grounded Benchmark for Human-Like Reactive Decision-Making in Embodied Multimodal LLMs》（2026-09-09 提交）https://arxiv.org/abs/2609.10895 ；HTML 版 https://arxiv.org/html/2609.10895v1 ；数据集 https://huggingface.co/datasets/Alan123/reacthuman-benchmark-scaled ；FutureX Physical AI Daily Issue 117（09/12）https://dev.to/future_x/futurex-physical-ai-daily-issue-117-0912-31g5</div>
</div>

---

*来源：神机百见-具身解读 · https://www.shenjibailian.com/jiedu/article/reacthuman-one-in-three-hazard-wrong/*
