研究解读 · 神机百见-具身解读

让 7 个多模态大模型当人形机器人的大脑:每三个突发危险,就有一个判错

一份把 MLLM 放进 240Hz 刚体仿真、让它真的去接滑落的盘子的基准。7 个模型测下来约三分之一突发危险处置错误,而且错误不随模型规模缩小——这条结论对「等下一代模型就好了」是直接的否定。

本篇目录4 节 · 11 分钟
一分钟速览
  1. 测的是什么:ReactHuman 让被测的多模态大模型充当仿真人形机器人的决策大脑,面对突发家庭危险(盘子滑落、刀掉落、衣柜倾倒)当场反应,覆盖 17 类事件族1000 多个可逐位复现的场景。
  2. 怎么保证答案对:真值来自 240 Hz 刚体仿真,无需人工标注;还专门放了外观与物理属性冲突的对抗物体——泡沫做的砧板、钢做的苹果
  3. 结果7 个代表性 MLLM,大约每三个危险就有一个处置错误
  4. 最扎心的一条:这些失败没有一个随模型规模增大而减少
  5. 判断:这份基准真正的贡献不是「三分之一」这个比例,而是它证明了安全问题不能用「等下一代模型」来回答——失败是结构性的(按固定倾向行动、信外观不信运动、拦截点差到米级),不是能力不足。
数据来源与边界
本文事实以 arXiv:2609.10895(2026 年 9 月 9 日 22:56 UTC 提交 v1,作者 Yizhan Li 等 8 人,单位含 Université de Montréal、Mila – Quebec AI Institute、McGill University、McMaster University、Meta Platforms)的摘要与正文 HTML 版为一手依据;17 类事件族、1000+ 场景、240 Hz 刚体仿真、7 个被测 MLLM、约 1/3 处置错误、错误不随规模缩小等数字均出自该文。数据集已发布在 Hugging Face(huggingface.co/datasets/Alan123/reacthuman-benchmark-scaled)。本文纳入本批的窗口内依据FutureX Physical AI Daily Issue 117(09/12)素材时间窗 2026-09-11 18:00 → 2026-09-12 09:00 内把该文列入 Research Progress 栏目,并给出中文口径的要点转述;英文侧另有 The Machine Press(09/12 前后)的独立摘要,与 arXiv 摘要一致,可互为交叉。论文为预印本,未经同行评审;「五指标三轴评分」的具体分值与各模型名称在本文可获取的摘要/HTML 段落中未逐项列出,故本文只转述总量结论,不列分模型排名。所有评价与推论为作者判断,已标注。
本文事实信息来自上方标注的公开来源;解读、判断与延伸部分为作者个人见解,写作过程使用了 AI 工具辅助整理,已由作者人工核实,不代表信息来源方立场。如有雷同纯属巧合;如涉及版权或权益问题,请联系 shenjibailian@shenjibailian.com,我们将在核实后及时删除或更正。
1它在测一件没人测过的事

不是问答,是「现在,接住它」

现有的物理推理基准,大多是**被动**的:给你一段视频,问你「接下来会发生什么」,或者判断两个场景哪个更合理。 embodied AI 的基准则偏**长程慢思考**:导航、重排、收拾房间。这两类都不测一件事——**模型能不能把物理理解,在几百毫秒内变成一次安全的动作**。

ReactHuman 测的就是这件事。它的设定很直接:把被测的 MLLM 放进一个仿真人形机器人的决策回路里,让它面对突然发生的家庭危险——盘子从台面滑落、刀从架子上掉下来、衣柜朝人倒过来——然后**当场**做出反应决策。

它的评估协议叫 **freeze-and-predict**:完整物理仿真一路跑到**关键决策时刻**然后冻结,把此刻的观测交给模型;模型给出计划后,**仿真继续执行这个计划**,让决策产生可见的物理后果。

这一点是整篇工作里最重要的设计。大多数基准里,模型答错了就答错了;在这里,模型说「我去接点 A」,仿真就真的把手伸向 A 点,然后根据物体真实轨迹判定接没接住。

事件族
17 类
可复现场景
1000+
仿真频率
240 Hz
被测 MLLM
7 个
错误率(约)
1/3
ReactHuman 基准规模与总体结果;数据来源 arXiv:2609.10895 摘要与正文
2真值从哪来

泡沫砧板与钢苹果

这类基准最难的不是搭建,是**怎么判定对错**。ReactHuman 的做法是:真值直接来自 **240 Hz 刚体仿真**,不需要人工标注。场景可以**逐位(bit-for-bit)复现**——同一场景在任何机器上跑出来的物理轨迹完全一致。

更狠的是它放了**对抗性物体**:**外观与物理属性相冲突**的东西。论文举的两个例子是**泡沫做的砧板**和**钢做的苹果**。

这两个道具的设计意图很清楚:如果一个模型是靠「砧板 = 硬 = 重 = 砸下来会伤人」这种外观先验做判断,那它在泡沫砧板面前就会系统性出错。它测的正是模型是**在看运动**还是在**看图片**。

评分不是单一成功率。作者设计了**五指标套件**,从三个轴打分:**reasonable**(合理,是不是一个正常人会选择并能为之辩护的动作)、**safe**(安全,是否避免造成伤害)、**physically grounded**(物理上站得住,手是否真的及时到达了物体位置)。

这个三轴拆法值得国内做评测的团队直接抄。因为一个模型可以**选对动作但抓空半米**——在只有成功率的基准里,这跟完全没反应是一样的;在三轴评分里,它能被精确定位成「决策对了,物理预测错了」。

传统物理推理基准被动问答

给视频 → 问「接下来会怎样」→ 选 A/B。测的是判断,不是动作;答错没有物理后果。

ReactHumanfreeze-and-predict

仿真跑到关键时刻冻结 → 模型出计划 → 仿真真的执行 → 按 240Hz 真值判定,分合理 / 安全 / 物理三轴打分。

协议对比依据 arXiv:2609.10895 正文;「答错没有物理后果」为本文对两类基准差异的概括表述。
3结果

三个失败模式,和一个否定

**7 个代表性 MLLM** 测下来,结论一句话:**反应式安全远未解决**——大约**每三个危险就有一个被处置错**。

作者把失败拆成了三个模式:

**其一,按固定倾向行动,而不是按眼前场景行动。** 模型表现出一种「性格」——不管现场是什么情况,它倾向于重复同一类反应。这在工程上的含义是:这不是知识缺失,是策略僵化。

**其二,信外观不信运动。** 面对泡沫砧板与钢苹果这类对抗物体时,模型倾向于依据物体的**看起来像什么**而不是**正在怎么动**来判断危险等级。

**其三,动作选对了,拦截点差到米级。** 论文原文的表述是「miss interception points at meter scale even when the chosen action is correct」——即使动作选择正确,手伸到的位置与物体实际会经过的位置可以差出**米**的量级。

然后是最关键的一句:**none of these failures shrink with model scale**——**这些失败没有一个随模型规模增大而减少**。

判断:这条结论的杀伤力大于「三分之一」。行业里对安全问题的默认回答一直是「等下一代模型」——参数更大、数据更多、推理更强,安全自然跟上。ReactHuman 说的是:至少在突发物理危险这个子类上,规模不解决问题。如果这条能被后续工作复现,那么「把大模型直接当家庭机器人的决策核心」这条路径,就需要一层**不随模型升级而消失**的独立安全兜底——而不是靠模型迭代把它抹掉。

4边界与用法

它不能证明什么,和它能用来做什么

先把边界说清楚,否则这份基准会被误读。

第一,**这是仿真,不是真机**。所有结论都建立在 240 Hz 刚体仿真的物理一致性上。作者自己在摘要里也留了这句话的等价表述:决策在仿真器内部产生后果,**但该基准不替代真实家庭机器人测试**。真机上的接触力学、柔性物体、传感器噪声,都不在这份评估范围内。

第二,**这是预印本**,2026 年 9 月 9 日提交,未经同行评审。分模型的具体分值与排名,在本文可获取的摘要与 HTML 段落中未逐项列出,所以本文只转述总量结论,不编造排名。

第三,**17 类事件族不等于 17 种真实危险**。家庭里的突发危险种类远超 17 类,而且真实场景的危险往往是连锁的(绊倒 → 撞到 → 掉落)。

但它的可用性是明确的。作者把基准定位成两样东西:一个**细粒度诊断工具**,和一个**可扩展的训练信号**。数据集已上架 Hugging Face。对做家庭机器人或具身安全兜底的团队,这份数据的用法不是「跑个分」,而是**把三个失败模式分别做成测试用例**:固定倾向测试(同一模型在不同场景是否给出同质反应)、外观对抗测试(泡沫砧板类道具)、拦截精度测试(动作对但位置差多少米)。

判断:对做真实场景交付的团队,这份基准可以直接改造成**交付前的验收清单**。现在行业里对「机器人安不安全」的验收基本停留在急停按钮 + 碰撞检测这类被动保护;ReactHuman 指出的是另一层——**主动反应式安全**,即机器人面对突发状况时的**主动**决策质量。这一层目前没有任何公开验收标准。谁先把这三层(被动保护 / 主动反应 / 处置精度)写成可执行的测试用例,谁在政企招标的技术规格书里就多一张牌。

来源:arXiv:2609.10895《ReactHuman: A Physics-Grounded Benchmark for Human-Like Reactive Decision-Making in Embodied Multimodal LLMs》(2026-09-09 提交)https://arxiv.org/abs/2609.10895 ;HTML 版 https://arxiv.org/html/2609.10895v1 ;数据集 https://huggingface.co/datasets/Alan123/reacthuman-benchmark-scaled ;FutureX Physical AI Daily Issue 117(09/12)https://dev.to/future_x/futurex-physical-ai-daily-issue-117-0912-31g5