让 7 个多模态大模型当人形机器人的大脑:每三个突发危险,就有一个判错
一份把 MLLM 放进 240Hz 刚体仿真、让它真的去接滑落的盘子的基准。7 个模型测下来约三分之一突发危险处置错误,而且错误不随模型规模缩小——这条结论对「等下一代模型就好了」是直接的否定。
- 测的是什么:ReactHuman 让被测的多模态大模型充当仿真人形机器人的决策大脑,面对突发家庭危险(盘子滑落、刀掉落、衣柜倾倒)当场反应,覆盖 17 类事件族、1000 多个可逐位复现的场景。
- 怎么保证答案对:真值来自 240 Hz 刚体仿真,无需人工标注;还专门放了外观与物理属性冲突的对抗物体——泡沫做的砧板、钢做的苹果。
- 结果:7 个代表性 MLLM,大约每三个危险就有一个处置错误。
- 最扎心的一条:这些失败没有一个随模型规模增大而减少。
- 判断:这份基准真正的贡献不是「三分之一」这个比例,而是它证明了安全问题不能用「等下一代模型」来回答——失败是结构性的(按固定倾向行动、信外观不信运动、拦截点差到米级),不是能力不足。
huggingface.co/datasets/Alan123/reacthuman-benchmark-scaled)。本文纳入本批的窗口内依据:FutureX Physical AI Daily Issue 117(09/12)在素材时间窗 2026-09-11 18:00 → 2026-09-12 09:00 内把该文列入 Research Progress 栏目,并给出中文口径的要点转述;英文侧另有 The Machine Press(09/12 前后)的独立摘要,与 arXiv 摘要一致,可互为交叉。论文为预印本,未经同行评审;「五指标三轴评分」的具体分值与各模型名称在本文可获取的摘要/HTML 段落中未逐项列出,故本文只转述总量结论,不列分模型排名。所有评价与推论为作者判断,已标注。不是问答,是「现在,接住它」
现有的物理推理基准,大多是**被动**的:给你一段视频,问你「接下来会发生什么」,或者判断两个场景哪个更合理。 embodied AI 的基准则偏**长程慢思考**:导航、重排、收拾房间。这两类都不测一件事——**模型能不能把物理理解,在几百毫秒内变成一次安全的动作**。
ReactHuman 测的就是这件事。它的设定很直接:把被测的 MLLM 放进一个仿真人形机器人的决策回路里,让它面对突然发生的家庭危险——盘子从台面滑落、刀从架子上掉下来、衣柜朝人倒过来——然后**当场**做出反应决策。
它的评估协议叫 **freeze-and-predict**:完整物理仿真一路跑到**关键决策时刻**然后冻结,把此刻的观测交给模型;模型给出计划后,**仿真继续执行这个计划**,让决策产生可见的物理后果。
这一点是整篇工作里最重要的设计。大多数基准里,模型答错了就答错了;在这里,模型说「我去接点 A」,仿真就真的把手伸向 A 点,然后根据物体真实轨迹判定接没接住。
泡沫砧板与钢苹果
这类基准最难的不是搭建,是**怎么判定对错**。ReactHuman 的做法是:真值直接来自 **240 Hz 刚体仿真**,不需要人工标注。场景可以**逐位(bit-for-bit)复现**——同一场景在任何机器上跑出来的物理轨迹完全一致。
更狠的是它放了**对抗性物体**:**外观与物理属性相冲突**的东西。论文举的两个例子是**泡沫做的砧板**和**钢做的苹果**。
这两个道具的设计意图很清楚:如果一个模型是靠「砧板 = 硬 = 重 = 砸下来会伤人」这种外观先验做判断,那它在泡沫砧板面前就会系统性出错。它测的正是模型是**在看运动**还是在**看图片**。
评分不是单一成功率。作者设计了**五指标套件**,从三个轴打分:**reasonable**(合理,是不是一个正常人会选择并能为之辩护的动作)、**safe**(安全,是否避免造成伤害)、**physically grounded**(物理上站得住,手是否真的及时到达了物体位置)。
这个三轴拆法值得国内做评测的团队直接抄。因为一个模型可以**选对动作但抓空半米**——在只有成功率的基准里,这跟完全没反应是一样的;在三轴评分里,它能被精确定位成「决策对了,物理预测错了」。
给视频 → 问「接下来会怎样」→ 选 A/B。测的是判断,不是动作;答错没有物理后果。
仿真跑到关键时刻冻结 → 模型出计划 → 仿真真的执行 → 按 240Hz 真值判定,分合理 / 安全 / 物理三轴打分。
三个失败模式,和一个否定
**7 个代表性 MLLM** 测下来,结论一句话:**反应式安全远未解决**——大约**每三个危险就有一个被处置错**。
作者把失败拆成了三个模式:
**其一,按固定倾向行动,而不是按眼前场景行动。** 模型表现出一种「性格」——不管现场是什么情况,它倾向于重复同一类反应。这在工程上的含义是:这不是知识缺失,是策略僵化。
**其二,信外观不信运动。** 面对泡沫砧板与钢苹果这类对抗物体时,模型倾向于依据物体的**看起来像什么**而不是**正在怎么动**来判断危险等级。
**其三,动作选对了,拦截点差到米级。** 论文原文的表述是「miss interception points at meter scale even when the chosen action is correct」——即使动作选择正确,手伸到的位置与物体实际会经过的位置可以差出**米**的量级。
然后是最关键的一句:**none of these failures shrink with model scale**——**这些失败没有一个随模型规模增大而减少**。
它不能证明什么,和它能用来做什么
先把边界说清楚,否则这份基准会被误读。
第一,**这是仿真,不是真机**。所有结论都建立在 240 Hz 刚体仿真的物理一致性上。作者自己在摘要里也留了这句话的等价表述:决策在仿真器内部产生后果,**但该基准不替代真实家庭机器人测试**。真机上的接触力学、柔性物体、传感器噪声,都不在这份评估范围内。
第二,**这是预印本**,2026 年 9 月 9 日提交,未经同行评审。分模型的具体分值与排名,在本文可获取的摘要与 HTML 段落中未逐项列出,所以本文只转述总量结论,不编造排名。
第三,**17 类事件族不等于 17 种真实危险**。家庭里的突发危险种类远超 17 类,而且真实场景的危险往往是连锁的(绊倒 → 撞到 → 掉落)。
但它的可用性是明确的。作者把基准定位成两样东西:一个**细粒度诊断工具**,和一个**可扩展的训练信号**。数据集已上架 Hugging Face。对做家庭机器人或具身安全兜底的团队,这份数据的用法不是「跑个分」,而是**把三个失败模式分别做成测试用例**:固定倾向测试(同一模型在不同场景是否给出同质反应)、外观对抗测试(泡沫砧板类道具)、拦截精度测试(动作对但位置差多少米)。