研究解读 · 神机百见-具身解读

28 项基准拿下开源第一的 PhysBrain 1.5:那 0.8 分的差距,测的到底是不是动手能力

深度机智 PhysBrain 1.5 的 8B 版在 28 项具身基准上拿 72.5 分,与 GPT-6 Astra 只差 0.8 分。但把 28 个基准名字逐个摊开会发现:它们测的都是「看图答题」的空间理解与规划,没有一项是真机操作成功率。这不是泼冷水,是搞清楚这个分数能兑换什么。

一分钟速览
  1. 成绩:9 月 9 日发布的 PhysBrain 1.5,8B 版在 28 项具身空间智能与规划公开基准上取得 72.5 综合均分,其中 14 项开源最佳、10 项开源第二;3 天下载量超 3000
  2. 闭源对照:同表 GPT-6 Astra 73.3、Gemini 3.6 Flash 73.0——差距收窄到 1 分以内;最强开源对手 Hy-Embodied-VLM-1.0(30A3B)为 66.0,落后 6.5 分
  3. 小版本更值得看:2B 版拿 66.6 分(官方规则不参与排名),数值上仍高于所有其他非 PhysBrain 开源参评模型——参数砍到四分之一,只掉 5.9 分
  4. 动作维度的证据:团队内部实验称动作预测能力从 24% 提升至 54%;Human-as-Humanoid 原始示范吞吐量达遥操作的 4.8—7.2 倍
  5. 判断:这 28 张卷子考的是「看懂物理世界」,不是「在物理世界里动手」——把 BLINK、CV-Bench、MMSI-Bench 这类基准的高分,直接读成操作能力强,是这轮叙事里最大的一次口径滑移。
数据来源与边界
本文事实以量子位与中关村科学城 2026-09-09 的报道(含完整 28 项基准分项表)、深度机智官方技术说明为基底,交叉FutureX Physical AI Daily Issue 119(09/14 期) 的英文复核条目与 AI Market Watch 的公司档案页。素材时间窗为 2026-09-13 18:00 → 2026-09-14 09:00:模型于 09-09 发布,早于本窗口;本窗口内可定位的新增量是 FutureX 09/14 期明确标注该组基准为 vendor-reported(厂商自报),以及 AI Market Watch 给出的第三方公司档案(成立于 2025 年、累计融资约 5000 万美元)。核查方式与不确定边界:① 72.5 分及各分项分数全部来自项目方自测与自报,未见第三方独立复现,FutureX 与 AI Market Watch 均就此给出明确警示;② 榜单中 GPT-6 Astra、Gemini 3.6 Flash 分数系项目方引用对比,非同一评测运行下的结果,评分设置(low think / minimal think)由项目方标注;③ 2B 版 66.6 分按官方评测规则不参与开源排名,本文的数值比较仅作参考;④ 「动作预测 24% → 54%」「示范吞吐量 4.8—7.2 倍」均为团队内部实验口径,未公开评测协议、样本量与失败定义;⑤ 公司成立时间与累计融资额来自第三方数据库,未经公司方面确认;⑥ 本文对 28 个基准属性的归类,依据的是基准名称与其公开定义的常识性判断,未逐项查阅原始论文。所有判断均以「判断:」标注。
本文事实信息来自上方标注的公开来源;解读、判断与延伸部分为作者个人见解,写作过程使用了 AI 工具辅助整理,已由作者人工核实,不代表信息来源方立场。如有雷同纯属巧合;如涉及版权或权益问题,请联系 shenjibailian@shenjibailian.com,我们将在核实后及时删除或更正。
1先把这张榜单原样摆出来

9 月 9 日,北京海淀的深度机智(DeepCybo)发布物理基座模型 PhysBrain 1.5,同时开源技术报告、2B 与 8B 两档权重,以及一套评测工具包。核心成绩一句话:8B 版在 28 项具身空间智能与规划基准上拿到 72.5 的综合均分,居参评开源模型首位。

GPT-6 Astra(闭源)
73.3
Gemini 3.6 Flash(闭源)
73.0
PhysBrain 1.5 · 8B
72.5
Claude Opus 5(闭源)
67.9
PhysBrain 1.5 · 2B
66.6
Hy-Embodied-VLM-1.0(30A3B)
66.0
Embodied-R1.5(8B)
64.9
RynnBrain 1.1(9B)
63.1
28 项具身空间智能与规划基准综合均分。深蓝为 PhysBrain 1.5,灰为闭源模型,蓝灰为其他开源参评模型。全部数值为项目方自报,未获第三方独立复现。

有两个数字值得单独说。第一个是 0.8 分——72.5 与闭源最强的 GPT-6 Astra(73.3)之间的差距。放在两年前,开源具身模型与闭源前沿之间还是两位数的分差,现在被压到 1 分以内。

第二个是 2B 版的 66.6 分。按官方评测规则,2B 版本仅作参考、不参与开源排名。但只比数值的话,它已经超过表中所有其他非 PhysBrain 的开源参评模型,包括 30A3B 的 Hy-Embodied-VLM-1.0(66.0)、8B 的 Embodied-R1.5(64.9)和 9B 的 RynnBrain 1.1(63.1)。参数从 8B 砍到 2B,只掉 5.9 分,却仍站在所有对手之上——这说明 2B 版不是 8B 的「展示性缩小版」,而是同一技术路线同时覆盖了性能上限和轻量部署两个方向。对开发者而言,后者的意义可能更大:一个能在边缘设备上跑起来的具身理解底座,比一个只能放在服务器上的榜单冠军有用得多。

2把这 28 张卷子逐个翻一遍

现在做一件很少有人做的事:把这 28 个基准的名字摊开看,它们到底在考什么。

能力维度代表性基准它实际在考什么
基础视空感知BLINK、CV-Bench、3DSRBench看图判断深度、尺寸、空间关系
空间与多视角理解EmbSpatial-Bench、MindCube、MMSI-Bench、VSI-Bench跨视角推理、空间想象、多图一致性
具身认知与规划EgoPlan-Bench2、ERQA、RoboVQA、VLABench给定第一视角画面,回答「下一步该做什么」
空间指向与可供性Part-Affordance、RoboAfford、Where2Place、RoboRefit指出「哪里可以抓、放在哪」
视觉轨迹推理ShareRobot-Traj、VABench-V-Trace根据画面判断轨迹是否合理
表:PhysBrain 1.5 评测覆盖的五类能力与代表性基准。归类与释义为本文依据基准公开定义的整理,供读者判断分数含义,非项目方原始分类表述。

看出来了吗?这 28 项全部是「给模型看一张图或一段视频,让它输出一个答案」的评测——输出的是坐标、选项、轨迹描述或语言回答,不是发给电机的控制指令。BLINK 考相对深度判断,MMSI-Bench 考多图空间一致性,RoboVQA 考视频问答,Part-Affordance 考「这个物体的哪个部位可以操作」。

这些能力重要吗?极其重要。一个连「杯子把手在哪里可以抓」都判断不对的模型,不可能完成任何操作任务。Part-Affordance 84.0 分、RoboRefit 89.8 分,说明的是模型对物理世界的理解水位确实上来了。

判断:但「理解哪里可以抓」和「真的抓起来了」是两件事,中间隔着整个运动控制与接触力学的鸿沟。把 28 项 VQA 类基准的均分,读成机器人操作能力的排名,是这轮叙事里最大的一次口径滑移。这不是深度机智一家的问题——整张榜单都是这么设计的,行业目前也确实没有更好的公开标尺。
3反过来看闭源模型:那次机械臂实验的两个数字

要理解「理解」与「操作」的落差有多大,可以借一个第三方的对照实验。Robocurve 把 GPT-6 Astra 直接部署到真实机械臂上,做了两类任务:

积木放入碗 · 20 次

GPT-6 Astra 成功 19 次,成功率 95%;对照组 Claude Fable 5.1 完成 8 次

模型读取摄像头画面与机器人自身状态,输出末端位姿与夹爪指令,并靠实时视觉反馈迭代调整。

拼图块对位插入凹槽

同一套测试,GPT-6 Astra 成功率从 95% 掉到 10%

毫米级精细装配任务,需要精确的接触判断与力反馈,通用理解能力在这里几乎帮不上忙。

这组对照把问题说得非常清楚:通用多模态理解可以跨越「看懂」到「粗动作」的鸿沟,却在「精细接触、精准插入」面前止步。而 PhysBrain 1.5 的 72.5 分,测的是前一半能力;后一半能力,在这张榜单里没有对应的格子。

那么深度机智在「动作」这一侧到底有什么公开证据?有两条,都需要标注口径:

其一是动作预测能力从 24% 提升至 54%——这是团队内部实验的数字,未公开评测协议、样本量与失败定义。其二是 Human-as-Humanoid 研究:把同步采集的第一视角与外部视角人类视频,转化为适配 Prime U(60 自由度拟人本体)的动作训练数据,原始示范吞吐量达到遥操作的 4.8—7.2 倍,部分任务无需目标机器人本体示范即可实现零样本迁移。

第二条比第一条更有分量,因为它解决的是具身智能最贵的一环:数据从哪来。如果人类视频能以 4.8—7.2 倍于遥操作的效率转成训练数据,那么「逐条采集机器人示范」这条最烧钱的路径就有可能被绕开。当然,这个倍数同样出自团队自己的测算。
4该把这个 72.5 分放在什么位置

把上面几层叠起来,可以得到一个相对公平的读法。

站得住的部分:在「空间理解与可供性判断」这个明确的能力切面上,一个 8B 的开源模型确实追到了闭源前沿 1 分以内,而且 2B 版本仍高于所有其他开源参评模型。技术报告、两档权重、评测工具包全部开放,社区可以自行复现——这一点本身就比多数只发公关稿的发布要扎实。

需要打折的部分:全部分数为厂商自报,FutureX 与 AI Market Watch 都明确给了 vendor-reported / company-reported 的标注,未见第三方独立复现;闭源对照分数是项目方引用的对比值,不是同一评测运行下的结果;而「动作预测 24% → 54%」这条唯一的动作侧指标,是未公开协议的内部实验。

判断:PhysBrain 1.5 真正的位置,是把开源具身模型的「理解层」水位推到了与闭源前沿持平,同时用 2B 版本证明了这条路线可以下沉到边缘部署。但它还没有回答那个更难的问题——理解到位之后,手能不能跟上。行业缺的恰恰是后者对应的公开标尺:一份像这 28 项基准一样,能让所有人对着同一套协议报真机操作成功率的榜单。

顺带记一笔公司侧的信息:第三方数据库 AI Market Watch 的档案显示,深度机智成立于 2025 年、累计融资约 5000 万美元。这与公开材料中「2025 年 10 月 10 日发布《源于人,超越人》发展战略」的时间线大致对得上,但成立时间与融资额均来自第三方数据库,未经公司方面确认。一家成立不到两年的公司,把 28 项基准的开源第一和两档权重一起放出来,节奏本身是值得观察的样本。

来源:量子位 / 中关村科学城 2026-09-09 PhysBrain 1.5 发布报道及 28 项基准分项表;FutureX Physical AI Daily Issue 119(09/14 期,标注 vendor-reported);AI Market Watch 公司档案;Hugging Face collections/DeepCybo/physbrain-15。素材时间窗:2026-09-13 18:00 → 2026-09-14 09:00。