研究解读 · 神机百见-具身解读

9B 参数、9 项基准 8 项第一:紫东太初把「空间理解」做成了具身智能的开源底座

约 90 亿参数的 ZDTaichu5.0-9B 在九大空间理解基准里拿了 8 项同参数组第一。但真正值得看的是分数分布:三维推演 78.27,跨视角 62.5,具身交互只有 48 和 56——从「看懂空间」到「在空间里行动」,差距被这几个数字量化了。

本篇目录6 节 · 11 分钟
一分钟速览
  1. 开源了什么:2026 年 9 月 15 日,紫东太初(武汉人工智能研究院体系)开源面向物理世界的通用多模态大模型 ZDTaichu5.0-9B,参数量约 9B(约 90 亿),支持单图、多图、长序列视频与任意分辨率视觉输入。
  2. 基准成绩:九大国际空间理解基准中拿下 8 项同参数组第一,官方定位为「10B 参数内空间具身能力最强的通用多模态大模型」。
  3. 分数分布不均:MindCube-tiny 78.27(较 Qwen3.5-9B 高 20.67 个百分点)、ViewSpatial 62.5(Qwen3.5-9B 48.20)、MMSI-Bench 47.2(Qwen3.5-9B 38.7)、ERQA 48、RoboSpatial 56。
  4. 不止权重:开放整套数据生产管线,覆盖预训练、监督微调、高质量退火、GRPO 可验证奖励强化学习,含哈希—URL 双重去重、画质过滤、Recaption、三维能力标签体系等工艺。
  5. 判断:「10B 参数内最强」是个精心选择的限定词;真正的价值不是跑分,而是 9B 能装进端侧与机器人计算单元——这是部署约束下的最优解,不是能力上限的突破。
数据来源与边界
本文事实以紫东太初 / 武汉人工智能研究院 2026 年 9 月 15 日开源发布为主源,经湖北日报 2026-09-15 报道(https://news.hubeidaily.net/pc/c_5977379.html)、第一财经报道(东方财富网 2026-09-15 转载,finance.eastmoney.com/a/202609153874673433.html)与自媒体解读(今日头条 2026-09-16 06:53)转述。核心数字(9B 参数、8/9 项同参数组第一、MindCube-tiny 78.27、ViewSpatial 62.5、MMSI-Bench 47.2、3DSRBench 60.96、SparBench 51.82、ERQA 48、RoboSpatial 56,以及 AI2D 91.48、WeMath 75.9、MathVista Mini 84.5、OCRBench 85.5、IFEval 93.7、AIME2026 89.2、LiveCodeBench v6 73.4)均出自发布方口径,各转述源数字一致,但本文未独立复现评测,属单一信源(官方口径)。对比基线 Qwen3.5-9B、STEP3-VL-10B、gemma4-8B-E4B 的分数亦为发布方提供的横向评测结果。关于自适应循环推理与 GPT-6 Astra 的 Loop Transformer 路线对齐,发布方原文使用的措辞是「业界猜测」,本文据此不作技术路线确证。模型已在北京、佛山、青岛等地具身智能训练场落地(湖北日报口径),具体落地形式与合作深度未披露。素材时间窗为 2026-09-15 18:00 → 2026-09-16 09:00:模型开源与首批报道发生于 9 月 15 日(部分在窗口内、具体时刻未标注),窗口内新增量为 9 月 16 日 06:53 起的自媒体深度解读与二次传播,本稿按扩窗规则第 1 条收录。本站 09-15 曾写具脑磐石 Cog-WM 1.0(世界模型 SR 与 SPL 背离),本稿对象为多模态空间理解基座,非世界模型,无同事件重复。所有判断均已用「判断:」标注。
本文事实信息来自上方标注的公开来源;解读、判断与延伸部分为作者个人见解,写作过程使用了 AI 工具辅助整理,已由作者人工核实,不代表信息来源方立场。如有雷同纯属巧合;如涉及版权或权益问题,请联系 shenjibailian@shenjibailian.com,我们将在核实后及时删除或更正。
定位

一个 9B 的模型,为什么值得单独看

2026 年 9 月 15 日,紫东太初开源了 ZDTaichu5.0-9B。参数量约 9B(约 90 亿),支持单图、多图、长序列视频与任意分辨率视觉输入,聚焦真实物理场景下的空间感知、跨视角变换与具身任务规划。

先看参数量这个选择。9B 在多模态模型里属于小个子,但这个尺寸有一个明确对应的部署场景:它可以在端侧设备上跑,可以放进工业设备或机器人的计算单元,而不必挂在云端。对做机器人的团队来说,这不是一个「性能差点但便宜」的妥协选项,而是三个硬约束共同决定的结果——延迟、成本、数据隐私。产线上的图像不能上公网,实时控制不能容忍云端往返,这两条直接把大模型方案挡在门外。

云端大模型的约束

推理往返延迟不可控,产线图像出网涉及合规,按调用量计费在高频场景下成本难预测。适合低频、非实时的高层规划,不适合闭环控制。

9B 端侧部署的可能

可装进机器人计算单元或工控机,延迟可控、数据不出厂、成本为一次性硬件投入。代价是能力上限低于大参数模型,需要靠专项训练补。

「任意分辨率视觉输入」这一条也值得单独拎出来。工业现场的相机、无人机、监控视频分辨率千差万别,模型如果只接受固定尺寸输入,落地时就要额外做一整套预处理。支持任意分辨率,等于把这段适配工作从工程侧挪进了模型侧。

判断:官方口径里的「10B 参数内空间具身能力最强」是一个精心选择的限定词——它同时承认了「放到更大参数量级就不成立」。判断:这类限定的价值在于诚实,也在于提醒读者:这个模型的定位不是能力竞赛的冠军,而是**部署约束下的最优解**。评价它该用的尺子是「在这个算力预算下能不能用」,不是「有没有超过最强的闭源模型」。
分数

8 项第一,但分数分布比「第一」更有信息量

九大国际空间理解基准中,ZDTaichu5.0-9B 拿下 8 项同参数组第一。但把这九个分数排在一起看,分布本身透露的信息比「8 项第一」这个结论多得多。

MindCube-tiny(复杂三维推演)
78.27
3DSRBench(空间感知)
60.96
ViewSpatial(跨视角)
62.5
RoboSpatial(具身交互)
56
SparBench(空间感知)
51.82
MMSI-Bench
47.2
ERQA(具身推理)
48
九大空间理解基准得分(发布方口径,未独立复现)。蓝色系为空间感知/推理类,红橙为具身交互类。

分布呈现出一个清晰的梯度:三维几何推演类最高(78.27),空间感知类居中(60.96、51.82),跨视角与多图推理偏低(62.5、47.2),而直接面向机器人交互的两项最低(RoboSpatial 56、ERQA 48)。

这个梯度不是随机的。三维几何推演本质上是「看一张或几张图,回答一个几何问题」,输入输出都是静态的;而具身交互类基准要求模型判断「哪里可以放东西、这个操作的前置条件是什么」,输出要能直接用于机器人动作——后者离真实执行更近,难度也更高。

判断:从 78.27 到 48,这条下降曲线就是「看懂空间」到「能在空间里行动」之间那道 gap 的量化形态。判断:机器人需要的恰恰是分数最低的那两项能力——判断可放置区域、识别操作前置条件。这说明当前空间理解模型的提升主要发生在感知与推理层,尚未充分传导到行动层。判断:对做机器人应用的团队,看 ERQA 和 RoboSpatial 这两项比看总分更能预测实际表现。
对照

跨视角 62.5 分,意味着什么

ViewSpatial 这个基准测的是跨视角空间一致性——机器人移动位置、或者摄像头机位变化之后,还能不能正确判断物体之间的相对方位。这一项 ZDTaichu5.0-9B 得 62.5,对比 Qwen3.5-9B 的 48.20 和 STEP3-VL-10B 的 46.14,提升幅度约 14 到 16 个百分点,是同参数组里的明显领先。

但 62.5 分绝对水位仍然不高,意味着在跨视角方位判断上,约有接近四成的题目会判错。而这个能力恰恰是移动机器人的核心痛点:机器人走两步之后,如果丢失了空间拓扑,之前建立的任务状态就全部失效。

基准ZDTaichu5.0-9BQwen3.5-9BSTEP3-VL-10B差值(对最强基线)
MindCube-tiny78.2757.6062.81+15.46
ViewSpatial62.548.2046.14+14.30
MMSI-Bench47.238.7032.18+8.50
3DSRBench60.9656.78未披露+4.18
SparBench51.8250.7945.68+1.03
表:与同参数量级开源模型的横向对比(发布方提供的评测结果,本文未独立复现)。Qwen3.5-9B 在 MindCube-tiny 与 3DSRBench 的数值为按发布方给出的差值反推,原文未直接列出绝对值。

再看 SparBench:51.82 对 50.79,只差 1.03 个百分点。这说明在部分空间感知子项上,同参数量级模型之间的差距已经很小——8 项第一里有几项是「险胜」,而不是断层领先。发布方自己也做了区分,明确用「断层领先」描述的只有 MindCube-tiny。

判断:「9 项 8 项第一」和「断层领先」是两个不同的说法,读的时候要分开。判断:从差值看,MindCube-tiny(+15.46)和 ViewSpatial(+14.30)是真正的领先项,SparBench(+1.03)和 3DSRBench(+4.18)更接近并列。判断:把八项第一平铺成一句宣传语,会掩盖「哪些能力真的领先、哪些只是打平」这个关键区分。
工艺

比权重更值钱的,是那套数据生产管线

这次发布里,工程价值最高的一项可能不是模型权重,而是开放的数据生产管线。按发布方描述,这套管线覆盖预训练、监督微调、高质量退火、GRPO 可验证奖励强化学习四个环节,并开放数据接入、哈希—URL 双重去重、画质过滤、Recaption 重描述、样本打包、三维能力标签体系、定向筛选、思维链合成、一致性校验等全部工艺。

为什么这条比权重重要?因为行业当前的真实痛点不是「没有开源模型」,而是「拿到权重不知道怎么用自己的数据继续训」。绝大多数开源模型只释放权重,不释放数据处理工艺,导致企业和研究机构要么从头摸索数据配方,要么直接用公开数据集——后者的结果就是各家模型能力趋同。

预训练
开源图文 / 结构化文档 / 多视角视频 / 仿真三维场景
监督微调
任务轨迹样本 · 具身样本强制一致性校验
高质量退火
能力域—难度—质量三维标签 · 长推理样本
GRPO 强化学习
答案正确性 / 空间框选命中 / 格式合规三类可校验奖励

设计上有一处值得注意:GRPO 阶段设置了「空间框选坐标命中奖励」,把空间点位输出这类难以用语言描述的任务,转成了可自动校验的奖励信号。这是把空间能力变成可优化目标的工程化做法——对比之下,很多多模态模型在空间任务上只能用「答案对不对」这种粗粒度奖励,学习信号稀疏。

判断:开放数据工艺这件事的商业含义是:发布方让出的是方法论,留住的是工程经验。判断:外部团队即便拿到完整管线,也要用自有数据跑一遍才能复现效果,而这一遍的成本(算力、时间、试错)正是发布方已经支付过的。判断:对做垂直场景的团队,务实的用法不是照抄配方,而是借用「三维能力标签体系 + 可校验奖励」这套框架,把自有数据标定成可训练的目标。
架构

自适应循环推理:一个需要打折看的对标

ZDTaichu5.0-9B 内置了自适应循环推理机制:标准前向得到 Token 输出分布与隐层状态后,通过熵门控计算预测不确定性;确定性 Token 直接输出,遇到空间变换、物体关系判别、操作条件校验等高不确定性节点时,模型在内部循环执行层块计算,迭代优化隐层表征,不调用外部工具。配套三重稳定化设计:阻尼更新、双重停止判据(同时监测 KL 散度与隐状态残差)、轨迹读出与状态回滚。

发布方指出,这一架构与「业界猜测」OpenAI GPT-6 Astra 所采用的 Loop Transformer 具备高度一致的技术前瞻性,均选择将复杂推理过程收敛至模型潜空间内部完成迭代优化。同时发布方也明确说明二者在具体技术实现细节上存在差异。

判断:这个对标必须打折看——发布方自己用的措辞是「业界猜测」,也就是说 GPT-6 Astra 的架构并未公开确认。判断:把未公开的竞品架构当作自己技术路线的背书,是常见的叙事手法,但不应作为技术判断的依据。判断:真正可以评价的是这套机制的设计本身——「不确定性高的地方多算几轮」这个思路在推理成本可控的前提下是合理的,代价是推理时延变得不均匀,对实时控制场景需要额外设计超时兜底。

还有一个边界要说清楚:自适应循环推理解决的是长程任务链条中「单步内部感知推理质量」的提升,完整复杂长程具身任务依然依靠外部任务循环——接收环境新观测、更新全局任务状态。内部循环与外部任务循环是两层架构,后者不在模型能力范围内,需要上层系统实现。

判断:把「内部循环」讲成能解决长程任务是一种常见的误解。判断:模型维护的是当前步的表征质量,任务状态的跨步维护(刀具身份延续、抽屉是否已打开、物体是否已放入)需要外部系统显式管理。判断:对工程落地来说,这意味着即便模型能力再强,上层任务管理框架仍是必选项——这一层不会因为换了个更强的模型而消失。
落地

两类已验证场景,和一个未验证的问题

按湖北日报报道,该模型已在北京、佛山、青岛等多地具身智能训练场落地;发布方披露已完成两类端到端场景验证。科研方向:打通仿真数值计算与湿实验实体操作闭环,完成试管按序入架、滴管液体转移等任务。智能制造方向:可根据工单规划跨工位配送、机台上料等任务,也能直接输出设备控制指令。

一个具体的例子能说明模型在工程上的价值:试管按序入架任务要求先放初始画面右侧试管、再放左侧,而抓取和交接会改变物体在画面中的坐标。模型需要持续维护两支试管的实例身份记忆,并在观测到「一支在架内、一支在桌面」时判断任务尚未完成。这类「多样品操作下物体身份不丢失」的能力,是传统视觉方案最容易出错的地方。

科研自动化
仿真计算到湿实验闭环:试管按序入架、滴管液体转移,核心是实例身份持久跟踪
智能制造
工单文本到车间现场:跨工位配送、机台上料,核心是遮挡与相似件判别
未披露
长程任务的端到端成功率、连续运行时长、真实产线节拍下的表现

未披露的部分恰恰是最关键的。所有已验证场景都是「演示级闭环」——展示了模型能完成任务的完整链路,但没有给出成功率、节拍、连续运行时长这类工程指标。ERQA 48 和 RoboSpatial 56 这两个分数也从侧面说明,具身交互层仍有明显提升空间。

判断:对观望的团队,最务实的做法是把它当「高层规划大脑」而不是「端到端控制器」——发布方自己的定位也是如此:模型负责理解语义、识别环境、维护对象身份、拆解操作步骤,底层运动控制与设备安全逻辑由机器人或自动化硬件控制系统负责。判断:这个分工是对的,也说明当前阶段的空间理解模型离「接管机器人」还很远;把它放在规划层,是当前能力边界内的正确用法。
信源:紫东太初 / 武汉人工智能研究院 2026-09-15 开源发布,湖北日报 2026-09-15(news.hubeidaily.net/pc/c_5977379.html)、第一财经(东方财富网 2026-09-15 转载,finance.eastmoney.com/a/202609153874673433.html)、自媒体解读 2026-09-16 06:53。全部基准分数出自发布方口径,本文未独立复现评测,属单一信源。GPT-6 Astra 架构对标为发布方所称「业界猜测」,未获确认。长程任务成功率、连续运行时长等工程指标未披露。素材时间窗 2026-09-15 18:00 → 2026-09-16 09:00,按扩窗规则第 1 条收录,窗口内新增量为 9 月 16 日 06:53 起的深度解读与二次传播。核查时间 2026-09-16。