工具教程 · 神机百见-具身解读

小米把具身世界模型训练框架开源了:4B 与 34B 两套权重,能干什么、不能干什么

9 月 10 日小米开源了具身世界模型训练框架与 4B/34B 两套权重,Apache 2.0 许可,覆盖场景生成、场景编辑、单图生成、图像编辑、视频生成与图文交错序列生成。这篇把它能接进哪些真实环节、以及三条不该碰的边界一次说清。

本篇目录4 节 · 10 分钟
一分钟速览
  1. 开源内容2026 年 9 月 10 日,小米技术宣布 Xiaomi-Robotics-U0 具身世界模型的训练框架与模型权重全面开源,同时提供配套的训练与推理框架
  2. 两套权重:提供 4B34B 两种规模;据 AGI Hunt 报道,该系列在 Hugging Face 上架,许可为 Apache 2.0,并包含 34B 的 any-to-any 版本(U0、U0-FlashAR)、4B 版本,以及用于建模连续交互的 Sequence 变体
  3. 六类能力:具身场景生成、具身场景编辑、单图生成、图像编辑、视频生成、图文交错序列生成。
  4. 定位:官方表述为"面向世界模型、具身智能和机器人应用研究",目标是"降低技术门槛,加速世界模型技术在真实机器人场景中的探索与落地"。
  5. 三条边界:它是生成模型不是策略模型,不输出可执行的机器人动作;生成的视频是像素级未来,不是运动学可行的轨迹;官方公告未公布评测基准与对比数字,无法与其他世界模型横向比较。
  6. 未获确认项:训练数据规模与构成、评测基准、具体仓库路径与依赖版本,截至发稿未见官方公布。
数据来源与边界
本文事实来自 @小米技术 2026 年 9 月 10 日的官方微博公告(原文附短链 t.cn/AX0gGnRV),经和讯科技、长桥证券(援引金石数据)、群益期货等多家财经媒体同日转述,口径完全一致,可交叉核对;许可类型(Apache 2.0)、上架平台(Hugging Face)与模型系列构成(34B any-to-any 的 U0 与 U0-FlashAR、4B 版本、Sequence 变体)来自 AGI Hunt 的英文报道,属二手转述,本文未直接核验 Hugging Face 页面;FutureX · Physical AI Daily Issue 116(09/11)的 Open Source 栏目亦收录此条。官方公告未公布训练数据规模、评测基准、具体仓库地址与依赖版本,本文在涉及这些内容时一律标注为未获确认,不作推测。本文第四节起的用法推演与选型建议为作者判断,已逐条标注。解读时间 2026-09-11。
本文事实信息来自上方标注的公开来源;解读、判断与延伸部分为作者个人见解,写作过程使用了 AI 工具辅助整理,已由作者人工核实,不代表信息来源方立场。如有雷同纯属巧合;如涉及版权或权益问题,请联系 shenjibailian@shenjibailian.com,我们将在核实后及时删除或更正。
1先确认开源了什么

框架 + 权重 + 两套尺寸

**2026 年 9 月 10 日**,小米技术发布公告:Xiaomi-Robotics-U0 具身世界模型的**训练框架与模型权重**已全面开源。

这条公告里能确认的四件事,逐条列清楚:

  • 权重规模:提供 **4B** 与 **34B** 两种规模的模型权重。
  • 配套代码:同时开源配套的**训练与推理框架**——这一点比只放权重重要,意味着可以基于自有数据继续训练,而不只是推理调用。
  • 能力范围:支持具身场景生成、具身场景编辑、单图生成、图像编辑、视频生成、图文交错序列生成,共六类任务。
  • 许可与平台:据 AGI Hunt 报道,模型在 Hugging Face 上架,许可为 **Apache 2.0**(二手转述,本文未直接核验页面)。Apache 2.0 是宽松许可,允许商用与修改,这对做产品集成的团队是关键前提。
具身场景生成
官方列首位
具身场景编辑
官方列第二
单图生成 / 图像编辑
通用图像能力
视频生成
时序预测基础
图文交错序列生成
连续交互建模
官方公告列出的六类支持任务,按公告中的表述顺序与性质分组;条形长度仅表示本文对"与具身任务相关度"的定性判断,非官方量化指标

官方对这次开源的定位表述是:面向世界模型、具身智能和机器人应用研究,"希望通过开放模型与代码,降低技术门槛,加速世界模型技术在真实机器人场景中的探索与落地"。

判断:"训练框架也开源"是这批开源里真正值钱的部分。只放权重,你能做的是调用;放了训练框架,你能做的是**把你自己的场景数据灌进去**。对有大量真实场景数据、但缺基础模型的团队(比如做工业质检、做特定作业流程的),可训练性比参数规模重要得多。
2四类能立刻接进去的用法

把六类能力映射成工程环节

以下映射为本文基于能力列表所作的推演,**不代表官方推荐用法**,标注为判断。之所以值得列,是因为"世界模型"这个词目前被视频生成、VLA、自动驾驶三类公司在同时使用,含义差别很大——先把它在机器人链路里落在哪一段说清楚,比讨论它强不强更重要。

官方能力可接入的工程环节输入 → 输出适用条件
具身场景生成训练场景批量扩充条件描述 / 参考图 → 新场景真机素材不足、需要扩充背景与光照多样性
具身场景编辑难例构造已有场景 + 修改指令 → 变体场景已有场景库,需要针对性生成遮挡、位姿偏移等难例
视频生成策略预演与演示首帧 + 指令 → 未来帧序列需要"看起来会怎样",而非精确物理仿真
图文交错序列生成长程任务分解演示图文交替输入 → 连续交互序列多步任务的过程表达与标注辅助
表注:表格右两列为本文推演判断,非官方内容。官方公告仅列出六类能力名称,未给出各能力的输入输出规格、分辨率与时长上限。
第 1 步 · 明确它在链路里的位置
数据侧,不是控制侧
世界模型产出的是"未来长什么样",不是"下一步该发什么指令"
第 2 步 · 先做数据扩充,别先做控制
用场景生成 / 编辑补训练集
这是风险最低、见效最快的一环,失败也不影响线上系统
第 3 步 · 再做评测,不要直接上机
建立自有评测集再谈替换
官方未公布评测基准,横向比较必须由使用方自己建立
第 4 步 · 最后才考虑训练
自有数据微调
需要训练框架与算力,且要确认许可对衍生权重的要求
判断:上表的四步顺序是刻意排的。很多团队拿到开源模型的第一反应是"接到控制链路里",这是**失败率最高的路径**——因为生成模型的误差会直接进到动作里。正确顺序是**先在离线数据环节用起来**(生成难例、扩充场景),等自有评测集跑通、知道了它的失败模式,再谈往控制侧靠。
34B 还是 34B

选型不看参数,看你在哪一步

官方提供了 4B 与 34B 两档。据 AGI Hunt 的转述,34B 是 any-to-any 版本(含 U0 与 U0-FlashAR 两种),4B 是新增的小尺寸版本,另有用于建模连续交互的 Sequence 变体。

先用 4B 的场景:数据扩充、批量生成难例、交互式试跑。这类任务的瓶颈是**吞吐**而不是单次质量——一天要出几千张场景图时,小模型的单位成本优势远大于质量差距。团队没有专用算力集群时,4B 也是唯一能本地跑起来的选择。

再考虑 34B 的场景:需要长时序一致性、需要复杂指令遵循、或者要作为**教师模型**给小模型做蒸馏。34B 的价值在于上限更高,代价是推理成本与部署复杂度显著上升。

选型判断(作者推演,非官方数据):两档之间的实际差距,官方**未公布任何评测数字**,因此无法从公开信息比较。建议做法是:**用同一批自有提示词在两档上各跑一次,按你自己的任务指标打分**,而不是参考任何第三方跑分。另外,具体显存占用、推理速度、依赖版本**以官方仓库 README 与配置文件为准**——本文不给出未经核验的数字。
4三条不该碰的边界

它不是什么,比它是什么更重要

其一,它是生成模型,不是策略模型。官方列出的六类能力全部是**生成类**(场景、图像、视频、图文序列),没有一项是"输出机器人可执行动作"。想用它直接驱动机械臂或人形机器人,链路里还缺动作解码与控制两层。**判断:**任何声称"接上世界模型机器人就会动了"的方案,中间一定还藏着一个没说清楚的 VLA 或策略网络。

其二,生成的视频是像素级未来,不是运动学可行的轨迹。视频里的动作看起来连贯,不等于它满足关节限位、力矩约束与碰撞约束。**判断:**把生成视频直接当作轨迹规划的输入,是这条路上最常见的坑。正确用法是把它当作**"目标长什么样"的示意**,再由规划器生成满足约束的实际轨迹。

其三,没有公开的评测基准,横向比较不成立。官方公告未公布评测基准、对比数字或失败案例。**判断:**这意味着"它比其他世界模型强/弱"这一类说法目前在公开信息层面**无法验证**。如果你在选型,唯一可靠的办法是建立自有评测集——这一点在第二节的第 3 步已经强调过,这里再重复一次,因为它决定了你能不能向上汇报一个站得住的结论。

判断:小米这次开源最实在的贡献不是"又一个世界模型",而是**把 Apache 2.0 的训练框架放出来了**。在同一周行业里大量讨论融资、上市与认证门槛的时候,这类可自由商用的基础工具,才是中小企业真正能拿到手的东西。**判断一个开源项目对你有没有用,标准只有一条:你手上有没有它能吃进去的数据。有数据,它是杠杆;没数据,它只是又一个 demo。**
待核验项:① Apache 2.0 许可与 Hugging Face 上架信息来自 AGI Hunt 二手转述,本文未直接核验页面;② 官方公告未公布训练数据规模、数据来源与清洗方法;③ 未公布评测基准、分辨率上限、视频时长上限与推理速度;④ 具体仓库地址、依赖版本与启动命令未在公告中给出(原文为短链),需以官方仓库 README 为准;⑤ Sequence 变体的具体规格与用途未见详细说明;⑥ 4B 与 34B 的质量差距无官方量化对比。
来源:@小米技术 官方微博 2026-09-10(t.cn/AX0gGnRV);和讯科技、长桥证券、群益期货 2026-09-10 同日转述;AGI Hunt(许可与平台信息,二手转述);FutureX · Physical AI Daily Issue 116(09/11)。官方未公布训练数据规模、评测基准与仓库细节,本文未作推测,逐项列为待核验。