一个模型覆盖 64 项任务,但开放是分层的:宇树 WLA-1.0 把「模型与本体解耦」摆上了台面
6B 参数、约 2500 小时真机数据、一个模型覆盖 64 项任务,具身推理底座拿下 7 项开源第一——这份成绩单真正的看点不在分数,而在开放清单分了四层:什么已经给了,什么还在计划里。
- 模型概要:宇树新一代通用人形机器人基础模型 UnifoLM-WLA-1.0 为 6B 参数,用约 2500 小时真机采集数据训练,单个模型覆盖 64 项任务(54 项桌面操作 + 10 项全身操作),兼容二指夹爪与 Shadow Dexterous Hand、Allegro Hand 等五指灵巧手。
- 推理底座:具身推理模型 UnifoLM-ER-1-4B 基于 Qwen3-VL-4B 构建,使用超 500 万条具身推理样本,在 16 项多模态感知与理解基准中有 7 项取得参评开源模型最佳(RefSpatial-Bench、Where2Place、PixMo-Point、BLINK、EmbSpatial、RoboSpatial、VSR)。
- 开放是分层的:目前已上线项目主页并开放部分模型权重与数据;后训练代码、UnifoLM-WLA-Base 权重、全身遥操作数据集、操作数据集仍列在后续开放计划中——「开源」的颗粒度,比「开源了」这三个字重要。
- 时间线提示:模型发布日为 9 月 10 日,首批权重 9 月 11 日上线,9 月 20 日前后出现的是中文媒体的集中报道与解读,属旧事件的传播扩散,本文据此按「发布+核查」而非「首发」处理。
- 判断:宇树这一周的三次动作(9/7 格斗演示、9/10 开源模型、9/14 发布 G1+)拼出的是一条明确的分工线——本体是硬件生意,模型是生态生意。谁定义模型接口,谁就掌握了下一轮本体厂商的兼容成本。
这不是一条「今天发布」的新闻
9 月 20 日凌晨到上午,中文媒体密集出现宇树通用人形机器人基础模型的报道:京报网、每日经济新闻、千龙网、艾瑞网、网易先后跟进,标题大多是「7 项评测领先开源模型」「让机器人理解世界」。如果只看标题,会以为这是一次当日发布。
把时间线摊开,实际顺序是:9 月 10 日,宇树发布 UnifoLM-WLA-1.0,同时宣布将开放模型、代码和数据集;9 月 11 日,首批权重上线;9 月 14 日,发布升级后的本体 G1+(颈部增加 2 个自由度,视觉系统升级为双目相机、广角单目相机与 3D 激光雷达,肩部与腰部电机峰值扭矩提升一倍以上、发热量降低约 70%,远场拾音升级为前 4 后 2 六麦克风阵列,含税售价 9.5 万元);再到 9 月 20 日,才出现这轮集中解读。
再往前推,9 月 7 日晚上,宇树放出一段 38 秒演示:一台 G1 站在场地中间,人类拳手出拳时它双拳收到胸前格挡,鞭腿扫来时退后半步稳住并回击,画面标注「全程实拍,无加速」——官方称之为全球首次由世界模型实时驱动的全自主人形机器人格斗,背后是另一套模型 UnifoLM-X2-1.0。
这个顺序值得留意:先用一场格斗证明模型能实时决策,再把模型开源出去,最后发布硬件本体。模型在前、本体在后,和多数厂商「先卖机器、后补软件」的做法正好相反。
7 项开源第一,和那个 82.0 分
按公司口径,WLA-1.0 是 6B 参数,用约 2500 小时高质量真机采集数据训练,覆盖多种机器人本体与作业场景,包含宇树自开源数据与第三方机器人数据。一个模型即可完成 64 项差异化任务:54 项桌面操作(收纳餐盘、电池充电等需要精细操作的场景)与 10 项全身移动操作(垃圾处理、鞋子整理、沙发整理、大空间取放物品)。模型兼容二指夹爪与两类五指灵巧手,支持不同末端执行器切换。
WLA 三个字母对应 World、Language、Action——环境感知、语义理解、空间推理、动态预测与动作生成被放进同一个框架。在技术细节上,两处设计值得记下来:一是用光流提取未来场景变化区域作为监督信号,训练出 UnifoLM-ER-Flow 模型,让机器人先预测环境将如何变化再生成动作;二是把统一动作空间划分为末端执行器位姿、末端执行器关节量、下肢运动关节量三部分,再通过残差矢量量化(RVQ)把连续动作转成离散 token,各部分 token 按共享时间步对齐后送入模型,学习三者的协同关系。
但同一批材料里还有一组反面对照。每日经济新闻报道引用独立第三方机器人基准测试平台 Robocurve 的实测:把「把积木放进碗里」分别下达给部署在真实机械臂上的 GPT-6 Astra 与 Claude Fable 5.1,20 次测试中成功 19 次与 8 次,对应成功率 95% 与 40%;任务细化为「把拼图块插入对应的凹槽」后,Astra 的成功率滑落至 10%。
这组数字的意义在于划出一条界线:顶尖大模型已经能操控物理设备,但在精细操作层面仍有明显短板,而且任务越精细,衰减越陡。它同时提醒所有看榜单的人——「理解能力」的分数和「动作成功率」之间存在真实的落差,而后者才是采购方验收的东西。当然,20 次的样本量本身也偏小,这个数字应作为信号而非结论。
「开源了」这三个字,要看它分了几层
比参数更值得逐个核对的是开放状态。按公开表述:目前宇树已上线 UnifoLM-WLA-1.0 项目主页,并开放**部分**模型权重和数据;**后训练代码、UnifoLM-WLA-Base 权重、全身遥操作数据集、操作数据集**仍列在后续开放计划中。
这意味着「宇树开源了人形基础模型」这个说法需要加限定词。已经拿到手的是部分权重和部分数据,后训练代码和两个关键数据集还在路上。对真正想复现或二次开发的研究团队来说,后训练代码往往比推理权重更重要——权重决定你能跑什么,后训练代码决定你能改什么。
| 层级 | 内容 | 当前状态 |
|---|---|---|
| 已开放 | 部分模型权重、部分数据、项目主页 | 可下载/可查看 |
| 计划中 | 后训练代码 | 待开放 |
| 计划中 | UnifoLM-WLA-Base 权重 | 待开放 |
| 计划中 | 全身遥操作数据集 | 待开放 |
| 计划中 | 操作数据集 | 待开放 |
把这一条和「本体售价 9.5 万元」放在一起看,宇树的分工线就清楚了:身体是硬件生意,一次性卖出;模型是生态生意,越多人用它的接口、越多硬件适配它的输出,它在本体之外的话语权就越重。这不是宇树独有的算盘——NVIDIA 用 GR00T、Google 用 Gemini Robotics、Figure 用 Helix,走的都是同一条路。差别在于国内厂商里,宇树是少数同时握着本体产线和基础模型的一方。
榜单之外,三处口径需要补上
第一,2500 小时真机数据的本体分布。64 项任务的训练数据「覆盖多种机器人本体」,但各家本体的观测空间、动作空间和末端执行器都不一样,跨本体迁移的效果取决于数据如何配比。目前公开信息没有给出按本体的数据分布表。第二,64 项任务的评测条件。任务成功率是在固定初始位姿、固定光照、固定物体集下测的,还是随机化之后测的,这两个数字的含义完全不同——YCB 式的标准物体和「任意家庭杂物」之间的距离,正是行业里最难补的一段。
第三,也是最容易被忽略的:64 项任务里,54 项桌面操作与 10 项全身操作的难度不在一个量级。桌面操作考的是精细控制,全身操作考的是移动与操作并行时的平衡协调。把它们合并成「64 项」这类汇总数字,读的时候要分开看,否则容易系统性高估全身移动操作的能力成熟度。
顺便说一句判断口径:凡厂商同时给了「现状表」和「任务表」的,优先看任务表。WLA 这类基础模型的出现,把「一个模型干多件事」从演示变成了工程目标,但从演示到验收,中间隔着的是长尾任务的成功率和故障恢复时间,这两项从来不上榜。