智元 GE-Act 2.0:300 小时到 3 万小时,具身模型第一次有了可查的 Scaling 曲线
智元把联合训练数据从 300 小时拉到 3 万小时,G1-OP 零样本成功率从 17.1% 涨到 44.1%,且 5000→30000 小时仍未饱和。更值得看的是:训练数据占比不足 2% 的 G2-90D 也涨了 17.7 个百分点——跨本体迁移第一次有了真机数字。
- 实验设计:四档数据量(300 / 1200 / 5000 / 30000 小时)分别训练,评测前不做微调、不给示范,直接测 100 项任务、20 类技能、两种本体。
- 主结果:G1-OP 平均成功率 17.1% → 44.1%,非零成功率任务数 39 项 → 76 项;G2-90D 13.4% → 31.1%,非零任务 24 项 → 72 项。
- 未见饱和:5000 小时扩到 3 万小时后,模型整体表现仍在提升。技能覆盖与零样本 OOD 成功率的相关性达 Pearson r = 0.80。
- 跨本体迁移:G2-90D 训练数据占比不足 2%,成功率仍提升 17.7 个百分点。
- 工程口径:CoAE 把一帧 256×384 画面压成 24 个视觉 Token(约为 DINOv3 的 1/16);RTX 5090 上生成一个 chunk 连续动作约 104 毫秒。
不是"又发了一个模型",是把 Scaling 当成实验变量
具身智能这两年缺的从来不是模型,是**可对照的实验**。大部分发布只给一个最终成功率,读者无从判断这个数字来自架构、数据规模还是评测任务的选择性挑拣。
GE-Act 2.0 的特别之处在于把"数据量"单独拎出来当变量:研究团队分别用 **300 小时、1200 小时、5000 小时、30000 小时**四档数据训练模型,训练完成后不针对评测任务做任何微调或示范,直接让机器人面对训练中从未出现过的场景、物体与光照条件做零样本测试。评测覆盖 **100 项原子任务、20 类技能、两种机器人本体**。
39 项到 76 项:能力是"点亮"出来的
比成功率更有信息量的是**非零成功率任务数**的变化。G1-OP 从 300 小时时的 39 项,增加到 3 万小时时的 **76 项**;G2-90D 从 24 项增加到 **72 项**。
这意味着新增的不是"原有任务做得更稳",而是**此前完全做不了的任务开始有了非零成功率**。折叠毛巾、嵌套纸杯、拔插笔盖、插花这类精细操作,在小规模数据训练的模型上基本无法完成,到 3 万小时规模时才出现明显增长。
技能覆盖点亮:任务数从 39→76(G1-OP)、24→72(G2-90D)。技能覆盖与零样本 OOD 成功率的 Pearson 相关系数达到 r = 0.80。
尚未饱和:从 5000 小时扩到 30000 小时,模型整体表现仍在提升,未出现明显平台。
跨本体迁移,第一次有真机数字
这次实验里两种本体的数据占比是**严重不均衡**的:G1-OP 贡献了超过一半的训练数据,G2-90D 占比不足 **2%**。但后者的任务成功率仍然提升了 **17.7 个百分点**(13.4% → 31.1%)。智元认为,这表明模型从其他本体及共享数据中获得了能力迁移。
| 本体 | 训练数据占比 | 300h 成功率 | 30000h 成功率 | 提升 |
|---|---|---|---|---|
| G1-OP | 超过一半 | 17.1% | 44.1% | +27.0 pct |
| G2-90D | 不足 2% | 13.4% | 31.1% | +17.7 pct |
如果只比较提升幅度,G1-OP 涨得更多(27.0 pct);但考虑到它的数据占比是对方的 25 倍以上,G2-90D 的"性价比"反而更高。
24 个 Token、104 毫秒、KASO
架构方面,GE-Act 2.0 没有沿用现成的视频生成模型再接动作模块,而是从随机初始化开始,视觉表征、未来生成、动作预测等组件都在具身操作数据上从头训练。三个核心组件分别是:
- CoAE(控制导向自编码器):把一帧 256×384 画面压缩为 **24 个视觉 Token**,约为 DINOv3 的 1/16。智元披露在 4000 条机器人操作数据的受控测试中,该表征的指令与画面匹配准确率达 **97.95%**。
- SVP(单步视觉规划器):在一次可微分计算中直接生成完整未来状态,动作误差可反馈回世界模型。在 RTX 5090 上生成一个 chunk 连续动作约需 **104 毫秒**。
- IDM(逆动力学模型):根据当前状态与规划的未来状态反推动作指令。
三者通过 **KASO(知识对齐选择性优化)** 联合训练,筛选与真实动作行为兼容的预测未来参与优化,减少不匹配的监督信号。据披露,这一机制让陌生场景下的抓取成功率提高约 10 个百分点。数据层面,模型使用了 3.9 万小时"指令—视频"数据、3.2 万小时机器人轨迹与 3 万小时完整配对数据,分别用于世界模型预训练、逆动力学训练和联合训练。