研究解读 · 神机百见解读

智元 GE-Act 2.0:300 小时到 3 万小时,具身模型第一次有了可查的 Scaling 曲线

智元把联合训练数据从 300 小时拉到 3 万小时,G1-OP 零样本成功率从 17.1% 涨到 44.1%,且 5000→30000 小时仍未饱和。更值得看的是:训练数据占比不足 2% 的 G2-90D 也涨了 17.7 个百分点——跨本体迁移第一次有了真机数字。

本篇目录4 节 · 10 分钟
一分钟速览
  1. 实验设计:四档数据量(300 / 1200 / 5000 / 30000 小时)分别训练,评测前不做微调、不给示范,直接测 100 项任务、20 类技能、两种本体。
  2. 主结果:G1-OP 平均成功率 17.1% → 44.1%,非零成功率任务数 39 项 → 76 项;G2-90D 13.4% → 31.1%,非零任务 24 项 → 72 项
  3. 未见饱和:5000 小时扩到 3 万小时后,模型整体表现仍在提升。技能覆盖与零样本 OOD 成功率的相关性达 Pearson r = 0.80
  4. 跨本体迁移:G2-90D 训练数据占比不足 2%,成功率仍提升 17.7 个百分点
  5. 工程口径:CoAE 把一帧 256×384 画面压成 24 个视觉 Token(约为 DINOv3 的 1/16);RTX 5090 上生成一个 chunk 连续动作约 104 毫秒
数据来源与边界
本文事实来自智元机器人(AgiBot)2026-09-09 发布的 GE-Act 2.0 原生世界—动作模型公开材料,经读创/深圳商报(首席记者袁静娴)、网易科技、搜狐科技同步报道,并经 FutureX · Physical AI Daily Issue 115(09/10)转述 arXiv 2609.05588(AgiBot Research Team)。四档数据量设置、成功率数字、非零任务数、跨本体提升幅度、CoAE Token 数与 104 毫秒推理耗时均出自上述同源材料,属发布方自述的实验口径,未见第三方复现或独立评测。微调后在 RoboTwin 陌生环境 60.52%、GenieSim 指令遵循 0.770 的对照数字同样来自发布方。需要说明的是:智元官方材料自身也提示,现阶段实验主要证明"在智元设定的模型架构、数据体系和评测范围内"成立,能否扩展到更多本体、长流程任务和非结构化环境仍需更多测试。解读时间 2026-09-10。
1它到底在验证什么

不是"又发了一个模型",是把 Scaling 当成实验变量

具身智能这两年缺的从来不是模型,是**可对照的实验**。大部分发布只给一个最终成功率,读者无从判断这个数字来自架构、数据规模还是评测任务的选择性挑拣。

GE-Act 2.0 的特别之处在于把"数据量"单独拎出来当变量:研究团队分别用 **300 小时、1200 小时、5000 小时、30000 小时**四档数据训练模型,训练完成后不针对评测任务做任何微调或示范,直接让机器人面对训练中从未出现过的场景、物体与光照条件做零样本测试。评测覆盖 **100 项原子任务、20 类技能、两种机器人本体**。

G1-OP @300h
17.1%
G1-OP @30000h
44.1%
G2-90D @300h
13.4%
G2-90D @30000h
31.1%
四档训练数据下的真机零样本平均成功率,数据来自智元公开材料,未经第三方复现
判断:这份工作的价值不在 44.1% 这个数字本身(距离可用还远),而在于它给出了**一条别人可以拿来对照的基线**。以后任何一家说"我们的世界动作模型更强",都得回答同一个问题:你在多少小时数据上、用什么本体、零样本测了多少任务。
2技能覆盖比成功率更值得看

39 项到 76 项:能力是"点亮"出来的

比成功率更有信息量的是**非零成功率任务数**的变化。G1-OP 从 300 小时时的 39 项,增加到 3 万小时时的 **76 项**;G2-90D 从 24 项增加到 **72 项**。

这意味着新增的不是"原有任务做得更稳",而是**此前完全做不了的任务开始有了非零成功率**。折叠毛巾、嵌套纸杯、拔插笔盖、插花这类精细操作,在小规模数据训练的模型上基本无法完成,到 3 万小时规模时才出现明显增长。

技能覆盖点亮:任务数从 39→76(G1-OP)、24→72(G2-90D)。技能覆盖与零样本 OOD 成功率的 Pearson 相关系数达到 r = 0.80

尚未饱和:从 5000 小时扩到 30000 小时,模型整体表现仍在提升,未出现明显平台。

判断:r = 0.80 这个相关性是全文最该被记住的数字。它说明**泛化能力主要由"见过多少种技能"决定,而不是由"单个技能练得多熟"决定**。对做数据采集的人来说,这条结论直接推翻了"把一个任务采集一万遍"的做法——同样的预算,铺开 100 个任务各采 100 条,可能比 1 个任务采 1 万条更有用。
3占比 2% 的本体涨了 17.7 个百分点

跨本体迁移,第一次有真机数字

这次实验里两种本体的数据占比是**严重不均衡**的:G1-OP 贡献了超过一半的训练数据,G2-90D 占比不足 **2%**。但后者的任务成功率仍然提升了 **17.7 个百分点**(13.4% → 31.1%)。智元认为,这表明模型从其他本体及共享数据中获得了能力迁移。

本体训练数据占比300h 成功率30000h 成功率提升
G1-OP超过一半17.1%44.1%+27.0 pct
G2-90D不足 2%13.4%31.1%+17.7 pct
表注:数据占比与成功率均来自智元公开材料;+27.0 pct 为按公布的首尾数字计算所得,非原文直接给出。

如果只比较提升幅度,G1-OP 涨得更多(27.0 pct);但考虑到它的数据占比是对方的 25 倍以上,G2-90D 的"性价比"反而更高。

判断:这是行业里第一次用真机零样本数据把"跨本体迁移"从口号变成可测的东西。对拥有稀有机型的团队(比如做异形机器人、轮式人形的),含义很直接:**你不需要自己攒够数据量,但需要保证你的数据在共享池里被正确标注和对齐**。数据标注规范的价值,正在超过数据总量本身。
4工程侧的三个口径

24 个 Token、104 毫秒、KASO

架构方面,GE-Act 2.0 没有沿用现成的视频生成模型再接动作模块,而是从随机初始化开始,视觉表征、未来生成、动作预测等组件都在具身操作数据上从头训练。三个核心组件分别是:

  • CoAE(控制导向自编码器):把一帧 256×384 画面压缩为 **24 个视觉 Token**,约为 DINOv3 的 1/16。智元披露在 4000 条机器人操作数据的受控测试中,该表征的指令与画面匹配准确率达 **97.95%**。
  • SVP(单步视觉规划器):在一次可微分计算中直接生成完整未来状态,动作误差可反馈回世界模型。在 RTX 5090 上生成一个 chunk 连续动作约需 **104 毫秒**。
  • IDM(逆动力学模型):根据当前状态与规划的未来状态反推动作指令。

三者通过 **KASO(知识对齐选择性优化)** 联合训练,筛选与真实动作行为兼容的预测未来参与优化,减少不匹配的监督信号。据披露,这一机制让陌生场景下的抓取成功率提高约 10 个百分点。数据层面,模型使用了 3.9 万小时"指令—视频"数据、3.2 万小时机器人轨迹与 3 万小时完整配对数据,分别用于世界模型预训练、逆动力学训练和联合训练。

待核验项:① 四档数据中"小时"的定义(是否含失败数据与无本体数据);② 100 项任务的难度分布与是否随机抽样;③ 微调后 60.52%(RoboTwin)与 0.770(GenieSim)的对照基线是否同条件;④ 104 毫秒是否含视觉编码与通信开销;⑤ 3 万小时在更多本体与长流程任务上的外推结果。
来源:AgiBot Research Team,arXiv 2609.05588;读创/深圳商报 2026-09-09;网易科技 2026-09-09;FutureX Physical AI Daily Issue 115(09/10)。所有实验数字均为发布方自述口径,未见第三方复现。