# 智元 GE-Act 2.0：300 小时到 3 万小时，具身模型第一次有了可查的 Scaling 曲线

> 智元把联合训练数据从 300 小时拉到 3 万小时，G1-OP 零样本成功率从 17.1% 涨到 44.1%，且 5000→30000 小时仍未饱和。更值得看的是：训练数据占比不足 2% 的 G2-90D 也涨了 17.7 个百分点——跨本体迁移第一次有了真机数字。

### TLDR

- **实验设计**：四档数据量（300 / 1200 / 5000 / 30000 小时）分别训练，评测前**不做微调、不给示范**，直接测 100 项任务、20 类技能、两种本体。
- **主结果**：G1-OP 平均成功率 **17.1% → 44.1%**，非零成功率任务数 **39 项 → 76 项**；G2-90D **13.4% → 31.1%**，非零任务 **24 项 → 72 项**。
- **未见饱和**：5000 小时扩到 3 万小时后，模型整体表现仍在提升。技能覆盖与零样本 OOD 成功率的相关性达 Pearson **r = 0.80**。
- **跨本体迁移**：G2-90D 训练数据占比不足 **2%**，成功率仍提升 **17.7 个百分点**。
- **工程口径**：CoAE 把一帧 256×384 画面压成 **24 个视觉 Token**（约为 DINOv3 的 1/16）；RTX 5090 上生成一个 chunk 连续动作约 **104 毫秒**。

### SRC

本文事实来自智元机器人（AgiBot）2026-09-09 发布的 GE-Act 2.0 原生世界—动作模型公开材料，经读创/深圳商报（首席记者袁静娴）、网易科技、搜狐科技同步报道，并经 FutureX · Physical AI Daily Issue 115（09/10）转述 arXiv 2609.05588（AgiBot Research Team）。四档数据量设置、成功率数字、非零任务数、跨本体提升幅度、CoAE Token 数与 104 毫秒推理耗时均出自上述同源材料，属**发布方自述的实验口径**，未见第三方复现或独立评测。微调后在 RoboTwin 陌生环境 60.52%、GenieSim 指令遵循 0.770 的对照数字同样来自发布方。需要说明的是：智元官方材料自身也提示，现阶段实验主要证明"在智元设定的模型架构、数据体系和评测范围内"成立，能否扩展到更多本体、长流程任务和非结构化环境仍需更多测试。解读时间 2026-09-10。

### BODY

<div class="sec"><div class="eyebrow"><span class="num">1</span>它到底在验证什么</div>

<h2>不是"又发了一个模型"，是把 Scaling 当成实验变量</h2>

<p>具身智能这两年缺的从来不是模型，是**可对照的实验**。大部分发布只给一个最终成功率，读者无从判断这个数字来自架构、数据规模还是评测任务的选择性挑拣。</p>

<p>GE-Act 2.0 的特别之处在于把"数据量"单独拎出来当变量：研究团队分别用 **300 小时、1200 小时、5000 小时、30000 小时**四档数据训练模型，训练完成后不针对评测任务做任何微调或示范，直接让机器人面对训练中从未出现过的场景、物体与光照条件做零样本测试。评测覆盖 **100 项原子任务、20 类技能、两种机器人本体**。</p>

<div class="jx-bars">
<div class="jx-bar-row"><div class="jx-bar-lab">G1-OP @300h</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:17%;background:#4b5f8a"></div></div><div class="jx-bar-val">17.1%</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">G1-OP @30000h</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:44%;background:#0a749a"></div></div><div class="jx-bar-val">44.1%</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">G2-90D @300h</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:13%;background:#566781"></div></div><div class="jx-bar-val">13.4%</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">G2-90D @30000h</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:31%;background:#00a6d6"></div></div><div class="jx-bar-val">31.1%</div></div>
<div class="jx-legend"><div class="jx-lg">四档训练数据下的真机零样本平均成功率，数据来自智元公开材料，未经第三方复现</div></div>
</div>

<div class="keypoint">
<strong>判断：</strong>这份工作的价值不在 44.1% 这个数字本身（距离可用还远），而在于它给出了**一条别人可以拿来对照的基线**。以后任何一家说"我们的世界动作模型更强"，都得回答同一个问题：你在多少小时数据上、用什么本体、零样本测了多少任务。
</div>
</div>

<div class="sec"><div class="eyebrow"><span class="num">2</span>技能覆盖比成功率更值得看</div>

<h2>39 项到 76 项：能力是"点亮"出来的</h2>

<p>比成功率更有信息量的是**非零成功率任务数**的变化。G1-OP 从 300 小时时的 39 项，增加到 3 万小时时的 **76 项**；G2-90D 从 24 项增加到 **72 项**。</p>

<p>这意味着新增的不是"原有任务做得更稳"，而是**此前完全做不了的任务开始有了非零成功率**。折叠毛巾、嵌套纸杯、拔插笔盖、插花这类精细操作，在小规模数据训练的模型上基本无法完成，到 3 万小时规模时才出现明显增长。</p>

<div class="jx-split">
<div style="flex:48">
<p><strong>技能覆盖点亮</strong>：任务数从 39→76（G1-OP）、24→72（G2-90D）。技能覆盖与零样本 OOD 成功率的 Pearson 相关系数达到 <strong>r = 0.80</strong>。</p>
</div>
<div style="flex:46">
<p><strong>尚未饱和</strong>：从 5000 小时扩到 30000 小时，模型整体表现仍在提升，未出现明显平台。</p>
</div>
</div>

<div class="keypoint">
<strong>判断：</strong>r = 0.80 这个相关性是全文最该被记住的数字。它说明**泛化能力主要由"见过多少种技能"决定，而不是由"单个技能练得多熟"决定**。对做数据采集的人来说，这条结论直接推翻了"把一个任务采集一万遍"的做法——同样的预算，铺开 100 个任务各采 100 条，可能比 1 个任务采 1 万条更有用。
</div>
</div>

<div class="sec"><div class="eyebrow"><span class="num">3</span>占比 2% 的本体涨了 17.7 个百分点</div>

<h2>跨本体迁移，第一次有真机数字</h2>

<p>这次实验里两种本体的数据占比是**严重不均衡**的：G1-OP 贡献了超过一半的训练数据，G2-90D 占比不足 **2%**。但后者的任务成功率仍然提升了 **17.7 个百分点**（13.4% → 31.1%）。智元认为，这表明模型从其他本体及共享数据中获得了能力迁移。</p>

<div class="tbl-wrap">
<table>
<thead><tr><th>本体</th><th>训练数据占比</th><th>300h 成功率</th><th>30000h 成功率</th><th>提升</th></tr></thead>
<tbody>
<tr><td>G1-OP</td><td>超过一半</td><td>17.1%</td><td>44.1%</td><td>+27.0 pct</td></tr>
<tr><td>G2-90D</td><td>不足 2%</td><td>13.4%</td><td>31.1%</td><td>+17.7 pct</td></tr>
</tbody>
</table>
<div class="cap">表注：数据占比与成功率均来自智元公开材料；+27.0 pct 为按公布的首尾数字计算所得，非原文直接给出。</div>
</div>

<p>如果只比较提升幅度，G1-OP 涨得更多（27.0 pct）；但考虑到它的数据占比是对方的 25 倍以上，G2-90D 的"性价比"反而更高。</p>

<div class="keypoint">
<strong>判断：</strong>这是行业里第一次用真机零样本数据把"跨本体迁移"从口号变成可测的东西。对拥有稀有机型的团队（比如做异形机器人、轮式人形的），含义很直接：**你不需要自己攒够数据量，但需要保证你的数据在共享池里被正确标注和对齐**。数据标注规范的价值，正在超过数据总量本身。
</div>
</div>

<div class="sec"><div class="eyebrow"><span class="num">4</span>工程侧的三个口径</div>

<h2>24 个 Token、104 毫秒、KASO</h2>

<p>架构方面，GE-Act 2.0 没有沿用现成的视频生成模型再接动作模块，而是从随机初始化开始，视觉表征、未来生成、动作预测等组件都在具身操作数据上从头训练。三个核心组件分别是：</p>

<ul>
<li><strong>CoAE（控制导向自编码器）</strong>：把一帧 256×384 画面压缩为 **24 个视觉 Token**，约为 DINOv3 的 1/16。智元披露在 4000 条机器人操作数据的受控测试中，该表征的指令与画面匹配准确率达 **97.95%**。</li>
<li><strong>SVP（单步视觉规划器）</strong>：在一次可微分计算中直接生成完整未来状态，动作误差可反馈回世界模型。在 RTX 5090 上生成一个 chunk 连续动作约需 **104 毫秒**。</li>
<li><strong>IDM（逆动力学模型）</strong>：根据当前状态与规划的未来状态反推动作指令。</li>
</ul>

<p>三者通过 **KASO（知识对齐选择性优化）** 联合训练，筛选与真实动作行为兼容的预测未来参与优化，减少不匹配的监督信号。据披露，这一机制让陌生场景下的抓取成功率提高约 10 个百分点。数据层面，模型使用了 3.9 万小时"指令—视频"数据、3.2 万小时机器人轨迹与 3 万小时完整配对数据，分别用于世界模型预训练、逆动力学训练和联合训练。</p>

<div class="jx-note">
<strong>待核验项：</strong>① 四档数据中"小时"的定义（是否含失败数据与无本体数据）；② 100 项任务的难度分布与是否随机抽样；③ 微调后 60.52%（RoboTwin）与 0.770（GenieSim）的对照基线是否同条件；④ 104 毫秒是否含视觉编码与通信开销；⑤ 3 万小时在更多本体与长流程任务上的外推结果。
</div>

<div class="srcline">来源：AgiBot Research Team，arXiv 2609.05588；读创/深圳商报 2026-09-09；网易科技 2026-09-09；FutureX Physical AI Daily Issue 115（09/10）。所有实验数字均为发布方自述口径，未见第三方复现。</div>
</div>

---

*来源：神机百见-具身解读 · https://www.shenjibailian.com/jiedu/article/zhiyuan-geact2-scaling-law/*
