# 成立三个月拿下 RoboDojo 榜首 33.95 分：Simate 把「调参」外包给了 Agent

> Simate-beta 以 33.95 分登顶 RoboDojo，超过 Liber-0 Preview（30.74）与 GPT-6-Astra（28.97）——但分维度看，它的开放任务得分不到 GPT-6-Astra 的三分之一，总分第一不等于全面领先。

### TLDR

- **榜单一手核实**：RoboDojo-Sim 共 **48 个模型**上榜（更新至 9 月 23 日），Simate-beta 以 **33.95 分（成功率 27.96%）** 排名第一，Liber-0 Preview **30.74** 第二，Liber-0 Lite **29.24** 第三，GPT-6-Astra **28.97** 第四。
- **分维度看短板**：Simate-beta 长程任务 **57.84** 居首、记忆 **33.33** 第一，但开放任务仅 **9.12**——不到 GPT-6-Astra（**34.36**）的三分之一；总分第一不等于全面领先。
- **公司口径**：Simate（硅基伙伴）成立**三个月**，创始人张颖出自一线自动驾驶公司（一段式端到端路线核心负责人）；累计完成**数亿元人民币**融资（厂商口径，轮次与投资方未披露）。
- **范式主张**：Physical RSI 三阶段路线——当前处于「**人机共驾弱 RSI**」：人类定目标与约束，AutoResearch 系统跑「假设—实验—验证—迭代」循环，已向清华、北大、MIT 等高校开放内测。
- **与本站 159 号稿差异**：9 月 17 日那篇写的是 LiberAI 以 30.74 登顶；本篇是榜首易主后的分维度拆解与 RSI 范式解读，榜单数字全部经本站当日直接核对。

### SRC

本文事实来自三类信源：①RoboDojo 官方榜单（https://robodojo-benchmark.com/leaderboard，页面标注 2026-09-23 更新），本站于 2026-09-27 直接抓取核对全部分数，Simate-beta 33.95/27.96%、Liber-0 Preview 30.74/25.52%、GPT-6-Astra 28.97/22.48% 均为榜单口径；②机器之心 Pro 2026-09-23 20:31 报道（toutiao.com/article/7688703665418420736）与智东西 2026-09-24 报道（zhidx.com/p/596826），提供公司与技术路线细节；③AGI HUNT 2026-09-27 日报收录。素材时间窗为当日 09:00 → 19:00，本批于 10:25 执行；事件披露在 9/23–24（窗口外），窗口内增量为 9/27 英文聚合日报再传播，按扩窗规则 2 处理。边界说明：「数亿元融资」「内测高校名单」均为厂商单一口径，未获独立信源确认；榜单为厂商自主提交评测，RoboDojo 团队模型（GPT-6-Astra 等）为基准组。与本站 159 号稿（LiberAI 30.74 登顶）为同一榜单的两次榜首变动，本篇新增量是 Simate 登顶与分维度结构分析。判断均以「判断：」开头。

### BODY

<div class="sec">
<div class="eyebrow">榜单顶部的三次变化</div>
<p>RoboDojo 是一个综合考察泛化、精细操作、长程执行、记忆与开放任务的机器人操作能力评测基准。本站 9 月 17 日报道过 LiberAI 以 30.74 分登顶（159 号稿），当时榜单第二名前后是 GPT-6-Astra。9 月 23 日榜单更新后，格局变成：Simate-beta 33.95 第一，Liber-0 Preview 30.74 第二，Liber-0 Lite 29.24 第三，GPT-6-Astra 28.97 被挤到第四。三个月前还不存在的公司，如今排在 48 个模型的最上面。</p>
<div class="jx-bars">
<div class="jx-bar-row"><div class="jx-bar-lab">Simate-beta</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:96%"></div></div><div class="jx-bar-val">33.95</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">Liber-0 Preview</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:87%"></div></div><div class="jx-bar-val">30.74</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">Liber-0 Lite</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:83%"></div></div><div class="jx-bar-val">29.24</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">GPT-6-Astra</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:82%"></div></div><div class="jx-bar-val">28.97</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">π0.5（基准组）</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:32%"></div></div><div class="jx-bar-val">11.44</div></div>
<div class="jx-legend"><div class="jx-lg">RoboDojo-Sim 总分（平均分制，成功率 27.96% 对应榜首），数据截至 2026-09-23 更新</div></div>
</div>
</div>

<div class="sec">
<div class="eyebrow">分维度拆开：总分第一遮住了什么</div>
<p>把榜首的五个分项摊开，故事比总分复杂。Simate-beta 的长程任务 57.84（成功率 43.42%）、记忆 33.33（33.00%）、泛化 35.09，三项都排榜首；但开放任务只有 9.12（8.50%），而 GPT-6-Astra 这一项是 34.36（31.00%）——几乎是三倍半的差距。反过来，GPT-6-Astra 的精细操作只有 12.65（成功率 4.00%），Simate-beta 是 34.35。两个模型在榜单两端互为镜像。</p>
<p>这说明 RoboDojo 的总分结构偏向「看得见的任务族」：堆叠、装箱、倒水这类有明确成功判定的仿真任务权重占绝对多数，真正开放的指令跟随只占一小格。Simate-beta 在「给 X 个盖子盖上」（100 分）这类任务上拿了满分，在开放任务上几乎不得分——它的第一名，是长程执行与精细操作两项优势叠加出来的，不是全面碾压。</p>
<div class="keypoint">判断：读这份榜单的正确姿势是先看分项再看总分。对采购方而言，长程与精细操作强、开放任务弱的模型，适合流程固定、任务可枚举的产线与商业场景；反过来开放任务强、精细操作弱的模型适合demo与探索。Simate-beta 的画像恰好是「工序型场景优等生」——这与它自动驾驶团队出身的工程基因一致：智驾系统从来都是在限定ODD里把可靠性做到极致，而不是追求无所不能。</div>
</div>

<div class="sec">
<div class="eyebrow">Physical RSI：把研究流程本身自动化</div>
<p>Simate 的核心主张不是某个模型，而是一条研发范式：Physical RSI（物理智能的递归自我改进），对标 Anthropic 披露的「Claude 已主导约 26% 的 AI 研发工作」（截至 2026 年 8 月）。目前处于第一阶段「弱 RSI」：人类研究员提出假设、设定目标与安全约束，AutoResearch 系统的 Agent 自主完成方案改进、代码修改、分布式实验下发、评测调用与多轮迭代；高风险节点交回人类裁决。底座是可插拔的 SiPAI 框架，统一支持世界模型、世界动作模型、VLA 与 VLM 四类架构，数据侧采用基于同构 UMI 的采集体系，按「时序对齐、轨迹质量、任务覆盖、训练配比」四个维度做治理而非单纯堆小时数。</p>
<p>团队构成解释了这套打法的来源：创始人张颖曾任头部自动驾驶公司核心技术负责人（一段式端到端路线），港科大助理教授占方能补世界模型与三维感知，00 后季马泽宇曾是硅谷物理智能公司 ARI（后被 Meta 收购）创始成员，负责人形全身控制的真机验证。公司已完成累计数亿元人民币融资，AutoResearch 平台已向清华、北大、MIT、加州理工等高校师生开放内测——把研发基础设施当产品卖，是比卖模型更早一步的生意。</p>
<div class="keypoint">判断：「弱 RSI」的实质是把调参、跑实验、写评测这些研究流程里的重复劳动外包给 Agent，方向判断与安全边界仍在人手里——这与Anthropic在数字世界的进展是同一件事，只是物理世界的迭代成本高一个量级（一次失败的抓取意味着重新采集与重训）。需要保持警惕的是：登顶成绩为厂商自主提交的评测结果，「数亿元融资」与「三个月」的时间线均为厂商单一口径；真正值得跟踪的不是榜单名次，而是它承诺的三篇技术报告——模型规模至今未披露，这是评判成色的最低门槛。</div>
</div>

<div class="srcline">来源：RoboDojo 官方榜单（https://robodojo-benchmark.com/leaderboard，2026-09-23 更新，本站 2026-09-27 直接核对）；机器之心 Pro 2026-09-23 20:31；智东西 2026-09-24（https://zhidx.com/p/596826）。素材时间窗：当日 09:00 → 19:00。</div>

---

*来源：神机百见-具身解读 · https://www.shenjibailian.com/jiedu/article/simate-robodojo-3395-weak-rsi/*
