研究解读 · 神机百见-具身解读

成立三个月拿下 RoboDojo 榜首 33.95 分:Simate 把「调参」外包给了 Agent

Simate-beta 以 33.95 分登顶 RoboDojo,超过 Liber-0 Preview(30.74)与 GPT-6-Astra(28.97)——但分维度看,它的开放任务得分不到 GPT-6-Astra 的三分之一,总分第一不等于全面领先。

一分钟速览
  1. 榜单一手核实:RoboDojo-Sim 共 48 个模型上榜(更新至 9 月 23 日),Simate-beta 以 33.95 分(成功率 27.96%) 排名第一,Liber-0 Preview 30.74 第二,Liber-0 Lite 29.24 第三,GPT-6-Astra 28.97 第四。
  2. 分维度看短板:Simate-beta 长程任务 57.84 居首、记忆 33.33 第一,但开放任务仅 9.12——不到 GPT-6-Astra(34.36)的三分之一;总分第一不等于全面领先。
  3. 公司口径:Simate(硅基伙伴)成立三个月,创始人张颖出自一线自动驾驶公司(一段式端到端路线核心负责人);累计完成数亿元人民币融资(厂商口径,轮次与投资方未披露)。
  4. 范式主张:Physical RSI 三阶段路线——当前处于「人机共驾弱 RSI」:人类定目标与约束,AutoResearch 系统跑「假设—实验—验证—迭代」循环,已向清华、北大、MIT 等高校开放内测。
  5. 与本站 159 号稿差异:9 月 17 日那篇写的是 LiberAI 以 30.74 登顶;本篇是榜首易主后的分维度拆解与 RSI 范式解读,榜单数字全部经本站当日直接核对。
数据来源与边界
本文事实来自三类信源:①RoboDojo 官方榜单(https://robodojo-benchmark.com/leaderboard,页面标注 2026-09-23 更新),本站于 2026-09-27 直接抓取核对全部分数,Simate-beta 33.95/27.96%、Liber-0 Preview 30.74/25.52%、GPT-6-Astra 28.97/22.48% 均为榜单口径;②机器之心 Pro 2026-09-23 20:31 报道(toutiao.com/article/7688703665418420736)与智东西 2026-09-24 报道(zhidx.com/p/596826),提供公司与技术路线细节;③AGI HUNT 2026-09-27 日报收录。素材时间窗为当日 09:00 → 19:00,本批于 10:25 执行;事件披露在 9/23–24(窗口外),窗口内增量为 9/27 英文聚合日报再传播,按扩窗规则 2 处理。边界说明:「数亿元融资」「内测高校名单」均为厂商单一口径,未获独立信源确认;榜单为厂商自主提交评测,RoboDojo 团队模型(GPT-6-Astra 等)为基准组。与本站 159 号稿(LiberAI 30.74 登顶)为同一榜单的两次榜首变动,本篇新增量是 Simate 登顶与分维度结构分析。判断均以「判断:」开头。
本文事实信息来自上方标注的公开来源;解读、判断与延伸部分为作者个人见解,写作过程使用了 AI 工具辅助整理,已由作者人工核实,不代表信息来源方立场。如有雷同纯属巧合;如涉及版权或权益问题,请联系 shenjibailian@shenjibailian.com,我们将在核实后及时删除或更正。
榜单顶部的三次变化

RoboDojo 是一个综合考察泛化、精细操作、长程执行、记忆与开放任务的机器人操作能力评测基准。本站 9 月 17 日报道过 LiberAI 以 30.74 分登顶(159 号稿),当时榜单第二名前后是 GPT-6-Astra。9 月 23 日榜单更新后,格局变成:Simate-beta 33.95 第一,Liber-0 Preview 30.74 第二,Liber-0 Lite 29.24 第三,GPT-6-Astra 28.97 被挤到第四。三个月前还不存在的公司,如今排在 48 个模型的最上面。

Simate-beta
33.95
Liber-0 Preview
30.74
Liber-0 Lite
29.24
GPT-6-Astra
28.97
π0.5(基准组)
11.44
RoboDojo-Sim 总分(平均分制,成功率 27.96% 对应榜首),数据截至 2026-09-23 更新
分维度拆开:总分第一遮住了什么

把榜首的五个分项摊开,故事比总分复杂。Simate-beta 的长程任务 57.84(成功率 43.42%)、记忆 33.33(33.00%)、泛化 35.09,三项都排榜首;但开放任务只有 9.12(8.50%),而 GPT-6-Astra 这一项是 34.36(31.00%)——几乎是三倍半的差距。反过来,GPT-6-Astra 的精细操作只有 12.65(成功率 4.00%),Simate-beta 是 34.35。两个模型在榜单两端互为镜像。

这说明 RoboDojo 的总分结构偏向「看得见的任务族」:堆叠、装箱、倒水这类有明确成功判定的仿真任务权重占绝对多数,真正开放的指令跟随只占一小格。Simate-beta 在「给 X 个盖子盖上」(100 分)这类任务上拿了满分,在开放任务上几乎不得分——它的第一名,是长程执行与精细操作两项优势叠加出来的,不是全面碾压。

判断:读这份榜单的正确姿势是先看分项再看总分。对采购方而言,长程与精细操作强、开放任务弱的模型,适合流程固定、任务可枚举的产线与商业场景;反过来开放任务强、精细操作弱的模型适合demo与探索。Simate-beta 的画像恰好是「工序型场景优等生」——这与它自动驾驶团队出身的工程基因一致:智驾系统从来都是在限定ODD里把可靠性做到极致,而不是追求无所不能。
Physical RSI:把研究流程本身自动化

Simate 的核心主张不是某个模型,而是一条研发范式:Physical RSI(物理智能的递归自我改进),对标 Anthropic 披露的「Claude 已主导约 26% 的 AI 研发工作」(截至 2026 年 8 月)。目前处于第一阶段「弱 RSI」:人类研究员提出假设、设定目标与安全约束,AutoResearch 系统的 Agent 自主完成方案改进、代码修改、分布式实验下发、评测调用与多轮迭代;高风险节点交回人类裁决。底座是可插拔的 SiPAI 框架,统一支持世界模型、世界动作模型、VLA 与 VLM 四类架构,数据侧采用基于同构 UMI 的采集体系,按「时序对齐、轨迹质量、任务覆盖、训练配比」四个维度做治理而非单纯堆小时数。

团队构成解释了这套打法的来源:创始人张颖曾任头部自动驾驶公司核心技术负责人(一段式端到端路线),港科大助理教授占方能补世界模型与三维感知,00 后季马泽宇曾是硅谷物理智能公司 ARI(后被 Meta 收购)创始成员,负责人形全身控制的真机验证。公司已完成累计数亿元人民币融资,AutoResearch 平台已向清华、北大、MIT、加州理工等高校师生开放内测——把研发基础设施当产品卖,是比卖模型更早一步的生意。

判断:「弱 RSI」的实质是把调参、跑实验、写评测这些研究流程里的重复劳动外包给 Agent,方向判断与安全边界仍在人手里——这与Anthropic在数字世界的进展是同一件事,只是物理世界的迭代成本高一个量级(一次失败的抓取意味着重新采集与重训)。需要保持警惕的是:登顶成绩为厂商自主提交的评测结果,「数亿元融资」与「三个月」的时间线均为厂商单一口径;真正值得跟踪的不是榜单名次,而是它承诺的三篇技术报告——模型规模至今未披露,这是评判成色的最低门槛。
来源:RoboDojo 官方榜单(https://robodojo-benchmark.com/leaderboard,2026-09-23 更新,本站 2026-09-27 直接核对);机器之心 Pro 2026-09-23 20:31;智东西 2026-09-24(https://zhidx.com/p/596826)。素材时间窗:当日 09:00 → 19:00。