研究解读 · 神机百见-具身解读

银河通用替全行业测了一遍 GPT-6 Astra:98% 的零样本成功率,和只准修 5 厘米的纠偏器

GPT-6 Astra 发布不到两周,最先系统测出它具身能力边界的,是一支中国团队。报告里最值钱的不是 98%,而是那条被写死的纠偏边界:单臂修正不超过 5 厘米。

一分钟速览
  1. 评测主体:银河通用团队发布《GPT-6 Astra as an Embodied Policy》报告,第一作者为王鹤教授博士生,是 GPT-6 Astra(9 月 3 日发布)发布后首个系统性具身能力评测。
  2. 零样本成绩:RoboLab 十个任务、每任务 5 次,Astra 直接控制成功率 98%(49/50),π0.5+Astra 混合 92%,π0.5 单独只有 36%。
  3. 长程任务反转:RoboDojo 十个双臂任务上,混合架构拿到 62.60 分、48% 成功率,Astra 直接控制反而跌到 26%——语义越复杂、越需要分工。
  4. 纠偏边界:混合系统里 Astra 只修正 14.4% 的控制步,单臂位置修正不超过 5 厘米、旋转不超过 0.35 rad,修正被刻意限制在短窗口内。
  5. 硬边界:报告明确承认延迟未解决——仿真里世界会等模型思考,真机上不会。
数据来源与边界
素材时间窗为当日 09:00 → 19:00。GPT-6 Astra 由 OpenAI 于 2026-09-03 发布(窗口外事件),本篇的窗口内新增量是:银河通用团队评测报告于 9 月 16 日前后在具身圈扩散、9 月 16–17 日中文报道密集出现(火星财经 9/16 18:06、机器之心 9/17 15:39 转载分析、具身智能之心编译),9 月 17 日白天中文圈对报告的解读形成集中增量,本篇写作于该窗口内。核心事实依据报告项目页(anonymous-report-421.github.io)与多源转述交叉核对;RoboLab/RoboDojo 两组数字在火星财经、具身智能之心、Humanoids Daily 三个独立转述源中一致。需要注意的边界:RoboDojo 任务子集是按「π0.5 公开成功率较低的任务」挑选的,不是全基准扫描;公开榜单对比数据由作者从已发表任务聚合数据重算,未用同一随机种子复跑。延迟问题的表述直接引自报告自述。
本文事实信息来自上方标注的公开来源;解读、判断与延伸部分为作者个人见解,写作过程使用了 AI 工具辅助整理,已由作者人工核实,不代表信息来源方立场。如有雷同纯属巧合;如涉及版权或权益问题,请联系 shenjibailian@shenjibailian.com,我们将在核实后及时删除或更正。
为什么这份报告重要:定义问题的人换了

GPT-6 Astra 发布后,海外开发者陆续放出零散演示:有人给它看人类视频让它复现动作,有人让它规划机械臂任务。但「演示」和「评测」是两回事——演示回答「能不能」,评测回答「边界在哪」。银河通用团队这次做的事,是把一个发布不到两周的通用大模型,放进两套成熟基准里,用严格对齐的闭环控制实验把它的能力边界画了出来。

报告的核心问题是具身圈争了几个月的那道选择题:大模型应该直接当策略(direct),还是站在现有策略旁边做纠偏器(hybrid)?报告用两组数字给出了不对称的答案。

RoboLab(零样本,10 任务×5 次)
Astra 直接控制:98%(49/50)
π0.5+Astra 混合:92%(46/50)
π0.5 单独:36%
Cosmos3-Nano-Policy:36%
DreamZero:34%
——任务以语义抓放为主,学生策略零样本迁移。
RoboDojo(10 个双臂长程任务)
π0.5+Astra 混合:62.60 分 / 48%(24/50)
Galaxea G0.5(公开榜):38.26
Astra 直接控制:37.81 分 / 26%(13/50)
π0.5 单独:约 24/50 中的低位
——混合较直接控制成功率高出 22 个百分点。
任务越难,分工越值钱

分任务看,结论更锋利。语义类任务(按语言分类、模仿排序、排出最大数字)上,π0.5 几乎零分——0.60、1.60、2.29——而混合架构直接拉到 38 到 53 分。这类题难在「想」:要读懂指令里哪个类别进哪个篮子,要记住刚才示范的顺序。一个靠模仿轨迹长大的 VLA 最难学的,恰是 GPT 最擅长的。反过来,接触类任务(搭塔、麻将杠牌)上,GPT 直接上手只有 12 分和 0 分,混合架构 64 和 40 分;柔性物体叠衣服,π0.5 只有 29.12 分,混合架构拿到 100 分。

最能说明工程思路的是一个比例:全部 50 条混合轨迹共执行 42,750 个控制步,其中 Astra 只修正了 14.4%。其余 85.6% 的动作,π0.5 自己做就够了。Astra 的介入方式也被刻意写死:可以继续执行 π0.5 的动作段,可以做 1–5 步的小幅偏移,可以给出短步长末端执行器目标——单臂位置修正不超过 5 厘米、旋转不超过 0.35 rad,每次执行后重新观察再进下一轮。

判断:这条 5 厘米的边界线,比 98% 的成功率更值得抄。它承认了一个事实——大模型的推理能力和误判、幻觉、不确定性是一枚硬币的两面,放进物理世界之前必须先给它套上笼子。短期最现实的架构不是大模型接管机器人,而是「连续操作交给具身策略,目标、几何关系和任务进度偏差交给通用模型重新判断」的分层闭环。这对自研具身大脑的团队是直接可复用的架构参考。
被一句话带过、却最致命的边界:延迟

报告有一处自白容易被热捧淹没:仿真环境里,Astra 可以慢慢想,世界会等它;报告给出的物理时长不包含模型响应延迟,作者自己把延迟列为实时部署未解决的障碍。Humanoids Daily 的核查也提醒,RoboDojo 子集按低 π0.5 成功率任务挑选,结果不能外推为「通用推理已让专用策略过时」。

另外两条边界同样要记录:公开榜单对比是从已发表数据重算的,不是同种子复跑;9 月 9 日的人类视频复现演示、9 月 14–15 日的厨房实验(三次迭代才接近成功,中途橘子汁掉了、托盘穿过夹爪)都仍是「演示」而非可重复试验。

9 月 3 日
OpenAI 发布 GPT-6 Astra;ARC-AGI-3 拿下 99.9%,96% 关卡达到或超过人类行动效率基准。
9 月 9 日
开发者 Wenli Xiao 报告:给 Astra 看人类任务视频,首次尝试即驱动机械臂复现,被称为「物理上下文学习」。
9 月 14–15 日
厨房模拟实验三次迭代:障碍停机→托盘穿透夹爪→换线束后接近成功。
9 月 16–17 日
银河通用评测报告在具身圈扩散,中文解读密集出现,分层架构成为讨论主线。
判断:这份报告真正的战略含义在于竞争门槛的重写方式。OpenAI 没有做机器人 demo,而是用万亿参数、上千万小时混合具身数据把「跨本体视觉推理规划」做成通用能力,再用「受限纠偏器」这个角色卡进控制闭环——它不抢整机厂的活,但把「大脑」这一层的定价权攥在了手里。中国团队最先测出边界是好事,但「测别人的边界」和「定义自己的问题」是两件事。下一次具身圈的关键报告,希望署名不再只是复核者。
来源:银河通用团队报告项目页(anonymous-report-421.github.io)+ 火星财经 2026-09-16 报道 + 机器之心 9-17 转载分析 + Humanoids Daily 英文核查交叉核对;素材时间窗:当日 09:00 → 19:00(事件增量窗口)。