# 银河通用替全行业测了一遍 GPT-6 Astra：98% 的零样本成功率，和只准修 5 厘米的纠偏器

> GPT-6 Astra 发布不到两周，最先系统测出它具身能力边界的，是一支中国团队。报告里最值钱的不是 98%，而是那条被写死的纠偏边界：单臂修正不超过 5 厘米。

### TLDR

- **评测主体**：银河通用团队发布《GPT-6 Astra as an Embodied Policy》报告，第一作者为王鹤教授博士生，是 GPT-6 Astra（9 月 3 日发布）发布后**首个系统性具身能力评测**。
- **零样本成绩**：RoboLab 十个任务、每任务 5 次，Astra 直接控制成功率 **98%**（49/50），π0.5+Astra 混合 92%，π0.5 单独只有 **36%**。
- **长程任务反转**：RoboDojo 十个双臂任务上，混合架构拿到 **62.60 分、48% 成功率**，Astra 直接控制反而跌到 26%——语义越复杂、越需要分工。
- **纠偏边界**：混合系统里 Astra 只修正 **14.4%** 的控制步，单臂位置修正不超过 **5 厘米**、旋转不超过 **0.35 rad**，修正被刻意限制在短窗口内。
- **硬边界**：报告明确承认**延迟未解决**——仿真里世界会等模型思考，真机上不会。

### SRC

素材时间窗为当日 09:00 → 19:00。GPT-6 Astra 由 OpenAI 于 2026-09-03 发布（窗口外事件），本篇的窗口内新增量是：银河通用团队评测报告于 9 月 16 日前后在具身圈扩散、9 月 16–17 日中文报道密集出现（火星财经 9/16 18:06、机器之心 9/17 15:39 转载分析、具身智能之心编译），9 月 17 日白天中文圈对报告的解读形成集中增量，本篇写作于该窗口内。核心事实依据报告项目页（anonymous-report-421.github.io）与多源转述交叉核对；RoboLab/RoboDojo 两组数字在火星财经、具身智能之心、Humanoids Daily 三个独立转述源中一致。需要注意的边界：RoboDojo 任务子集是按「π0.5 公开成功率较低的任务」挑选的，不是全基准扫描；公开榜单对比数据由作者从已发表任务聚合数据重算，未用同一随机种子复跑。延迟问题的表述直接引自报告自述。

### BODY

<div class="sec">
<div class="eyebrow">为什么这份报告重要：定义问题的人换了</div>

GPT-6 Astra 发布后，海外开发者陆续放出零散演示：有人给它看人类视频让它复现动作，有人让它规划机械臂任务。但「演示」和「评测」是两回事——演示回答「能不能」，评测回答「边界在哪」。银河通用团队这次做的事，是把一个发布不到两周的通用大模型，放进两套成熟基准里，用严格对齐的闭环控制实验把它的能力边界画了出来。

报告的核心问题是具身圈争了几个月的那道选择题：大模型应该直接当策略（direct），还是站在现有策略旁边做纠偏器（hybrid）？报告用两组数字给出了不对称的答案。

<div class="jx-split">
<div style="flex:44">
<div class="jx-note"><b>RoboLab（零样本，10 任务×5 次）</b><br>Astra 直接控制：<b>98%</b>（49/50）<br>π0.5+Astra 混合：92%（46/50）<br>π0.5 单独：36%<br>Cosmos3-Nano-Policy：36%<br>DreamZero：34%<br>——任务以语义抓放为主，学生策略零样本迁移。</div>
</div>
<div style="flex:56">
<div class="jx-note"><b>RoboDojo（10 个双臂长程任务）</b><br>π0.5+Astra 混合：<b>62.60 分 / 48%</b>（24/50）<br>Galaxea G0.5（公开榜）：38.26<br>Astra 直接控制：37.81 分 / 26%（13/50）<br>π0.5 单独：约 24/50 中的低位<br>——混合较直接控制成功率高出 22 个百分点。</div>
</div>
</div>
</div>

<div class="sec">
<div class="eyebrow">任务越难，分工越值钱</div>

分任务看，结论更锋利。语义类任务（按语言分类、模仿排序、排出最大数字）上，π0.5 几乎零分——0.60、1.60、2.29——而混合架构直接拉到 38 到 53 分。这类题难在「想」：要读懂指令里哪个类别进哪个篮子，要记住刚才示范的顺序。一个靠模仿轨迹长大的 VLA 最难学的，恰是 GPT 最擅长的。反过来，接触类任务（搭塔、麻将杠牌）上，GPT 直接上手只有 12 分和 0 分，混合架构 64 和 40 分；柔性物体叠衣服，π0.5 只有 29.12 分，混合架构拿到 100 分。

最能说明工程思路的是一个比例：全部 50 条混合轨迹共执行 42,750 个控制步，其中 Astra 只修正了 14.4%。其余 85.6% 的动作，π0.5 自己做就够了。Astra 的介入方式也被刻意写死：可以继续执行 π0.5 的动作段，可以做 1–5 步的小幅偏移，可以给出短步长末端执行器目标——单臂位置修正不超过 5 厘米、旋转不超过 0.35 rad，每次执行后重新观察再进下一轮。

<div class="keypoint">判断：这条 5 厘米的边界线，比 98% 的成功率更值得抄。它承认了一个事实——大模型的推理能力和误判、幻觉、不确定性是一枚硬币的两面，放进物理世界之前必须先给它套上笼子。短期最现实的架构不是大模型接管机器人，而是「连续操作交给具身策略，目标、几何关系和任务进度偏差交给通用模型重新判断」的分层闭环。这对自研具身大脑的团队是直接可复用的架构参考。</div>
</div>

<div class="sec">
<div class="eyebrow">被一句话带过、却最致命的边界：延迟</div>

报告有一处自白容易被热捧淹没：仿真环境里，Astra 可以慢慢想，世界会等它；报告给出的物理时长**不包含模型响应延迟**，作者自己把延迟列为实时部署未解决的障碍。Humanoids Daily 的核查也提醒，RoboDojo 子集按低 π0.5 成功率任务挑选，结果不能外推为「通用推理已让专用策略过时」。

另外两条边界同样要记录：公开榜单对比是从已发表数据重算的，不是同种子复跑；9 月 9 日的人类视频复现演示、9 月 14–15 日的厨房实验（三次迭代才接近成功，中途橘子汁掉了、托盘穿过夹爪）都仍是「演示」而非可重复试验。

<div class="jx-tl">
<div class="jx-tl-row"><div class="jx-tl-t">9 月 3 日</div><div class="jx-tl-b">OpenAI 发布 GPT-6 Astra；ARC-AGI-3 拿下 99.9%，96% 关卡达到或超过人类行动效率基准。</div></div>
<div class="jx-tl-row"><div class="jx-tl-t">9 月 9 日</div><div class="jx-tl-b">开发者 Wenli Xiao 报告：给 Astra 看人类任务视频，首次尝试即驱动机械臂复现，被称为「物理上下文学习」。</div></div>
<div class="jx-tl-row"><div class="jx-tl-t">9 月 14–15 日</div><div class="jx-tl-b">厨房模拟实验三次迭代：障碍停机→托盘穿透夹爪→换线束后接近成功。</div></div>
<div class="jx-tl-row"><div class="jx-tl-t">9 月 16–17 日</div><div class="jx-tl-b">银河通用评测报告在具身圈扩散，中文解读密集出现，分层架构成为讨论主线。</div></div>
</div>

<div class="keypoint">判断：这份报告真正的战略含义在于竞争门槛的重写方式。OpenAI 没有做机器人 demo，而是用万亿参数、上千万小时混合具身数据把「跨本体视觉推理规划」做成通用能力，再用「受限纠偏器」这个角色卡进控制闭环——它不抢整机厂的活，但把「大脑」这一层的定价权攥在了手里。中国团队最先测出边界是好事，但「测别人的边界」和「定义自己的问题」是两件事。下一次具身圈的关键报告，希望署名不再只是复核者。</div>

<div class="srcline">来源：银河通用团队报告项目页（anonymous-report-421.github.io）+ 火星财经 2026-09-16 报道 + 机器之心 9-17 转载分析 + Humanoids Daily 英文核查交叉核对；素材时间窗：当日 09:00 → 19:00（事件增量窗口）。</div>
</div>

---

*来源：神机百见-具身解读 · https://www.shenjibailian.com/jiedu/article/gpt6-astra-galbot-embodied-policy-review/*
