# 56% 到 95%：三个 coding agent 写出来的规划器，把手工 TAMP 的 47% 甩在身后，但最差那个只高 9 个点

> 980 个程序、98,000 次评测，三种 agent 配置的平均成功率是 56% 到 95%。真正该读的不是那个 95%，是这段 39 个百分点的跨度——以及"推理时不再有 LLM 参与"这件事本身。

### TLDR

- **论文的规模**：28 个来自 **KinDER 与 PDDLStream** 的仿真环境，**980 个生成的程序**各在 **100 个留出实例**上评测，合计 **98,000 次评估回合**。测试实例的物体数量**超过原始基准所评测的数量**。
- **三种配置，一个区间**：Claude Code（Opus 5）、Codex（GPT-5.6 Sol）、Codex（GPT-6 Astra）。在**有手工规划器可对照的 16 个环境**上，三种配置的平均成功率为 **56% 至 95%**，手工规划器为 **47%**。
- **区间跨度 39 个百分点**：最差的一种配置只比手工规划器高 **9 个百分点**；差距没有被平均掉。
- **规模变大会拉开差距**：随着物体数量增长，agent 写出的程序**保持更高成功率**，且每个实例平均**少用一个数量级的计算量**。
- **推理阶段没有 LLM**：程序在合成预算内生成后即**冻结**，在未见实例上做零样本推理，**推理阶段不再有任何 LLM 介入**。
- **作者自己的一句话**：Tom Silver 在 09-26 早间的长帖里说，机器人出现意外行为通常意味着 **bug**，而这是他职业生涯中**少见的几次看到机器人"意外地聪明"**——做出了团队里没有人预料到的物理推理。

### SRC

本文事实以 arXiv 预印本 **2609.30233**《Coding Agents for Generalized Task and Motion Planning Problems》摘要与公开报道为准，作者信息、实验设置与成绩取自论文摘要的中文编译版（PaperReading / 钛媒体 2026-09-25 深度解读）与 AGI HUNT 2026-09-26 期收录；作者 Tom Silver 的定性表述来自其 **2026-09-26 早间**发布的 X 长帖（AGI HUNT 转述）。素材时间窗为**前一日 18:00 → 当日 09:00**：论文预印本上线于 **2026-09-24**，属窗口外但**在近 3 日内**；**窗口内新增量有三项**——① Tom Silver 于 09-26 早间首次公开其定性观察与具体案例（"预期 vs 实际"对照、其偏好的 2D 案例、一个更慢但可能更鲁棒的解法）；② AGI HUNT 2026-09-26 期首次将该工作收录进当日具身条目并给出 98,000 次评测的规模口径；③ 中文深度解读在窗口内落地。本文按"近期进展 + 补充解读"处理，**落点是分数分布与部署形态，不是事件报道**。需要明示的边界：① 论文为**预印本，未经同行评审**；② 全部实验在**仿真环境**中完成，**无真机验证**；③ "56% 至 95%"为**三种配置的区间**，报道**未逐一对齐哪种配置对应哪个分数**，本文无法归因到具体模型；④ 对比基准 47% 仅存在于**16 个有手工规划器的环境**，其余 12 个环境无此对照；⑤ AGI HUNT 提到的"每次运行约 20 美元模型调用预算"为**该转述稿口径**，论文摘要中表述为"固定合成预算（fixed synthesis budget）"，**未给出金额**，本文不将 20 美元作为论文数据引用；⑥ "少一个数量级计算量"为论文摘要表述，未说明度量方式（墙钟时间或浮点运算数）；⑦ 作者"意外地聪明"的表述为**主观定性判断**，附带的案例为定性示例，**无量化指标**。与存量稿件的差异：本站研究解读类写过 Hydra-0 动作流评测口径、RoboHarm 拒绝评测、RoboDawn 真机分布落差，共同方法是"**读分布不读总分**"；本篇沿用该方法，但对象是**规划器生成方式**而非模型能力。判断性内容均以"判断："开头。

### BODY

<div class="sec">
<div class="eyebrow">先说被标题吃掉的那一半</div>
<p>几乎所有转述都把这条工作写成"coding agent 碾压手工规划器：95% vs 47%"。但论文摘要给出的其实是**一个区间，不是一个分数**：在有对照的 16 个环境上，三种 agent 配置的平均成功率是 **56% 至 95%**，而手工规划器是 **47%**。</p>
<p>把这三个数摆在一起，画面会变：</p>
<div class="jx-bars">
<div class="jx-bar-row"><div class="jx-bar-lab">最佳 agent 配置</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:95%"></div></div><div class="jx-bar-val">95%</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">最差 agent 配置</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:56%"></div></div><div class="jx-bar-val">56%</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">手工规划器</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:47%"></div></div><div class="jx-bar-val">47%</div></div>
</div>
<div class="jx-legend"><div class="jx-lg">16 个有对照环境的平均成功率；条长即百分比。三种配置的具体对应关系未披露</div></div>
<p>最差的那一种配置，只比手工规划器高 **9 个百分点**。这不是"碾压"，这是"有的场景赢很多、有的场景勉强赢"。</p>
<div class="keypoint">判断：区间跨度 39 个百分点，说明**变量不在"用不用 agent"，而在"用哪个 agent、怎么配"**。论文摘要没有逐一对齐配置与分数，这恰恰是工程上最想知道的信息。对打算照抄这条路线的人，真正要问的不是"coding agent 行不行"，而是"**我的任务落在 28 个环境里的哪一档**"，以及"我能接受 56% 那一档吗"。把 95% 当结论去立项，是最容易踩的坑。</div>
</div>

<div class="sec">
<div class="eyebrow">它把 LLM 从规划器换成了编译器</div>
<p>理解这条工作，关键不是分数，是它改变了 LLM 在机器人系统里的**位置**。</p>
<div class="jx-tl">
<div class="jx-tl-row"><div class="jx-tl-t">传统做法</div><div class="jx-tl-b">LLM 在运行时做规划——每一步都问一次模型，延迟与成本随任务长度线性增长</div></div>
<div class="jx-tl-row"><div class="jx-tl-t">广义 TAMP</div><div class="jx-tl-b">人工设计符号谓词、手写操作符、精调采样器参数，跨实例复用规律以减少规划量</div></div>
<div class="jx-tl-row"><div class="jx-tl-t">本篇做法</div><div class="jx-tl-b">给 agent 一个任务描述 + 一个可交互仿真器 + 固定预算，让它自己写出一个程序</div></div>
<div class="jx-tl-row"><div class="jx-tl-t">部署形态</div><div class="jx-tl-b">程序<strong>冻结</strong>后在未见实例上零样本运行，推理阶段<strong>没有任何 LLM 介入</strong></div></div>
</div>
<p>最后一行是全部意义所在。模型只在"合成阶段"出现一次，产出的**纯代码程序**被部署到机器上。这意味着运行时的延迟、成本、网络依赖与模型可用性风险，全部被一次性地移出了关键路径。</p>
<div class="keypoint">判断：这个形态对工业场景的吸引力，比分数本身大得多。工厂不愿意在产线节拍里挂一个需要联网调用的大模型——不只因为延迟抖动，还因为**不可审计、不可复现、以及模型版本变更会导致行为漂移**。一个冻结下来的程序，可以做版本管理、可以做回归测试、可以过安全认证。**"LLM 从规划器变成编译器"这句话，本质上是把非确定性的东西关进了编译期。**</div>
</div>

<div class="sec">
<div class="eyebrow">为什么是仿真器，而不是更多数据</div>
<p>论文摘要里有一句容易被跳过的话：日志显示 agent 利用与环境的交互来**校准物理模型、测试边界情况、修正策略**（calibrate physical models, test edge cases, refine strategies）。</p>
<p>这句话解释了 56% 与 95% 的差距可能来自哪里。同样是"写代码"，一种是直接一次性生成，另一种是**先做实验再写**。前者是代码生成，后者是工程方法——差别在于有没有反馈闭环。</p>
<div class="jx-split">
<div style="flex:44">
<div class="eyebrow">一次性生成</div>
<p>任务描述 → 程序。快，但物理参数、碰撞容差、动力学边界全靠模型 priors 猜。论文将其列为对照方法之一，被三种 agent 配置击败。</p>
</div>
<div style="flex:44">
<div class="eyebrow">闭环合成</div>
<p>任务描述 + 仿真器 → 反复探测、校准、试错 → 冻结程序。慢，但把不确定性留在了编译期。</p>
</div>
</div>
<div class="keypoint">判断：这里的真正资产不是"更好的模型"，是**一个足够快的仿真器**。整个方法的经济性取决于"跑一次仿真的成本"与"跑一次真机的成本"之比——比值越低，用仿真换真机的杠杆越大。这反过来说明了一件事：**具身智能的基础设施竞赛里，仿真器的保真度与速度是被低估的一环**。谁掌握高保真、低延迟、可批量并行的仿真环境，谁就能把"写代码"这件事规模化。论文把全部代码与 agent 提示词开源，等于把这套杠杆公开了。</div>
</div>

<div class="sec">
<div class="eyebrow">规模越大，差距越大——这条比分数重要</div>
<p>论文摘要中最有产业含义的一句：随着物体数量增长，agent 写出的程序**比手工规划器更好地保持成功率**，且每个实例平均**少用一个数量级的计算量**。</p>
<p>注意测试的设定：物体数量**超过原始基准所评测的数量**。也就是说，这不是在基准的原难度上比较，而是**把难度推到基准之外**再比较。</p>
<div class="tbl-wrap">
<table>
<thead><tr><th>维度</th><th>论文口径</th><th>为什么重要</th></tr></thead>
<tbody>
<tr><td>成功率随规模衰减</td><td>agent 程序衰减更慢</td><td>决定能不能用于杂乱、多物体的真实工位</td></tr>
<tr><td>单实例计算量</td><td>少约一个数量级</td><td>决定能不能跑在边缘算力上</td></tr>
<tr><td>测试难度</td><td>物体数超出原基准</td><td>排除了"在熟悉难度上刷分"的可能</td></tr>
<tr><td>验证环境</td><td>仅仿真，无真机</td><td>仿真到真机的落差未测量</td></tr>
</tbody>
</table>
</div>
<div class="cap">表：按论文摘要整理。最后一行为本文补充的边界说明。</div>
<div class="keypoint">判断：**"规模越大差距越大"是这条工作最有价值的一条结论**，因为它指向的正是工业场景的真实形态——料框里的零件数量不固定、来料姿态不固定、遮挡情况不固定。手工规划器在物体变多时遭遇的是组合爆炸，这是结构性的，不是工程调优能解决的。如果 agent 生成的程序确实在大规模下衰减更慢，那么它的适用区间是**高杂乱度工位**，而不是简单重复动作。这也意味着，把它用在"分拣两个零件"这种简单任务上是浪费。</div>
</div>

<div class="sec">
<div class="eyebrow">"意外地聪明"，以及它为什么不能当指标</div>
<p>Tom Silver 在 09-26 早间的长帖里给了一句很有传播力的话：机器人出现意外行为通常意味着 **bug**，而这是他职业生涯中**少见的几次看到机器人"意外地聪明"**——做出了团队里没有人预料到的物理推理。</p>
<p>他贴了若干案例：预期行为与实际行为的对照、他最喜欢的 2D 案例、以及一个**更慢但可能更鲁棒**的解法。</p>
<div class="keypoint">判断：这句话值得传播，但**不能被当成指标用**。"意外地聪明"是事后从日志里挑出来的，**分母不明**——我们不知道 98,000 次评测里有多少次是"意外地愚蠢"并被算进了失败率。真正值得借鉴的是最后那个例子：**一个更慢但可能更鲁棒的解法被保留了下来**。这说明 agent 在合成阶段形成了某种对鲁棒性的偏好，而这恰恰是手工规划器最难编码的东西。如果这种现象可以被量化——比如统计生成程序中"牺牲速度换取稳定性"的比例——它会是比 95% 更有说服力的结论。</div>
<p>把整件事收拢一下：这篇论文真正的贡献不是"agent 赢了 48 个百分点"，而是提供了一条**可复制的路径**——任务描述 + 仿真器 + 固定预算 → 冻结程序 → 零样本部署，且代码与提示词全部开源。这条路径的成本门槛只取决于三件事：仿真器的保真度与速度、合成阶段的预算、以及你的任务在 28 个环境的光谱上落在哪里。</p>
</div>

<div class="srcline">参考来源：arXiv:2609.30233（预印本，未经同行评审）；Tom Silver 2026-09-26 早间 X 长帖（AGI HUNT 转述）；AGI HUNT 2026-09-26 期；钛媒体 2026-09-25 深度解读。抓取日期 2026-09-26。</div>

---

*来源：神机百见-具身解读 · https://www.shenjibailian.com/jiedu/article/agenticgentamp-coding-agents-beat-tamp-planners/*
