研究解读 · 神机百见-具身解读
56% 到 95%:三个 coding agent 写出来的规划器,把手工 TAMP 的 47% 甩在身后,但最差那个只高 9 个点
980 个程序、98,000 次评测,三种 agent 配置的平均成功率是 56% 到 95%。真正该读的不是那个 95%,是这段 39 个百分点的跨度——以及"推理时不再有 LLM 参与"这件事本身。
一分钟速览
- 论文的规模:28 个来自 KinDER 与 PDDLStream 的仿真环境,980 个生成的程序各在 100 个留出实例上评测,合计 98,000 次评估回合。测试实例的物体数量超过原始基准所评测的数量。
- 三种配置,一个区间:Claude Code(Opus 5)、Codex(GPT-5.6 Sol)、Codex(GPT-6 Astra)。在有手工规划器可对照的 16 个环境上,三种配置的平均成功率为 56% 至 95%,手工规划器为 47%。
- 区间跨度 39 个百分点:最差的一种配置只比手工规划器高 9 个百分点;差距没有被平均掉。
- 规模变大会拉开差距:随着物体数量增长,agent 写出的程序保持更高成功率,且每个实例平均少用一个数量级的计算量。
- 推理阶段没有 LLM:程序在合成预算内生成后即冻结,在未见实例上做零样本推理,推理阶段不再有任何 LLM 介入。
- 作者自己的一句话:Tom Silver 在 09-26 早间的长帖里说,机器人出现意外行为通常意味着 bug,而这是他职业生涯中少见的几次看到机器人"意外地聪明"——做出了团队里没有人预料到的物理推理。
数据来源与边界
本文事实以 arXiv 预印本
2609.30233《Coding Agents for Generalized Task and Motion Planning Problems》摘要与公开报道为准,作者信息、实验设置与成绩取自论文摘要的中文编译版(PaperReading / 钛媒体 2026-09-25 深度解读)与 AGI HUNT 2026-09-26 期收录;作者 Tom Silver 的定性表述来自其
2026-09-26 早间发布的 X 长帖(AGI HUNT 转述)。素材时间窗为
前一日 18:00 → 当日 09:00:论文预印本上线于
2026-09-24,属窗口外但
在近 3 日内;
窗口内新增量有三项——① Tom Silver 于 09-26 早间首次公开其定性观察与具体案例("预期 vs 实际"对照、其偏好的 2D 案例、一个更慢但可能更鲁棒的解法);② AGI HUNT 2026-09-26 期首次将该工作收录进当日具身条目并给出 98,000 次评测的规模口径;③ 中文深度解读在窗口内落地。本文按"近期进展 + 补充解读"处理,
落点是分数分布与部署形态,不是事件报道。需要明示的边界:① 论文为
预印本,未经同行评审;② 全部实验在
仿真环境中完成,
无真机验证;③ "56% 至 95%"为
三种配置的区间,报道
未逐一对齐哪种配置对应哪个分数,本文无法归因到具体模型;④ 对比基准 47% 仅存在于
16 个有手工规划器的环境,其余 12 个环境无此对照;⑤ AGI HUNT 提到的"每次运行约 20 美元模型调用预算"为
该转述稿口径,论文摘要中表述为"固定合成预算(fixed synthesis budget)",
未给出金额,本文不将 20 美元作为论文数据引用;⑥ "少一个数量级计算量"为论文摘要表述,未说明度量方式(墙钟时间或浮点运算数);⑦ 作者"意外地聪明"的表述为
主观定性判断,附带的案例为定性示例,
无量化指标。与存量稿件的差异:本站研究解读类写过 Hydra-0 动作流评测口径、RoboHarm 拒绝评测、RoboDawn 真机分布落差,共同方法是"
读分布不读总分";本篇沿用该方法,但对象是
规划器生成方式而非模型能力。判断性内容均以"判断:"开头。
本文事实信息来自上方标注的公开来源;解读、判断与延伸部分为作者个人见解,写作过程使用了 AI 工具辅助整理,已由作者人工核实,不代表信息来源方立场。如有雷同纯属巧合;如涉及版权或权益问题,请联系 shenjibailian@shenjibailian.com,我们将在核实后及时删除或更正。
先说被标题吃掉的那一半
几乎所有转述都把这条工作写成"coding agent 碾压手工规划器:95% vs 47%"。但论文摘要给出的其实是**一个区间,不是一个分数**:在有对照的 16 个环境上,三种 agent 配置的平均成功率是 **56% 至 95%**,而手工规划器是 **47%**。
把这三个数摆在一起,画面会变:
16 个有对照环境的平均成功率;条长即百分比。三种配置的具体对应关系未披露
最差的那一种配置,只比手工规划器高 **9 个百分点**。这不是"碾压",这是"有的场景赢很多、有的场景勉强赢"。
判断:区间跨度 39 个百分点,说明**变量不在"用不用 agent",而在"用哪个 agent、怎么配"**。论文摘要没有逐一对齐配置与分数,这恰恰是工程上最想知道的信息。对打算照抄这条路线的人,真正要问的不是"coding agent 行不行",而是"**我的任务落在 28 个环境里的哪一档**",以及"我能接受 56% 那一档吗"。把 95% 当结论去立项,是最容易踩的坑。
它把 LLM 从规划器换成了编译器
理解这条工作,关键不是分数,是它改变了 LLM 在机器人系统里的**位置**。
传统做法
LLM 在运行时做规划——每一步都问一次模型,延迟与成本随任务长度线性增长
广义 TAMP
人工设计符号谓词、手写操作符、精调采样器参数,跨实例复用规律以减少规划量
本篇做法
给 agent 一个任务描述 + 一个可交互仿真器 + 固定预算,让它自己写出一个程序
部署形态
程序冻结后在未见实例上零样本运行,推理阶段没有任何 LLM 介入
最后一行是全部意义所在。模型只在"合成阶段"出现一次,产出的**纯代码程序**被部署到机器上。这意味着运行时的延迟、成本、网络依赖与模型可用性风险,全部被一次性地移出了关键路径。
判断:这个形态对工业场景的吸引力,比分数本身大得多。工厂不愿意在产线节拍里挂一个需要联网调用的大模型——不只因为延迟抖动,还因为**不可审计、不可复现、以及模型版本变更会导致行为漂移**。一个冻结下来的程序,可以做版本管理、可以做回归测试、可以过安全认证。**"LLM 从规划器变成编译器"这句话,本质上是把非确定性的东西关进了编译期。**
为什么是仿真器,而不是更多数据
论文摘要里有一句容易被跳过的话:日志显示 agent 利用与环境的交互来**校准物理模型、测试边界情况、修正策略**(calibrate physical models, test edge cases, refine strategies)。
这句话解释了 56% 与 95% 的差距可能来自哪里。同样是"写代码",一种是直接一次性生成,另一种是**先做实验再写**。前者是代码生成,后者是工程方法——差别在于有没有反馈闭环。
一次性生成
任务描述 → 程序。快,但物理参数、碰撞容差、动力学边界全靠模型 priors 猜。论文将其列为对照方法之一,被三种 agent 配置击败。
闭环合成
任务描述 + 仿真器 → 反复探测、校准、试错 → 冻结程序。慢,但把不确定性留在了编译期。
判断:这里的真正资产不是"更好的模型",是**一个足够快的仿真器**。整个方法的经济性取决于"跑一次仿真的成本"与"跑一次真机的成本"之比——比值越低,用仿真换真机的杠杆越大。这反过来说明了一件事:**具身智能的基础设施竞赛里,仿真器的保真度与速度是被低估的一环**。谁掌握高保真、低延迟、可批量并行的仿真环境,谁就能把"写代码"这件事规模化。论文把全部代码与 agent 提示词开源,等于把这套杠杆公开了。
规模越大,差距越大——这条比分数重要
论文摘要中最有产业含义的一句:随着物体数量增长,agent 写出的程序**比手工规划器更好地保持成功率**,且每个实例平均**少用一个数量级的计算量**。
注意测试的设定:物体数量**超过原始基准所评测的数量**。也就是说,这不是在基准的原难度上比较,而是**把难度推到基准之外**再比较。
| 维度 | 论文口径 | 为什么重要 |
| 成功率随规模衰减 | agent 程序衰减更慢 | 决定能不能用于杂乱、多物体的真实工位 |
| 单实例计算量 | 少约一个数量级 | 决定能不能跑在边缘算力上 |
| 测试难度 | 物体数超出原基准 | 排除了"在熟悉难度上刷分"的可能 |
| 验证环境 | 仅仿真,无真机 | 仿真到真机的落差未测量 |
表:按论文摘要整理。最后一行为本文补充的边界说明。
判断:**"规模越大差距越大"是这条工作最有价值的一条结论**,因为它指向的正是工业场景的真实形态——料框里的零件数量不固定、来料姿态不固定、遮挡情况不固定。手工规划器在物体变多时遭遇的是组合爆炸,这是结构性的,不是工程调优能解决的。如果 agent 生成的程序确实在大规模下衰减更慢,那么它的适用区间是**高杂乱度工位**,而不是简单重复动作。这也意味着,把它用在"分拣两个零件"这种简单任务上是浪费。
"意外地聪明",以及它为什么不能当指标
Tom Silver 在 09-26 早间的长帖里给了一句很有传播力的话:机器人出现意外行为通常意味着 **bug**,而这是他职业生涯中**少见的几次看到机器人"意外地聪明"**——做出了团队里没有人预料到的物理推理。
他贴了若干案例:预期行为与实际行为的对照、他最喜欢的 2D 案例、以及一个**更慢但可能更鲁棒**的解法。
判断:这句话值得传播,但**不能被当成指标用**。"意外地聪明"是事后从日志里挑出来的,**分母不明**——我们不知道 98,000 次评测里有多少次是"意外地愚蠢"并被算进了失败率。真正值得借鉴的是最后那个例子:**一个更慢但可能更鲁棒的解法被保留了下来**。这说明 agent 在合成阶段形成了某种对鲁棒性的偏好,而这恰恰是手工规划器最难编码的东西。如果这种现象可以被量化——比如统计生成程序中"牺牲速度换取稳定性"的比例——它会是比 95% 更有说服力的结论。
把整件事收拢一下:这篇论文真正的贡献不是"agent 赢了 48 个百分点",而是提供了一条**可复制的路径**——任务描述 + 仿真器 + 固定预算 → 冻结程序 → 零样本部署,且代码与提示词全部开源。这条路径的成本门槛只取决于三件事:仿真器的保真度与速度、合成阶段的预算、以及你的任务在 28 个环境的光谱上落在哪里。
参考来源:arXiv:2609.30233(预印本,未经同行评审);Tom Silver 2026-09-26 早间 X 长帖(AGI HUNT 转述);AGI HUNT 2026-09-26 期;钛媒体 2026-09-25 深度解读。抓取日期 2026-09-26。