工具教程 · 神机百见-具身解读

一小时干净数据抵十七小时:pi0.5 那份两个月消融,把真机微调的杠杆序排出来了

两个月、一个真实制造任务、最终 98%。这份消融最有用的不是那个 98%,是它把四个杠杆按性价比排了序——加数据量排在最后一位,学习率和 batch size 被明确列为「意外地不重要」。

一分钟速览
  1. 实验设定:π0.5 在一个真实制造任务上的微调消融,历时两个月,数据与全部 run 均已公开,最终策略成功率 98%。
  2. 最弱杠杆是加数据量:单纯把数据增加 5 倍,成功率只从 63% 走到 76%,涨 13 个百分点。
  3. 同样四小时,换采法差 30 个点:4 小时数据分散到 5 个场景采集,比全部采在评测场景高出约 30 个百分点——数据量没变,只是重新分配。
  4. 一小时抵十七小时:在已有 21 小时数据基础上,只加 1 小时「更慢、更干净」的数据,成功率 76% → 90%,这一小时的贡献超过此前 17 小时的总和。
  5. 十二分之一的数据反超 12 个点:1 小时干净数据 + 240 次人工介入 rollout(合计 1.7 小时),从 28% 走到 88%,数据量约为 21 小时模型的十二分之一。
  6. 不用重训还能再涨一档:调整推理设置,21 小时模型 76% → 93%,21 小时+1 小时模型 90% → 98%。学习率、batch size、相对/绝对关节表示、图像增强四项被明确列为「意外地不重要」。
数据来源与边界
本文事实来自 AGI HUNT 2026 年 9 月 24 日期对 X 用户 DominiqueCAPaul 公开实验记录的转述,原实验说明其数据与全部 run 均已发布。素材时间窗为前一日 18:00 → 当日 09:00:AGI HUNT 该期为 2026-09-24 发布,英文源落在隔夜窗口内。需要明示的边界:① 本条为单一信源,且 AGI HUNT 页面自述其正文为 AI 生成摘要,本文所引全部数字均来自该摘要,未获论文、技术报告或第三方复现佐证;② 摘要未给出制造任务的具体内容、本体型号、成功率的判定标准与评测次数,因此 98% 这一数字不可与其他 VLA 基准横向比较;③ 「更慢、更干净」为原文表述,摘要未给出可量化的判定阈值(如速度上限、抖动容差),本文不代为定义。与存量稿件的差异:本站过往研究解读类稿件多聚焦模型架构与榜单分数,本篇是工程配方,落点在采集与推理阶段的可操作顺序,不涉及模型结构改进。判断性内容均以「判断:」开头。
本文事实信息来自上方标注的公开来源;解读、判断与延伸部分为作者个人见解,写作过程使用了 AI 工具辅助整理,已由作者人工核实,不代表信息来源方立场。如有雷同纯属巧合;如涉及版权或权益问题,请联系 shenjibailian@shenjibailian.com,我们将在核实后及时删除或更正。
先把四个杠杆按性价比排个序

这份消融的价值不在最终那个 98%,在于它把真机微调时能动的几个旋钮,按「投入产出比」排出了一个明确的顺序。下面这张表按每档提升所需代价重排。

杠杆变动成功率变化代价
推理设置不重训,调推理参数76%→93%;90%→98%最低(无训练成本)
数据质量21h 基础上 +1h 慢而干净76%→90%1 小时采集
场景分布4h 从 1 个场景改采 5 个场景提升约 30 个百分点零(总量不变)
数据规模数据量 ×563%→76%最高(5 倍采集)
表注:四档提升来自同一实验的不同消融条件,非叠加关系;场景分布一栏原文为「4h spread across five scenes beat 4h in the eval scene by 30pp」,未给出两端绝对值。数据来源:AGI HUNT 2026-09-24 转述。
推理设置(不重训)
98%
21h+1h 干净数据 + 推理调优
98%
21h+1h 干净数据
90%
21h 数据
76%
基准(少量数据)
63%
条形为各条件下的最终成功率,非等距时间轴。数据来源:AGI HUNT 2026-09-24 转述 DominiqueCAPaul 公开实验。
最反直觉的一条:加数据是最弱杠杆

把数据量翻 5 倍,成功率从 63% 到 76%。13 个百分点,方向是对的,但这是四个杠杆里投入最大、产出最小的一个。

这条结论对做真机落地的团队意义很直接:当一条产线上的策略卡在七成上下,第一反应通常是「再多采点数据」。这份消融给出的反证是——同样的时间预算,拿去采一小时高质量数据,或者拿去重新规划采集场景,回报都可能高于闷头加量。

判断:这条结论有一个前提必须说清——它成立于「已有 21 小时基线数据」这个量级上。数据量在极少时(比如从 0 到几小时)边际收益通常很高,消融里的 28% → 88% 那一条恰恰证明了这一点。所以正确的读法不是「数据不重要」,而是「数据的重要程度随基线量级快速衰减」。对预算有限的团队,判断该不该继续加量的方法很简单:先拿最近一次加量的实际提升做基准,如果最近一批数据的边际提升已经低于上一批的一半,就该换杠杆了。
零成本杠杆:四小时不变,只改场景分布

这是整份消融里性价比最高的一条。同样是 4 小时数据,分散到 5 个场景采集,比全部采在评测场景高出约 30 个百分点。

关键在于:采集成本没有增加。总时长还是 4 小时,变的只是这 4 小时花在哪里。这意味着「多场景」不是预算问题,是采集计划问题。

对现场团队的可操作含义是:不要把采集集中在一个工位、一种光照、一种来料状态上。评测场景内采集看起来最「对口」,实际效果最差——因为它把模型训练成了一个只在特定条件下有效的策略。

这一条的原文表述是「4h spread across five scenes beat 4h in the eval scene by 30pp」,摘要未说明 5 个场景如何选取、与评测场景的差异维度是什么(光照/背景/来料/工位角度等),也未给出两端的绝对成功率。本文只转述差值,不代为补充维度定义。
「慢而干净」这一小时到底做了什么

在 21 小时数据之上加 1 小时,成功率从 76% 抬到 90%,涨 14 个百分点——超过此前 17 小时的总贡献。原文对这一小时的描述是两个词:clean(干净)与slower(更慢)。

还有一条更强的对照:1 小时干净数据加 240 次人工介入 rollout,合计 1.7 小时,成功率从 28% 走到 88%,以约十二分之一的数据量反超 21 小时模型 12 个百分点。这两条合起来指向同一个机制——示范动作的可执行性比示范的数量更关键。

判断:「慢」这个字最容易被忽略,但工程含义最明确。人类操作员按正常工作节奏示范时,动作里包含大量为了效率而做的加速、插行与微操,这些段落在模仿学习里是噪声——策略学不到「为什么快」,只能学到「这段轨迹长这样」。把示范放慢,等于把任务的可执行区间显式暴露给模型。所以「慢」不是采集风格,是一种标注方式。

最后一档:不动权重也能涨

纯调推理设置,21 小时模型从 76% 到 93%,21 小时+1 小时模型从 90% 到 98%。这一档的成本几乎为零——不需要重新训练,不需要新数据。

更值得注意的是摘要里那句「意外地不重要」(surprisingly unimportant),列了四项:学习率、batch size、相对关节与绝对关节的表示选择、图像增强。

数据质量 / 分布
高影响
推理设置
高影响 · 零训练成本
学习率 / batch size
意外地不重要
图像增强
意外地不重要
条形为本文依据原文定性表述绘制的相对影响示意,非量化得分;原文仅给出「surprisingly unimportant」的归类,未提供数值。

这四项恰好是很多团队调参时最先花时间的地方。把它们往后放,是这份消融最直接的省时价值。

可抄的四步顺序
1
先调推理,不重训
成本最低的一档放在最前面,先榨干再谈训练
2
重排采集场景,不增加总量
同样小时数分散到多个场景;评测场景内集中采集是最差解
3
补一小时慢而干净的示范
放慢动作节奏,把可执行区间显式暴露出来
4
最后才考虑加量
用最近一批数据的边际提升做判据,衰减过半就换杠杆
判断:这份消融真正的贡献,是把「调不好就加数据」这个行业默认动作降级成了最后选项。但引用时必须守住边界——它是单一研究者在一个未具名的制造任务上跑出的结果,摘要没有给出任务定义、本体型号与成功率判定标准,因此这套杠杆序适合当作排查顺序使用,不适合当作预期提升幅度承诺。落到自己的项目上时,正确做法是照这个顺序各跑一次小规模验证,用自己的数据复现排序,而不是直接引用 30 个百分点或 14 个百分点这两个数。
来源:AGI HUNT 2026-09-24 期,转述 X 用户 DominiqueCAPaul 的公开实验记录(原实验数据与全部 run 已发布)。单一信源 + AI 生成摘要,未经第三方复现,抓取日期 2026-09-24。