研究解读 · 神机百见解读

星尘智能 SmoothRL:投掷 39% 到 94%,三个成功率数字该怎么读

动态投掷 39% 提到 94%,给笔戴帽 8% 提到 83%,开箱 30% 提到 90%。三个数字都很硬,但它们不是这篇报告里最值得看的部分。最值得看的是那条 30%→20%→40%→90% 的非单调曲线,和「机器人错法变了」这件事。

本篇目录5 节 · 12 分钟
一分钟速览
  1. 它解决的是一个很具体的工程错位:模型一次生成一段动作序列,但异步部署下机器人真正执行的往往只是其中一部分,在线强化学习却把整段一起优化,导致「没做过的动作也被记功或背锅」。
  2. 做法是把动作块切成三个区域:已提交(committed)、执行中(execution)、被丢弃(discarded),只让梯度穿过真正执行的那一区。
  3. 三个真机数字:动态投掷 39% → 94%,给笔戴帽 8% → 83%,快递开箱 30% → 90%,均在绳驱本体 S1 上完成。
  4. 关键参数是节奏:S1 以 30 Hz 执行动作,推理请求 5 Hz(每 200 毫秒一个新动作块),每次预测 32 帧,其中只有 6 帧真正被执行。
  5. 开箱那条曲线不是单调上升的:在 150 个 rollout 时成功率一度从 30% 掉到 20%,再回升到 40%,最后到 90%。
  6. 它不是自主进化:基础策略被冻结,只训残差修正,且依赖稀疏的成功/失败奖励,允许人工介入。
数据来源与边界
技术细节以星尘智能(Astribot)公开的 SmoothRL 技术报告为准,报告与无剪辑验证视频发布于 astribot.com/en/research/SmoothRL。中文报道以腾讯新闻·星河频率(2026-09-04)的版本最完整,云启创投(星尘天使轮领投方)的官方稿件提供了算法实现细节与团队署名,两者在三个成功率数字、动作块分区方案、30 Hz / 5 Hz 节奏参数上完全一致。搜狐科技(2026-09-04)的同题稿件在「给笔戴帽」的误差描述上出现自相矛盾(同一篇内既写「允许误差仅 5 毫米」又写「误差容忍≈一根头发丝直径」),本文采用 5 毫米这一出自技术报告口径的数字。项目负责人王佳楠,共同第一贡献者高广、农宇轩,黄百富参与研究。截至抓取时(2026-09-04),未见该工作的第三方复现或独立评测。
1问题出在哪

机器人手在做 A,模型在算 B

现在的 VLA 与世界—动作模型,通常一次生成未来一整段动作序列,也就是 action chunk。模型越来越大,推理耗时越来越长,而机器人不能每隔几百毫秒停下来等下一段结果——尤其在投掷这类任务里,停一拍,已经攒起来的速度就掉了。

所以真实部署里普遍采用异步推理:机器人继续执行手上的动作,模型在后台同时算下一段。手上做 A,模型已经在算 B。

这个安排解决了卡顿,却给在线强化学习出了一道新题。传统在线 RL 默认一种规整的节奏:模型算出动作,机器人执行,按结果更新策略——模型生成什么,机器人就执行什么。异步执行打破了这个对应关系。

一个动作块里的三种命运据 SmoothRL 技术报告,S1 实测节奏
Committed 已提交
6 帧
Execution 真正执行
6 帧
Discarded 被覆盖
20 帧
基础策略每次预测 32 帧;在固定延迟预算下,真正被机器人走完的只有 Execution 区那 6 帧,其余 20 帧在轮到它们之前就被下一个动作块替换掉了。

结果是:一整段动作块里,有些动作已经来不及改,有些真正执行了,还有一些根本没有发生过。如果强化学习照样把整段一起优化,就会出现一个很直接的荒诞——机器人没做过的动作,也可能因为这次任务成功而被记功,或者因为失败而背锅。

判断:这个问题的本质是「训练时的数据分布」和「部署时的数据分布」不一致,只不过不一致的维度不是图像或语言,而是时间。过去两年大家都在对齐场景分布,SmoothRL 对齐的是执行节奏——这个维度此前几乎没人公开处理。
2解法

只对真正执行过的动作求梯度

SmoothRL 的处理分两步。第一步把账算清楚:把 action chunk 按执行状态切成三个区域——已提交区(上一轮已经提交、不可再改)、执行区(本轮新生成、机器人实际会走完)、丢弃区(模型生成过但会被下一轮覆盖)。训练时只让梯度穿过执行区,机器人的优化目标才和它真实经历的过程一致。

第二步更关键:让训练和部署遵守同一套时间节奏。很多方案是在理想的同步环境里训练,到部署才切异步;SmoothRL 反过来,在训练 rollout 阶段就完整跑异步推理环路,让推理延迟、动作切换、执行节奏与真实部署保持一致。团队把这条原则概括为 Reinforce in Deployment

实现细节出自技术报告与云启创投稿件
项目取值 / 做法
基础策略各任务微调后的 π0.5,沿用 RLT 基本骨架
RL 结构轻量 TD3-style actor-critic
输出形式在原始动作空间预测残差修正(residual correction)
执行频率S1 本体 30 Hz
推理频率5 Hz,即每 200 ms 拿到一个新动作块
动作块长度32 帧,其中 6 帧属执行区
额外约束速度、加速度、加加速度的平滑性约束
注意「残差修正」这四个字:基础策略是冻结的,RL 只在其上叠加修正量。这决定了它的能力上限,也决定了它的适用边界。
3三个数字

39→94、8→83、30→90

三项真机验证都在星尘自研的绳驱本体 S1 上完成,覆盖两类互补能力:高速动态操作与高精度双臂操作。

三项真机任务的成功率变化横轴为累计 rollout episodes
动态投掷 · 基础策略
39%
动态投掷 · 在线 RL 后
94%
给笔戴帽 · 基础策略
8%
给笔戴帽 · 在线 RL 后
83%
快递开箱 · 基础策略
30%
快递开箱 · 在线 RL 后
90%
动态投掷需在摆动中持续加速并精准释放;给笔戴帽允许的相对位姿误差约 5 毫米;快递开箱要用约 1 毫米宽刀片插入仅 2–3 毫米宽的箱盖接缝。

但比数字更值得看的是错误模式的变化。在线 RL 之前,三项任务都有明显的系统性偏差:投掷时不能根据目标远近调节释放速度,开箱时刀片持续向左偏,给笔戴帽时对不同笔帽位置输出几乎一模一样的动作。这些不是随机噪声,是模型在异步失配下产生的固定偏移。

在线 RL 做的事情,是利用真实执行结果,一点一点把这些固定偏差修回来。到最终检查点,失败样本已经明显向成功位置收缩:开箱失败时刀片相对接缝的左右偏差约为 1–2 毫米,给笔戴帽的失败也主要变成正确位置附近的小幅错位。

判断:这三个数字里,真正有工程价值的是「错法变了」,不是「成功率涨了」。随机失败可以靠重试和冗余兜底,系统性偏差不行——它会让所有样本朝同一个方向错,数据量再大也纠不回来。判断一个后训练方案有没有用,先看它有没有改变失败分布,再看成功率。
4那条不上升的曲线

30% → 20% → 40% → 90%

快递开箱这项任务的学习曲线,是整份报告里信息密度最高、也最容易被快讯漏掉的一条。

快递开箱 · 成功率随 rollout 变化注意中段回落
0 轮
基础策略 30%,刀片稳定左偏
150 轮
一度跌到 20%,比起点还低
中段
回升至 40%
250 轮
达到 90%
真实在线探索并不保证单调变好。团队在报告里没有回避这段回落,这一点值得加分。

对做交付排期的人来说,这条曲线的意义超过三个终点数字。它意味着在线 RL 的收敛过程不能按「越跑越好」来做计划:中间存在性能回退窗口,而且回退幅度可能大到低于起点。如果你的验收节点恰好落在那个窗口里,你会得出完全相反的结论。

同一份报告里还有一组平滑性数据:在一次真实自主投掷 rollout 中,经过在线 RL 后,右侧末端执行器的加速度均方根下降 52%,急动度(Jerk)下降 47%。这说明它不只是把成功率做上去了,动作也变连贯了——这对硬件寿命和现场观感都有直接影响。这也是「Smooth」这个名字的来源。

5边界

它不是自主进化,也不该被当成自主进化

SmoothRL 的四条明确限制均出自技术报告自述
限制含义
冻结的基础策略只训残差修正,基础策略离目标行为太远时救不回来
稀疏奖励当前只用任务成功/失败作为奖励信号
允许人工介入训练中操作员可介入,介入动作直接进入训练数据
延迟预算硬约束要求每次 chunk-level 推理都在预设延迟预算内完成
第二条和第三条合起来看,它更接近「带人类监督的在线后训练」,而不是「机器人自己在工作里学习」。

还有一个换算值得做一线的人记下来:如果一个动作每天重复 1000 次,99% 成功率意味着一天 10 次故障,95% 则是 50 次故障。成功率差 4 个百分点,故障次数差 5 倍。机器人的商业竞争力,正在从「能不能做出 Demo」转向「失败率是否低到足以投入业务使用」。

把这个换算套回 SmoothRL 的三个数字:94%、83%、90% 都是很大的提升,但离 99% 都还有距离。开箱任务 90% 意味着每天 1000 次里有 100 次失败——对一条真实产线来说,这仍然需要人工兜底。

本文的边界
三个成功率数字、分区方案、30 Hz / 5 Hz 与 32 帧 / 6 帧的参数、加速度与急动度下降幅度,均出自星尘智能公开技术报告及其中文转述,未见第三方独立复现或评测。S1 为星尘自研绳驱本体,其末端速度、加速度与重复定位精度优势来自厂商自述,其他构型(尤其是刚性连杆或高减速比谐波方案)上的迁移效果未知。

搜狐科技同题稿件在「给笔戴帽」误差描述上存在自相矛盾(5 毫米 vs「一根头发丝直径」),本文未采用其表述。

解读时间:2026-09-04。