# 星尘智能 SmoothRL：投掷 39% 到 94%，三个成功率数字该怎么读

> 动态投掷 39% 提到 94%，给笔戴帽 8% 提到 83%，开箱 30% 提到 90%。三个数字都很硬，但它们不是这篇报告里最值得看的部分。最值得看的是那条 30%→20%→40%→90% 的非单调曲线，和「机器人错法变了」这件事。

### TLDR

- **它解决的是一个很具体的工程错位**：模型一次生成一段动作序列，但异步部署下机器人真正执行的往往只是其中一部分，在线强化学习却把整段一起优化，导致「没做过的动作也被记功或背锅」。
- **做法是把动作块切成三个区域**：已提交（committed）、执行中（execution）、被丢弃（discarded），只让梯度穿过真正执行的那一区。
- **三个真机数字**：动态投掷 **39% → 94%**，给笔戴帽 **8% → 83%**，快递开箱 **30% → 90%**，均在绳驱本体 S1 上完成。
- **关键参数是节奏**：S1 以 **30 Hz** 执行动作，推理请求 **5 Hz**（每 200 毫秒一个新动作块），每次预测 **32 帧**，其中只有 **6 帧**真正被执行。
- **开箱那条曲线不是单调上升的**：在 150 个 rollout 时成功率一度从 30% 掉到 20%，再回升到 40%，最后到 90%。
- **它不是自主进化**：基础策略被冻结，只训残差修正，且依赖稀疏的成功/失败奖励，允许人工介入。

### SRC

技术细节以星尘智能（Astribot）公开的 SmoothRL 技术报告为准，报告与无剪辑验证视频发布于 astribot.com/en/research/SmoothRL。中文报道以腾讯新闻·星河频率（2026-09-04）的版本最完整，云启创投（星尘天使轮领投方）的官方稿件提供了算法实现细节与团队署名，两者在三个成功率数字、动作块分区方案、30 Hz / 5 Hz 节奏参数上完全一致。搜狐科技（2026-09-04）的同题稿件在「给笔戴帽」的误差描述上出现自相矛盾（同一篇内既写「允许误差仅 5 毫米」又写「误差容忍≈一根头发丝直径」），本文采用 5 毫米这一出自技术报告口径的数字。项目负责人王佳楠，共同第一贡献者高广、农宇轩，黄百富参与研究。截至抓取时（2026-09-04），未见该工作的第三方复现或独立评测。

### BODY

<div class="sec"><div class="eyebrow"><span class="num">1</span>问题出在哪</div>
<h2>机器人手在做 A，模型在算 B</h2>

<p>现在的 VLA 与世界—动作模型，通常一次生成未来一整段动作序列，也就是 action chunk。模型越来越大，推理耗时越来越长，而机器人不能每隔几百毫秒停下来等下一段结果——尤其在投掷这类任务里，停一拍，已经攒起来的速度就掉了。</p>

<p>所以真实部署里普遍采用<strong>异步推理</strong>：机器人继续执行手上的动作，模型在后台同时算下一段。手上做 A，模型已经在算 B。</p>

<p>这个安排解决了卡顿，却给在线强化学习出了一道新题。传统在线 RL 默认一种规整的节奏：模型算出动作，机器人执行，按结果更新策略——模型生成什么，机器人就执行什么。异步执行打破了这个对应关系。</p>

<div class="jx">
  <div class="jx-h"><span>一个动作块里的三种命运</span><span class="jx-note">据 SmoothRL 技术报告，S1 实测节奏</span></div>
  <div class="jx-bars">
    <div class="jx-bar-row"><div class="jx-bar-lab">Committed 已提交</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:19%;background:#566781"></div></div><div class="jx-bar-val">6 帧</div></div>
    <div class="jx-bar-row"><div class="jx-bar-lab">Execution 真正执行</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:19%;background:#0a749a"></div></div><div class="jx-bar-val">6 帧</div></div>
    <div class="jx-bar-row"><div class="jx-bar-lab">Discarded 被覆盖</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:62%;background:#b85c0a"></div></div><div class="jx-bar-val">20 帧</div></div>
  </div>
  <div class="jx-legend"><div class="jx-lg">基础策略每次预测 32 帧；在固定延迟预算下，真正被机器人走完的只有 Execution 区那 6 帧，其余 20 帧在轮到它们之前就被下一个动作块替换掉了。</div></div>
</div>

<p>结果是：一整段动作块里，有些动作已经来不及改，有些真正执行了，还有一些<strong>根本没有发生过</strong>。如果强化学习照样把整段一起优化，就会出现一个很直接的荒诞——机器人没做过的动作，也可能因为这次任务成功而被记功，或者因为失败而背锅。</p>

<div class="keypoint">
  <strong>判断：</strong>这个问题的本质是「训练时的数据分布」和「部署时的数据分布」不一致，只不过不一致的维度不是图像或语言，而是<strong>时间</strong>。过去两年大家都在对齐场景分布，SmoothRL 对齐的是执行节奏——这个维度此前几乎没人公开处理。
</div>
</div>

<div class="sec"><div class="eyebrow"><span class="num">2</span>解法</div>
<h2>只对真正执行过的动作求梯度</h2>

<p>SmoothRL 的处理分两步。第一步把账算清楚：把 action chunk 按执行状态切成三个区域——已提交区（上一轮已经提交、不可再改）、执行区（本轮新生成、机器人实际会走完）、丢弃区（模型生成过但会被下一轮覆盖）。训练时<strong>只让梯度穿过执行区</strong>，机器人的优化目标才和它真实经历的过程一致。</p>

<p>第二步更关键：让训练和部署遵守同一套时间节奏。很多方案是在理想的同步环境里训练，到部署才切异步；SmoothRL 反过来，在训练 rollout 阶段就完整跑异步推理环路，让推理延迟、动作切换、执行节奏与真实部署保持一致。团队把这条原则概括为 <strong>Reinforce in Deployment</strong>。</p>

<div class="jx">
  <div class="jx-h"><span>实现细节</span><span class="jx-note">出自技术报告与云启创投稿件</span></div>
  <div class="tbl-wrap">
  <table>
    <tr><th>项目</th><th>取值 / 做法</th></tr>
    <tr><th>基础策略</th><td>各任务微调后的 π0.5，沿用 RLT 基本骨架</td></tr>
    <tr><th>RL 结构</th><td>轻量 TD3-style actor-critic</td></tr>
    <tr><th>输出形式</th><td>在原始动作空间预测残差修正（residual correction）</td></tr>
    <tr><th>执行频率</th><td>S1 本体 30 Hz</td></tr>
    <tr><th>推理频率</th><td>5 Hz，即每 200 ms 拿到一个新动作块</td></tr>
    <tr><th>动作块长度</th><td>32 帧，其中 6 帧属执行区</td></tr>
    <tr><th>额外约束</th><td>速度、加速度、加加速度的平滑性约束</td></tr>
  </table>
  </div>
  <div class="cap">注意「残差修正」这四个字：基础策略是冻结的，RL 只在其上叠加修正量。这决定了它的能力上限，也决定了它的适用边界。</div>
</div>
</div>

<div class="sec"><div class="eyebrow"><span class="num">3</span>三个数字</div>
<h2>39→94、8→83、30→90</h2>

<p>三项真机验证都在星尘自研的绳驱本体 S1 上完成，覆盖两类互补能力：高速动态操作与高精度双臂操作。</p>

<div class="jx">
  <div class="jx-h"><span>三项真机任务的成功率变化</span><span class="jx-note">横轴为累计 rollout episodes</span></div>
  <div class="jx-bars">
    <div class="jx-bar-row"><div class="jx-bar-lab">动态投掷 · 基础策略</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:39%;background:#566781"></div></div><div class="jx-bar-val">39%</div></div>
    <div class="jx-bar-row"><div class="jx-bar-lab">动态投掷 · 在线 RL 后</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:94%;background:#0a749a"></div></div><div class="jx-bar-val">94%</div></div>
    <div class="jx-bar-row"><div class="jx-bar-lab">给笔戴帽 · 基础策略</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:8%;background:#566781"></div></div><div class="jx-bar-val">8%</div></div>
    <div class="jx-bar-row"><div class="jx-bar-lab">给笔戴帽 · 在线 RL 后</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:83%;background:#0d8a5f"></div></div><div class="jx-bar-val">83%</div></div>
    <div class="jx-bar-row"><div class="jx-bar-lab">快递开箱 · 基础策略</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:30%;background:#566781"></div></div><div class="jx-bar-val">30%</div></div>
    <div class="jx-bar-row"><div class="jx-bar-lab">快递开箱 · 在线 RL 后</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:90%;background:#b85c0a"></div></div><div class="jx-bar-val">90%</div></div>
  </div>
  <div class="jx-legend"><div class="jx-lg">动态投掷需在摆动中持续加速并精准释放；给笔戴帽允许的相对位姿误差约 5 毫米；快递开箱要用约 1 毫米宽刀片插入仅 2–3 毫米宽的箱盖接缝。</div></div>
</div>

<p>但比数字更值得看的是<strong>错误模式的变化</strong>。在线 RL 之前，三项任务都有明显的系统性偏差：投掷时不能根据目标远近调节释放速度，开箱时刀片持续向左偏，给笔戴帽时对不同笔帽位置输出几乎一模一样的动作。这些不是随机噪声，是模型在异步失配下产生的固定偏移。</p>

<p>在线 RL 做的事情，是利用真实执行结果，一点一点把这些固定偏差修回来。到最终检查点，失败样本已经明显向成功位置收缩：开箱失败时刀片相对接缝的左右偏差约为 <strong>1–2 毫米</strong>，给笔戴帽的失败也主要变成正确位置附近的小幅错位。</p>

<div class="keypoint">
  <strong>判断：</strong>这三个数字里，真正有工程价值的是「错法变了」，不是「成功率涨了」。随机失败可以靠重试和冗余兜底，系统性偏差不行——它会让所有样本朝同一个方向错，数据量再大也纠不回来。判断一个后训练方案有没有用，先看它有没有改变失败分布，再看成功率。
</div>
</div>

<div class="sec"><div class="eyebrow"><span class="num">4</span>那条不上升的曲线</div>
<h2>30% → 20% → 40% → 90%</h2>

<p>快递开箱这项任务的学习曲线，是整份报告里信息密度最高、也最容易被快讯漏掉的一条。</p>

<div class="jx">
  <div class="jx-h"><span>快递开箱 · 成功率随 rollout 变化</span><span class="jx-note">注意中段回落</span></div>
  <div class="jx-tl">
    <div class="jx-tl-row"><div class="jx-tl-t">0 轮</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#566781">基础策略 30%，刀片稳定左偏</div></div></div>
    <div class="jx-tl-row"><div class="jx-tl-t">150 轮</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#b85c0a">一度跌到 20%，比起点还低</div></div></div>
    <div class="jx-tl-row"><div class="jx-tl-t">中段</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#4b5f8a">回升至 40%</div></div></div>
    <div class="jx-tl-row"><div class="jx-tl-t">250 轮</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#0a749a">达到 90%</div></div></div>
  </div>
  <div class="cap">真实在线探索并不保证单调变好。团队在报告里没有回避这段回落，这一点值得加分。</div>
</div>

<p>对做交付排期的人来说，这条曲线的意义超过三个终点数字。它意味着<strong>在线 RL 的收敛过程不能按「越跑越好」来做计划</strong>：中间存在性能回退窗口，而且回退幅度可能大到低于起点。如果你的验收节点恰好落在那个窗口里，你会得出完全相反的结论。</p>

<p>同一份报告里还有一组平滑性数据：在一次真实自主投掷 rollout 中，经过在线 RL 后，右侧末端执行器的<strong>加速度均方根下降 52%，急动度（Jerk）下降 47%</strong>。这说明它不只是把成功率做上去了，动作也变连贯了——这对硬件寿命和现场观感都有直接影响。这也是「Smooth」这个名字的来源。</p>
</div>

<div class="sec"><div class="eyebrow"><span class="num">5</span>边界</div>
<h2>它不是自主进化，也不该被当成自主进化</h2>

<div class="jx">
  <div class="jx-h"><span>SmoothRL 的四条明确限制</span><span class="jx-note">均出自技术报告自述</span></div>
  <div class="jx-mx">
    <table>
      <tr><th>限制</th><th>含义</th></tr>
      <tr><th>冻结的基础策略</th><td>只训残差修正，基础策略离目标行为太远时救不回来</td></tr>
      <tr><th>稀疏奖励</th><td>当前只用任务成功/失败作为奖励信号</td></tr>
      <tr><th>允许人工介入</th><td>训练中操作员可介入，介入动作直接进入训练数据</td></tr>
      <tr><th>延迟预算硬约束</th><td>要求每次 chunk-level 推理都在预设延迟预算内完成</td></tr>
    </table>
  </div>
  <div class="cap">第二条和第三条合起来看，它更接近「带人类监督的在线后训练」，而不是「机器人自己在工作里学习」。</div>
</div>

<p>还有一个换算值得做一线的人记下来：如果一个动作每天重复 1000 次，<strong>99% 成功率意味着一天 10 次故障，95% 则是 50 次故障</strong>。成功率差 4 个百分点，故障次数差 5 倍。机器人的商业竞争力，正在从「能不能做出 Demo」转向「失败率是否低到足以投入业务使用」。</p>

<p>把这个换算套回 SmoothRL 的三个数字：94%、83%、90% 都是很大的提升，但离 99% 都还有距离。开箱任务 90% 意味着每天 1000 次里有 100 次失败——对一条真实产线来说，这仍然需要人工兜底。</p>

<div class="srcline">
  <div class="h">本文的边界</div>
  三个成功率数字、分区方案、30 Hz / 5 Hz 与 32 帧 / 6 帧的参数、加速度与急动度下降幅度，均出自星尘智能公开技术报告及其中文转述，<strong>未见第三方独立复现或评测</strong>。S1 为星尘自研绳驱本体，其末端速度、加速度与重复定位精度优势来自厂商自述，其他构型（尤其是刚性连杆或高减速比谐波方案）上的迁移效果未知。<br><br>
  搜狐科技同题稿件在「给笔戴帽」误差描述上存在自相矛盾（5 毫米 vs「一根头发丝直径」），本文未采用其表述。<br><br>
  解读时间：2026-09-04。
</div>
</div>

---

*来源：神机百见-具身解读 · https://www.shenjibailian.com/jiedu/article/stardust-smoothrl-online-rl/*
