140 年模拟踢球:Skild S1 自博弈配方里,三个限定词比那个数字更值钱
Skild 让 S1 在仿真里和「近期的自己」踢了 140 年球。这个数字很抓人,但公告里真正有信息量的是三个限定词——累计、自博弈阶段、未量化。读懂这三个词,才知道这份成果处在什么位置。
- 140 年的口径:Skild 称 S1 在 NVIDIA Isaac Sim 中累计了超过 140 年的模拟自博弈,对手是「近期版本的自己」。这是累计模拟经验,公告未说明实际训练耗时、算力预算与并行比赛场数。
- 每秒 50 次:模型以 50 Hz 输出人形各关节角度;虚拟足球训练场由 NVIDIA Omniverse 库构建。
- 「无示范」有前置条件:自博弈阶段以进球为目标、不再提供额外演示;但此前的 drill 阶段(不同速度与方向的带球、踢球)每个动作各有独立奖励,并使用人类参考。
- 真机能打:Skild 报告所得策略可在现实中与人类或其他机器人对战,四个 agent 的比赛中出现了早期传球与配合。
- 本月初的账本:Skild 报告年度经常性收入(ARR)突破 1 亿美元,距首个商业部署 10 个月。
- 公告自设的边界:完整训练与仿真到硬件的迁移方法要等后续发布;公告未建立在商业任务上的改进;传球配合与社会导航的主张未给出量化评测。
「140 年」是这个消息里最抓人的数字,也是最容易读错的一个。Skild 的表述是:S1 在 NVIDIA Isaac Sim 中累计了超过 140 年的模拟自博弈(accumulated simulated experience),与近期版本的自己对抗。
关键在于,报道明确指出材料没有说明三件事:实际训练耗时、算力预算、并行比赛场数。这三件事恰好是把「140 年」换算成成本所必需的三个参数。
累计的模拟经验总量。如果并行跑一万场比赛,一年墙钟时间就能堆出一万「年」的经验。它衡量的是样本量,不是训练难度或花费。
不是训练跑了 140 年,也不能据此推算电费、卡时或项目周期。缺少并行度与算力口径时,这个数字不可横向比较——不同团队报出的「X 年模拟经验」之间没有共同标尺。
不少转述把这条成果概括成「机器人无师自通学会了踢球」,但完整序列不是这样。公告描述的是一个两阶段流程。
模型以 50 Hz 的频率输出人形各关节角度,虚拟训练场由 NVIDIA Omniverse 库构建。随着模型变强,对手(也就是它自己的近期版本)也在变强,成功策略会持续遇到更难的考验。
Skild 报告自博弈阶段产出了愈发复杂的行为,而这些涌现出的战术并没有单独的奖励函数——进球这一个信号就够。这个说法成立的范围是自博弈阶段;前置的 drill 训练用的是技能专属奖励加人类参考。
报道对此给了一句很干脆的限定:完整训练序列同时包含 S1 的预训练能力与带人类参考的足球 drill,因此不应被描述为「在没有任何人类指导下学会踢球」。这句话值得所有转述者照抄。
Skild 列出的自博弈产出技能包括:过掉防守队员、护球、抢断、以及摔倒后起身。真机方面,报告称所得策略可以与人或另一台机器人在现实中对战,四个 agent 的比赛中出现了早期的传球与配合。
足球被选中不是因为它热门,而是因为它天然构成一个随模型一起变难的考场:站稳、移动到位、控球、应对对手必须同时成立;而对手的存在让训练条件持续变化。这与固定任务的评测集有本质区别——后者的难度是静态的,刷分到一定程度就不再产生新压力。
这个思路有先例。报道提到,Google DeepMind 2024 年发表的研究用强化学习训练小型人形机器人进行一对一足球对抗,包含摔倒恢复与对对手的战术响应,并把策略迁移到了实体机器人上。Skild 这次的差异在于,它把自博弈作为基础模型的后训练策略,而不是从零训练一个足球策略。
把这条研究放回公司账本上看,会得到一个更有意思的对照。报道提到,本月初 Skild 报告 ARR 突破 1 亿美元,距离其首个商业部署 10 个月。那次发布的侧重点,是从「令人印象深刻的演示」走到「能可靠跟上客户运营节奏的机器人」有多难。
而这一次,Humanoids Daily 给了一句很硬的限定:这份公告并未建立在商业任务上的改进(does not establish improvements on commercial tasks)。
第一,自博弈的核心价值是绕开「每个行为都要收一次人类示范」这个瓶颈。对需要大量动作库的场景(赛事对抗、群控表演、复杂地形通过),这条路径的边际成本远低于逐个动作采集。
第二,摔倒后起身、身体对抗后恢复平衡这类能力,恰好是对抗性表演场景最需要的。它们很难靠脚本覆盖,因为摔倒的姿态组合是开放集;自博弈因为训练中必然包含大量失败样本,反而天然擅长这一类。
第三,50 Hz 的关节角度输出频率是一个可对照的工程基准。做同类本体时,这个数字可以直接拿来校验自己的控制回路是否能支撑同等强度的动态对抗。