研究解读 · 神机百见-具身解读

亮源新创一个月三连发:把大模型后训练那套流程,原样搬进机器人全身

跑酷、导航、抗摔三件看似不相关的事,拼起来是一条完整的路线:中期训练、SFT、在线 RL 的后训练三段式,加上把偏好对齐做进全身控制——创始人姜旭来自 OpenAI RLHF 团队,这套打法是他履历的具身复刻。

本篇目录4 节 · 12 分钟
一分钟速览
  1. 三连发:过去一个多月,亮源新创接连发布 LightParkour(跑酷技能扩展)、LightNav-0(通用导航,9 月 1 日开源)、Light REACT(抗扰韧性控制)三项技术,分别对应技能、导航、全身控制三个方向。
  2. 数据引擎:LightNav-0 基于 Real2Sim2Real,把 2000+ 个互联网来源的真实场景转成可反复使用的仿真环境,合成 4000+ 小时视觉-语言-动作经验用于导航后训练——不走遥操作采集。
  3. 零样本跨本体:同一套模型权重,零样本部署到人形、四足、轮式、飞行四类机器人本体;基座是 Qwen3-VL-4B-Instruct,只扩展词表、不加导航专用头。
  4. 反直觉细节:仅用单目 RGB、不依赖深度与里程计,在动态跟踪基准上反超使用全景与多相机的系统;在 10 项公开仿真评测中取得领先(团队口径)。
  5. 判断:这不是三篇孤立的论文,是大模型「预训练—后训练—对齐」范式的具身复刻——Light REACT 干脆把「能站着走就别爬」的人类偏好做进了强化学习目标。
数据来源与边界
本文事实以量子位 2026-09-13 发布的报道(微信公众号文章,微博转载)为唯一信源,素材时间窗为 2026-09-13 09:00 → 19:00。核查方式与不确定边界:① 「10 项公开仿真评测取得领先」「动态跟踪基准反超多相机系统」等指标均转述自亮源新创技术报告与团队口径,未在第三方环境独立复现,属单一信源;② Light REACT 的训练细节(监督学习整合起身、行走和爬行技能,再用 RL 对齐「能站着走就别爬」偏好)来自量子位报道转述;③ 创始人姜旭的 OpenAI RLHF 履历为报道表述,未做独立背景核查;④ LightNav-0 于 9 月 1 日开源的日期为报道明确给出。与 09-13 上午批存量稿《不建地图、不用相机》(ETH 单杠/原始点云)的差异:那篇讲感知降级下的全身控制单点突破,本篇讲一家公司三条技术线的整体路线与 Scaling 方法论,互不重叠。所有判断均已用「判断:」标注。
本文事实信息来自上方标注的公开来源;解读、判断与延伸部分为作者个人见解,写作过程使用了 AI 工具辅助整理,已由作者人工核实,不代表信息来源方立场。如有雷同纯属巧合;如涉及版权或权益问题,请联系 shenjibailian@shenjibailian.com,我们将在核实后及时删除或更正。
1评价标准在变

「会做」和「稳定做成」,是两回事

量子位这篇报道开头点出了一个正在行业里扩散的共识:机器人「会做」一件事,和它能在开放环境里长期、稳定、泛化地把事情做成,是两回事。能跨过固定高度的障碍,不代表换一种障碍还行;能在一个房间导航,不代表换一个场景、换一种本体仍然有效;正常状态能稳定行走,不代表被撞了一下、摔了一跤、关节损伤之后还能继续工作。

所以行业的评价标准正在从「会多少技能」转向「能力能不能持续规模化扩展」——这里的 Scaling 不只是参数量,也不只是数据量,而是更多环境、更多任务、更多本体,以及进入物理世界后对没见过的状态的适应

判断:这个转向和本站此前对智元 GE-Act 2.0 的解读一脉相承——具身模型行业正在进入「Scaling 可验证」阶段。区别在于切面:GE-Act 2.0 给出的是任务数据量的 Scaling 曲线(300 小时到 3 万小时),亮源新创三连发给出的是环境、本体、韧性三个维度的扩展框架。两篇合起来看,才是 2026 年具身 Scaling 叙事的完整切面。
2三项技术

跑酷、认路、摔了再站起来

三项技术各自解决一个问题:

LightParkour

简短的人类动作片段出发,通过物理仿真与课程学习扩展出复杂接触技能——人类示范只需要几秒钟,剩下靠仿真里练。

LightNav-0

通用导航。以开源视觉语言模型为基座,不添加任何导航专用模块,同一套权重零样本部署到人形、四足、轮式乃至飞行机器人上,听自然语言指令自己找路。

Light REACT

面向外力扰动、跌倒、硬件损伤条件的全身韧性控制,研究机器人如何依据自身交互历史调整运动方式。

看起来是三个不相关的方向,但报道点破了它们的公共结构:三项技术都在回答同一个问题——Physical AI 如何从单点能力走向可以规模化训练、规模化对齐、规模化部署的基础模型体系。

互联网真实场景转仿真环境
2000+
合成视觉-语言-动作训练数据
4000+ 小时
零样本迁移的机器人本体类别
4 类
LightNav-0 数据引擎三要素,均来自团队技术报告口径
3两个值得记的细节

传感器降级反超,和按遗忘曲线分配的注意力

第一个细节是传感器降级、成绩反超。LightNav-0 只用单目 RGB,不依赖深度相机和里程计——在动态跟踪基准上的成绩超过了使用全景与多相机的系统。这类「配置降级、指标反超」的反直觉结果,往往比单纯的 SOTA 更能说明方法本身的含金量:它赢的不是传感器堆料,是训练范式。

第二个细节是记忆设计。为了让模型「记住来路」又不被历史观测撑爆,团队按人类记忆的遗忘曲线分配注意力:越久远的画面保留得越粗略,眼前的画面保留最高精度。工程上,数据没有走遥操作采集,而是把 2000 余个真实场景转成仿真资产、在仿真里合成 4000 余小时训练数据——真实世界负责定义数据分布的边界,仿真负责在边界内规模化,具身后训练由此跨过了最贵的冷启动门槛。

训练流程的复刻则更直白:LightNav-0 的后训练严格按「中期训练—SFT—在线 RL」三阶段展开,几乎是大模型后训练流程的具身翻版;Light REACT 更进一步,先通过监督学习整合起身、行走和爬行技能,再用强化学习对齐「能站着走,就别爬」的人类偏好——把偏好对齐做进了机器人全身控制。

判断:这条路线的出处写在创始人履历里。姜旭在 OpenAI 从事过 RLHF 研究——当很多团队还在讨论具身范式的理论框架时,他属于亲眼见过「对齐」如何把一个只会补全的模型变成产品的那批人。亮源新创的技术选择之所以透着一股罕见的笃定,原因大概在此。判断:未来一年判断具身公司成色的试金石,不再是「发布了什么模型」,而是「后训练流程里有没有一条可审计的对齐链路」。
4冷静一下

仿真评测领先,不等于真机领先

需要泼的冷水:所有亮眼指标都来自仿真评测(10 项公开仿真基准)。导航任务从仿真到真机的落差集中在动态障碍、光照变化和长时程记忆上,而这些恰恰是仿真环境最难保真的部分。4000 小时合成数据的分布边界由那 2000 个真实场景定义——真实世界里没被这 2000 个场景覆盖的东西,模型依然要靠在线学习兜底。

判断:对采购方(包括做机器人租赁与运营的团队)的实际启示是:零样本跨本体意味着换硬件不用重新训练导航模块,这会直接改变机器人机队的混合采购逻辑——导航能力可以成为独立于本体的选型项。但下单前应该要求供应商提供真机环境下的连续运行数据,而不是仿真基准截图。
来源:量子位《2000+ 真实场景搬进仿真!一个导航模型零样本「通吃」四种机器人本体》(2026-09-13)。技术指标为团队口径,未经第三方复现。