研究解读 · 神机百见-具身解读

20 到 30 条力觉轨迹,把汉诺塔从 26.7 提到 56.7:LIFT 给预训练 VLA 补的是「手感」

只要 20–30 条在线力觉轨迹就能让预训练 VLA 学会反应式力控制,控制频率从 1Hz 抬到 10Hz——但 56.7 分这个绝对值,才是真正该盯的地方。

一分钟速览
  1. 做了什么:LIFT(Late Reactive Injection of Force for VLA Post-Training)在不做力觉数据预训练的前提下,通过后训练把力觉模态注入已经预训练好的 VLA 模型,CoRL 2026 接收并已开源。
  2. 最反常识的数字:只需要 20–30 条在线力觉轨迹。叠毛巾、插书、汉诺塔三个任务上,表现显著超过纯视觉后训练,汉诺塔任务从 26.7 提升到 56.7。
  3. 怎么做到的:克隆 action expert 的权重,并偏移因果注意力掩码(shifted causal attention mask),以此保留预训练知识;同时混入无力觉数据防止过拟合。
  4. 第二个关键数字:控制回路频率从 1Hz 提升到 10Hz——这才是「反应式」这三个字的技术含义。
  5. 作者主张的适用范围:该范式适用于任何基于 MoT(Mixture-of-Transformers)架构的预训练模型。
  6. 本文的读法:56.7 分的绝对水平、10Hz 与工业力控的量级差、三个任务的共同特征,这三点比「翻了一倍」这个说法更值得看。
数据来源与边界
本文事实来自 AGI HUNT 英文日报 2026-09-28 期收录的条目及子页(URL 见 source_url),原始工作为 LIFT: Late Reactive Injection of Force for VLA Post-Training,作者为上海交通大学 Lu Cewu、Wen Chuan 团队与 QunChu,CoRL 2026 接收(报道称高分接收)并已开源。素材时间窗为「前一日 18:00 → 当日 09:00」:该条目出现在 2026-09-28 期的英文日报中,为窗口内的英文侧首次收录;论文自身的公开时间未在日报中标注,本文不作推断。边界说明:本文未直接访问论文原文或 arXiv 页面,所有数字与结论均转述自该日报子页,属单一信源 + 二手转述;26.7→56.7 的具体评测口径(是成功率百分比还是评分、是否同一任务子集)日报未说明,本文按原文表述引用并标注口径不明;20–30 条、1Hz→10Hz、三个任务名称来自同一来源。判断一律以「判断:」开头,事实与判断分开。
本文事实信息来自上方标注的公开来源;解读、判断与延伸部分为作者个人见解,写作过程使用了 AI 工具辅助整理,已由作者人工核实,不代表信息来源方立场。如有雷同纯属巧合;如涉及版权或权益问题,请联系 shenjibailian@shenjibailian.com,我们将在核实后及时删除或更正。
先别看「翻倍」,先看绝对值

26.7 到 56.7,这个涨幅很容易被读成「翻了一倍多」。但把这两个数放在任务语境里看,得出的结论会完全不同。

纯视觉后训练(汉诺塔)
26.7
LIFT 后训练(汉诺塔)
56.7
距满分的剩余空间
43.3
示意图:以 100 为满标度。第三行为示意对比,非论文原始指标。数据口径:AGI HUNT 2026-09-28 期子页,评测口径(百分比成功率或评分)未说明。

56.7 意味着这台机器人在汉诺塔任务上,仍然有超过四成的次数做不成。这是一个「显著改进」的结果,不是一个「可用」的结果。这两件事必须分开讲——论文的价值在于证明了力觉注入这条路能走通且极其便宜,不在于它已经把任务做到了能交付的程度。

判断:读这类论文的第一条纪律是先看绝对水平,再看提升幅度。从 26.7 到 56.7 的相对提升是 112%,听起来比从 90 到 95 的 5.6% 壮观得多,但后者更接近可部署。这条判据在本站多篇研究解读里反复用到,这次再次成立:分布与绝对值,比涨幅更值钱。
三个任务的共同点,才是这篇论文的真正结论

报道点名的三个任务是叠毛巾(towel folding)、插书(book insertion)、汉诺塔(Hananoi)。这三个任务放在一起,指向性非常明确。

三个任务的共同特征

都是接触密集型操作
都要求持续力反馈而非一次性抓取
都存在视觉不可见的状态量(布料层叠、书页摩擦、塔块贴合)
失败模式多为「位置对了但力不对」

反过来说,不适用的任务

纯位姿搬运:视觉足够,力觉边际收益低
大间隙装配:接触少,力信号稀疏
高速抓取放置:节拍优先,反应式力控反而拖慢
视觉完全可判定的任务:白增一条模态

这三个任务的共同点,就是力觉传感器的价值区间:当任务的关键状态量在视觉上不可见、只能通过接触力推断时,力觉才是必需的。叠毛巾时布料叠了几层、插书时书页之间是滑还是卡、汉诺塔时块与块是否真的贴合——这些信息纯视觉模型只能猜。

判断:这篇论文给出的其实是一张力觉传感器的适用任务地图,而不是一个通用提升方案。对做产线选型的团队来说,可以直接照着这份地图问自己:我这个任务的关键状态,视觉能不能看见?看不见就该上力觉,看得见则力觉是成本不是收益。这条判断比「VLA 应该加力觉」这种泛泛结论有用得多。
1Hz 到 10Hz,才是「反应式」的技术含义

报道里最容易被跳过的数字,是控制回路频率从 1Hz 提升到 10Hz。这个数字比分数更能说明这项工作的性质。

1Hz 是什么概念?机器人每秒只根据力反馈调整一次动作。在这个频率下,系统能做的顶多是「发现太紧了就松一点」这种粗粒度修正,谈不上反应式控制。10Hz 意味着每秒十次修正,这才勉强进入「反应式」的门槛。

1 Hz
原有水平:每秒一次力反馈修正,只能做粗粒度调整
10 Hz
LIFT 后训练后:每秒十次修正,进入反应式力控制的门槛
数百至数千 Hz
传统工业力控的常规区间(本文按公开常识补充,非论文数据)
未说明
10Hz 频控下的稳定性表现、延迟构成、是否受限于推理耗时

把这三个数量级放在一起,事情的边界就清楚了。10Hz 是一个从「几乎没有反应」到「有反应」的跃迁,但它距离传统工业机器人几百到上千赫兹的力控频率,还差一到两个数量级。这意味着 LIFT 目前能覆盖的,是那些对力控带宽要求不高、但对力的存在与否很敏感的任务——恰好就是叠毛巾、插书、汉诺塔这一类。

判断:1Hz→10Hz 这个进步的性质,是「从无到有」而不是「从有到强」。它打开的是一类此前做不了的任务,而不是把已有的任务做得更好。判断一项模态注入技术的价值,应该看它新打开了什么,而不是看它在原任务上提了多少分——这是「分布 > 总分」这条判据的另一个侧面。
方法上的两个设计,值得工程团队抄

LIFT 的做法里有两个细节,比分数更有迁移价值。

设计一
克隆 action expert 权重——不是从头加一个力觉分支,而是复制一份已有的动作专家,让它专门处理带力觉的输入。好处是预训练的能力被完整保留,新分支只学增量。
设计二
偏移因果注意力掩码——通过调整 causal mask,让新分支能看到力觉信息,同时不破坏原有 token 之间的依赖关系。
配套一
混入无力觉数据——训练时掺入没有力觉标注的样本,防止模型在只有 20–30 条力觉轨迹的情况下过拟合。
配套二
无需力觉预训练——这是成本的关键。如果需要从头做一遍带力觉的预训练,采集成本会高到无法承受;后训练注入把这个成本压到了几十条轨迹。

这四个设计合起来,构成了一个可复用的范式:不动预训练权重、只加一条模态分支、用极少量新模态数据后训练、用旧数据稀释过拟合风险。作者自己也主张,这套范式适用于任何 MoT 架构的预训练模型。

判断:这套范式对工业界的意义,大于这篇论文本身的分数。因为它把「给机器人增加一种感知模态」的成本,从「重做一遍预训练」降到了「几十条演示」。对做二次开发的团队来说,这意味着客户现场那条产线如果要加一种新传感器,不需要推倒重来——这条路径一旦被更多工作验证,会直接改变具身智能项目的改造成本结构。
三个还没回答的问题

在把这套方法搬进项目之前,有三个问题是报道没有回答、但必须回答的。

关于数据

20–30 条轨迹是谁采集的?遥操作还是动捕?
采集一条要多久?
换一个任务,是否还要再来 20–30 条?
力觉传感器的型号与安装位置是否影响结果?

关于泛化

56.7 是在同一套硬件上测的吗?
换本体之后还成立吗?
物体换成不同材质(毛巾厚薄、书本软硬)会掉多少?
20–30 条这个数量对任务复杂度的敏感度如何?

这三个问题之所以重要,是因为它们决定了「20–30 条」这个诱人的数字能不能被复制到别的场景。如果每条轨迹都要工程师遥操作半小时采集,那么 30 条就是 15 小时人工,这个成本对单点任务是划算的,对多任务铺开未必。

判断:评价一项数据高效方法的真实成本,公式不是「条数 × 采集时长」这么简单,还要加上「换任务是否要重采」。LIFT 报道里只给了条数,没给采集方式与换任务成本,因此「极其便宜」这个结论目前只在论文设定的三个任务内成立。在它开源之后,最值得做的第三方验证是:换一个本体、换一类任务,重跑一遍,看 20–30 条这个数字是否稳定。
来源:AGI HUNT 2026-09-28 期收录条目及子页,https://agihunt.info/en/p/1a0e2796956c6a8cc3d8d5584d4 。素材时间窗:前一日 18:00 → 当日 09:00。