研究解读 · 神机百见-具身解读

74.7 掉到 26.6:Berkeley 这份触觉世界模型,最值钱的不是 70.6 分,是那次替换

六项富接触任务平均 70.6 分、压过最强基线 38.0 分——但真正说明问题的是那次消融:把世界模型的触觉潜变量换成原始触觉特征,四任务均值从 74.7 掉到 26.6。

一分钟速览
  1. 做了什么:加州大学伯克利分校 Humanoid Intelligence Center 提出 DexTacWAM,一个用于灵巧操作的视觉—触觉世界—动作模型。
  2. 怎么做的:通过持续视觉到触觉学习,把一个预训练的视频世界模型改造成视觉—触觉模型,用于多指接触的预测建模与动作生成。
  3. 分数:在 6 项富接触(contact-rich)灵巧操作任务上全部取得最高分,平均 70.6,最强基线为 38.0。
  4. 关键消融:保持编码器、策略与训练配方不变,只把世界模型的触觉潜变量替换成直接输入的原始触觉特征,四任务平均从 74.7 掉到 26.6。
  5. 结论:世界模型式的触觉潜表示,优于把触觉特征直接注入策略。
  6. 动机:多指触觉数据稀缺且昂贵,从视觉迁移提供了一条可扩展的替代路径。
数据来源与边界
本篇素材来自 AGI HUNT(AI News Daily)2026 年 9 月 30 日期的条目及其详情页子页,该期于北京时间 2026 年 9 月 30 日早晨可访问,落在素材时间窗「2026-09-29 18:00 → 2026-09-30 09:00」内。70.6 / 38.0、六项任务、74.7 → 26.6 消融、四任务统计口径以及「多指触觉数据稀缺且昂贵」的动机说明均出自该条目正文。重要限定:该来源为 AI 生成的摘要型日报,本次未取得论文原文、arXiv 编号或项目主页,因此所有数字按「单一信源 + AI 摘要 + 未见论文原文」处理,未在第三方渠道交叉核实;任务名称、实验设置、基线方法均未披露。文中「绝对提升 32.6 点」「消融落差 48.1 点」「74.7 与 70.6 统计对象不同」为作者对已披露数字的算术与口径辨析,非论文结论。与既有稿件的差异:本站 278 号稿写 Sharpa 同日发布的触觉硬件(产品与数采视角),本篇只谈算法侧「触觉信息该放在哪一层」的消融证据,不涉硬件参数。事实与判断分开,判断以「判断:」开头。
本文事实信息来自上方标注的公开来源;解读、判断与延伸部分为作者个人见解,写作过程使用了 AI 工具辅助整理,已由作者人工核实,不代表信息来源方立场。如有雷同纯属巧合;如涉及版权或权益问题,请联系 shenjibailian@shenjibailian.com,我们将在核实后及时删除或更正。
两个数字,哪个更能说明问题

先看结论:UC Berkeley Humanoid Intelligence Center 的 DexTacWAM,在 6 项富接触灵巧操作任务上全部拿到最高分,平均 70.6 分,最强基线 38.0 分。绝对提升 32.6 点,接近翻倍。

但这份工作真正值钱的不是这个数字,是那次消融。研究者保持编码器、策略、训练配方全部不变,只把世界模型内部的触觉潜变量,换成了直接喂给策略的原始触觉特征。结果是:四任务平均从 74.7 掉到 26.6。

世界模型潜变量
74.7(四任务平均)
直接注入触觉特征
26.6(四任务平均)
同一编码器、同一策略、同一配方,只替换中间表示;落差 48.1 点为作者算术
48.1 点 > 32.6 点

把两个数字摆在一起看,结构就很清楚了:

对外分数

70.6 对 38.0,绝对提升 **32.6 点**。
这是「整套方法 vs 别家方法」的比较,变量不唯一——模型结构、数据、训练配方都不同。

内部消融

74.7 对 26.6,落差 **48.1 点**。
这是「同方法换一个中间表示」的比较,其他全部固定,变量唯一。

判断:消融的落差大于对外的绝对提升,这件事本身就说明——这套方法里真正起作用的那一环,比整套方法相对基线的优势还要大。读论文时先找消融、再看总分,是本站反复验证过的一条判据:总分回答「好不好」,消融回答「好在哪」,而只有后者能指导自己的工程决策。
一个必须先说清的口径问题

注意:74.7 和 70.6 不是同一个统计对象。70.6 是**六项任务**的平均,74.7 是消融中**四项任务**的平均。摘要没有说明这四项是哪四项,也没有给出六项任务的逐项分数分布。

这个差别不能忽略。如果用于消融的四项恰好是模型表现较好的那几项,那么 74.7 会高于 70.6,这符合观察;反之若四项偏难,则这个差值就需要别的解释。在拿到论文原文之前,只能把这个 3—4 分的差值标注为「统计对象不同所致,具体原因未披露」。

判断:凡是摘要里同时出现「总分」和「子任务分数」却没给分布的,都要先默认它们不可直接比较。这条跟本站处理 RoboDawn(真机 9/10 vs 5/10)、紫东太初(分数梯度)时的做法一致——真正有信息量的往往不是那个平均值,是各任务之间的离散度。
「放在哪一层」比「用不用」重要得多

这次消融的结论可以翻译成一句工程语言:触觉信息不是「给不给策略」的问题,是「放在哪一层」的问题。直接把原始触觉特征拼进策略输入,效果只有 26.6;先让世界模型把触觉学成可预测的潜表示,效果到 74.7。

为什么差这么多?一个合理的解释是:世界模型的预训练目标本身就是「预测未来」,它逼着潜变量去编码那些**对未来接触状态有预测力的信息**;而原始触觉特征是「当下的读数」,其中包含大量对决策无用的噪声维度,策略得自己学会筛。

判断:如果这条结论成立,它对做触觉硬件的团队有一个直接含义——传感器的竞争焦点不该只在采样率和通道数,还要看输出能不能被上层模型学成稳定的潜表示。换句话说,触觉模组未来可能要开始比「表示友好度」,而不只是比硬件指标。这个判断基于单一来源的消融结果,样本有限,建议等论文原文与后续复现再下结论。
为什么非要从视觉迁移

摘要给出的动机很实在:多指触觉数据稀缺且昂贵,而视觉数据便宜且海量。所以路线是——先有一个在视频上预训练好的世界模型,再通过「持续视觉到触觉学习」把它改造成视觉—触觉模型。

这条路径的经济性才是重点。多指触觉传感器的标定、维护、同步采集成本都很高,一条产线配齐触觉手套做数采,门槛远高于架几个摄像头。

路径数据来源成本特征已知限制
纯触觉采集多指触觉传感器实测稀缺且昂贵规模受限、跨本体复用难
视觉预训练 + 触觉迁移海量视频 + 少量触觉边际成本低迁移损失大小未见披露
表注:左两列来自摘要披露的动机说明;右列「已知限制」为作者归纳,摘要未给出迁移效率的量化结果。
在拿到论文之前,还缺哪些信息

由于本次只取得了 AI 摘要源,以下几项尚未确认,建议在引用前补齐:

一是任务清单与评判标准——「富接触灵巧操作任务」具体是哪六项、评分是成功率还是归一化分数,摘要未说明;二是基线方法——38.0 分对应的是哪个方法,决定了这个提升的含金量;三是硬件配置——用的是什么触觉传感器、多少通道、是否跨本体验证;四是泛化边界——是否在新物体、新光照条件下测试过。

判断:四项里第三项对国内团队最实际。如果这项工作需要高密度触觉阵列才能跑出 70.6,那么它对用低成本触觉方案的团队参考价值就有限;反之若在中低通道配置下依然成立,那它的工程可复制性会高一个量级。建议把「传感器通道数与性能的关系」作为读原文时的第一目标。
来源:AGI HUNT(AI News Daily)2026-09-30 期条目及详情页;单一信源、AI 生成摘要、未见论文原文。素材时间窗 2026-09-29 18:00 → 2026-09-30 09:00。