15.4 小时导航数据换 8.39 个百分点:具脑磐石 Cog-WM 1.0 真正值得看的是 SR 与 SPL 的背离
具脑磐石在浦江创新论坛发布类脑认知世界模型 Cog-WM 1.0,用约 15.4 小时导航数据把成功率从 78.50% 提到 86.89%。但同期路径效率只涨了 0.65——「找到了」和「走得近」之间的这道缝,才是这份成绩单里最该被读的东西。
具脑磐石在浦江创新论坛发布类脑认知世界模型 Cog-WM 1.0,用约 15.4 小时导航数据把成功率从 78.50% 提到 86.89%。但同期路径效率只涨了 0.65——「找到了」和「走得近」之间的这道缝,才是这份成绩单里最该被读的东西。
一个主智能体加三类子智能体,用图结构调度 VLA 和世界模型,再用三个 Markdown 文件管记忆——清华团队的 EMERGE-Policy 在真机纸杯实验里扛住了人为拆毁和尺寸扰动,成功率保持 85% 到 94%。这可能是「系统编排」第一次在具身智能里正面击败「单个大模型」。
深度机智 PhysBrain 1.5 的 8B 版在 28 项具身基准上拿 72.5 分,与 GPT-6 Astra 只差 0.8 分。但把 28 个基准名字逐个摊开会发现:它们测的都是「看图答题」的空间理解与规划,没有一项是真机操作成功率。这不是泼冷水,是搞清楚这个分数能兑换什么。
跑酷、导航、抗摔三件看似不相关的事,拼起来是一条完整的路线:中期训练、SFT、在线 RL 的后训练三段式,加上把偏好对齐做进全身控制——创始人姜旭来自 OpenAI RLHF 团队,这套打法是他履历的具身复刻。
一根悬在半空、几何稀疏的细杆,会把感知和全身控制一起卡死。苏黎世联邦理工让一台众擎 PM-01 跳上单杠、双手交替摆荡、再落地,15 次试验成功 14 次。真正值得记的不是这个动作本身,而是它证明了「不建地形图」这条路在非结构化场景里更对。
高盛科技大会上,黄仁勋把物理 AI 拆成三层递进:自动驾驶已到来,操作机器人还要几年,6G 要五年。「两年拐点」给行业一个时间锚,也给所有人一个必须回答的问题——凭什么。
一份把 MLLM 放进 240Hz 刚体仿真、让它真的去接滑落的盘子的基准。7 个模型测下来约三分之一突发危险处置错误,而且错误不随模型规模缩小——这条结论对「等下一代模型就好了」是直接的否定。
朱军团队发布《General World Models from First-Principles》,把世界模型从名词变成 L1–L5 五级可检验路线;同场发布的 Motus2 用 13 万小时人类第一视角视频加 100 小时机器人数据,把策略、模拟器、评估器装进同一套参数。
证券日报 9 月 11 日刊文梳理车百会研究:智能汽车与具身机器人核心技术栈重合度超 70%,供应链融合集中在电机、热管理、芯片、材料四笔账。车企做机器人的真实动机,是给存量竞争找第二曲线。
同一家机构把 2030 年机器人拣选市场从此前的 68 亿美元下调到 46 亿,但把料箱拣选的增速上调到 36%、卸车机器人上调到 64%。总量在缩、结构在换——对做仓储机器人的人来说,该换的不是信心,是细分赛道。
智元把联合训练数据从 300 小时拉到 3 万小时,G1-OP 零样本成功率从 17.1% 涨到 44.1%,且 5000→30000 小时仍未饱和。更值得看的是:训练数据占比不足 2% 的 G2-90D 也涨了 17.7 个百分点——跨本体迁移第一次有了真机数字。
Arm 首席架构师 Richard Grisenthwaite 推出与架构无关的能力描述框架,把机器人能做什么、需要什么运行环境、需要多少监督、给什么安全保证写进同一套词汇表。它不是新标准,但可能是第一个能跨厂商串起来用的。
机器人会说话之后,最尴尬的是手不知道往哪放。银河通用联合六校的 RoboGesture 把自碰撞帧率从 4.16% 压到 0.13%——这项研究真正的工程难点,不是让动作像人,是让动作不伤到自己。
光象科技与清华李升波课题组的 Phi-WM 1.0 ActEffect,让世界模型只在训练时上班、部署时退场。真正有意思的不是 80.3% 这个分数,是它的消融实验:去掉后果反馈,分布内只掉 1.8 个点,分布外掉 28.8 个点。
动态投掷 39% 提到 94%,给笔戴帽 8% 提到 83%,开箱 30% 提到 90%。三个数字都很硬,但它们不是这篇报告里最值得看的部分。最值得看的是那条 30%→20%→40%→90% 的非单调曲线,和「机器人错法变了」这件事。
深朴智能说它的 Omni-Simple-World 模型「预训练与后训练全程未使用任何一条真机数据」。这句话在技术上是成立的,但在传播上极其容易被读歪——它绕开的是机器人本体,不是真实世界。
智谱 GLM-5.3-Flash(中文圈称「牛来」)以约 1/40 的单价追平 Claude Opus 4.8 的智力指数,MIT 开源、原生多模态、跑在国产芯片上。对机器人仿真与专家 IP 内容降本很香,但限时价、速度和本地部署门槛三件事被原帖讲轻了。
行业吵了几个月的「VLA 还是世界模型」,在 2026 智源大会上被给出一个共识判断:世界模型不是 VLA 的竞争路线,而是 VLA 体系的核心组成部分。本文拆这个判断是怎么成立的,以及它对做落地的人意味着什么。
H2 Plus 全身 75 个自由度里,两只手占 44 个。智元的灵巧手子公司「临界点」估值突破 10 亿美元,单手 19 自由度、850 克。灵巧手正在从配件变成决定机器人能力上限的核心部件——这是 2026 年最容易被低估的一条线。
Physical Intelligence 的 π0.7 被称为机器人领域的「GPT-3 时刻」,关键词是组合泛化——模型见过「抓红杯」和「杯子烫就用夹子」之后,能组合出没练过的动作。它还首次把世界模型作为 Subgoal Image Provider 集成进 VLA。