Arm 发布 Robotics Capability Framework:机器人能力的"普通话"试图统一
Arm 首席架构师 Richard Grisenthwaite 推出与架构无关的能力描述框架,把机器人能做什么、需要什么运行环境、需要多少监督、给什么安全保证写进同一套词汇表。它不是新标准,但可能是第一个能跨厂商串起来用的。
Arm 首席架构师 Richard Grisenthwaite 推出与架构无关的能力描述框架,把机器人能做什么、需要什么运行环境、需要多少监督、给什么安全保证写进同一套词汇表。它不是新标准,但可能是第一个能跨厂商串起来用的。
机器人会说话之后,最尴尬的是手不知道往哪放。银河通用联合六校的 RoboGesture 把自碰撞帧率从 4.16% 压到 0.13%——这项研究真正的工程难点,不是让动作像人,是让动作不伤到自己。
光象科技与清华李升波课题组的 Phi-WM 1.0 ActEffect,让世界模型只在训练时上班、部署时退场。真正有意思的不是 80.3% 这个分数,是它的消融实验:去掉后果反馈,分布内只掉 1.8 个点,分布外掉 28.8 个点。
动态投掷 39% 提到 94%,给笔戴帽 8% 提到 83%,开箱 30% 提到 90%。三个数字都很硬,但它们不是这篇报告里最值得看的部分。最值得看的是那条 30%→20%→40%→90% 的非单调曲线,和「机器人错法变了」这件事。
深朴智能说它的 Omni-Simple-World 模型「预训练与后训练全程未使用任何一条真机数据」。这句话在技术上是成立的,但在传播上极其容易被读歪——它绕开的是机器人本体,不是真实世界。
智谱 GLM-5.3-Flash(中文圈称「牛来」)以约 1/40 的单价追平 Claude Opus 4.8 的智力指数,MIT 开源、原生多模态、跑在国产芯片上。对机器人仿真与专家 IP 内容降本很香,但限时价、速度和本地部署门槛三件事被原帖讲轻了。
行业吵了几个月的「VLA 还是世界模型」,在 2026 智源大会上被给出一个共识判断:世界模型不是 VLA 的竞争路线,而是 VLA 体系的核心组成部分。本文拆这个判断是怎么成立的,以及它对做落地的人意味着什么。
H2 Plus 全身 75 个自由度里,两只手占 44 个。智元的灵巧手子公司「临界点」估值突破 10 亿美元,单手 19 自由度、850 克。灵巧手正在从配件变成决定机器人能力上限的核心部件——这是 2026 年最容易被低估的一条线。
Physical Intelligence 的 π0.7 被称为机器人领域的「GPT-3 时刻」,关键词是组合泛化——模型见过「抓红杯」和「杯子烫就用夹子」之后,能组合出没练过的动作。它还首次把世界模型作为 Subgoal Image Provider 集成进 VLA。