理想交出具身智能第一份全家桶:记忆、认知、行动三件套,外加一条第三方泼的冷水
理想 Foundation Model 团队连发四份技术报告,把具身智能系统 ME-Brain-1.0、统一世界动作模型 ME-U0、认知模型 ME-VLM 和触觉方案 ME-Dex-1.0 一次性交齐。指标全面领先的同时,第三方复看视频发现夹爪停顿与偶发抓取失误——这份「全家桶」的成色,要看两拨人的账怎么对。
- 一次交四份作业:理想 Foundation Model 团队发布 ME-Brain-1.0 具身智能系统、ME-U0 统一理解与生成世界动作模型、ME-VLM 认知模型(35B-A3B MoE + 4B 边缘版)与触觉方案 ME-Dex-1.0。
- 端侧落地有实数:ME-VLM 4B 在自研马赫 M100 芯片上完成部署优化,预填充时延从约 400ms 降到 188ms(token 压缩 + W4A8 量化)。
- 模型指标(厂商口径):ME-U0 从约 4200 小时过滤数据预训练,标准 LIBERO 平均成功率 99.1%、LIBERO-Plus 81.8%、RoboDojo-Sim 过程分 17.66。
- 第三方冷水:Robot Forward 等第三方复看演示视频指出,脚本场景成功之外仍存在夹爪停顿、偶发抓取失误、开放任务未完成——指标与观感之间有落差。
- 判断:这批发布的真正信号不是跑分,是车企把「车端芯片 + 具身系统」打包成了一条可复用路线。
理想的具身智能研发在 9 月 22 日集中交卷:ME-Brain-1.0 搭建记忆、认知与行动协作的系统框架;ME-VLM 提供认知核心;ME-U0 把任务理解、未来预测与动作生成放进一个统一模型;ME-Dex-1.0 把触觉纳入预测范围。四份工作不是四个产品,而是同一个系统的四层解剖。
先看最容易被忽视的记忆部分。理想把机器人经历存进独立于模型上下文窗口的外部记忆结构:近期图像、动作与状态进短期记忆;抓取、放置、失败等关键事件进中期记忆;反复出现的成功条件与失败模式沉淀为可跨任务复用的长期经验,且各层记录之间保留关联。演示里那句「把桌面恢复成之前的样子」,靠的就是从记忆中找回物品原位——这类任务没有记忆结构就做不成。
ME-Brain 的记忆、认知、行动三大模块都完成了向理想自研马赫 M100 边缘 SoC 的迁移。官方部署笔记给出实数:ME-VLM 4B 经 token 压缩与 W4A8 量化,M100 上预填充时延从约 400ms 降至 188ms。认知核心提供 35B-A3B MoE 大核与 4B 边缘版两档,官方自测中大核在具身套件平均约 70.9 分、智能体套件 72.5 分。
ME-U0 从约 5700 小时机器人数据与 3920 小时第一视角数据的原始池中,筛出约 4200 小时用于预训练,架构上采用理解与生成双专家加多速率旋转位置编码,让视觉隐变量与动作 token 在时间轴上对齐。官方指标:标准 LIBERO 平均成功率 99.1%,未经专门适配的 LIBERO-Plus 为 81.8%,RoboDojo-Sim 过程分 17.66(参与对比的世界动作模型中)。
演示侧,理想给出「无剪辑一小时连续抓万物真机测试」:覆盖上百种形状、尺寸、材质,期间切换 23 次灯光与 15 次桌布背景,宣称成功率 100%;另有一个 15 步、约 4 分钟的手冲咖啡长程任务,系统边做边语音与界面同步汇报进度。
Pandaily 在技术拆解中专门引用了第三方观察:包括 Robot Forward 报道(凤凰科技转载)在内的复看指出,即便在脚本化场景成功的前提下,演示视频中仍可见夹爪明显停顿、偶发抓取失误、部分开放式任务未完成。理想自己的表述也承认「抓起和放下时夹爪停顿明显,流畅性还有提升空间」。
在小鹏(212 号稿的供应链大会、IRON 量产推进)之后,理想成为第二家把「系统 + 模型 + 芯片 + 触觉」打包发布的车企。两家路径的共同点是:不单独卖机器人本体,而是把自动驾驶时代攒下的数据管线、模型工程与车规芯片,重组为机器人的基础设施层。