产品发布 · 神机百见解读

理想 MindVLA-o1:1280 TOPS 自研芯片 + 3D ViT 进车端,VLA 走完最后一公里

9 月 8 日 NVIDIA GTC 2026 上,理想首次把原生 3D ViT 放进感知栈,用自研的 1280 TOPS 芯片 Mach 100 把 VLA 推到车端。稳定感知距离 500 米,训练成本下降 75%,这是把车厂推上 AI 主战场的最后一步。

本篇目录4 节 · 9 分钟
一分钟速览
  1. 事件:2026 年 9 月 8 日 NVIDIA GTC 2026 上,理想汽车发布下一代自动驾驶架构 MindVLA-o1,并将首搭车型定为 全新 L9
  2. 核心硬件:自研车规芯片 Mach 100,单颗有效算力 1280 TOPS;原生 3D ViT 引入感知栈,稳定感知距离 >500 米
  3. 架构组件:原生多模态 MoE Transformer、预测式潜在世界模型、VLA-MoE 统一行为生成、离散扩散轨迹优化、闭环强化学习。
  4. 工程信号:基础模型团队评估近 2000 种模型架构配置做软硬协同;前馈式场景重建渲染速度约翻倍;整体训练成本下降 约 75%
  5. 行业意义:把 VLA 从云端训练拉到车端实时,是车厂第一次把"模型架构"作为发布会主角——AI 不再是功能,而是品牌。
数据来源与边界
本文事实来自理想汽车 2026-09-08 GTC 2026 官方发布稿件及现场演讲内容,交叉验证智驾派、凤凰汽车、车云三家媒体同日(2026-09-08)的报道。Mach 100 芯片 1280 TOPS 算力、稳定感知距离 500 米、2000 种架构配置、训练成本下降 75%、L9 首搭为官方口径。"原生 3D ViT"、"原生多模态 MoE Transformer"、"预测式潜在世界模型"、"VLA-MoE 统一行为生成"、"离散扩散轨迹优化"、"闭环强化学习"为理想技术白皮书公开表述,具体实现细节(参数量、训练数据规模、推理延迟)官方未披露。解读时间 2026-09-09。
1MindVLA-o1 的三件新东西

原生 3D ViT + Mach 100 芯片 + 训练成本 -75%

把理想 9 月 8 日 GTC 2026 发布的技术清单压缩成三件事:**3D ViT 进感知栈、Mach 100 自研芯片上车、训练成本下降 75%**。这三件事单独看都有先例,但组合在一起是车厂第一次把"模型架构"作为发布会主角。

Mach 100
1280 TOPS
Orin-X 双颗
508 TOPS
Thor 单颗
680 TOPS
Mach 100 单颗 1280 TOPS 是 Orin-X 双颗的 2.5 倍、Thor 单颗的 1.9 倍,是车规 AI 芯片的新水位

1280 TOPS 这个数字出现在量产车上,意味着车端可以承载**多模态大模型实时推理**——这是 VLA 上车的硬门槛。此前国内车端主流算力集中在 100–500 TOPS 区间,跑 VLA 必须做大量蒸馏与裁剪;1280 TOPS 让"原始 VLA 模型上车"第一次在物理上可行。

判断:MindVLA-o1 不是一次"功能升级",而是一次**架构换轨**。从 BEV + Transformer + 规则后处理的标准自动驾驶栈,切换到原生多模态 + 预测式世界模型 + VLA-MoE 的"具身智能车端"栈。这一换轨意味着车厂从"功能集成商"变成"模型架构公司"——理想在这一步上抢到了车厂的先发位。
23D ViT 进感知栈的工程意义

从 2D 鸟瞰到原生 3D 体素

理想此次最大胆的硬件无关改动,是把**原生 3D ViT**(Vision Transformer)引入感知栈。这意味着理想放弃了"2D 图像 + BEV 鸟瞰"的传统路径,直接在 3D 体素(voxel)空间做注意力运算。

  • 3D ViT 的算力开销是 2D BEV 的 4–8 倍,因此必须配合 1280 TOPS 算力才能实时推理——**Mach 100 与 3D ViT 是同一张设计图上的两件事**。
  • 3D ViT 的工程红利是**稳定感知距离 >500 米**:2D BEV 在 200 米外几何精度急剧下降,3D ViT 可以把距离推过 500 米,这是高速 NOA 体验的关键边界。
  • 3D ViT 对数据标注提出新要求:传统 BEV 标注只需 2D 边界 + 深度,3D ViT 需要体素级标注,成本是前者的 3–5 倍。

前馈式场景重建 + 渲染速度约翻倍,意味着 MindVLA-o1 可以把感知结果直接喂给预测模块做"低成本推演"——这是预测式潜在世界模型(Predictive Latent World Model)的工程基础。

整体训练成本下降 75%,主要来自三块:① 3D 标注成本被自监督预训练消化;② 软硬协同设计避免重复试错;③ MoE 架构让专家模型共享主干。

判断:3D ViT + 1280 TOPS 是"软硬协同"的产物——理想基础模型团队评估近 2000 种模型架构配置,是在**芯片设计阶段就已经考虑过哪些算子需要加速**。这意味着 MindVLA-o1 在 Mind 100 芯片上跑出 60+ FPS 时,可能根本跑不动在 Orin-X 上——**这是车厂第一次把"硬件绑定模型"做到这种程度**。
3训练成本下降 75% 的真实成分

2000 种架构配置背后的工程组织

"训练成本下降 75%"是 GTC 2026 现场被反复强调的数字。这个下降幅度比单纯"用更大模型"或"用更多数据"都激进得多,**几乎一定是结构性优化**——而不是单点效率提升。可能的来源:

数据侧
3D 标注转向自监督预训练 + 自动标注流水线,单帧标注成本大幅下降
模型侧
MoE 架构让"任务专家"共享主干,避免独立训练 5–10 个完整模型
软硬侧
Mach 100 芯片为 MindVLA 定制算子,推理训练共用同一套硬件约束
流程侧
2000 种架构配置走的是大模型"超参搜索 + 蒸馏"成熟工程范式

但需要注意的是,**"训练成本下降"不等于"研发投入下降"**。2000 种架构配置本身就是巨大的算力开销,理想技术团队规模与日算力消耗在 2026 年仍持续上升。这 75% 是单次训练成本,不反映总研发预算。

判断:75% 这个数字的最大价值,是**让 VLA 在车端训练从"每月千万级人民币"降到"每月百万级"**——这意味着理想可以在更短周期内做模型迭代、可以训练 50+ 个变体做 A/B、可以做更激进的架构实验。**单位实验成本的下降,会换来实验次数的上升,最终带来模型质量的代际差**。
4对车厂 AI 竞争的影响

车厂从功能集成商变成模型架构公司

MindVLA-o1 的发布是车厂 AI 竞争的**第一次结构性变化**。在此之前,车厂之间的差异主要在"传感器数量 + 芯片算力 + 数据规模"上;发布之后,差异转移到**模型架构与软硬协同能力**上——这是从"配置竞赛"转向"架构竞赛"。

  • 小鹏、蔚来、极氪、智己目前仍以 BEV + Transformer + 规则栈为主,没有公开宣布原生 3D ViT。
  • 特斯拉 FSD V13 早在 2024 年就推进 3D 占用网络(Occupancy Network),但占用网络 ≠ 3D ViT,理想此次把"注意力直接跑在 3D 体素"作为差异化卖点。
  • 华为 ADS 4.0 在 MDC 810 上以 BEV + Transformer 为主,未公开 3D ViT 路线。
对照参考:理想 MindVLA-o1 当前的竞争对象不是"国内同行",而是**特斯拉 FSD V13/V14**——两者都在拼"原生 3D + 大模型 + 自研芯片"的全栈闭环。区别在于:特斯拉 HW4.0 算力约 144 TOPS(单颗),HW5.0 计划 500–800 TOPS;而理想 Mach 100 是 1280 TOPS、**直接跳过特斯拉 HW5.0**。这意味着理想在车端算力维度上**首次超越特斯拉**。
判断:MindVLA-o1 的发布是中国车厂第一次在车端 AI 架构上**领先特斯拉同期硬件一个身位**。但优势是脆弱的——特斯拉随时可以通过 HW5.0 + FSD V14 反击,理想必须在 2026 年底前把 MindVLA-o1 落地到 L9 量产并交付真实用户数据,否则领先窗口只有 6–9 个月。
待核验项:① MindVLA-o1 实际参数量、训练数据规模、推理延迟(FPS);② Mach 100 是否已通过 AEC-Q100 车规认证;③ 全新 L9 的 MindVLA-o1 实际开放城市与功能边界;④ VLA-MoE 的专家模型数量与激活策略。