理想 MindVLA-o1:1280 TOPS 自研芯片 + 3D ViT 进车端,VLA 走完最后一公里
9 月 8 日 NVIDIA GTC 2026 上,理想首次把原生 3D ViT 放进感知栈,用自研的 1280 TOPS 芯片 Mach 100 把 VLA 推到车端。稳定感知距离 500 米,训练成本下降 75%,这是把车厂推上 AI 主战场的最后一步。
- 事件:2026 年 9 月 8 日 NVIDIA GTC 2026 上,理想汽车发布下一代自动驾驶架构 MindVLA-o1,并将首搭车型定为 全新 L9。
- 核心硬件:自研车规芯片 Mach 100,单颗有效算力 1280 TOPS;原生 3D ViT 引入感知栈,稳定感知距离 >500 米。
- 架构组件:原生多模态 MoE Transformer、预测式潜在世界模型、VLA-MoE 统一行为生成、离散扩散轨迹优化、闭环强化学习。
- 工程信号:基础模型团队评估近 2000 种模型架构配置做软硬协同;前馈式场景重建渲染速度约翻倍;整体训练成本下降 约 75%。
- 行业意义:把 VLA 从云端训练拉到车端实时,是车厂第一次把"模型架构"作为发布会主角——AI 不再是功能,而是品牌。
原生 3D ViT + Mach 100 芯片 + 训练成本 -75%
把理想 9 月 8 日 GTC 2026 发布的技术清单压缩成三件事:**3D ViT 进感知栈、Mach 100 自研芯片上车、训练成本下降 75%**。这三件事单独看都有先例,但组合在一起是车厂第一次把"模型架构"作为发布会主角。
1280 TOPS 这个数字出现在量产车上,意味着车端可以承载**多模态大模型实时推理**——这是 VLA 上车的硬门槛。此前国内车端主流算力集中在 100–500 TOPS 区间,跑 VLA 必须做大量蒸馏与裁剪;1280 TOPS 让"原始 VLA 模型上车"第一次在物理上可行。
从 2D 鸟瞰到原生 3D 体素
理想此次最大胆的硬件无关改动,是把**原生 3D ViT**(Vision Transformer)引入感知栈。这意味着理想放弃了"2D 图像 + BEV 鸟瞰"的传统路径,直接在 3D 体素(voxel)空间做注意力运算。
- 3D ViT 的算力开销是 2D BEV 的 4–8 倍,因此必须配合 1280 TOPS 算力才能实时推理——**Mach 100 与 3D ViT 是同一张设计图上的两件事**。
- 3D ViT 的工程红利是**稳定感知距离 >500 米**:2D BEV 在 200 米外几何精度急剧下降,3D ViT 可以把距离推过 500 米,这是高速 NOA 体验的关键边界。
- 3D ViT 对数据标注提出新要求:传统 BEV 标注只需 2D 边界 + 深度,3D ViT 需要体素级标注,成本是前者的 3–5 倍。
前馈式场景重建 + 渲染速度约翻倍,意味着 MindVLA-o1 可以把感知结果直接喂给预测模块做"低成本推演"——这是预测式潜在世界模型(Predictive Latent World Model)的工程基础。
整体训练成本下降 75%,主要来自三块:① 3D 标注成本被自监督预训练消化;② 软硬协同设计避免重复试错;③ MoE 架构让专家模型共享主干。
2000 种架构配置背后的工程组织
"训练成本下降 75%"是 GTC 2026 现场被反复强调的数字。这个下降幅度比单纯"用更大模型"或"用更多数据"都激进得多,**几乎一定是结构性优化**——而不是单点效率提升。可能的来源:
但需要注意的是,**"训练成本下降"不等于"研发投入下降"**。2000 种架构配置本身就是巨大的算力开销,理想技术团队规模与日算力消耗在 2026 年仍持续上升。这 75% 是单次训练成本,不反映总研发预算。
车厂从功能集成商变成模型架构公司
MindVLA-o1 的发布是车厂 AI 竞争的**第一次结构性变化**。在此之前,车厂之间的差异主要在"传感器数量 + 芯片算力 + 数据规模"上;发布之后,差异转移到**模型架构与软硬协同能力**上——这是从"配置竞赛"转向"架构竞赛"。
- 小鹏、蔚来、极氪、智己目前仍以 BEV + Transformer + 规则栈为主,没有公开宣布原生 3D ViT。
- 特斯拉 FSD V13 早在 2024 年就推进 3D 占用网络(Occupancy Network),但占用网络 ≠ 3D ViT,理想此次把"注意力直接跑在 3D 体素"作为差异化卖点。
- 华为 ADS 4.0 在 MDC 810 上以 BEV + Transformer 为主,未公开 3D ViT 路线。