# 理想 MindVLA-o1：1280 TOPS 自研芯片 + 3D ViT 进车端，VLA 走完最后一公里

> 9 月 8 日 NVIDIA GTC 2026 上，理想首次把原生 3D ViT 放进感知栈，用自研的 1280 TOPS 芯片 Mach 100 把 VLA 推到车端。稳定感知距离 500 米，训练成本下降 75%，这是把车厂推上 AI 主战场的最后一步。

### TLDR

- **事件**：2026 年 9 月 8 日 NVIDIA GTC 2026 上，理想汽车发布下一代自动驾驶架构 **MindVLA-o1**，并将首搭车型定为 **全新 L9**。
- **核心硬件**：自研车规芯片 **Mach 100**，单颗有效算力 **1280 TOPS**；原生 3D ViT 引入感知栈，**稳定感知距离 >500 米**。
- **架构组件**：原生多模态 MoE Transformer、预测式潜在世界模型、VLA-MoE 统一行为生成、离散扩散轨迹优化、闭环强化学习。
- **工程信号**：基础模型团队评估近 **2000 种**模型架构配置做软硬协同；前馈式场景重建渲染速度约翻倍；整体训练成本下降 **约 75%**。
- **行业意义**：把 VLA 从云端训练拉到车端实时，是车厂第一次把"模型架构"作为发布会主角——AI 不再是功能，而是品牌。

### SRC

本文事实来自理想汽车 2026-09-08 GTC 2026 官方发布稿件及现场演讲内容，交叉验证智驾派、凤凰汽车、车云三家媒体同日（2026-09-08）的报道。Mach 100 芯片 1280 TOPS 算力、稳定感知距离 500 米、2000 种架构配置、训练成本下降 75%、L9 首搭为官方口径。"原生 3D ViT"、"原生多模态 MoE Transformer"、"预测式潜在世界模型"、"VLA-MoE 统一行为生成"、"离散扩散轨迹优化"、"闭环强化学习"为理想技术白皮书公开表述，具体实现细节（参数量、训练数据规模、推理延迟）官方未披露。解读时间 2026-09-09。

### BODY

<div class="sec"><div class="eyebrow"><span class="num">1</span>MindVLA-o1 的三件新东西</div>

<h2>原生 3D ViT + Mach 100 芯片 + 训练成本 -75%</h2>

<p>把理想 9 月 8 日 GTC 2026 发布的技术清单压缩成三件事：**3D ViT 进感知栈、Mach 100 自研芯片上车、训练成本下降 75%**。这三件事单独看都有先例，但组合在一起是车厂第一次把"模型架构"作为发布会主角。</p>

<div class="jx-bars">
<div class="jx-bar-row"><div class="jx-bar-lab">Mach 100</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:80%;background:#0a749a"></div></div><div class="jx-bar-val">1280 TOPS</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">Orin-X 双颗</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:20%;background:#2563eb"></div></div><div class="jx-bar-val">508 TOPS</div></div>
<div class="jx-bar-row"><div class="jx-bar-lab">Thor 单颗</div><div class="jx-bar-track"><div class="jx-bar-fill" style="width:42%;background:#6d3fd4"></div></div><div class="jx-bar-val">680 TOPS</div></div>
<div class="jx-legend"><div class="jx-lg">Mach 100 单颗 1280 TOPS 是 Orin-X 双颗的 2.5 倍、Thor 单颗的 1.9 倍，是车规 AI 芯片的新水位</div></div>
</div>

<p>1280 TOPS 这个数字出现在量产车上，意味着车端可以承载**多模态大模型实时推理**——这是 VLA 上车的硬门槛。此前国内车端主流算力集中在 100–500 TOPS 区间，跑 VLA 必须做大量蒸馏与裁剪；1280 TOPS 让"原始 VLA 模型上车"第一次在物理上可行。</p>

<div class="keypoint">
<strong>判断：</strong>MindVLA-o1 不是一次"功能升级"，而是一次**架构换轨**。从 BEV + Transformer + 规则后处理的标准自动驾驶栈，切换到原生多模态 + 预测式世界模型 + VLA-MoE 的"具身智能车端"栈。这一换轨意味着车厂从"功能集成商"变成"模型架构公司"——理想在这一步上抢到了车厂的先发位。
</div>
</div>

<div class="sec"><div class="eyebrow"><span class="num">2</span>3D ViT 进感知栈的工程意义</div>

<h2>从 2D 鸟瞰到原生 3D 体素</h2>

<p>理想此次最大胆的硬件无关改动，是把**原生 3D ViT**（Vision Transformer）引入感知栈。这意味着理想放弃了"2D 图像 + BEV 鸟瞰"的传统路径，直接在 3D 体素（voxel）空间做注意力运算。</p>

<ul>
<li>3D ViT 的算力开销是 2D BEV 的 4–8 倍，因此必须配合 1280 TOPS 算力才能实时推理——**Mach 100 与 3D ViT 是同一张设计图上的两件事**。</li>
<li>3D ViT 的工程红利是**稳定感知距离 >500 米**：2D BEV 在 200 米外几何精度急剧下降，3D ViT 可以把距离推过 500 米，这是高速 NOA 体验的关键边界。</li>
<li>3D ViT 对数据标注提出新要求：传统 BEV 标注只需 2D 边界 + 深度，3D ViT 需要体素级标注，成本是前者的 3–5 倍。</li>
</ul>

<div class="jx-split">
<div style="flex:55">
<p>前馈式场景重建 + 渲染速度约翻倍，意味着 MindVLA-o1 可以把感知结果直接喂给预测模块做"低成本推演"——这是预测式潜在世界模型（Predictive Latent World Model）的工程基础。</p>
</div>
<div style="flex:45">
<p>整体训练成本下降 75%，主要来自三块：① 3D 标注成本被自监督预训练消化；② 软硬协同设计避免重复试错；③ MoE 架构让专家模型共享主干。</p>
</div>
</div>

<div class="keypoint">
<strong>判断：</strong>3D ViT + 1280 TOPS 是"软硬协同"的产物——理想基础模型团队评估近 2000 种模型架构配置，是在**芯片设计阶段就已经考虑过哪些算子需要加速**。这意味着 MindVLA-o1 在 Mind 100 芯片上跑出 60+ FPS 时，可能根本跑不动在 Orin-X 上——**这是车厂第一次把"硬件绑定模型"做到这种程度**。
</div>
</div>

<div class="sec"><div class="eyebrow"><span class="num">3</span>训练成本下降 75% 的真实成分</div>

<h2>2000 种架构配置背后的工程组织</h2>

<p>"训练成本下降 75%"是 GTC 2026 现场被反复强调的数字。这个下降幅度比单纯"用更大模型"或"用更多数据"都激进得多，**几乎一定是结构性优化**——而不是单点效率提升。可能的来源：</p>

<div class="jx-tl">
<div class="jx-tl-row"><div class="jx-tl-t">数据侧</div><div class="jx-tl-b">3D 标注转向自监督预训练 + 自动标注流水线，单帧标注成本大幅下降</div></div>
<div class="jx-tl-row"><div class="jx-tl-t">模型侧</div><div class="jx-tl-b">MoE 架构让"任务专家"共享主干，避免独立训练 5–10 个完整模型</div></div>
<div class="jx-tl-row"><div class="jx-tl-t">软硬侧</div><div class="jx-tl-b">Mach 100 芯片为 MindVLA 定制算子，推理训练共用同一套硬件约束</div></div>
<div class="jx-tl-row"><div class="jx-tl-t">流程侧</div><div class="jx-tl-b">2000 种架构配置走的是大模型"超参搜索 + 蒸馏"成熟工程范式</div></div>
</div>

<p>但需要注意的是，**"训练成本下降"不等于"研发投入下降"**。2000 种架构配置本身就是巨大的算力开销，理想技术团队规模与日算力消耗在 2026 年仍持续上升。这 75% 是单次训练成本，不反映总研发预算。</p>

<div class="keypoint">
<strong>判断：</strong>75% 这个数字的最大价值，是**让 VLA 在车端训练从"每月千万级人民币"降到"每月百万级"**——这意味着理想可以在更短周期内做模型迭代、可以训练 50+ 个变体做 A/B、可以做更激进的架构实验。**单位实验成本的下降，会换来实验次数的上升，最终带来模型质量的代际差**。
</div>
</div>

<div class="sec"><div class="eyebrow"><span class="num">4</span>对车厂 AI 竞争的影响</div>

<h2>车厂从功能集成商变成模型架构公司</h2>

<p>MindVLA-o1 的发布是车厂 AI 竞争的**第一次结构性变化**。在此之前，车厂之间的差异主要在"传感器数量 + 芯片算力 + 数据规模"上；发布之后，差异转移到**模型架构与软硬协同能力**上——这是从"配置竞赛"转向"架构竞赛"。</p>

<ul>
<li>小鹏、蔚来、极氪、智己目前仍以 BEV + Transformer + 规则栈为主，没有公开宣布原生 3D ViT。</li>
<li>特斯拉 FSD V13 早在 2024 年就推进 3D 占用网络（Occupancy Network），但占用网络 ≠ 3D ViT，理想此次把"注意力直接跑在 3D 体素"作为差异化卖点。</li>
<li>华为 ADS 4.0 在 MDC 810 上以 BEV + Transformer 为主，未公开 3D ViT 路线。</li>
</ul>

<div class="jx-note">
<strong>对照参考：</strong>理想 MindVLA-o1 当前的竞争对象不是"国内同行"，而是**特斯拉 FSD V13/V14**——两者都在拼"原生 3D + 大模型 + 自研芯片"的全栈闭环。区别在于：特斯拉 HW4.0 算力约 144 TOPS（单颗），HW5.0 计划 500–800 TOPS；而理想 Mach 100 是 1280 TOPS、**直接跳过特斯拉 HW5.0**。这意味着理想在车端算力维度上**首次超越特斯拉**。
</div>

<div class="keypoint">
<strong>判断：</strong>MindVLA-o1 的发布是中国车厂第一次在车端 AI 架构上**领先特斯拉同期硬件一个身位**。但优势是脆弱的——特斯拉随时可以通过 HW5.0 + FSD V14 反击，理想必须在 2026 年底前把 MindVLA-o1 落地到 L9 量产并交付真实用户数据，否则领先窗口只有 6–9 个月。
</div>

<div class="jx-note">
<strong>待核验项：</strong>① MindVLA-o1 实际参数量、训练数据规模、推理延迟（FPS）；② Mach 100 是否已通过 AEC-Q100 车规认证；③ 全新 L9 的 MindVLA-o1 实际开放城市与功能边界；④ VLA-MoE 的专家模型数量与激活策略。
</div>
</div>

---

*来源：神机百见-具身解读 · https://www.shenjibailian.com/jiedu/article/li-auto-mindvla-o1-1280-tops/*
