# VLA 与世界模型之争结束了吗：2026 智源大会上的那个共识判断

> 行业吵了几个月的「VLA 还是世界模型」，在 2026 智源大会上被给出一个共识判断：世界模型不是 VLA 的竞争路线，而是 VLA 体系的核心组成部分。本文拆这个判断是怎么成立的，以及它对做落地的人意味着什么。

### TLDR

- **共识判断**：2026 智源大会上，智平方提出、并获广泛印证的观点是——世界模型并非 VLA 的竞争路线，而是 VLA 体系的核心组成部分，二者融合形成的类脑架构是下一代具身大脑的方向。
- **VLA 已是大一统**：端到端取代「感知→规划→控制」的模块化流水线，输入像素和文字指令，直接输出动作信号。
- **VLA 的短板**：本质是模仿学习，擅长静态环境下的绑定任务，在泛化性、动态环境、长程任务上短板明显，还会「幻觉」——做出违反物理规律的动作。
- **融合的技术路径**：世界模型生成任务完成状态或中间状态的预测图片/视频，与真实视觉输入合并后一起送进 VLM。这条路不冲突、易实现，被越来越多前沿团队采纳。
- **落地含义**：别按技术路线选供应商，按场景选。两条范式各有明确的适用边界。

### SRC

本文核心判断来自 2026 智源大会公开报道（界面新闻、南方+等），模型进展信息整理自各家公开宣传资料与研报。π0.7、HyVLA-0.5、G0.5、Thinker-VLA、LingBot-VLA2.0 等模型的具体指标为各机构自行公布，无第三方统一基准复核，不同模型的测试条件不可直接横向比较。

### BODY

<div class="sec"><div class="eyebrow"><span class="num">1</span>争论本身</div>
<h2>过去几个月在吵什么</h2>

<p>具身智能领域 2026 年上半年有一场持续的路线争论：<strong>具身大脑该走 VLA，还是走世界模型？</strong></p>

<p>先把两个词说清楚：</p>

<div class="jx">
  <div class="jx-h"><span>两个概念的最小定义</span></div>
  <table class="jx-mx">
    <tr><th></th><th class="c">模块化流水线（过去）</th><th class="a">VLA（现在主流）</th><th class="b">世界模型（新增能力）</th></tr>
    <tr><th>结构</th><td class="c">感知 → 规划 → 控制，三段独立</td><td class="a">端到端，一个网络到底</td><td class="b">先预测未来状态，再决策</td></tr>
    <tr><th>输入</th><td class="c">各段分别处理</td><td class="a">图像 + 语言指令</td><td class="b">当前观测 + 想象的后果</td></tr>
    <tr><th>输出</th><td class="c">逐段传递</td><td class="a">动作信号</td><td class="b">预测帧 → 送入 VLA</td></tr>
    <tr><th>主要问题</th><td class="c">误差逐段累积</td><td class="a">会「幻觉」，泛化有限</td><td class="b">单独用时任务成功率不如 VLA</td></tr>
  </table>
  <div class="cap">三者不是三个并列的选项。严格说，世界模型是加在 VLA 前面或中间的一个模块。</div>
</div>

<p>一年前 VLA 成为主流，一位投资人的说法很实在：<strong>不是因为它绝对正确，而是这条路线在可控场景下能跑通，是最现实的选择</strong>。经过一年发展，VLA 在泛化性、动态环境、长程任务上的短板逐渐显现，从业者开始把世界模型的预测与建模能力融进原有架构。</p>
</div>

<div class="sec"><div class="eyebrow"><span class="num">2</span>共识</div>
<h2>「不是竞争路线，是组成部分」</h2>

<p>2026 智源大会上给出的判断是：<strong>世界模型并非 VLA 的竞争路线，而是 VLA 体系的核心组成部分</strong>。二者融合形成的类脑架构，是下一代具身大脑的方向。</p>

<p>这个判断不是和稀泥，它有具体的技术依据——融合路径在工程上是明确的：</p>

<div class="jx">
  <div class="jx-h"><span>融合的技术路径</span></div>
  <div class="jx-tl">
    <div class="jx-tl-row"><div class="jx-tl-t">1 · 观测</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#3a4d66">相机拿到当前画面</div></div></div>
    <div class="jx-tl-row"><div class="jx-tl-t">2 · 想象</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#6d3fd4">世界模型生成几秒后的预测帧 / 目标状态图</div></div></div>
    <div class="jx-tl-row"><div class="jx-tl-t">3 · 合并</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#2563eb">预测帧 + 真实观测，一起送进 VLM</div></div></div>
    <div class="jx-tl-row"><div class="jx-tl-t">4 · 决策</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#0d8a5f">VLA 输出动作，且已被「想象过后果」校验</div></div></div>
    <div class="jx-tl-row"><div class="jx-tl-t">5 · 闭环</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#0a749a">真实执行 → 回到 1，误差反哺世界模型</div></div></div>
  </div>
  <div class="cap">关键在于第 3 步：预测出来的画面不需要替代真实观测，只要作为额外的一路输入。这条路径因不冲突、易实现，正被越来越多前沿团队采纳。</div>
</div>

<div class="analogy">
  <div class="h">打个比方</div>
  <p>纯 VLA 像一个从没下过水、靠看视频学游泳的人——动作都记得，但一下水就慌，因为没预判过水的阻力。世界模型是让他在脑子里先「游一遍」：我这样划水，身体会往哪偏，水花会怎么溅。真正下水时，心里有底。<br><br>
  关键是：想象不会替代真实的感受，它只是多了一路信息。这也是为什么「融合」而不是「替换」在工程上成立。</p>
</div>
</div>

<div class="sec"><div class="eyebrow"><span class="num">3</span>代表选手</div>
<h2>2026 年这一波模型各自站在哪</h2>

<div class="jx">
  <div class="jx-h"><span>2026 年主要具身大脑模型</span><span class="jx-note">各机构自公布，非统一基准</span></div>
  <table class="jx-mx">
    <tr><th>模型</th><th>机构</th><th>公开要点</th></tr>
    <tr><th>π0.7</th><td>Physical Intelligence</td><td>首次在机器人领域实证「组合泛化」，被称机器人领域的 GPT-3 时刻；首次将世界模型作为 Subgoal Image Provider 集成进 VLA</td></tr>
    <tr><th>HyVLA-0.5</th><td>腾讯</td><td>4B MoT 骨干 + 370M 动作专家的双塔 Flow Matching；10K 小时动捕数据；长时程双臂任务成功率 94%–99%</td></tr>
    <tr><th>G0.5</th><td>星海图</td><td>视觉/语言/动作离散化为 Token，GPT 式自回归逐个输出；Max 版 8 月底全面开源</td></tr>
    <tr><th>Thinker-VLA</th><td>优必选</td><td>小参数高性能全开源，10B 以下具身大脑基准 9 项第一，最大基座达 100B</td></tr>
    <tr><th>LingBot-VLA 2.0</th><td>蚂蚁灵波</td><td>预训练融入 6 万小时真实物理数据，覆盖 17 个品牌 20 种机器人构型</td></tr>
    <tr><th>NeuroVLA</th><td>智平方</td><td>「皮层—小脑—脊髓」三层类脑架构；称可抑制 75% 以上动作抖动，碰撞后任务恢复率 54.8%</td></tr>
    <tr><th>UnifoLM-VLA-0</th><td>宇树</td><td>2026 年 1 月开源，LIBERO 基准 98.7 分</td></tr>
  </table>
  <div class="cap">这张表不能横向比分数——测试条件、任务集、硬件平台全都不同。它的用处是看各家在往哪个方向使劲。</div>
</div>

<div class="keypoint">
  <strong>看这张表的正确姿势：</strong>注意到没有——几乎每一家都在往「融合」上靠，只是叫法不同（Subgoal Image Provider、WUM 世界统一模型、类脑架构、Video2Act）。<strong>路线之争在技术层面已经结束了，剩下的分歧在工程实现和场景选择上。</strong>
</div>
</div>

<div class="sec"><div class="eyebrow"><span class="num">4</span>别忽略的瓶颈</div>
<h2>所有路线绕不开的还是数据</h2>

<p>一位行业人士给的量级对比很说明问题：今天的 VLA 模型大部分在 <strong>70 亿参数规模</strong>上下，离早期语言模型的千亿级差得远。很多人训练今天的 VLA，几十个 GPU 甚至几张卡就够。</p>

<div class="jx">
  <div class="jx-h"><span>参数量级对比 · 量级示意</span><span class="jx-note">非精确数值，示意用</span></div>
  <div class="jx-bars">
    <div class="jx-bar-row">
      <div class="jx-bar-lab">前沿 LLM</div>
      <div class="jx-bar-track"><div class="jx-bar-fill" data-w="100%" style="background:#3a4d66">千亿级</div></div>
      <div class="jx-bar-val">参考</div>
    </div>
    <div class="jx-bar-row">
      <div class="jx-bar-lab">主流 VLA</div>
      <div class="jx-bar-track"><div class="jx-bar-fill" data-w="7%" style="background:#0a749a">7B</div></div>
      <div class="jx-bar-val">当前</div>
    </div>
  </div>
  <div class="cap">VLA 的参数规模比前沿语言模型小两个数量级。这不是因为不需要，而是因为没有足够的高质量物理交互数据去喂——真实世界机器人交互数据靠遥操作采集，成本高、效率低。</div>
</div>

<div class="analogy">
  <div class="h">打个比方</div>
  <p>语言模型有整个互联网当免费粮仓，所以能长到千亿参数。机器人模型的数据得靠人一遍遍抓杯子抓出来，一小时遥操作可能只产出几百条有效样本。粮仓太小，模型就长不大。这也是为什么「仿真合成数据」会成为一个独立赛道——用假粮先把模型喂大，再用真粮微调。</p>
</div>

<div class="srcline">
  <div class="h">对我们的意义</div>
  如果你在做选型或投资判断，<strong>别按技术路线站队，按场景站队</strong>。业界的基本划分是：<br><br>
  <strong>本能驱动 / 触觉为主</strong>——数据需求小、冷启动快、端侧算力要求低，适合固定工位的柔性装配、分拣、接触式精细操作（日化、消费电子、生物医药产线）。<br>
  <strong>类脑 VLA 融合</strong>——需要海量图文配对数据和多样物理交互样本，适合多任务切换、开放环境、长序列复杂作业（半导体面板转运、整车多工序、新零售交互服务）。<br><br>
  换句话说：<strong>产线上的固定工位，和商场里的交互服务，本来就不该用同一套大脑。</strong>
</div>
</div>

---

*来源：神机百见-具身解读 · https://www.shenjibailian.com/jiedu/article/vla-vs-world-model/*
