研究解读 · 神机百见解读

VLA 与世界模型之争结束了吗:2026 智源大会上的那个共识判断

行业吵了几个月的「VLA 还是世界模型」,在 2026 智源大会上被给出一个共识判断:世界模型不是 VLA 的竞争路线,而是 VLA 体系的核心组成部分。本文拆这个判断是怎么成立的,以及它对做落地的人意味着什么。

本篇目录4 节 · 14 分钟
一分钟速览
  1. 共识判断:2026 智源大会上,智平方提出、并获广泛印证的观点是——世界模型并非 VLA 的竞争路线,而是 VLA 体系的核心组成部分,二者融合形成的类脑架构是下一代具身大脑的方向。
  2. VLA 已是大一统:端到端取代「感知→规划→控制」的模块化流水线,输入像素和文字指令,直接输出动作信号。
  3. VLA 的短板:本质是模仿学习,擅长静态环境下的绑定任务,在泛化性、动态环境、长程任务上短板明显,还会「幻觉」——做出违反物理规律的动作。
  4. 融合的技术路径:世界模型生成任务完成状态或中间状态的预测图片/视频,与真实视觉输入合并后一起送进 VLM。这条路不冲突、易实现,被越来越多前沿团队采纳。
  5. 落地含义:别按技术路线选供应商,按场景选。两条范式各有明确的适用边界。
数据来源与边界
本文核心判断来自 2026 智源大会公开报道(界面新闻、南方+等),模型进展信息整理自各家公开宣传资料与研报。π0.7、HyVLA-0.5、G0.5、Thinker-VLA、LingBot-VLA2.0 等模型的具体指标为各机构自行公布,无第三方统一基准复核,不同模型的测试条件不可直接横向比较。
1争论本身

过去几个月在吵什么

具身智能领域 2026 年上半年有一场持续的路线争论:具身大脑该走 VLA,还是走世界模型?

先把两个词说清楚:

两个概念的最小定义
模块化流水线(过去)VLA(现在主流)世界模型(新增能力)
结构感知 → 规划 → 控制,三段独立端到端,一个网络到底先预测未来状态,再决策
输入各段分别处理图像 + 语言指令当前观测 + 想象的后果
输出逐段传递动作信号预测帧 → 送入 VLA
主要问题误差逐段累积会「幻觉」,泛化有限单独用时任务成功率不如 VLA
三者不是三个并列的选项。严格说,世界模型是加在 VLA 前面或中间的一个模块。

一年前 VLA 成为主流,一位投资人的说法很实在:不是因为它绝对正确,而是这条路线在可控场景下能跑通,是最现实的选择。经过一年发展,VLA 在泛化性、动态环境、长程任务上的短板逐渐显现,从业者开始把世界模型的预测与建模能力融进原有架构。

2共识

「不是竞争路线,是组成部分」

2026 智源大会上给出的判断是:世界模型并非 VLA 的竞争路线,而是 VLA 体系的核心组成部分。二者融合形成的类脑架构,是下一代具身大脑的方向。

这个判断不是和稀泥,它有具体的技术依据——融合路径在工程上是明确的:

融合的技术路径
1 · 观测
相机拿到当前画面
2 · 想象
世界模型生成几秒后的预测帧 / 目标状态图
3 · 合并
预测帧 + 真实观测,一起送进 VLM
4 · 决策
VLA 输出动作,且已被「想象过后果」校验
5 · 闭环
真实执行 → 回到 1,误差反哺世界模型
关键在于第 3 步:预测出来的画面不需要替代真实观测,只要作为额外的一路输入。这条路径因不冲突、易实现,正被越来越多前沿团队采纳。
打个比方

纯 VLA 像一个从没下过水、靠看视频学游泳的人——动作都记得,但一下水就慌,因为没预判过水的阻力。世界模型是让他在脑子里先「游一遍」:我这样划水,身体会往哪偏,水花会怎么溅。真正下水时,心里有底。

关键是:想象不会替代真实的感受,它只是多了一路信息。这也是为什么「融合」而不是「替换」在工程上成立。

3代表选手

2026 年这一波模型各自站在哪

2026 年主要具身大脑模型各机构自公布,非统一基准
模型机构公开要点
π0.7Physical Intelligence首次在机器人领域实证「组合泛化」,被称机器人领域的 GPT-3 时刻;首次将世界模型作为 Subgoal Image Provider 集成进 VLA
HyVLA-0.5腾讯4B MoT 骨干 + 370M 动作专家的双塔 Flow Matching;10K 小时动捕数据;长时程双臂任务成功率 94%–99%
G0.5星海图视觉/语言/动作离散化为 Token,GPT 式自回归逐个输出;Max 版 8 月底全面开源
Thinker-VLA优必选小参数高性能全开源,10B 以下具身大脑基准 9 项第一,最大基座达 100B
LingBot-VLA 2.0蚂蚁灵波预训练融入 6 万小时真实物理数据,覆盖 17 个品牌 20 种机器人构型
NeuroVLA智平方「皮层—小脑—脊髓」三层类脑架构;称可抑制 75% 以上动作抖动,碰撞后任务恢复率 54.8%
UnifoLM-VLA-0宇树2026 年 1 月开源,LIBERO 基准 98.7 分
这张表不能横向比分数——测试条件、任务集、硬件平台全都不同。它的用处是看各家在往哪个方向使劲。
看这张表的正确姿势:注意到没有——几乎每一家都在往「融合」上靠,只是叫法不同(Subgoal Image Provider、WUM 世界统一模型、类脑架构、Video2Act)。路线之争在技术层面已经结束了,剩下的分歧在工程实现和场景选择上。
4别忽略的瓶颈

所有路线绕不开的还是数据

一位行业人士给的量级对比很说明问题:今天的 VLA 模型大部分在 70 亿参数规模上下,离早期语言模型的千亿级差得远。很多人训练今天的 VLA,几十个 GPU 甚至几张卡就够。

参数量级对比 · 量级示意非精确数值,示意用
前沿 LLM
千亿级
参考
主流 VLA
7B
当前
VLA 的参数规模比前沿语言模型小两个数量级。这不是因为不需要,而是因为没有足够的高质量物理交互数据去喂——真实世界机器人交互数据靠遥操作采集,成本高、效率低。
打个比方

语言模型有整个互联网当免费粮仓,所以能长到千亿参数。机器人模型的数据得靠人一遍遍抓杯子抓出来,一小时遥操作可能只产出几百条有效样本。粮仓太小,模型就长不大。这也是为什么「仿真合成数据」会成为一个独立赛道——用假粮先把模型喂大,再用真粮微调。

对我们的意义
如果你在做选型或投资判断,别按技术路线站队,按场景站队。业界的基本划分是:

本能驱动 / 触觉为主——数据需求小、冷启动快、端侧算力要求低,适合固定工位的柔性装配、分拣、接触式精细操作(日化、消费电子、生物医药产线)。
类脑 VLA 融合——需要海量图文配对数据和多样物理交互样本,适合多任务切换、开放环境、长序列复杂作业(半导体面板转运、整车多工序、新零售交互服务)。

换句话说:产线上的固定工位,和商场里的交互服务,本来就不该用同一套大脑。