VLA 与世界模型之争结束了吗:2026 智源大会上的那个共识判断
行业吵了几个月的「VLA 还是世界模型」,在 2026 智源大会上被给出一个共识判断:世界模型不是 VLA 的竞争路线,而是 VLA 体系的核心组成部分。本文拆这个判断是怎么成立的,以及它对做落地的人意味着什么。
- 共识判断:2026 智源大会上,智平方提出、并获广泛印证的观点是——世界模型并非 VLA 的竞争路线,而是 VLA 体系的核心组成部分,二者融合形成的类脑架构是下一代具身大脑的方向。
- VLA 已是大一统:端到端取代「感知→规划→控制」的模块化流水线,输入像素和文字指令,直接输出动作信号。
- VLA 的短板:本质是模仿学习,擅长静态环境下的绑定任务,在泛化性、动态环境、长程任务上短板明显,还会「幻觉」——做出违反物理规律的动作。
- 融合的技术路径:世界模型生成任务完成状态或中间状态的预测图片/视频,与真实视觉输入合并后一起送进 VLM。这条路不冲突、易实现,被越来越多前沿团队采纳。
- 落地含义:别按技术路线选供应商,按场景选。两条范式各有明确的适用边界。
过去几个月在吵什么
具身智能领域 2026 年上半年有一场持续的路线争论:具身大脑该走 VLA,还是走世界模型?
先把两个词说清楚:
| 模块化流水线(过去) | VLA(现在主流) | 世界模型(新增能力) | |
|---|---|---|---|
| 结构 | 感知 → 规划 → 控制,三段独立 | 端到端,一个网络到底 | 先预测未来状态,再决策 |
| 输入 | 各段分别处理 | 图像 + 语言指令 | 当前观测 + 想象的后果 |
| 输出 | 逐段传递 | 动作信号 | 预测帧 → 送入 VLA |
| 主要问题 | 误差逐段累积 | 会「幻觉」,泛化有限 | 单独用时任务成功率不如 VLA |
一年前 VLA 成为主流,一位投资人的说法很实在:不是因为它绝对正确,而是这条路线在可控场景下能跑通,是最现实的选择。经过一年发展,VLA 在泛化性、动态环境、长程任务上的短板逐渐显现,从业者开始把世界模型的预测与建模能力融进原有架构。
「不是竞争路线,是组成部分」
2026 智源大会上给出的判断是:世界模型并非 VLA 的竞争路线,而是 VLA 体系的核心组成部分。二者融合形成的类脑架构,是下一代具身大脑的方向。
这个判断不是和稀泥,它有具体的技术依据——融合路径在工程上是明确的:
纯 VLA 像一个从没下过水、靠看视频学游泳的人——动作都记得,但一下水就慌,因为没预判过水的阻力。世界模型是让他在脑子里先「游一遍」:我这样划水,身体会往哪偏,水花会怎么溅。真正下水时,心里有底。
关键是:想象不会替代真实的感受,它只是多了一路信息。这也是为什么「融合」而不是「替换」在工程上成立。
2026 年这一波模型各自站在哪
| 模型 | 机构 | 公开要点 |
|---|---|---|
| π0.7 | Physical Intelligence | 首次在机器人领域实证「组合泛化」,被称机器人领域的 GPT-3 时刻;首次将世界模型作为 Subgoal Image Provider 集成进 VLA |
| HyVLA-0.5 | 腾讯 | 4B MoT 骨干 + 370M 动作专家的双塔 Flow Matching;10K 小时动捕数据;长时程双臂任务成功率 94%–99% |
| G0.5 | 星海图 | 视觉/语言/动作离散化为 Token,GPT 式自回归逐个输出;Max 版 8 月底全面开源 |
| Thinker-VLA | 优必选 | 小参数高性能全开源,10B 以下具身大脑基准 9 项第一,最大基座达 100B |
| LingBot-VLA 2.0 | 蚂蚁灵波 | 预训练融入 6 万小时真实物理数据,覆盖 17 个品牌 20 种机器人构型 |
| NeuroVLA | 智平方 | 「皮层—小脑—脊髓」三层类脑架构;称可抑制 75% 以上动作抖动,碰撞后任务恢复率 54.8% |
| UnifoLM-VLA-0 | 宇树 | 2026 年 1 月开源,LIBERO 基准 98.7 分 |
所有路线绕不开的还是数据
一位行业人士给的量级对比很说明问题:今天的 VLA 模型大部分在 70 亿参数规模上下,离早期语言模型的千亿级差得远。很多人训练今天的 VLA,几十个 GPU 甚至几张卡就够。
语言模型有整个互联网当免费粮仓,所以能长到千亿参数。机器人模型的数据得靠人一遍遍抓杯子抓出来,一小时遥操作可能只产出几百条有效样本。粮仓太小,模型就长不大。这也是为什么「仿真合成数据」会成为一个独立赛道——用假粮先把模型喂大,再用真粮微调。
本能驱动 / 触觉为主——数据需求小、冷启动快、端侧算力要求低,适合固定工位的柔性装配、分拣、接触式精细操作(日化、消费电子、生物医药产线)。
类脑 VLA 融合——需要海量图文配对数据和多样物理交互样本,适合多任务切换、开放环境、长序列复杂作业(半导体面板转运、整车多工序、新零售交互服务)。
换句话说:产线上的固定工位,和商场里的交互服务,本来就不该用同一套大脑。