第一条线:具身智能 vs 传统机器人控制
传统控制是"模型+规划器":先建动力学模型再解最优控制;具身智能是"数据+策略":VLA 直接从视觉与语言映射到动作(a_t = pi(s_t, l))。IEEE TNNLS 2026 首篇 VLA 综述把研究分成三条线:组件级(视觉/语言/动作编码器)、策略级(低频高层规划+高频低层控制)、规划级(长程任务分解)。术语 RT-2 首次提出 VLA 一词。
第二条线:VLA vs 世界模型
VLA 的软肋是不懂物理:它难以捕捉连续动力学、难以验证计划可执行性、难以克服数据稀缺。世界模型作为"未来预测器"补上这三点:同济/电子科大 2026 年 1 月综述给出四范式——世界规划器(在想象里搜计划)、世界动作模型(把预测并入策略)、世界合成器(生成训练数据)、世界模拟器(可交互沙盒)。优必选 Thinker-WM、英伟达 Cosmos 3 都是"世界合成器+模拟器"路线的工业实现。

第三条线:具身智能 vs AGI
两篇 2026 年综述(IEEE TNNLS 与 SSRN《Large Model Empowered Embodied AI》)都把具身智能写成 AGI 的"基石/可行路径":理由是可验证性——文本智能可以幻觉,物理智能会被重力与摩擦当场证伪。反方向上,AGI 的推理能力(长程规划、因果、反事实)正是具身智能缺的。于是 2026 年的论文出现"双向奔赴":AGI benchmark 开始加入物理操作项,具身 benchmark 开始加入语言推理项。边界不是消失,而是变成接口。
| 概念 | 核心问题 | 2026 代表工作 |
|---|---|---|
| VLA | 语言+视觉→动作的端到端映射 | RT-2 系、GR00T N1、Helix |
| 世界模型 | 预测连续未来、验证计划 | Thinker-WM、Cosmos 3/Edge |
| AGI | 跨域通用推理 | 物理操作项进入 AGI benchmark |