首页  /  机器人种类  /  具身智能

学术边界:正在融化的三条线

VLA × 世界模型 × AGI:2026 年的互相引用网络

第一条线:具身智能 vs 传统机器人控制

传统控制是"模型+规划器":先建动力学模型再解最优控制;具身智能是"数据+策略":VLA 直接从视觉与语言映射到动作(a_t = pi(s_t, l))。IEEE TNNLS 2026 首篇 VLA 综述把研究分成三条线:组件级(视觉/语言/动作编码器)、策略级(低频高层规划+高频低层控制)、规划级(长程任务分解)。术语 RT-2 首次提出 VLA 一词。

第二条线:VLA vs 世界模型

VLA 的软肋是不懂物理:它难以捕捉连续动力学、难以验证计划可执行性、难以克服数据稀缺。世界模型作为"未来预测器"补上这三点:同济/电子科大 2026 年 1 月综述给出四范式——世界规划器(在想象里搜计划)、世界动作模型(把预测并入策略)、世界合成器(生成训练数据)、世界模拟器(可交互沙盒)。优必选 Thinker-WM、英伟达 Cosmos 3 都是"世界合成器+模拟器"路线的工业实现。

世界合成器路线的现实形态:数据工厂批量产出训练轨迹
世界合成器路线的现实形态:数据工厂批量产出训练轨迹

第三条线:具身智能 vs AGI

两篇 2026 年综述(IEEE TNNLS 与 SSRN《Large Model Empowered Embodied AI》)都把具身智能写成 AGI 的"基石/可行路径":理由是可验证性——文本智能可以幻觉,物理智能会被重力与摩擦当场证伪。反方向上,AGI 的推理能力(长程规划、因果、反事实)正是具身智能缺的。于是 2026 年的论文出现"双向奔赴":AGI benchmark 开始加入物理操作项,具身 benchmark 开始加入语言推理项。边界不是消失,而是变成接口。

三概念对照
概念核心问题2026 代表工作
VLA语言+视觉→动作的端到端映射RT-2 系、GR00T N1、Helix
世界模型预测连续未来、验证计划Thinker-WM、Cosmos 3/Edge
AGI跨域通用推理物理操作项进入 AGI benchmark