三层时延账本
端侧(on-robot):<10ms,跑运动控制、平衡、避障——闭环运控等不起一次网络往返;硬件锚点 NVIDIA Jetson Thor(2070 FP4 TFLOPS、40W)。工厂边缘(on-site):10-50ms,跑 fleet 协同、复杂感知、VLA 推理;京东亚洲一号边缘集群协调 500+ 机器人、任务分配延迟 <5ms。云端:50ms+ 可接受,跑训练、fleet 学习、OTA;特斯拉 Dojo(D1 7nm、BF16 362 TFLOPS、规划 100 EFlops)。
| 层 | 时延目标 | 跑什么 | 典型硬件 |
|---|---|---|---|
| 端侧 | <10ms | 运控/平衡/避障 | Jetson Thor、嵌入式 NPU |
| 工厂边缘 | 10-50ms | fleet 协同/VLA 推理 | GPU 边缘服务器 |
| 云端 | 50ms+ | 训练/fleet 学习/OTA | Dojo、公有云 |
双脑模型:大模型下发指令、小模型执行
2026 年生产级 VLA 普遍采用双系统:系统 2(慢思考)LLM 以 1-2 Hz 解读自然语言、拆子目标;系统 1(快行动)轻量视觉运动策略以 30-50 Hz 把相机帧翻译成电机指令。关键洞见是"系统 2 不需要跑在控制频率上"——于是可以激进量化:LiteVLA 用 NF4 量化+llama-cpp 在树莓派 4 上跑通视觉运动控制;商用标准是 INT8/FP16+TensorRT 跑在 Jetson AGX Orin/Thor 上,GR00T N1.7 附带专门 Jetson 部署指南。
端侧小模型(Phi-3.5-mini、Qwen2.5-0.5B 级,<10 亿参数、功耗低至 2W)承担 80% 日常感知;剩下 20% 非标抓取、异常工况上调云端 GPT-4 级模型。宇树消费级机器人即此方案:端侧管导航/语音/简单识别,云端管复杂指令理解与多轮对话。长江证券口径:端侧 VLA 蒸馏至百亿以下实现 1kHz 运控,云端千亿模型辅助高泛化场景——云边长期并行是现实路径。
数据质量:边缘部署的隐藏倍率
反直觉事实:模型越小,训练数据质量越重要。700 亿云端模型能靠蛮力越过噪声标签,量化后的 10 亿边缘模型不能——每个错标抓取点、每次相机-动作时间戳错位都会在边缘复合成性能退化。实测口径:训练前做严格数据预处理的团队,边缘任务成功率比用原始采集数据的团队高 15-25%。这也是智元/优必选重资产数据工厂的真正护城河。
部署问答
工厂断网了,具身机器人还能干活吗?
能,但降级:端侧小模型继续执行已下发的子任务序列与运控;新的自然语言指令与异常升级需等网络恢复。工程上应按"断网可续作 8 小时"设计任务包粒度。