具身智能链路:VLA 与世界模型
2026/8/23大约 2 分钟
AICon 2026 学习系列 · 阶段 6 · 前沿扫描 · 第 37/43 篇 · 🚧 占位待学
上一篇:《多模态架构直觉:模型怎么看图》
下一篇:《端侧智能与超级 App:端云协同》
学习大纲:《AICon 2026 学习总纲》
状态:待学习。 本文为占位文档:知识点清单、实验与验收标准已就绪,正文待按「先学习、先实验、再撰写」补全。
对应总纲单元:阶段 6 · 单元 6.2
一、本文要解决的问题
机器人的「大脑」怎么长?VLA(视觉-语言-动作)模型把指令、视觉、动作串成一体,世界模型负责在脑内推演后果。概念级走一遍技术链,AICon 机器人专题就从科幻变成工程。
二、知识点清单
- 具身智能 = 大模型 + 身体:感知 → 决策 → 动作的闭环
- VLA:输入视觉与指令,输出连续动作序列;与「LLM + 工具调用」的同构性
- 世界模型:在脑内模拟环境后果,为规划服务
- 数据瓶颈:真机数据贵 → 遥操作 / 仿真合成 / 视频学习的三条供给线
- 双臂与灵巧手为什么难(自由度与接触丰富性)
三、动手实验(学习时必须真跑)
- 读 AICon《轻量化异构双臂 + VLA/世界模型:家庭服务具身机器人》议题摘要
- 把它的技术链画成一张图:数据从哪来 → 模型怎么训 → 机器人怎么执行
四、验收标准(全部通过才进入下一篇)
五、写作提示(补正文时遵守)
- 开篇问题驱动;结构走「是什么 → 为什么 → 怎么做 → 背景知识」
- 所有代码、命令、输出必须先在本机跑通再写入,不得杜撰
- 版本口径以总纲环境清单为准(Python 3.12 / Ollama / vLLM 与 SGLang 最新版 / Spring AI 1.x)
- 涉及版本敏感结论时标注出处与时间
本篇完成后,把文首导航块的「🚧 占位待学」去掉,并在总纲处打卡。