多模态架构直觉:模型怎么看图
2026/8/23大约 2 分钟
AICon 2026 学习系列 · 阶段 6 · 前沿扫描 · 第 36/43 篇 · 🚧 占位待学
上一篇:《RL Infra 概念级:从 RLHF 到 Diffusion RL》
下一篇:《具身智能链路:VLA 与世界模型》
学习大纲:《AICon 2026 学习总纲》
状态:待学习。 本文为占位文档:知识点清单、实验与验收标准已就绪,正文待按「先学习、先实验、再撰写」补全。
对应总纲单元:阶段 6 · 单元 6.1
一、本文要解决的问题
模型怎么「看懂」图?主流答案朴素得意外:视觉编码器把图切块变成「视觉 token」,投影后和文字 token 一起喂给 LLM。建立这个直觉,多模态议题的技术部分就通了。
二、知识点清单
- 视觉编码器(ViT 类):图 → patch → 视觉 token 序列
- 投影层 / 连接器:视觉特征对齐到语言空间(线性投影 / Q-Former / 交叉注意力三代思路)
- 原生多模态 vs 拼接多模态:从头多模态训练与后期拼接的差异
- 多模态推理的特殊性:视觉 token 数量暴涨 → KV cache 压力(回扣阶段 5)
- 视频与音频的 token 化思路(一眼级)
三、动手实验(学习时必须真跑)
- 用多模态 API 做一个图片问答小工具(图表理解 / 票据抽取)
- 试一张「考眼力」图(数数 / 空间关系),记录模型的强项与短板
- 读 AICon《OPPO 端侧多模态大模型工程化实践》议题摘要
四、验收标准(全部通过才进入下一篇)
五、写作提示(补正文时遵守)
- 开篇问题驱动;结构走「是什么 → 为什么 → 怎么做 → 背景知识」
- 所有代码、命令、输出必须先在本机跑通再写入,不得杜撰
- 版本口径以总纲环境清单为准(Python 3.12 / Ollama / vLLM 与 SGLang 最新版 / Spring AI 1.x)
- 涉及版本敏感结论时标注出处与时间
本篇完成后,把文首导航块的「🚧 占位待学」去掉,并在总纲处打卡。