AICon 2026 学习总纲:零基础到看得懂顶级 AI 大会的完整教学大纲
AI · 学习路线 · 总纲第 1 篇
本文的目标只有一个:让一个 AI 零基础的工程师,学完后能真正「看得懂」InfoQ AICon 2026 的每一场演讲。先把「看懂」定义清楚,再把大会的全部议题拆成可以逐个吃掉的小单元,后续系列文章按本大纲逐篇展开。
🧪 系列全部实验代码统一收录在 GitHub 仓库 code-corey/ai-lab,目录与各板块文章一一对应,每篇文章讲解代码处均注明来源。
开头:为什么要为「看懂一场大会」专门写一份大纲?
因为 AICon 2026 的议题互相咬合得比任何技术领域都狠。随手翻开深圳站的议程:
- 听《百万上下文下的 DeepSeek V4:SGLang 推理优化实战》——前置是 KV cache 是什么、为什么长上下文会把显存吃爆;
- 听《Harness Engineering:模型之外的智能体工程》——前置是 Agent 的工具调用循环长什么样;
- 听《从 LLM RL 到 Diffusion RL:统一多模态 RL 基础设施实践》——前置是大模型训练为什么要分 pretrain / SFT / RL 三段;
- 听《从 HAMi 到 HAMi-DRA:异构环境的算力资源管理实践》——前置是 K8s 的 GPU 调度为什么难。
没有路线图的学习是这样的:看 Agent 议题 → 听不懂「上下文耗尽」→ 回去补 Transformer → 被注意力公式劝退 → 又跳去看多模态 → 每场演讲都指向三场前置演讲,听哪场都是黑洞,一场都听不完整。
这份大纲要做的事就一件:把 12 个专题织成的知识网,压平成一条单向的线——每个单元只依赖前面的单元,学完一个,就解锁一批议题。这就是西蒙学习法在这个领域的落地方式。
一、AICon 2026 到底在讲什么:12 个专题的知识底图
AICon(全球人工智能开发与应用大会)是 InfoQ 中国主办的 AI 工程大会,面向中高端技术人员,重点关注AI 的落地实践。2026 年共三站:上海站(6 月 26—27 日,已结束)、深圳站(8 月 21—22 日,刚结束)、北京站(预计 12 月,以官网为准)。
议程信息抓取自 AICon 深圳站官网议程页,核验于 2026-08-23。
深圳站共 12 个专题。先把它们和知识线的对应关系摆出来,你就知道这份大纲为什么这么排了:
| # | AICon 2026 深圳站专题 | 它在解决什么问题 | 前置知识线 | 本大纲阶段 |
|---|---|---|---|---|
| 1 | 主题演讲 | AI 技术趋势的前瞻洞察 | 全部 | 全程贯穿 |
| 2 | AI Infra、推理工程与异构计算 | 模型服务为什么慢、为什么贵?GPU 怎么管? | 推理机制、K8s | 阶段 5 |
| 3 | Harness Engineering:模型之外的智能体工程 | 模型能力上限之外,工程怎么把它兑现? | Agent 工程 | 阶段 4 |
| 4 | Agent 安全:从风险到可控 | Agent 能行动之后,怎么防它被攻击、被滥用? | Agent 工程 | 阶段 4 |
| 5 | 智能体时代的数据供给与治理 | 给 Agent 喂什么数据才是「可理解、可追溯」的? | RAG、Agent | 阶段 2 |
| 6 | 超级个体与蜂群智能的共生进化 | 多智能体协同怎么组织?组织形态怎么变? | Agent、多智能体 | 阶段 3 |
| 7 | 从感知到行动:多模态大模型与 Agent 落地 | 模型怎么看图看视频并据此行动? | 多模态架构直觉 | 阶段 6 |
| 8 | 迈向机器人 AGI 的关键技术与产业实践 | 具身智能的技术链路(VLA / 世界模型)走到哪了? | 多模态、RL | 阶段 6 |
| 9 | 端侧智能与 AI 原生终端 | 手机上跑大模型,性能怎么突围?端云怎么协同? | 量化、端云架构 | 阶段 6 |
| 10 | 超级 App 的 AI 原生化 | App 怎么从「功能入口」变成「智能任务入口」? | Agent、端侧 | 阶段 6 |
| 11 | AI 原生新范式:Coding Agent 重构软件研发全流程 | AI 怎么吃掉软件研发全流程?规模化后卡在哪? | Agent、研发工程 | 阶段 6 |
| 12 | AI Agent 高价值商业场景实战 | 金融、电商、工业里 Agent 怎么赚钱? | 前面全部 | 阶段 6 |
看清楚这张表,两个结论自然浮出来:
- 应用工程(3~6 阶段)是主干,Infra(阶段 5)是深水区,前沿(阶段 6)只需概念级。12 个专题里 8 个挂在应用工程和它的外延上。
- 这条线和后端工程师的已有技能高度重合。Harness Engineering 讲的可靠性、可观测、安全,就是你熟悉的那套分布式系统课;HAMi-DRA 讲的 GPU 调度,就是 K8s 的资源分配问题。你不是从零开始,你是带着一半地图进场的。
二、学成什么样,才算「看得懂」?
先立靶子。「看得懂」不是「能背出每个名词」,它有五档验收:
| # | 能力 | 具体表现 |
|---|---|---|
| 1 | 听得懂问题 | 每场演讲开场三分钟,能说出「这场要解决什么问题、为什么现在这个问题重要」 |
| 2 | 跟得上机制 | 讲到关键技术(KV cache、RadixAttention、MCP、语义层)时,脑子里有画面,不需要停下来查词 |
| 3 | 辨得出取舍 | 听完能说出方案的代价——它牺牲了什么换来了什么(比如量化牺牲精度换吞吐) |
| 4 | 复述得出 | 能给没参会的同事把这场演讲讲明白,十分钟讲清主线 |
| 5 | 连得上业务 | 能判断这场的内容和自己手头的系统有没有关系、能抄什么作业 |
注意「看得懂」的定义里没有:推导注意力公式、手写 CUDA kernel、从零训练模型、读懂论文里的数学证明。AICon 是工程落地大会,不是学术会——细节查文档就行,机制直觉 + 工程取舍判断力才是「看得懂」的分水岭。
三、西蒙学习法在本领域的四个落法
西蒙学习法的核心:把领域拆碎成小单元,连续地、单点聚焦地逐个吃掉,每个单元立刻获得反馈。对应到本大纲:
- 拆碎:每个知识单元控制在 0.5 ~ 2 天内可完成。绝不出现「学大模型推理」这种大块头,只有「手算一次 7B 模型 32k 上下文的 KV cache 显存」这种小块。
- 单点聚焦:一次只学一个单元。学 RAG 的时候不要顺手去翻 vLLM——忍住,它排在阶段 5,到时候再看。
- 及时反馈:每个单元都配动手实验和吃透的标准。实验跑不通 = 没学会,不进入下一单元。
- 连续推进:每天 1.5 ~ 2 小时,每周 5 ~ 6 天,连续推进约 15 周。从 8 月底开始,12 月初学完——正好以「看得懂」的状态迎接 AICon 北京站;深圳站的回放和专题报道,则随时可以拿来当考卷。
学习环境清单(开工前一次备齐)
| 工具 | 版本建议 | 用途 |
|---|---|---|
| Python | 3.12+(配 uv 管环境) | 阶段 1 起的裸调实验 |
| Ollama | 最新版 | 阶段 0 本地跑 qwen3 系列 |
| 商用 API Key | DeepSeek 开放平台 或 阿里云百炼(通义) | 全程主力,按 token 计费,全程预算 100 元以内 |
| Spring AI | 1.x(已有 16 篇系列笔记) | 阶段 1~4 的 Java 侧实现 |
| Node.js | 20+ | MCP server、Playwright 自动化 |
| vLLM | 最新版(Docker 一行起) | 阶段 5 推理实验主力 |
| GPU | 阶段 0~4 不需要;阶段 5 可按小时租云 GPU(2~3 元/小时),或用 CPU 跑量化小模型 | 推理压测 |
| Docker / Kind | 最新版 | 沙箱实验、阶段 5 的 HAMi 实验 |
已有弹药盘点(这是你相对外行的巨大优势)
本板块已有 30+ 篇文章,直接映射进各阶段,能省下近三分之一的时间:
| 阶段 | 已有文章(学到对应单元时回看) |
|---|---|
| 0 地基 | 本地跑通 Ollama + OpenCode、Qwen3.5-27B 深度体验 |
| 1 主干 | ChatClient、Prompt、Memory、结构化输出、Function Call |
| 2 RAG | LangChain RAG、Spring AI RAG 四篇 |
| 3 Agent | Spring AI Alibaba 全七篇、Agent 模式、Docker 沙箱师生对话 |
| 4 Harness | Harness Engineering(译文)、可观测性 |
| 6 前沿 | Playwright + Agent Skills 三篇、2026 Agent 框架选型指南 |
四、知识全景图
八大阶段,总周期约 15 周:
| 阶段 | 主题 | 回答的核心问题 | 周期 |
|---|---|---|---|
| 0 | 地基:大模型的物理直觉 | 大模型到底是什么?为什么会幻觉、会忘事、会算错? | 1.5 周 |
| 1 | 主干:把模型变成程序组件 | 怎么让模型的输出可控、可解析、可拼进工程? | 1.5 周 |
| 2 | RAG:外挂知识与数据治理 | 怎么给模型喂私有知识?智能体时代的数据长什么样? | 1.5 周 |
| 3 | Agent:从回答问题到执行任务 | 怎么让模型调工具、做规划、多智能体协同? | 2 周 |
| 4 | Harness:可靠、可观测、安全 | 怎么让 Agent 敢上生产? | 2 周 |
| 5 | 推理与 AI Infra:深水区 | 模型服务为什么慢、为什么贵?GPU 怎么管? | 3 周 |
| 6 | 前沿扫描:听得懂即可 | 多模态、具身、端侧、Coding Agent 各到哪了? | 2 周 |
| 7 | 毕业:模拟参会 | 一场大会的信息量,你能吸收多少? | 1 周 |
顺序设计的三个关键决定,先说透,免得学到一半怀疑路线:
- 先用再懂,Transformer 只到直觉级。阶段 0 第一件事就是把模型跑起来、把 API 调通,用体感兜住概念;注意力机制只讲「每个 token 回看所有前文、按相关性加权」这一句人话。被 AI 劝退的人,九成死在第一天就去啃数学公式——AICon 是工程大会,听懂它需要的是工程直觉,不是推导能力。
- 应用先于 Infra。token、上下文、工具调用这些词,是《vLLM 推理优化》这类议题的词汇表;词汇表没齐就进 Infra,每个优化手段都挂不上钩。而且你的 K8s / 分布式功底是阶段 5 的杠杆——放在那一步才兑现,放早了浪费锚点。
- 多模态、具身只到「复述链路」级。这两个专题在 AICon 是产业实践向:考的不是你会不会训 VLA 模型,是你知不知道「VLA = 视觉-语言-动作、世界模型在补什么」。概念级扫描,两天一块,别陷进去。
五、阶段 0:地基——建立对大模型的物理直觉(第 1 ~ 2 周前半)
为什么有这个阶段:AICon 所有议题都建立在「大模型是什么」上。token、上下文、采样、训练范式这四个词不清,每场演讲的前三页 PPT 就能把你甩下车。
| 单元 | 回答的核心问题 | 动手实验 | 吃透的标准 |
|---|---|---|---|
| 0.1 下一个 token 的概率世界 | 模型的输出怎么来的?为什么会幻觉? | 裸调 API:同一问题 temperature=0 连跑 10 次,再调 1.5 跑 10 次,对比输出的稳定性 | 说清「模型 = 下一个 token 的概率采样器」,以及「幻觉是机制的必然副产品,不是 bug」 |
| 0.2 上下文窗口与 KV cache 直觉 | 上下文是什么?为什么长上下文又贵又慢? | 给同一问题垫 0 / 1k / 10k token 的前缀,观察延迟与计费变化;顺手做个「大海捞针」测试 | 说清「模型对前文的记账(KV cache)随长度增长」——这是将来听懂 vLLM / SGLang 议题的钥匙 |
| 0.3 训练三段论 | pretrain / SFT / RL 各产出什么能力? | 读一份 Qwen 技术报告,只读训练章节的结论段 | 给「世界知识、指令遵循、对齐」三个能力各标注来自哪一段 |
| 0.4 本地跑通一个模型 | 参数量、量化、上下文长度怎么影响体验? | Ollama 跑 qwen3 小模型,和商用 API 同题对比 | 说清「本地小模型 vs 云端大模型」差在哪、各自的适用档位 |
| 0.5 模型卡阅读法 | 7B / 72B / MoE / license 怎么读? | 收集三张不同量级的模型卡,逐项对照 | 给定三个业务场景(客服摘要、代码生成、端侧离线),能各选出一个模型并说理由 |
阶段验收:用一段话向完全不懂 AI 的同事解释「大模型为什么会一本正经地胡说八道」,并且不带任何没解释过的术语。
学完能听懂的议题:主题演讲里的趋势判断、《Qwen 系列模型线性注意力优化》的问题背景部分。
六、阶段 1:主干——把模型变成程序里可控的组件(第 2 周后半 ~ 3)
为什么有这个阶段:模型裸输出的是自然语言,工程要的是结构、是闭环。Prompt / 结构化输出 / Function Calling 这三件事,是把「会说话的模型」变成「系统组件」的全部接口——也是 Agent 的原子操作。
| 单元 | 回答的核心问题 | 动手实验 | 吃透的标准 |
|---|---|---|---|
| 1.1 Prompt 三件套 | system / few-shot / CoT 各解决什么问题? | 同一任务用三种写法各跑 20 次,统计成功率 | 能说清每种手法「改变的是模型的哪部分行为」 |
| 1.2 结构化输出 | 怎么让模型稳定输出 JSON? | 用 JSON Schema 约束输出;先故意诱导模型写散文,再看约束如何纠正 | 说清「为什么 Agent 的一切都建立在结构化输出上」 |
| 1.3 裸写 Function Calling 循环 | 模型怎么「调用」你的函数? | 不用任何框架,裸 HTTP 实现 50 行:模型决定调工具 → 程序执行 → 结果回填 → 模型继续 | 画出这个闭环的时序图——它就是一切 Agent 的心跳 |
| 1.4 多轮与记忆 | 无状态的模型怎么「记得」对话? | 手动维护 messages 数组实现多轮对话 | 说清「记忆的本质是把历史拼进 prompt」 |
| 1.5 上下文耗尽与压缩 | 对话太长怎么办? | 实现滑动窗口 + 摘要压缩两种策略,对比效果与信息损失 | 说清「压缩是有损的」——这直接连着后面 Harness 专题的上下文工程 |
阶段验收:脱稿画出「用户提问 → 模型选择工具 → 程序执行 → 结果回填 → 模型总结」的完整时序,并指出每一步的耗时大头在哪。
学完能听懂的议题:几乎所有应用类议题的方法论底座;《Omni-Infer:高吞吐低时延推理优化》里「时延」一词的构成(阶段 5 会展开)。
七、阶段 2:RAG——外挂知识与数据治理(第 4 周 ~ 5 周前半)
为什么有这个阶段:模型的参数知识有截止日期、没有你的私有数据。RAG 是最普遍的大模型落地形态;而 AICon 2026 专门设了「智能体时代的数据供给与治理」专题——它是 RAG 的升级版考题。
| 单元 | 回答的核心问题 | 动手实验 | 吃透的标准 |
|---|---|---|---|
| 2.1 Embedding 与相似度 | 「语义坐标」是什么? | 对几句话手工计算余弦相似度,验证「意思近 = 距离近」 | 说清 embedding 与关键词匹配的本质区别 |
| 2.2 Chunking 策略 | 文档怎么切?切错了会怎样? | 对同一份 PDF 用固定 / 递归 / 按结构三种切法,对比检索命中 | 能说出三种切法各自的翻车场景 |
| 2.3 混合检索与 Rerank | 为什么向量检索之后还要重排? | 搭 BM25 + 向量 + 交叉编码器三段流水线,逐段看指标变化 | 说清「召回求全、重排求准」的分工 |
| 2.4 RAG 评估 | 效果好不好,凭什么说? | 建 20 条评测集,测召回率 / 答案忠实度;故意破坏 chunking 看指标怎么变 | 说清「没有评测集的 RAG 调优是玄学」 |
| 2.5 从 RAG 到 Agentic 数据 | AICon 数据治理专题在讲什么升级? | 精读《可观测对象图语义层》与《DataBuddy:数据语义驱动的 Agent Runtime》两场议题摘要 | 说清演进线:「给模型喂文档 → 给 Agent 喂可理解、可追溯、可治理的语义层」 |
阶段验收:给自己业务领域的一批文档搭一个最小 RAG,评测集指标达到「敢给同事演示」的水平,并写一份「失败案例集」——每个失败案例对应一个可改进的环节。
学完能听懂的议题:《Quick BI 数据分析智能体的可靠工程实践》《DataBuddy》《可观测对象图语义层》全部主线。
八、阶段 3:Agent——从回答问题到执行任务(第 5 周后半 ~ 7)
为什么有这个阶段:AICon 2026 的绝对主角是 Agent(12 个专题里 9 个带 Agent 属性)。从这阶段起,「模型」退居零部件,「循环 + 工具 + 规划」走到台前。
| 单元 | 回答的核心问题 | 动手实验 | 吃透的标准 |
|---|---|---|---|
| 3.1 ReAct 循环 | 思考-行动-观察怎么转起来? | 裸写 50 行 ReAct 循环(阶段 1 的 function calling 循环加「观察→再思考」) | 说清 Agent 和单次问答的本质区别:循环 |
| 3.2 工具设计工程学 | 什么样的工具 Agent 用得好? | 给同一个 Agent 换三套工具描述(模糊 / 清晰 / 带反例),统计任务成功率 | 说清「工具文档是写给模型看的 API 文档」 |
| 3.3 MCP | 为什么需要一个协议? | 用官方 SDK 写一个最小 MCP server,接入客户端调用 | 说清 MCP 与 function calling 的关系:协议化 + 可发现,以及「USB-C」类比 |
| 3.4 规划模式 | 先规划再执行,还是边走边看? | 同一长任务分别用 plan-and-execute 与反馈式实现,对比失败模式 | 说清两种模式各自的翻车场景(规划过时 vs 陷入循环) |
| 3.5 多智能体 | 编排和协同各适合什么? | 用图编排(LangGraph 系)实现一个两角色流水线;再读「蜂群」议题摘要做对照 | 说清「编排 = 确定性拓扑,协同 = 涌现式协作」 |
| 3.6 执行环境与沙箱 | Agent 的手为什么要关进笼子? | Docker 沙箱里跑 Agent 生成的代码,观察资源隔离与失败隔离 | 说清「沙箱不是可选项,是 Agent 执行的默认前提」 |
阶段验收:做一个「给它一个模糊目标,它能拆解、调 3 个以上工具、在沙箱里完成并汇报」的 Agent——规模不限,闭环必须完整。
学完能听懂的议题:《EvoMap 自进化蜂群》《Agentic-Native 增长:Zilliz 用 Agent 支撑超线性扩张》《面向 Agentic 负载的下一代推理引擎》的问题定义部分。
九、阶段 4:Harness——可靠、可观测、安全(第 8 ~ 9 周)
为什么有这个阶段:AICon 2026 专门设了「Harness Engineering」专题,命题人一句话点题:模型决定能力上限,harness 决定能否抵达上限。这个词 2025 年才流行起来,但它讲的东西你太熟了:可靠性、可观测性、安全——就是分布式系统课在 AI 领域的重放。
| 单元 | 回答的核心问题 | 动手实验 | 吃透的标准 |
|---|---|---|---|
| 4.1 上下文工程 | 上下文是稀缺资源,怎么分配? | 给阶段 3 的 Agent 做上下文预算:工具结果截断、记忆分层、检索按需注入 | 说清「上下文里每一段的性价比怎么算」 |
| 4.2 评测(Evals) | 没有测试的 Agent 怎么敢上线? | 给 Agent 建 20 条用例集,之后每次改 prompt / 换模型都跑回归 | 说清「Agent 调优没有评测集 = 后端优化没有压测」 |
| 4.3 可观测性 | 多步执行炸了,怎么定位是哪一步? | 给 Agent 全链路加 trace,把一次多步执行的调用树打出来 | 能指着调用树说出「这次失败在工具选择,不在模型」 |
| 4.4 Agent 安全攻防 | 间接注入是什么?为什么防不住? | 复现一次间接 prompt injection:在工具返回的网页内容里藏一条指令,看 Agent 是否中招;再上最小权限 + 审批门对比 | 说清「间接注入的根因:模型无法区分指令与数据」 |
| 4.5 可控 Agent 体系 | 事前-事中-事后怎么设防? | 按「事前限权、事中审批熔断、事后审计回放」重构阶段 3 的 Agent | 对照腾讯《Loop Engineering》议题自查:三个环节你各有什么 |
阶段验收:把阶段 3 的 Agent 升级到「敢给真实同事用」:有评测集、有 trace、有权限边界、有审批点,并写一份威胁模型清单。
学完能听懂的议题:《Harness Engineering》专题全部四场、《Agent 想用但不敢用?百度智能云企业级 Agent 安全落地》《以 AI 对抗 AI:腾讯 Agent Runtime 安全防线》。
十、阶段 5:推理与 AI Infra——深水区(第 10 ~ 12 周)
为什么有这个阶段:这是 2026 年 AICon 最硬的专题(九成议题名自带引擎名:vLLM、SGLang、Omni-Infer),也是工程师最容易被名词劝退的地方。但拆开看全是系统课:缓存、批处理、调度——你分布式系统的老三样。这一阶段结束时,这个专题对你不再是天书,而是「又一批分布式优化手法」。
| 单元 | 回答的核心问题 | 动手实验 | 吃透的标准 |
|---|---|---|---|
| 5.1 推理两阶段 | prefill 和 decode 各吃资源 | vLLM 起服务,压测并画出 TTFT / TPOT 随并发变化的曲线 | 说清「首 token 慢(算力密集)和后续 token 慢(访存密集)是两种病」 |
| 5.2 KV cache 账本 | 显存为什么是瓶颈? | 手算:7B 模型 + 32k 上下文,KV cache 要多少显存(层数 × KV 头数 × 长度 × 精度,给得出数量级即可) | 说清「上下文越长、并发越高,KV cache 越爆」——长上下文议题的物理根源 |
| 5.3 PagedAttention 与 Continuous Batching | vLLM 靠什么成为事实标准? | 精读 vLLM 论文前两节;高并发下对比静态 batch 与 continuous batching 的吞吐 | 说清「显存碎片」和「批内等待」分别怎么被解决 |
| 5.4 前缀复用 | SGLang 的 RadixAttention 复用什么? | 多轮对话 / 共享 system prompt 场景,观察前缀缓存命中率与延迟收益 | 说清「树结构缓存命中 = 相同前缀只算一次」 |
| 5.5 长上下文与 PD 分离 | 百万上下文怎么做? | 读《百万上下文 DeepSeek V4:SGLang 优化实战》议题详解,画出其架构图(prefill / decode 分离、缓存卸载) | 说清「为什么要把 prefill 和 decode 拆到不同机器」 |
| 5.6 量化 | 精度换吞吐,值不值? | 同一模型跑量化版与原版,对比质量(评测集)与吞吐 | 说清 W8A8 / INT4 / AWQ 各自的适用档位 |
| 5.7 投机解码与 MoE | 一眼对照,各一段话 | — | 各用一句人话说清「小模型打草稿大模型批改」「专家分工 + 路由」 |
| 5.8 异构算力调度 | GPU 怎么池化切分? | Kind 起集群跑 HAMi demo;补 K8s DRA(动态资源分配)背景,再读《HAMi 到 HAMi-DRA》议题详解 | 说清「虚拟切卡解决了什么、DRA 又补了什么」——你的 K8s 功底在这里兑现 |
| 5.9 RL Infra(概念级) | RL 在补模型的什么能力? | 读《从 LLM RL 到 Diffusion RL:统一多模态 RL 基础设施》议题详解,梳理 RLHF → GRPO → Diffusion RL 的演进线 | 只求复述「为什么多模态 RL 需要统一的基础设施」 |
阶段验收:拿租来的云 GPU(或量化小模型 + CPU),压测出自己的一组 TTFT / 吞吐 / 显存数据,写一份《推理优化手段效果清单》——每个手段标注「它优化了哪个瓶颈」。
学完能听懂的议题:「AI Infra、推理工程与异构计算」专题全部七场——这是全大会含金量最高的硬核专题,也是本大纲投入产出比最高的一段。
十一、阶段 6:前沿扫描——听得懂即可(第 13 ~ 14 周)
为什么有这个阶段:12 个专题里有一半是前沿与产业向(多模态、具身、端侧、Coding Agent、商业落地)。这些专题考的是视野,不是实现能力——目标定为「复述得出技术链路和商业逻辑」,每块 2 ~ 3 天,坚决不陷进去。
| 单元 | 回答的核心问题 | 动手实验 | 吃透的标准 |
|---|---|---|---|
| 6.1 多模态架构直觉 | 模型怎么「看懂」图? | 用多模态 API 做一个图片问答小工具;读《OPPO 端侧多模态大模型工程化实践》议题详解 | 说清「视觉编码器 + 投影层 + LLM」的拼接逻辑 |
| 6.2 具身智能链路 | VLA、世界模型在解决什么? | 读《轻量化异构双臂 + VLA / 世界模型》议题详解 | 复述「感知 → 决策 → 动作」链路,以及数据采集为什么是瓶颈 |
| 6.3 端侧智能与超级 App | 端云怎么分工? | 读鸿蒙 AI Native、支付宝 xUI、京东端智能三场议题详解 | 说清「端侧管即时感知与隐私,云端管复杂推理」的分工逻辑,以及 Agentic UI 和传统 UI 的区别 |
| 6.4 Coding Agent 与研发范式 | AI 怎么吃掉研发全流程? | 用 Claude Code 完成一个真实小任务并写复盘:它在哪步神勇、哪步翻车、你补了什么 | 说清 SWE-bench 类评测在测什么;规模化后的「流程与成本双困局」指什么 |
| 6.5 商业与组织 | Agent 怎么变成增长引擎? | 读《Zilliz Agentic-Native 增长》《快手分销增长 Agent》《从超级顾问到 Agent 蜂群》三场议题详解 | 能各用三句话说清「谁的什么问题、用什么解法、换来了什么」 |
阶段验收:把 6.1 ~ 6.5 每块写成一篇千字笔记——能脱稿讲,才算扫描完成。
学完能听懂的议题:第 7 ~ 12 号专题全部主线内容。
十二、阶段 7:毕业——模拟参会(第 15 周)
7.1 三问笔记
从深圳站 12 个专题里挑 10 场议题(官网议程页逐场精读,有回放看回放,没有就看专题报道),每场写一份三问笔记:
- 这场在解决什么问题?为什么是现在?
- 关键技术取舍:它牺牲了什么、换来了什么?
- 和我手头的系统有什么关系?能抄什么作业?
7.2 输出毕业作品
写一篇《AICon 2026 观后感》发布在本板块:选出你认为被高估和被低估的议题各一场,给出理由——能批评,才证明真看懂了。
7.3 资深自检 20 问(节选 10 问)
- 模型为什么会幻觉?为什么 RAG 只是缓解、不是根治?
- Function calling 的「调用」发生在模型侧还是程序侧?
- MCP 解决了什么问题?没有它,多工具接入是什么惨状?
- RAG 召回率上不去,先查 chunking、embedding 还是 rerank?为什么?
- Harness Engineering 的 harness,具体包括哪些东西?
- 为什么说没有评测集的 Agent 调优是玄学?
- 间接 prompt injection 为什么防不住?根因是什么?
- prefill 和 decode 谁吃算力、谁吃带宽?PD 分离因此怎么设计?
- KV cache 为什么吃显存?PagedAttention 省的到底是什么?
- 端侧模型和云端模型,是替代关系还是分工关系?
(答不出哪个,回对应阶段补哪个。)
十三、总时间线
| 周 | 内容 |
|---|---|
| 1 ~ 2 前半 | 阶段 0:大模型地基 |
| 2 后半 ~ 3 | 阶段 1:Prompt / 结构化输出 / Function Calling / 记忆 |
| 4 ~ 5 前半 | 阶段 2:RAG 与数据治理 |
| 5 后半 ~ 7 | 阶段 3:Agent 工程(ReAct / MCP / 规划 / 多智能体 / 沙箱) |
| 8 ~ 9 | 阶段 4:Harness(上下文工程 / 评测 / 可观测 / 安全 / 可控) |
| 10 ~ 12 | 阶段 5:推理与 AI Infra(vLLM / SGLang / 量化 / 异构算力 / RL) |
| 13 ~ 14 | 阶段 6:前沿扫描(多模态 / 具身 / 端侧 / Coding / 商业) |
| 15 | 阶段 7:模拟参会 + 毕业作品 |
每天 1.5 ~ 2 小时。进度可以慢,顺序不要乱:每个阶段的验收没过,不进下一阶段。
十四、参考资料(均已核验为当前版本,核验时间 2026-08-23)
大会一手信息
- AICon 2026 深圳站官网(含全部专题与议题,本文议题均出自议程页)
- AICon 2026 深圳站专题议程
- InfoQ AICon 专题报道(历届演讲图文实录,学完各阶段就近取材)
官方文档
- Ollama 文档(阶段 0 本地模型)
- MCP 规范(阶段 3,Model Context Protocol 已成为事实标准)
- vLLM 文档(阶段 5 主力,PagedAttention 出自其论文)
- SGLang 文档(阶段 5,RadixAttention 前缀复用)
- HAMi 项目(阶段 5 异构算力虚拟化)
书与博客
- Chip Huyen, AI Engineering(O'Reilly, 2025)——应用工程主线的最佳系统读物,读完大纲再读,吸收率完全不同
- Simon Willison's blog——Agent / prompt injection / 工具生态的一手实践记录
- Lilian Weng 的博客——需要补哪块原理,就读她哪篇(挑结论读,别陷进数学)
- 3Blue1Brown《神经网络》系列视频——阶段 0 建立注意力直觉的最快路径
结语:一条线,走到底
这份大纲的本质,是把 12 个专题织成的知识网压平成一条链:
模型直觉 → 程序组件 → 外挂知识 → 自主行动 → 生产可依 → 推理底座 → 前沿视野 → 亲自验证
每个环节只有一个入口——前一个环节。从阶段 0 的第一次 API 调用开始,走完这条线,AICon 2026 的 12 个专题对你就不再是黑话连篇的秀场,而是一张你能指出哪里扎实、哪里取巧的施工图——到那时,「看得懂」只是起点,你会开始看得出门道。
系列占位文档已按本大纲建好:8 个模块共 43 篇,每篇列出「要解决的问题、知识点清单、动手实验、验收标准」,完成一篇就去掉一篇的「占位待学」标记。完整索引见本板块目录(侧边栏按学习顺序排列)。
下一篇,从阶段 0 的第一个实验开始:《下一个 token 的概率世界:模型到底在算什么》。