投机解码与 MoE:一眼对照
2026/8/23大约 2 分钟
AICon 2026 学习系列 · 阶段 5 · 推理与 AI Infra · 第 33/43 篇 · 🚧 占位待学
上一篇:《量化:拿精度换显存和吞吐》
下一篇:《异构算力调度:从 HAMi 到 HAMi-DRA》
学习大纲:《AICon 2026 学习总纲》
状态:待学习。 本文为占位文档:知识点清单、实验与验收标准已就绪,正文待按「先学习、先实验、再撰写」补全。
对应总纲单元:阶段 5 · 单元 5.7
一、本文要解决的问题
两个高频黑话,各用一句人话拆掉:投机解码是「小模型打草稿、大模型批改」,MoE 是「专家分工、按需路由」。不深挖,但 AICon 议题里出现时要秒懂。
二、知识点清单
- 投机解码:小模型并行猜 k 个 token,大模型一次验证,接受率决定加速比;为什么验证不损失质量
- MoE:总参数大(知识容量)、激活参数小(算力成本);路由器与负载均衡的难点
- 两者常一起出现的原因:都在「单位算力买更多智能」
- 对照:主流 MoE 模型的参数标注方式(总参数 / 激活参数)
三、动手实验(学习时必须真跑)
- 读 vLLM / SGLang 文档中 speculative decoding 配置节,跑一次开关对比吞吐
- 查一个 MoE 模型卡的总参数与激活参数,手算「激活占比」
四、验收标准(全部通过才进入下一篇)
五、写作提示(补正文时遵守)
- 开篇问题驱动;结构走「是什么 → 为什么 → 怎么做 → 背景知识」
- 所有代码、命令、输出必须先在本机跑通再写入,不得杜撰
- 版本口径以总纲环境清单为准(Python 3.12 / Ollama / vLLM 与 SGLang 最新版 / Spring AI 1.x)
- 涉及版本敏感结论时标注出处与时间
本篇完成后,把文首导航块的「🚧 占位待学」去掉,并在总纲处打卡。