量化:拿精度换显存和吞吐
2026/8/23大约 2 分钟
AICon 2026 学习系列 · 阶段 5 · 推理与 AI Infra · 第 32/43 篇 · 🚧 占位待学
上一篇:《长上下文与 PD 分离:百万 token 的工程》
下一篇:《投机解码与 MoE:一眼对照》
学习大纲:《AICon 2026 学习总纲》
状态:待学习。 本文为占位文档:知识点清单、实验与验收标准已就绪,正文待按「先学习、先实验、再撰写」补全。
对应总纲单元:阶段 5 · 单元 5.6
一、本文要解决的问题
同一个模型,INT4 版显存占四分之一、速度快一倍,答案略傻——值不值?量化是部署侧最立竿见影的杠杆,也是端侧模型的生死线。
二、知识点清单
- 量化的对象:权重(W)与激活(A),W8A8 / W4A16 各自含义
- 主流方法谱系:RTN / GPTQ / AWQ 的思路差异(校准数据怎么用)
- 三个收益:显存 ↓、吞吐 ↑(访存减压)、可部署档位 ↑
- 代价:质量损失与「困惑度 ≠ 下游任务表现」的坑
- 端侧的极端档位:手机上跑模型的量化组合
三、动手实验(学习时必须真跑)
- 同一模型跑原版与量化版:用阶段 2 的评测集测质量差,压测吞吐差
- 找到「再低一档就明显变傻」的临界点
四、验收标准(全部通过才进入下一篇)
五、写作提示(补正文时遵守)
- 开篇问题驱动;结构走「是什么 → 为什么 → 怎么做 → 背景知识」
- 所有代码、命令、输出必须先在本机跑通再写入,不得杜撰
- 版本口径以总纲环境清单为准(Python 3.12 / Ollama / vLLM 与 SGLang 最新版 / Spring AI 1.x)
- 涉及版本敏感结论时标注出处与时间
本篇完成后,把文首导航块的「🚧 占位待学」去掉,并在总纲处打卡。