本地跑通一个模型:参数量、量化与体验
2026/8/23大约 2 分钟
AICon 2026 学习系列 · 阶段 0 · 大模型地基 · 第 4/43 篇 · 🚧 占位待学
上一篇:《训练三段论:pretrain、SFT 与 RL 各产出什么》
下一篇:《模型卡阅读法:7B、MoE 与选型档位》
学习大纲:《AICon 2026 学习总纲》
状态:待学习。 本文为占位文档:知识点清单、实验与验收标准已就绪,正文待按「先学习、先实验、再撰写」补全。
对应总纲单元:阶段 0 · 单元 0.4
一、本文要解决的问题
参数量、量化、上下文长度怎么影响一台笔记本上的体验?本地小模型和云端大模型的差距到底在哪、什么时候够用?亲手跑一遍,模型从「云端的黑盒」变成「磁盘上的文件」。
二、知识点清单
- Ollama 的模型管理:pull / run / Modelfile
- 参数量与显存需求的粗略换算(fp16 下每参数约 2 字节)
- 量化:Q4/Q8 拿精度换显存,质量损失直觉
- 本地 vs 云端:隐私、成本、延迟、能力四个维度的分工
三、动手实验(学习时必须真跑)
- Ollama 跑 qwen3 小模型(如 4b/8b),与商用 API 同题对比 10 个问题
- 同一模型跑两个量化档位,对比质量与速度
四、验收标准(全部通过才进入下一篇)
五、写作提示(补正文时遵守)
- 开篇问题驱动;结构走「是什么 → 为什么 → 怎么做 → 背景知识」
- 所有代码、命令、输出必须先在本机跑通再写入,不得杜撰
- 版本口径以总纲环境清单为准(Python 3.12 / Ollama / vLLM 与 SGLang 最新版 / Spring AI 1.x)
- 涉及版本敏感结论时标注出处与时间
本篇完成后,把文首导航块的「🚧 占位待学」去掉,并在总纲处打卡。