训练三段论:pretrain、SFT 与 RL 各产出什么
2026/8/23大约 2 分钟
AICon 2026 学习系列 · 阶段 0 · 大模型地基 · 第 3/43 篇 · 🚧 占位待学
上一篇:《上下文窗口与 KV cache:模型的记忆账本》
下一篇:《本地跑通一个模型:参数量、量化与体验》
学习大纲:《AICon 2026 学习总纲》
状态:待学习。 本文为占位文档:知识点清单、实验与验收标准已就绪,正文待按「先学习、先实验、再撰写」补全。
对应总纲单元:阶段 0 · 单元 0.3
一、本文要解决的问题
为什么同一个模型,有的版本听话、有的版本会聊天、有的版本会推理?大模型的能力不是一次训练出来的,是三段接力:预训练给知识、SFT 给指令遵循、RL 给对齐与推理。分不清这三段,就听不懂 AICon 里一切关于「RL」「对齐」「推理能力」的讨论。
二、知识点清单
- pretrain:海量语料下一词预测,产出世界知识(最贵的一段)
- SFT(监督微调):指令-回答对,教会「听指令办事」
- RLHF / RLVR:奖励信号下的强化学习,对齐人类偏好、激发推理能力
- 各段的数据形态、算力量级与产出能力对照表
- 基座模型 / chat 模型 / 推理模型的关系(API 里的名字背后是哪一段)
三、动手实验(学习时必须真跑)
- 读一份 Qwen 技术报告,只读训练章节的结构与结论段,给三段各记一句「它给了模型什么」
- 在模型卡里找出 base / instruct / thinking 变体,同题对比行为差异
四、验收标准(全部通过才进入下一篇)
五、写作提示(补正文时遵守)
- 开篇问题驱动;结构走「是什么 → 为什么 → 怎么做 → 背景知识」
- 所有代码、命令、输出必须先在本机跑通再写入,不得杜撰
- 版本口径以总纲环境清单为准(Python 3.12 / Ollama / vLLM 与 SGLang 最新版 / Spring AI 1.x)
- 涉及版本敏感结论时标注出处与时间
本篇完成后,把文首导航块的「🚧 占位待学」去掉,并在总纲处打卡。