RL Infra 概念级:从 RLHF 到 Diffusion RL
2026/8/23大约 2 分钟
AICon 2026 学习系列 · 阶段 5 · 推理与 AI Infra · 第 35/43 篇 · 🚧 占位待学
上一篇:《异构算力调度:从 HAMi 到 HAMi-DRA》
下一篇:《多模态架构直觉:模型怎么看图》
学习大纲:《AICon 2026 学习总纲》
状态:待学习。 本文为占位文档:知识点清单、实验与验收标准已就绪,正文待按「先学习、先实验、再撰写」补全。
对应总纲单元:阶段 5 · 单元 5.9
一、本文要解决的问题
AICon 里有整场讲「RL 基础设施」的议题——RL 在给模型补什么能力?为什么多模态 RL 需要统一的基础设施?概念级扫描,能复述演进线即可,不推数学。
二、知识点清单
- RL 三件套直觉:策略(模型)、奖励(评分器)、采样(生成一批试错)
- RLHF → RLVR:从人类偏好打分到可验证奖励(代码跑测试、数学对答案)
- 训练推理模型的循环:采样 → 打分 → 更新;为何吃算力(rollout 本身是推理负载)
- 多模态 RL:视觉生成模型的 RL(Diffusion RL)与文本 RL 的基础设施差异(生成器是扩散模型)
- 统一 RL Infra 在统一什么:采样引擎、奖励服务、训练框架的胶水层
三、动手实验(学习时必须真跑)
- 读 AICon《从 LLM RL 到 Diffusion RL:统一多模态 RL 基础设施实践》议题摘要
- 画出「采样 → 奖励 → 更新」循环图,标注每步吃哪类资源(算力 / 访存)
四、验收标准(全部通过才进入下一篇)
五、阶段验收(本篇是阶段 5收尾篇)
六、写作提示(补正文时遵守)
- 开篇问题驱动;结构走「是什么 → 为什么 → 怎么做 → 背景知识」
- 所有代码、命令、输出必须先在本机跑通再写入,不得杜撰
- 版本口径以总纲环境清单为准(Python 3.12 / Ollama / vLLM 与 SGLang 最新版 / Spring AI 1.x)
- 涉及版本敏感结论时标注出处与时间
本篇完成后,把文首导航块的「🚧 占位待学」去掉,并在总纲处打卡。