《深入理解 AI Infra:量化分析与系统设计》开源书稿(ai-infra-book)
2026/8/22大约 4 分钟
《深入理解 AI Infra:量化分析与系统设计》开源书稿(ai-infra-book)
📅 2026-08-22(仓库创建)| 🏷️ 值得研究的仓库 | ⭐ 2,344(30 天慢热发现)
🔗 原文:https://github.com/bojieli/ai-infra-book
是什么
李博杰撰写的《深入理解 AI Infra:量化分析与系统设计》开源书稿:从硬件约束和模型架构出发,量化推导 LLM 推理与训练系统的设计,附全书正文、PDF、配套计算工具与实验代码。上线约三周积累 2,344 星,是本期唯一的「慢热发现」。
🔍 小白解读
先说几个词
- AI Infra(AI 基础设施):让大模型能被高效训练和使用的底层系统,包括 GPU 集群、推理服务、资源调度等——相当于 AI 时代的「电厂和电网」。
- 量化分析:不靠拍脑袋,用算术算清楚——一层注意力要多少显存、一个 token 要多少计算,数字算明白再做设计。
- 推理(Inference):模型训练完之后拿来回答问题的过程,是你每次用 ChatGPT 时发生的事,也是线上成本的大头。
- 吞吐与时延:吞吐是每秒能处理多少请求(电站总功率),时延是你等第一个字出现的秒数(水龙头出热水的速度)。
- KV Cache:推理时缓存已算内容的机制,省算力但吃显存,是推理系统设计绕不开的东西。
这篇到底在说什么
市面上讲大模型系统的内容大多停在「是什么」,这本书的特点是「算得清」:从 GPU 显存带宽、算力上限这些硬件硬约束出发,一步步推导推理系统该怎么批处理、KV Cache 怎么放、训练系统该怎么切分并行,每个设计决策都有数字支撑。书稿完整开源,还配了计算工具和实验,读者可以自己动手验证。作者李博杰长期从事系统方向研究并以深度技术博客为社区所知,这本书是他把 AI Infra 知识体系化的成果。三周 2,300+ 星的增速,反映的正是「推理成本决定 AI 业务生死」背景下,工程师对系统知识的饥渴。
这跟普通人有什么关系
AI 应用的价格、响应速度、能不能用得起,都由这些底层系统决定。看懂这本书的逻辑,就能理解为什么有的 AI 产品便宜量大、有的贵得离谱,也能判断公司该买卡自建还是用云 API。
为什么值得架构师关注
- 选型与容量规划直接可用:书中量化方法可用于估算「我们的业务需要什么规模的集群、单 token 成本是多少」,替代拍脑袋式容量规划。
- 自建推理 vs 采购 API 的成本模型:配套计算工具可以把 TCO 算清楚,是「自托管 vs API」争论的定量依据(与本期另一篇 Ollama 迁移实录互为印证)。
- 中文原创、体系完整、可本地做实验,适合作为团队 AI Infra 内训教材,比拼凑外文资料效率高得多。
- 慢热发现的信号意义:不靠热点事件、靠内容质量在 30 天窗口持续涨星,内容生命力大概率长于一般趋势仓库。
核心内容
- 从硬件约束与模型架构出发,量化推导 LLM 推理与训练系统的设计决策。
- 开源内容包括:全书正文、PDF、配套计算工具与实验。
- 仓库 2026-08-22 创建,约三周 2,344 星,配套代码以 Python 为主。
- 定位为系统设计教材而非 API 教程,填补「会调 API」到「懂系统设计」之间的空白。
行动建议
平台/infra 团队建议按章组织共读,优先精读推理系统章节,并用配套工具核算当前业务的单 token 成本;正在做 GPU 采购或模型服务选型的团队,把书中量化模型当作评审依据。仅调用托管 API、不关心成本的团队可以延后,列入团队书架长期参考。