容量规划与成本:水位的艺术
2026/8/24大约 3 分钟
亿级规模系统系列 · 阶段 8 · 压测与容量 · 第 46/49 篇 · 🚧 占位待学
上一篇:《可观测体系:指标、告警与容量水位》
下一篇:《架构设计方法论:从需求到图纸》
学习大纲:《QPS 过万与亿级消息系统设计学习总纲》
状态:待学习。 本文为占位文档:知识点清单、实验与验收标准已就绪,正文待按「先学习、先实验、再撰写」补全。
对应总纲单元:阶段 8 · 单元 8.4
一、本文要解决的问题
1000 台机器日常水位 30%,老板问能不能砍一半——这是架构师迟早要回答的问题。容量规划是工程与账本的交界:水位目标怎么定、大促怎么扩、怎么用错峰与混合部署省钱——每一台机器都是成本。
二、知识点清单
- 水位目标区间:日常 30% ~ 50%(留故障余量与峰值余量),为什么不能跑满
- 扩缩容策略:定时扩缩(大促日历)、指标驱动(HPA 按 CPU / QPS,衔接 K8s 总纲)、混合
- 成本优化三板斧:错峰利用(白天在线 / 夜间离线任务混部)、规格调优(大实例省虚拟化损耗)、存储分层(热 SSD 冷 HDD)
- 容量评估报告:假设(业务增长)、方法(压测推算)、结论(机器数 / 成本)、风险(单点 / 极端场景)
- 单位成本思维:每千 QPS 的机器成本、每亿消息的存储成本——跨方案对比的通用尺子
三、动手实验(学习时必须真跑)
- 基于阶段 8.1 的全链路压测结论,给示例系统算出「支撑 5 万 QPS」需要的机器数(含冗余)
- 编制成本表:应用机 / Redis / DB / MQ / 带宽,月度成本估算
- 做一个 HPA 实验(K8s 环境):按 CPU 阈值自动扩容,压测观察扩容节奏与稳定性
四、验收标准(全部通过才进入下一篇)
五、阶段验收(本篇是阶段 8收尾篇)
六、写作提示(补正文时遵守)
- 开篇问题驱动;结构走「是什么 → 为什么 → 怎么做 → 背景知识」
- 所有代码、命令、输出必须先在本机跑通再写入,不得杜撰
- 版本口径以总纲环境清单为准(Spring Boot 3.x / MySQL 8.0 / Redis 8.x / RocketMQ 5.3.x / Kafka 4.3 / ShardingSphere 5.5.3)
- 涉及版本敏感结论时标注出处与时间
本篇完成后,把文首导航块的「🚧 占位待学」去掉,并在总纲处打卡。