跳至主要內容
Corey 知识库
首页
AI
AI 专栏
每日 AI 简报
Web3 区块链
Java
Java
并发编程
源码剖析
后端 · 架构
.NET
微服务
分布式
软件架构
亿级规模系统
性能调优
数据 · 中间件
数据库
中间件
大数据
运维 · 环境
云原生
Linux
Windows
前端 · 小程序
前端
微信小程序
面试题
更多
工具
英语
笔记
5 Inference Infra
Corey
小于 1 分钟
目录
推理两阶段:prefill 算得快,decode 取得慢
KV cache 账本:显存为什么是瓶颈
PagedAttention 与 Continuous Batching:vLLM 的两板斧
前缀复用:SGLang RadixAttention 与缓存命中
长上下文与 PD 分离:百万 token 的工程
量化:拿精度换显存和吞吐
投机解码与 MoE:一眼对照
异构算力调度:从 HAMi 到 HAMi-DRA
RL Infra 概念级:从 RLHF 到 Diffusion RL
上一页
阶段 4 · Harness 工程
下一页
阶段 6 · 前沿扫描