
第17章 模型部署与推理优化——vLLM/TGI/量化学习目标理解推理优化基础(KV Cache、PagedAttention)用vLLM部署VLM生产服务了解TGI推理框架掌握模型量化方法(GPTQ/AWQ/GGUF)了解端侧部署方案17.1 推理优化基础KV Cache自回归模型生成时,前面Token的Key/Value可以缓存,避免重复计算。生成Token1: 计算K1,V1 → 缓存 生成Token2: 计算K2,V2 + 读取K1,V1 → 缓存K1,V1,K2,V2 生成Token3: 计算K3,V3 + 读取K1,V1,K2,V2 → 缓存所有显存占用:KV Cache = 2 × num_layers × hidden_dim × seq_len × batch_size × dtype_size7B模型,seq_len=4096,batch=32,fp16:2 × 32 × 4096 × 4096 × 32 × 2 = 64GBKV Cache可能比模型本身还大!