Prefill Pool和Decode Pool是现代 LLM 大模型推理系统如 DistServe、Splitwise 以及 SGLang/vLLM 的 PD 分离架构中将推理计算的两个关键阶段剥离并独立部署的PD 分离Prefill-Decode Disaggregation资源池。两者的核心差异对比维度Prefill Pool预填池Decode Pool解码池主要任务一次性处理用户 Prompt提示词生成首个 Token 和初始 KV Cache逐字生成后续 TokenAutoregressive Decoding瓶颈类型计算密集型Compute-Bound访存密集型Memory-Bound核心优化目标极低TTFT首字延迟 / Time To First Token低TPOT逐字延迟与高系统总吞吐ThroughputGPU 硬件偏好高 FP16/FP8算力如 H100/H200/TPU高显存带宽与大显存容量用于存庞大的 KV Cache并行策略偏向高Tensor Parallelism (TP)用多卡算力硬砸延迟偏向高Pipeline/Data Parallelism或 Chunked Decode最大化 Batch Size为什么要拆分成两个 Pool在传统的混跑模式Unified Cluster中Prefill 和 Decode 是在同一块 GPU 上交替执行的这会导致严重的资源抢占与干扰干扰与延迟抖动当系统正在逐字吐字Decode时突然进来一个长 PromptPrefill。Prefill 会瞬间吃满 GPU 算力导致 Decode 被卡住用户体验到的打字速度突然“卡顿一下”TPOT 剧烈波动。硬件利用率妥协Prefill 需要高算力Decode 需要高显存带宽混跑无法针对特定阶段做硬件定制与卡数Parallelism Size的最优配置。SLO服务等级协议难以兼顾很难同时做到“首字极快”和“吞吐极大”。工作流程与 KV Cache 传输在 PD 分离架构下一个请求的完整生命周期如下路由调度用户请求到达调度器根据当前负载被分配给Prefill Pool中的某台机器。计算首字Prefill 机器并行计算全部 Prompt算出第 1 个 Token并生成前置所有 Token 的KV Cache。KV Cache 跨节点传输Prefill 机器将生成的 KV Cache 通过高速网络如 RDMA/InfiniBand 或 NVLink传输给Decode Pool中的目标机器。接力生成Decode 机器接收 KV Cache 后接管该请求以自回归的方式逐字生成后续 Token直至生成结束。总结拆分为 Prefill Pool 和 Decode Pool 的本质是“用网络传输 KV Cache 的微小开销换取计算与访存的极致解耦”从而让 CPU/GPU 调度器能够对不同计算特征的阶段实施针对性的硬件选型和并行策略扩缩容。