infinigence/pdd

GitHub: infinigence/pdd

PDD 是一种跨数据中心 Prefill-Decode 分离的 LLM 推理架构,通过三层分离设计与延迟掩盖机制,在低成本广域网互联的异构集群上实现高性价比且低延迟的大模型推理。

Stars: 19 | Forks: 0

# PDD:跨数据中心 Prefill-Decode 分离架构 **PDD:通过跨数据中心 Prefill-Decode 分离架构,释放经济且灵活的异构 LLM 推理能力** [Infinigence-AI](https://www.infini-ai.com/)  |  [📄 技术报告](./tech_report/PDD-tech-report-release-v1.pdf) ## 新闻 - **[2026-07]** PDD 技术报告现已公开发布。本项目的后续进展及公开资料将在此仓库中更新。敬请关注! ## 概述 通过低成本、广域以太网将地理上分散的集群互联,是构建专用数据中心内异构集群进行 LLM 推理的一种可扩展且高性价比的替代方案。然而,这种分离架构会在集群之间产生大量的 KV cache 通信,导致显著的 Time-to-First-Token (TTFT) 延迟——这对于以长上下文、高 prefix cache 命中率和短输出长度为特征的 **agentic workload**(智能体工作负载)尤为不利。 **PDD** 是一种基于 Prefill-Decode (PD) 分离架构构建的三层分离架构,包括: - **Prefill (P) 实例** —— 在主数据中心内计算密集型硬件上处理计算密集型的 prefill 阶段。 - **RelayDecode (RLD) 实例** —— 通过高速 RDMA 与 P 实例部署在同一数据中心内。它会在 prefill 后的几十毫秒内接收到 KV cache,并 *急切地(eagerly)* 开始解码,从而掩盖慢得多的跨数据中心 KV 传输。 - **MainDecode (MD) 实例** —— 部署在地理位置较远的数据中心,通过低成本的广域以太网(通常 < 100 Gbps)连接。它通过 TCP 接收 KV cache,从 RLD 无缝接管解码工作,并完成绝大部分的 token 生成。

PDD three-tier cross-datacenter architecture

## 核心机制 - **解码端 Radix Cache (DRC)**。在解码实例上缓存历史 KV cache,在 90% 的平均 prefix 命中率下,可将所需的跨数据中心带宽减少高达 10 倍,从而缓解广域带宽瓶颈。 - **Extend-Decode 切换**。RLD 不再向 MD 传输庞大的增量 KV cache,而是仅发送轻量级的、驻留在 CPU 的 Token ID;MD 在生成下一个 token 的同时在本地重新计算增量 KV cache。该机制支持两种模式,并可根据 RLD 负载动态交替: - *Catch-Up 切换* —— MD 通过逐步的 Extend-Decode 逐渐追上 RLD 的进度;对用户完全透明,且 OTPS 无波动。 - *One-Shot 切换* —— RLD 一次性传输所有急切生成的 token,并立即释放资源,以短暂的 OTPS 下降为代价,最大程度地减少 RLD 占用时间。 - **多阶段 Pipeline 编排**。请求根据缓存命中率进行路由:绝大多数(> 70%)高命中率请求直接通过 **P-MD** pipeline 处理,而低命中率的异常请求则通过 **P-RLD-MD** 处理以实现延迟掩盖。这限制了 RLD 的占用时间,并使 MD 端的 DRC 命中率与 P 端的 prefix cache 保持一致。 - **细粒度异构部署**。由于 RLD 仅处理低命中率请求中一小部分初始 token,提供商只需在计算密集型数据中心内部署极少量的内存访问高效型芯片,将大部分内存密集型的解码工作卸载到远程 MD 集群——从而最大程度地减少异构硬件成本,并降低工作负载波动带来的资源浪费。

Extend-Decode Handoff: One-Shot and Catch-Up modes

## 关键结果 基于 DeepSeek-V4-pro 及真实世界的 agentic workload 轨迹(平均 64K 上下文,90% 平均 prefix 命中率且分布极度倾斜),在由 2×10 Gbps 广域以太网互联的 43×8 H100 GPU(P + RLD)和 32×8 H200 GPU(MD)测试床上进行了评估: | 结果 | 详情 | | --- | --- | | **P90 TTFT 降低 46%** | 相比于简单的跨数据中心 PD 基准 (CDC-PD):P90 TTFT 从 18.3s 降至 9.8s | | **稳定的切换开销** | 本地重计算切换将最大延迟限制在 321.4ms(标准差 4.8ms),而简单的以太网 KV 传输峰值高达 512.6ms(标准差 96.3ms),且额外增加 24.5ms 的 H2D/D2H 开销;每 100 个 token 切换的有效载荷从 4,649KB 缩减至 1.5KB | | **极低的 RLD 成本** | RLD 仅生成总输出 token 的 6.2%(MD/RLD 负载比 ≈ 15.2×) | | **效益成本比提升 37.5%** | 相比于数据中心内同构 PD 基准 (IDC-PD),PDD 的 H100/H200 跨数据中心映射在单位成本下实现了高达 37.5% 的 SLA 合规吞吐量提升,且在总成本降低 3.5%–7.1% 的情况下 RPS 提升了 27.8% | PDD 与 PrfaaS (Prefill-as-a-Service) 等以调度为中心的跨数据中心设计是正交且互补的:PrfaaS 通过请求调度来优化 SLA 公平性,而 PDD 通过延迟掩盖优化端到端 SLO——这两者可以自然地结合在一起。 ## 仓库内容 | 路径 | 描述 | | --- | --- | | `/tech_report/PDD-tech-report.pdf` | PDD 技术报告 | | `/tech_report/assets/` | 本 README 中使用的图表 | 本仓库目前托管技术报告。项目的后续进展及相关公开资料将在此处更新。 ## 引用 如果您在研究或生产系统中发现 PDD 有用,请引用: ``` @techreport{wang2026pdd, title = {PDD: Unleashing Economical and Flexible Heterogeneous LLM Inference via Cross-Datacenter Prefill-Decode Disaggregation}, author = {Wang, Yida and Li, Xiuhong and Ma, Jianping and Sun, Gan and Xu, Yunshen and Han, Buhe and Ng, Jingxu and Luo, Yuhao and Hong, Ke and Dai, Guohao and Li, Boxun and Wang, Yu}, institution = {Infinigence-AI}, year = {2026} } ``` ## 作者 Yida Wang¹, Xiuhong Li¹, Jianping Ma¹, Gan Sun¹, Yunshen Xu¹, Buhe Han¹, Jingxu Ng¹˒⁴, Yuhao Luo¹˒⁴, Ke Hong¹˒², Guohao Dai¹˒³\*, Boxun Li¹\*, Yu Wang²\* ¹ Infinigence-AI   ² 清华大学   ³ 上海交通大学   ⁴ 北京大学   (\* 通讯作者) ## 致谢 PDD 的跨数据中心传输栈构建于 [Mooncake](https://github.com/kvcache-ai/Mooncake) (KVCache.AI) 的 TCP 传输引擎之上。我们还要感谢开源 LLM 服务社区,包括 [SGLang](https://github.com/sgl-project/sglang)),为这项工作奠定了坚实的基础。 ## 联系方式 如有问题或合作意向,请在此仓库中提 issue,或联系 Boxun Li (liboxun@infini-ai.com)。
标签:DLL 劫持, KV缓存, LLM推理, 分布式架构, 大语言模型, 异构计算, 系统优化, 跨数据中心