infinigence/pdd
GitHub: infinigence/pdd
PDD 是一种跨数据中心 Prefill-Decode 分离的 LLM 推理架构,通过三层分离设计与延迟掩盖机制,在低成本广域网互联的异构集群上实现高性价比且低延迟的大模型推理。
Stars: 19 | Forks: 0
# PDD:跨数据中心 Prefill-Decode 分离架构
**PDD:通过跨数据中心 Prefill-Decode 分离架构,释放经济且灵活的异构 LLM 推理能力**
[Infinigence-AI](https://www.infini-ai.com/) | [📄 技术报告](./tech_report/PDD-tech-report-release-v1.pdf)
## 新闻
- **[2026-07]** PDD 技术报告现已公开发布。本项目的后续进展及公开资料将在此仓库中更新。敬请关注!
## 概述
通过低成本、广域以太网将地理上分散的集群互联,是构建专用数据中心内异构集群进行 LLM 推理的一种可扩展且高性价比的替代方案。然而,这种分离架构会在集群之间产生大量的 KV cache 通信,导致显著的 Time-to-First-Token (TTFT) 延迟——这对于以长上下文、高 prefix cache 命中率和短输出长度为特征的 **agentic workload**(智能体工作负载)尤为不利。
**PDD** 是一种基于 Prefill-Decode (PD) 分离架构构建的三层分离架构,包括:
- **Prefill (P) 实例** —— 在主数据中心内计算密集型硬件上处理计算密集型的 prefill 阶段。
- **RelayDecode (RLD) 实例** —— 通过高速 RDMA 与 P 实例部署在同一数据中心内。它会在 prefill 后的几十毫秒内接收到 KV cache,并 *急切地(eagerly)* 开始解码,从而掩盖慢得多的跨数据中心 KV 传输。
- **MainDecode (MD) 实例** —— 部署在地理位置较远的数据中心,通过低成本的广域以太网(通常 < 100 Gbps)连接。它通过 TCP 接收 KV cache,从 RLD 无缝接管解码工作,并完成绝大部分的 token 生成。
标签:DLL 劫持, KV缓存, LLM推理, 分布式架构, 大语言模型, 异构计算, 系统优化, 跨数据中心