ai-dynamo/dynamo
GitHub: ai-dynamo/dynamo
NVIDIA推出的数据中心级分布式LLM推理服务框架,解决大模型在多节点多GPU环境下的编排调度与吞吐优化问题。
Stars: 7629 | Forks: 1388
# Dynamo
**开源的数据中心级推理技术栈。** Dynamo 是位于推理引擎之上的编排层——它不会取代 SGLang、TensorRT-LLM 或 vLLM,而是将它们转化为一个协调的多节点推理系统。分离式服务(Disaggregated serving)、智能路由、多级 KV 缓存和自动扩缩容协同工作,旨在最大化吞吐量并最小化 LLM、推理、多模态和视频生成工作负载的延迟。
使用 Rust 构建以保障性能,使用 Python 实现可扩展性。
## 何时使用 Dynamo
- 您正在**多个 GPU 或节点**上提供 LLM 服务,并需要协调它们
- 您希望使用 **KV 感知路由**来避免冗余的 prefill 计算
- 您需要**独立扩缩容 prefill 和 decode**(分离式服务)
- 您希望获得**自动扩缩容**能力,在最低总拥有成本(TCO)下满足延迟 SLA
- 您在启动新副本时需要**快速冷启动**
如果您只在单个 GPU 上运行单个模型,那么仅使用推理引擎可能就足够了。
**功能支持一览:**
| | [SGLang](https://docs.nvidia.com/dynamo/backends/sg-lang) | [TensorRT-LLM](https://docs.nvidia.com/dynamo/backends/tensor-rt-llm) | [vLLM](https://docs.nvidia.com/dynamo/backends/v-llm) |
|---|:----:|:----------:|:--:|
| [**分离式服务**](https://docs.nvidia.com/dynamo/design-docs/disaggregated-serving) | ✅ | ✅ | ✅ |
| [**KV 感知路由**](https://docs.nvidia.com/dynamo/components/router) | ✅ | ✅ | ✅ |
| [**基于 SLA 的规划器**](https://docs.nvidia.com/dynamo/components/planner/planner-guide) | ✅ | ✅ | ✅ |
| [**KVBM**](https://docs.nvidia.com/dynamo/components/kvbm) | 🚧 | ✅ | ✅ |
| [**多模态**](https://docs.nvidia.com/dynamo/user-guides/multimodal) | ✅ | ✅ | ✅ |
| [**工具调用**](docs/tool-calling/README.md) | ✅ | ✅ | ✅ |
## 主要成果
| 成果 | 详情 |
|--------|---------|
| 每块 GPU 吞吐量提升 **7x** | 在 GB200 NVL72 上使用 Dynamo 运行 DeepSeek R1,对比在单块 B200 上未使用 ([InferenceX](https://inferencex.semianalysis.com/)) |
| 模型启动速度提升 **7x** | 使用 ModelExpress 进行权重流式传输(在 H200 上运行 DeepSeek-V3) |
| 首字延迟(TTFT)缩短 **2x** | 使用 KV 感知路由,运行 Qwen3-Coder 480B ([Baseten benchmark](https://www.baseten.co/blog/how-baseten-achieved-2x-faster-inference-with-nvidia-dynamo/)) |
| SLA 违规减少 **80%** | 规划器在 TCO 降低 5% 的情况下实现自动扩缩容 ([Alibaba APSARA 2025 @ 2:50:00](https://yunqi.aliyun.com/2025/session?agendaId=6062)) |
| 吞吐量提升 **750x** | 在 GB300 NVL72 上运行 DeepSeek-R1 ([InferenceXv2](https://inferencex.semianalysis.com/)) |
## Dynamo 的作用
大多数推理引擎针对单个 GPU 或单个节点进行优化。Dynamo 是**位于它们之上的编排层**——它将一组 GPU 集群转化为一个协调的推理系统。
)** – 优化部署以满足 SLA 要求
## Frontend OpenAPI 规范
兼容 OpenAI 的 Frontend 在 `/openapi.json` 路径下提供 OpenAPI 3 规范。要在不运行服务器的情况下生成:
```
cargo run -p dynamo-llm --bin generate-frontend-openapi
```
这会将内容写入 `docs/reference/api/openapi.json`。
## 服务发现与消息传递
Dynamo 使用 TCP 进行组件间通信。在 Kubernetes 上,原生资源([CRDs + EndpointSlices](docs/kubernetes/service-discovery.md))处理服务发现。对于大多数部署,外部服务是可选的:
| 部署环境 | etcd | NATS | 备注 |
|------------|------|------|-------|
| **本地开发** | ❌ 不需要 | ❌ 不需要 | 传递 `--discovery-backend file`;vLLM 还需要 `--kv-events-config '{"enable_kv_cache_events": false}'` |
| **Kubernetes** | ❌ 不需要 | ❌ 不需要 | K8s 原生发现;TCP 请求平面 |
对于 Slurm 或其他选择 etcd 或基于 NATS JetStream 模式的分布式部署:
- [etcd](https://etcd.io/) 可以直接通过 `./etcd` 运行。
- [nats](https://nats.io/) 需要启用 JetStream:`nats-server -js`。
快速设置两者:`docker compose -f dev/docker-compose.yml up -d`
## 更多资讯
- [11/20] [Dell 将 PowerScale 与 Dynamo 的 NIXL 集成,TTFT 提速 19 倍](https://www.dell.com/en-us/dt/corporate/newsroom/announcements/detailpage.press-releases~usa~2025~11~dell-technologies-and-nvidia-advance-enterprise-ai-innovation.htm)
- [11/20] [WEKA 与 NVIDIA 合作开发 Dynamo 的 KV 缓存存储](https://siliconangle.com/2025/11/20/nvidia-weka-kv-cache-solution-ai-inferencing-sc25/)
- [11/13] [Dynamo 办公时间播放列表](https://www.youtube.com/playlist?list=PL5B692fm6--tgryKu94h2Zb7jTFM3Go4X)
- [10/16] [Baseten 如何通过 NVIDIA Dynamo 实现推理速度提升 2 倍](https://www.baseten.co/blog/how-baseten-achieved-2x-faster-inference-with-nvidia-dynamo/)
- [12/01] [InfoQ: NVIDIA Dynamo 简化了用于 LLM 推理的 Kubernetes 部署](https://www.infoq.com/news/2025/12/nvidia-dynamo-kubernetes/)
## 参考
- **[支持矩阵](https://docs.nvidia.com/dynamo/resources/support-matrix)** — 硬件、操作系统、CUDA 和后端版本
- **[功能矩阵](https://docs.nvidia.com/dynamo/resources/feature-matrix)** — 详细的 backend 兼容性
- **[发布构件](https://docs.nvidia.com/dynamo/resources/release-artifacts)** — 容器、wheels、Helm charts
- **[服务发现](https://docs.nvidia.com/dynamo/kubernetes-deployment/advanced-platform/service-discovery)** — K8s 原生对比 etcd 对比基于文件的发现
- **[基准测试指南](https://docs.nvidia.com/dynamo/user-guides/benchmarking)** — 使用 AIPerf 比较部署拓扑
较早的资讯
Dynamo 提供全面的基准测试工具: - **[基准测试指南](docs/benchmarks/benchmarking.md)** – 使用 AIPerf 比较部署拓扑 - **[SLA 驱动的部署](标签:人工智能, 分布式系统, 响应大小分析, 大模型推理, 推理服务框架, 数据中心, 用户模式Hook绕过, 通知系统