kvcache-ai/ktransformers
GitHub: kvcache-ai/ktransformers
KTransformers 是一个基于 CPU-GPU 异构计算的大语言模型高效推理与微调框架,旨在让超大 MoE 模型在有限显存硬件上也能高效运行。
Stars: 18766 | Forks: 1463
## 🎯 概述
KTransformers 是一个专注于通过 CPU-GPU 异构计算实现大语言模型高效推理和微调的研究项目。该项目现在从 kt-kernel 源码树中对外暴露了两项面向用户的功能:[推理](./kt-kernel/README.md) 和 [SFT](./doc/en/SFT/KTransformers-Fine-Tuning_Quick-Start.md)。
## 🔥 更新
* **2026年6月21日**:MiniMax-M3 Day0 支持!([教程](./doc/en/kt-kernel/MiniMax-M3-Tutorial.md))
* **2026年6月17日**:GLM-5.2 Day0 支持!([教程](./doc/en/kt-kernel/GLM-5.2-Tutorial.md))
* **2026年5月6日**:KTransformers 参与 [GOSIM Paris 2026](https://paris2026.gosim.org/zh/schedule/) — “边缘端 Agentic AI”分会场。我们将介绍 KT 在消费级硬件上的推理性能。
* **2026年5月2日**:DeepSeek-V4-Flash 支持!([教程](./doc/en/DeepSeek-V4-Flash.md))
* **2026年4月30日**:KTransformers v0.6.1 更新了 kt-kernel 推理和 SFT 文档,提供了独立的 [推理](./kt-kernel/README.md) 和 [SFT 快速开始](./doc/en/SFT/KTransformers-Fine-Tuning_Quick-Start.md) 入口。
* **2026年3月26日**:支持仅使用 AVX2 的 CPU 后端进行 KT-Kernel 推理。([教程](./doc/en/kt-kernel/AVX2-Tutorial.md))
* **2026年2月13日**:MiniMax-M2.5 Day0 支持!([教程](./doc/en/MiniMax-M2.5.md))
* **2026年2月12日**:GLM-5 Day0 支持!([教程](./doc/en/kt-kernel/GLM-5-Tutorial.md))
* **2026年1月27日**:Kimi-K2.5 Day0 支持!([教程](./doc/en/Kimi-K2.5.md))([SFT 教程](./doc/en/SFT_Installation_Guide_KimiK2.5.md))
* **2026年1月22日**:支持 [CPU-GPU 专家调度](./doc/en/kt-kernel/experts-sched-Tutorial.md)、[原生 BF16 和 FP8 逐通道精度](./doc/en/kt-kernel/Native-Precision-Tutorial.md) 以及 [AutoDL 统一微调与推理](./doc/zh/【云端低价训推】%20KTransformers%2BAutoDL%2BLlamaFactory:随用随租的低成本超大模型「微调%2B推理」一体化流程.pdf)
* **2025年12月24日**:支持原生 MiniMax-M2.1 推理。([教程](./doc/en/kt-kernel/MiniMax-M2.1-Tutorial.md))
* **2025年12月22日**:支持使用 LLaMA-Factory 进行 RL-DPO 微调。([教程](./doc/en/SFT/DPO_tutorial.md))
* **2025年12月5日**:支持原生 Kimi-K2-Thinking 推理([教程](./doc/en/kt-kernel/Kimi-K2-Thinking-Native.md))
* **2025年11月6日**:支持 Kimi-K2-Thinking 推理([教程](./doc/en/Kimi-K2-Thinking.md))和微调([教程](./doc/en/SFT_Installation_Guide_KimiK2.md))
* **2025年11月4日**:KTransformers 微调 × LLaMA-Factory 集成。([教程](./doc/en/SFT/KTransformers-Fine-Tuning_User-Guide.md))
* **2025年10月27日**:支持 Ascend NPU。([教程](./doc/zh/DeepseekR1_V3_tutorial_zh_for_Ascend_NPU.md))
* **2025年10月10日**:集成至 SGLang。([路线图](https://github.com/sgl-project/sglang/issues/11425),[博客](https://lmsys.org/blog/2025-10-22-KTransformers/))
* **2025年9月11日**:支持 Qwen3-Next。([教程](./doc/en/Qwen3-Next.md))
* **2025年9月5日**:支持 Kimi-K2-0905。([教程](./doc/en/Kimi-K2.md))
* **2025年7月26日**:支持 SmallThinker 和 GLM4-MoE。([教程](./doc/en/SmallThinker_and_Glm4moe.md))
* **2025年7月11日**:支持 Kimi-K2。([教程](./doc/en/Kimi-K2.md))
* **2025年6月30日**:支持 3 层(GPU-CPU-磁盘)[prefix cache](./doc/en/prefix_cache.md) 复用。
* **2025年5月14日**:支持 Intel Arc GPU([教程](./doc/en/xpu.md))。
* **2025年4月29日**:支持 AMX-Int8、AMX-BF16 和 Qwen3MoE([教程](./doc/en/AMX.md))
* **2025年4月9日**:实验性支持 LLaMA 4 模型([教程](./doc/en/llama4.md))。
* **2025年4月2日**:支持多并发。([教程](./doc/en/balance-serve.md))。
* **2025年3月15日**:支持在 AMD GPU 上使用 ROCm([教程](./doc/en/ROCm.md))。
* **2025年3月5日**:支持 unsloth 1.58/2.51 bits 权重和 [IQ1_S/FP8 混合](./doc/en/fp8_kernel.md) 权重。支持在 24GB VRAM 下为 DeepSeek-V3 和 R1 提供 139K [更长上下文](./doc/en/DeepseekR1_V3_tutorial.md#v022--v023-longer-context--fp8-kernel)。
* **2025年2月25日**:支持用于 DeepSeek-V3 和 R1 的 [FP8 GPU kernel](./doc/en/fp8_kernel.md);[更长上下文](./doc/en/DeepseekR1_V3_tutorial.md#v022-longer-context)。
* **2025年2月15日**:更长上下文(24GB VRAM 下从 4K 提升至 8K)及略微提升的速度(+15%,最高达 16 Tokens/s),更新了[文档](./doc/en/DeepseekR1_V3_tutorial.md) 和[在线书籍](https://kvcache-ai.github.io/ktransformers/)。
* **2025年2月10日**:支持在单张(24GB VRAM)/多张 GPU 和 382G DRAM 上运行 Deepseek-R1 和 V3,速度提升达 3~28 倍。详细展示和复现教程请见[这里](./doc/en/DeepseekR1_V3_tutorial.md)。
* **2024年8月28日**:将 DeepseekV2 所需的 VRAM 从 21G 降至 11G。
* **2024年8月15日**:更新了关于注入和多 GPU 的详细[教程](doc/en/injection_tutorial.md)。
* **2024年8月14日**:支持将 llamfile 作为线性后端。
* **2024年8月12日**:支持多 GPU;支持新模型:mixtral 8\*7B 和 8\*22B;支持在 GPU 上进行 q2k、q3k、q5k 反量化。
* **2024年8月9日**:支持 Windows 原生。
## 📦 功能
### 🚀 [推理](./kt-kernel/README.md) - 高性能 kt-kernel 服务
针对异构 LLM 推理优化的 CPU kernel 操作。
**核心特性:**
- **AMX/AVX 加速**:针对 INT4/INT8 量化推理优化的 Intel AMX 和 AVX512/AVX2 kernel
- **MoE 优化**:具有 NUMA 感知内存管理的高效混合专家推理
- **量化支持**:CPU 端支持 INT4/INT8 量化权重,GPU 端支持 GPTQ
- **易于集成**:提供简洁的 Python API,适配 SGLang 及其他框架
**快速开始:**
```
cd kt-kernel
pip install .
```
**应用场景:**
- 针对大型 MoE 模型的 CPU-GPU 混合推理
- 与 SGLang 集成以用于生产环境部署
- 异构专家部署(热门专家置于 GPU,冷门专家置于 CPU)
**性能示例:**
| 模型 | 硬件配置 | 总吞吐量 | 输出吞吐量 |
|-------|------------------------|------------------|-------------------|
| DeepSeek-R1-0528 (FP8) | 8×L20 GPU + Xeon Gold 6454S | 227.85 tokens/s | 87.58 tokens/s (8路并发) |
👉 **[完整文档 →](./kt-kernel/README.md)**
### 🎓 [SFT](./doc/en/SFT/KTransformers-Fine-Tuning_Quick-Start.md) - 使用 LLaMA-Factory 进行微调
KTransformers × LLaMA-Factory 集成,用于超大型 MoE 模型微调。

**核心特性:**
- **多后端支持**:支持 INT8/INT4 量化的 CPU/GPU 混合微调
- **超大型 MoE 支持**:在有限的 GPU 内存下微调 DeepSeek-V3/R1 等模型
- **快于 ZeRO-Offload**:在基准测试的 MoE SFT 任务中实现 6-12 倍的训练加速
- **更低的 CPU 内存**:在基准测试环境中,CPU 内存占用约为之前 KT SFT 路径的一半
- **LLaMA-Factory 集成**:与主流微调框架无缝集成
| 模型 | GPU 内存 | 训练速度 | 硬件 |
|-------|------------|----------------|----------|
| DeepSeek-V3 | 总计 ~80GB | 3.7 it/s | 4x RTX 4090 |
| DeepSeek-R1 | 总计 ~80GB | 3.7 it/s | 4x RTX 4090 |
| Qwen3-30B-A3B | 总计 ~24GB | 8+ it/s | 1x RTX 4090 |
**快速开始:**
```
cd /path/to/LLaMA-Factory
pip install -e .
pip install -r requirements/ktransformers.txt
CUDA_VISIBLE_DEVICES=0,1,2,3 accelerate launch \
--config_file examples/ktransformers/accelerate/fsdp2_kt_int8.yaml \
src/train.py \
examples/ktransformers/train_lora/qwen3_5moe_lora_sft_kt.yaml
```
👉 **[快速开始 →](./doc/en/SFT/KTransformers-Fine-Tuning_Quick-Start.md)**
👉 **[完整文档 →](./doc/en/SFT/KTransformers-Fine-Tuning_User-Guide.md)**
## 🔥 引用
如果您在研究中使用了 KTransformers,请引用我们的论文:
```
@inproceedings{10.1145/3731569.3764843,
title = {KTransformers: Unleashing the Full Potential of CPU/GPU Hybrid Inference for MoE Models},
author = {Chen, Hongtao and Xie, Weiyu and Zhang, Boxin and Tang, Jingqi and Wang, Jiahao and Dong, Jianwei and Chen, Shaoyuan and Yuan, Ziwei and Lin, Chen and Qiu, Chengyu and Zhu, Yuening and Ou, Qingliang and Liao, Jiaqi and Chen, Xianglin and Ai, Zhiyuan and Wu, Yongwei and Zhang, Mingxing},
booktitle = {Proceedings of the ACM SIGOPS 31st Symposium on Operating Systems Principles},
year = {2025}
}
```
## 📦 KT 原始代码
原始集成的 KTransformers 框架已归档至 [`archive/`](./archive/) 目录以供参考。该项目现在从 kt-kernel 源码树中组织上述两项功能,以实现更清晰的文档和维护。
有关包含完整快速入门指南和示例的原始文档,请参见:
- [archive/README.md](./archive/README.md) (英文)
- [archive/README_ZH.md](./archive/README_ZH.md) (中文)
**核心特性:**
- **AMX/AVX 加速**:针对 INT4/INT8 量化推理优化的 Intel AMX 和 AVX512/AVX2 kernel
- **MoE 优化**:具有 NUMA 感知内存管理的高效混合专家推理
- **量化支持**:CPU 端支持 INT4/INT8 量化权重,GPU 端支持 GPTQ
- **易于集成**:提供简洁的 Python API,适配 SGLang 及其他框架
**快速开始:**
```
cd kt-kernel
pip install .
```
**应用场景:**
- 针对大型 MoE 模型的 CPU-GPU 混合推理
- 与 SGLang 集成以用于生产环境部署
- 异构专家部署(热门专家置于 GPU,冷门专家置于 CPU)
**性能示例:**
| 模型 | 硬件配置 | 总吞吐量 | 输出吞吐量 |
|-------|------------------------|------------------|-------------------|
| DeepSeek-R1-0528 (FP8) | 8×L20 GPU + Xeon Gold 6454S | 227.85 tokens/s | 87.58 tokens/s (8路并发) |
👉 **[完整文档 →](./kt-kernel/README.md)**
### 🎓 [SFT](./doc/en/SFT/KTransformers-Fine-Tuning_Quick-Start.md) - 使用 LLaMA-Factory 进行微调
KTransformers × LLaMA-Factory 集成,用于超大型 MoE 模型微调。

**核心特性:**
- **多后端支持**:支持 INT8/INT4 量化的 CPU/GPU 混合微调
- **超大型 MoE 支持**:在有限的 GPU 内存下微调 DeepSeek-V3/R1 等模型
- **快于 ZeRO-Offload**:在基准测试的 MoE SFT 任务中实现 6-12 倍的训练加速
- **更低的 CPU 内存**:在基准测试环境中,CPU 内存占用约为之前 KT SFT 路径的一半
- **LLaMA-Factory 集成**:与主流微调框架无缝集成
| 模型 | GPU 内存 | 训练速度 | 硬件 |
|-------|------------|----------------|----------|
| DeepSeek-V3 | 总计 ~80GB | 3.7 it/s | 4x RTX 4090 |
| DeepSeek-R1 | 总计 ~80GB | 3.7 it/s | 4x RTX 4090 |
| Qwen3-30B-A3B | 总计 ~24GB | 8+ it/s | 1x RTX 4090 |
**快速开始:**
```
cd /path/to/LLaMA-Factory
pip install -e .
pip install -r requirements/ktransformers.txt
CUDA_VISIBLE_DEVICES=0,1,2,3 accelerate launch \
--config_file examples/ktransformers/accelerate/fsdp2_kt_int8.yaml \
src/train.py \
examples/ktransformers/train_lora/qwen3_5moe_lora_sft_kt.yaml
```
👉 **[快速开始 →](./doc/en/SFT/KTransformers-Fine-Tuning_Quick-Start.md)**
👉 **[完整文档 →](./doc/en/SFT/KTransformers-Fine-Tuning_User-Guide.md)**
## 🔥 引用
如果您在研究中使用了 KTransformers,请引用我们的论文:
```
@inproceedings{10.1145/3731569.3764843,
title = {KTransformers: Unleashing the Full Potential of CPU/GPU Hybrid Inference for MoE Models},
author = {Chen, Hongtao and Xie, Weiyu and Zhang, Boxin and Tang, Jingqi and Wang, Jiahao and Dong, Jianwei and Chen, Shaoyuan and Yuan, Ziwei and Lin, Chen and Qiu, Chengyu and Zhu, Yuening and Ou, Qingliang and Liao, Jiaqi and Chen, Xianglin and Ai, Zhiyuan and Wu, Yongwei and Zhang, Mingxing},
booktitle = {Proceedings of the ACM SIGOPS 31st Symposium on Operating Systems Principles},
year = {2025}
}
```
## 📦 KT 原始代码
原始集成的 KTransformers 框架已归档至 [`archive/`](./archive/) 目录以供参考。该项目现在从 kt-kernel 源码树中组织上述两项功能,以实现更清晰的文档和维护。
有关包含完整快速入门指南和示例的原始文档,请参见:
- [archive/README.md](./archive/README.md) (英文)
- [archive/README_ZH.md](./archive/README_ZH.md) (中文)标签:CPU-GPU异构计算, DLL 劫持, LLM推理, Vectored Exception Handling, 人工智能, 大语言模型, 模型微调, 深度学习, 用户模式Hook绕过, 逆向工具