**Mage** 是一个在固定 **40 亿参数**预算下构建的轻量级、研究友好的多模态模型家族。它旨在让高级的视觉**理解**与**生成**能力,能够被广泛应用于受控实验、训练后研究,以及现实算力预算下的垂直领域应用。
该家族围绕一种共享的**编码器对齐效率**理念构建——*将表征能力花在信号所在之处*——该理念同时应用于理解侧和生成侧:
| 模型 | 任务 | 规模 | 代码 | 报告 |
| :--- | :--- | :---: | :--- | :--- |
| **[Mage-VL](mage_vl/)** | 图像与视频理解,主动式流处理 | 4B | [`mage_vl/`](mage_vl/README.md) | [arXiv](https://github.com/microsoft/Mage/blob/main/assets/mage_vl_tech_report.pdf) |
| **[Mage-Flow](mage_flow/)** | 文生图与基于指令的编辑 | 4B | [`mage_flow/`](mage_flow/README.md) | [arXiv](https://arxiv.org/abs/2607.19064) |
这两个模型足够紧凑,能够在普通硬件上进行训练、微调和部署,同时在各自的领域中依然能与规模大得多的开放系统相媲美。
## 🧩 Mage-VL — 高效的 codec 原生主动式流处理理解
**Mage-VL** 是一个 codec 原生、主动式流处理的多模态基础模型,用于图像和视频理解。其视觉编码器(**Mage-ViT**)是**完全从零开始**训练的,并在紧凑的 **4B** 规模上与 Qwen3-4B 解码器配对。针对 VLM 现代的*莫拉维克悖论*——拥有强大的复杂推理能力,但在实时感知上却缓慢且易失败——它减少了 **75% 以上**的视觉 token,实现了**高达 3.5 倍**的实际推理加速。**单个**发布的 checkpoint 同时提供图像和视频理解**以及**主动式流处理门控——一个模型,无需单独的变体。
**亮点**
- **codec 原生且从零训练。** 整个视觉层均从零开始训练;受生物学启发的 I/P 预测 patch 机制(`16×16`)将视觉 token 的使用量减少了 **75% 以上**(约为密集帧采样的 **1/8 或更少**),实现了 **8 倍**更长的视频训练和**最高 3.5 倍**的推理加速。
- **同等 LLM 下的视频增益。** 在固定使用 4B Qwen3 主干网络的情况下,替换为 Mage-ViT 后,在**所有**已报告的视频与时序定位基准测试中均击败了 Qwen3-VL-4B(例如 **+22.5** QVHighlight,**+11.0** VSI-Bench)。
- **在其规模下表现强劲。** 在静态图像上与 Qwen3-VL-4B 持平,在视频理解和空间智能上明显领先(**+11.0** VSI-Bench,**+53.1** CrossPoint,**+5.2** EmbSpatial)。
- **主动式流处理,单一模型。** 一个冻结主干网络的认知门控可提供低延迟、事件门控的解说,并能泛化到真实的 2026 年世界杯转播。
- **七项经验发现**,涉及数据效率、分辨率缩放、codec 加速、VideoQA-SFT 冗余、运动与空间协同、AI4AI 数据流水线,以及用于多模态 RL 的 Zero-Vision SFT。
→ 详细信息、安装、推理和主动式流处理:**[`mage_vl/README.md`](mage_vl/README.md)**
## 🎨 Mage-Flow — 高效的原生分辨率生成与编辑
**Mage-Flow** 是一个紧凑的 4B 生成模型栈,用于**文生图**和**基于指令的图像编辑**,由两个共同设计的组件构建而成:**Mage-VAE**(一个轻量级、高保真的 latent tokenizer)和一个通过 rectified flow matching 训练的**原生分辨率多模态 Diffusion Transformer**。每个任务都提供 **Base**、**RL-aligned** 和 **4-step Turbo** 变体。
**亮点**
- **紧凑且极具竞争力。** 单个 4B 家族即可同时用于生成*和*编辑,其表现足以媲美甚至超越规模更大的开放系统(Qwen-Image 20B、Z-Image 6B、FLUX.2 32B、FireRed-Image-Edit 20B)。
- **高效的 tokenizer。** Mage-VAE 在重建保真度上与 FLUX.2-VAE 相当,但每像素的编码/解码 MACs 量减少了约 **12 倍 / 22 倍**,消除了 VAE 在高分辨率下的瓶颈。
- **原生分辨率。** 单个 checkpoint 即可生成从 **512 到 2048** 的任意长宽比图像,包括极端的 **4:1**(例如 `512×2048`、`2048×512`)。
- **系统级速度。** 原生分辨率打包 + 融合的 CUDA kernels 将每步训练时间从 **~1.93 秒 → ~0.78 秒**削减(**训练速度提升约 2.5 倍**);在单个 A100 上处理 `1024²` 分辨率时,**Mage-Flow-Turbo 为 0.59 秒/图像**,**Mage-Flow-Edit-Turbo 为 1.02 秒/次编辑**。
- **多功能的编辑能力。** Mage-Flow-Edit 在统一的图像与文本条件控制模型内,支持语义内容编辑、外观转换、图像修复以及具有结构感知的图像生成。
→ 详细信息、安装、Python API、CLI 和 Gradio 应用:**[`mage_flow/README.md`](mage_flow/README.md)**
## 📣 新闻
- **2026-07-26** — **Mage-VL** 已在 🤗 [Hugging Face](https://huggingface.co/microsoft/Mage-VL) 上发布:提供单个 codec 原生的 checkpoint,用于图像和视频理解,**内置**主动式流处理门控,同时发布的还有独立的 [Mage-ViT](https://huggingface.co/microsoft/Mage-ViT) 视觉编码器(仅包含 ViT 预训练)。
- **2026-07-22** — **Mage-Flow** 的 checkpoint 已在 🤗 [Hugging Face](https://huggingface.co/collections/microsoft/mage) 上发布:包含文生图和图像编辑的 Base、RL-aligned 和 4-step Turbo 变体。
## 📥 模型库
**Mage-VL** — 视觉-语言(图像和视频理解)。单个 checkpoint 将理解主干网络与主动式流处理门控捆绑在一起。我们还发布了独立的视觉编码器 **Mage-ViT**(仅包含 ViT 预训练——不包含 VLM 联合训练)。
| 模型 | 任务 | Hugging Face |
| :--- | :--- | :--- |
| `Mage-VL` | 图像和视频理解 **+** 主动式流处理门控 | [🤗 microsoft/Mage-VL](https://huggingface.co/microsoft/Mage-VL) |
| `Mage-ViT` | codec 原生视觉编码器(仅包含 ViT 预训练) | [🤗 microsoft/Mage-ViT](https://huggingface.co/microsoft/Mage-ViT) |
**Mage-Flow** — 生成与编辑。每个 checkpoint 都是一个自包含的 diffusers 风格仓库(包含 `transformer/` + 共享的 `vae/`、`text_encoder/`、`scheduler/`)。
| 模型 | 任务 | 变体 | 步数 | Hugging Face |
| :--- | :--- | :--- | :---: | :--- |
| `Mage-Flow-4B-Base` | 文生图 | Base | 30 | [🤗 microsoft/Mage-Flow-Base](https://huggingface.co/microsoft/Mage-Flow-Base) |
| `Mage-Flow-4B` | 文生图 | RL-aligned | 20 | [🤗 microsoft/Mage-Flow](https://huggingface.co/microsoft/Mage-Flow) |
| `Mage-Flow-4B-Turbo` | 文生图 | Few-step distilled | 4 | [🤗 microsoft/Mage-Flow-Turbo](https://huggingface.co/microsoft/Mage-Flow-Turbo) |
| `Mage-Flow-Edit-4B-Base` | 编辑 | Base | 30 | [🤗 microsoft/Mage-Flow-Edit-Base](https://huggingface.co/microsoft/Mage-Flow-Edit-Base) |
| `Mage-Flow-Edit-4B` | 编辑 | RL-aligned | 30 | [🤗 microsoft/Mage-Flow-Edit](https://huggingface.co/microsoft/Mage-Flow-Edit) |
| `Mage-Flow-Edit-4B-Turbo` | 编辑 | Few-step distilled | 4 | [🤗 microsoft/Mage-Flow-Edit-Turbo](https://huggingface.co/microsoft/Mage-Flow-Edit-Turbo) |
## 🚀 用法
每个模型都独立存放在各自的目录中,并配有专属的 README:
- **Mage-VL** — 图像/视频理解演示、codec 后端、CLI → **[`mage_vl/README.md`](mage_vl/README.md)**
- **Mage-Flow** — 安装、Python API、CLI、prompt 增强、Gradio 应用 → **[`mage_flow/README.md`](mage_flow/README.md)**
## 📝 引用
```
@article{yang2026magevl,
title={Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model},
author={Yang, Senqiao and Zhang, Kaichen and Jia, Zhaoyang and Guo, Jinghao and Shen, Yifei and Zhang, Xinjie and Zhang, Xiaoyi and Wang, Haoqing and Li, Xiao and Zhang, Peng and An, Xiang and Xie, Yin and Liu, Zhening and Guo, Xun and Li, Jiahao and Zheng, Shicheng and Wang, Jinglu and Guo, Zongyu and Xie, Wenxuan and Zheng, Zihan and Luo, Yuxuan and Li, Bin and Lu, Yan},
journal={arXiv preprint},
year={2026}
}
@article{zhang2026mageflow,
title={Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing},
author={Zhang, Xinjie and Zhang, Peng and Zheng, Shicheng and Guo, Jinghao and Jia, Zhaoyang and Shen, Yifei and Guo, Xun and Luo, Yuxuan and Li, Jiahao and Xie, Wenxuan and Pu, Fanyi and Zhang, Xiaoyi and Zhang, Kaichen and Guo, Zongyu and Bi, Tianci and Gui, Dongnan and Liu, Zhening and Wen, Zimo and Zheng, Zihan and Yang, Senqiao and Li, Xiao and Wang, Jinglu and Li, Bin and Lu, Yan},
journal={arXiv preprint arXiv:2607.19064},
year={2026}
}
```
## 负责任的 AI
这些模型仅供研究目的发布,不适用于产品或服务部署。在整个开发过程中,我们纳入了负责任的 AI 考量,包括数据选择、模型训练和评估。训练数据包含了公开、授权和内部数据集的组合,并已进行处理,以清除明显可识别的个人信息,并尽可能减少有害内容。然而,由于数据主要来源于网络规模的收集,它们可能包含偏见或不均衡的代表性。因此,模型在某些特定的 prompt 下可能会生成不准确、带有偏见或不当的输出。该模型应在具有适当人工监督的受控研究环境中使用,下游用户有责任在更广泛的应用前采取额外的防护措施——例如内容审核、验证和合规性检查。
## License
授权视具体模型而定:
| 模型 | License |
| :--- | :--- |
| **Mage-VL** | [Apache-2.0](https://www.apache.org/licenses/LICENSE-2.0) |
| **Mage-ViT** | [MIT](LICENSE) |
| **Mage-Flow** | [MIT](LICENSE) |