HKUST-LongGroup/MoKus
GitHub: HKUST-LongGroup/MoKus
MoKus 是一个基于跨模态知识转移的知识感知概念定制框架,解决了传统图像概念定制中罕见 token 无法传达丰富知识的问题。
Stars: 12 | Forks: 0

## 摘要
概念定制通常将*罕见 token* 与目标概念绑定。遗憾的是,由于预训练数据中很少包含这些罕见 token,这些方法往往存在性能不稳定的问题。同时,这些罕见 token 也无法传达目标概念的固有知识。因此,我们引入了**知识感知概念定制 (Knowledge-Aware Concept Customization)**,这是一项旨在将多种文本知识绑定到目标视觉概念上的全新任务。该任务要求模型识别文本提示中的知识,以执行高保真度的定制化生成。同时,模型应能高效地将所有文本知识绑定到目标概念上。因此,我们提出了 MoKus,一个用于知识感知概念定制的新颖框架。我们的框架基于一项关键观察:*跨模态知识转移*,即在生成过程中,对文本模态内知识的修改会自然地转移到视觉模态。受此观察启发,MoKus 包含两个阶段:(1) 在视觉概念学习阶段,我们首先学习锚点表示,以存储目标概念的视觉信息。(2) 在文本知识更新阶段,我们将知识查询的答案更新为锚点表示,从而实现高保真度的定制化生成。为了进一步在全新任务上全面评估我们提出的 MoKus,我们引入了首个用于知识感知概念定制的基准测试:*KnowCusBench*。广泛的评估表明,MoKus 优于现有的最先进方法。此外,跨模态知识转移使 MoKus 能够轻松扩展到其他知识感知应用中,如虚拟概念创建和概念擦除。我们还展示了我们的方法在世界知识基准测试中实现性能提升的能力。
## 核心亮点
- 引入了**知识感知概念定制**,一项将丰富文本知识绑定到定制视觉概念上的全新任务。
- 我们观察到了**跨模态知识转移**现象,即文本模态中的知识更新可以转移到视觉模态中。
- 受此观察启发,我们提出了 **MoKus**,一个用于知识感知概念定制的两阶段框架。
- 提出了 **KnowCusBench**,首个专为知识感知概念定制设计的基准测试。
## 最新动态
- **[2026.03.13]**:在 arXiv 上发布了论文([2603.12743](https://arxiv.org/abs/2603.12743))、项目主页和代码库。
- **[2026.06.18]**:MoKus 被 ECCV 2026 收录!
## 快速开始
### 1. 下载 KnowCusBench
从 [Hugging Face](https://huggingface.co/datasets/zcaoyao/KnowCusBench) 下载基准测试资源。发布内容包括:
1. 位于 `KnowCusBench/concept_image` 中的概念图像
2. 位于 `KnowCusBench/knowledge_data` 中的文本知识
3. 位于 `KnowCusBench/concept_image/dataset.json` 中的生成提示词
4. 针对每个目标概念的视觉概念学习 checkpoints,位于 `KnowCusBench/visual_ckpt`
### 2. 视觉概念学习
你可以直接使用 KnowCusBench 中提供的视觉概念学习 checkpoints,因此重新训练是可选的。
如果你更倾向于自己训练视觉概念模型,请首先准备官方 Diffusers DreamBooth 为 Qwen-Image 提供的实现所需的额外环境:
[DreamBooth for Qwen-Image](https://github.com/huggingface/diffusers/blob/main/examples/dreambooth/README_qwen.md)
我们使用了以下训练命令:
```
export concept_name="your-concept-name"
export MODEL_NAME="./path/to/Qwen-Image"
export INSTANCE_DIR="./path/to/concept_image"
export OUTPUT_DIR="./path/to/output_dir"
accelerate launch train_dreambooth_lora_qwen_image.py \
--pretrained_model_name_or_path="$MODEL_NAME" \
--instance_data_dir="$INSTANCE_DIR" \
--output_dir="$OUTPUT_DIR" \
--mixed_precision="bf16" \
--instance_prompt="sks $concept_name" \
--resolution=1024 \
--train_batch_size=1 \
--gradient_accumulation_steps=1 \
--use_8bit_adam \
--learning_rate=2e-4 \
--report_to="wandb" \
--lr_scheduler="constant" \
--lr_warmup_steps=0 \
--max_train_steps=500 \
--checkpointing_steps=100 \
--cache_latents \
--seed="42"
```
### 3. 文本知识更新
#### 环境配置
你可以运行 [setup_env.sh](setup_env.sh),或者手动创建 conda 环境:
```
conda create -n MoKus python=3.9.7 -y
conda activate MoKus
pip install -r requirements.txt
```
#### 下载预训练模型
从 Hugging Face 下载 [Qwen-Image](https://huggingface.co/Qwen/Qwen-Image) 和 [Qwen2.5-VL-7B-Instruct](https://huggingface.co/Qwen/Qwen2.5-VL-7B-Instruct) 的权重,然后将它们放置在 `./pretrained_models` 目录下。
#### 运行知识更新
下载 KnowCusBench 后,运行以下命令,或使用 [run_text_knowledge_updating.sh](run_text_knowledge_updating.sh):
```
export concept_name="your-concept-name"
python text_knowledge_updating.py \
--editing_method=UltraEdit \
--hparams_dir="./hparams/qwenvl2.5-7b.yaml" \
--data_dir="./knowledge_data/${concept_name}.json" \
--data_type=unike_data \
--output_dir="./updated_models" \
--task_name="${concept_name}" \
--sequential_edit
```
更新后的 Qwen-Image 模型将保存在 `./updated_models/${concept_name}` 目录下。
### 4. 推理
使用以下命令,或运行 [run_inference.sh](run_inference.sh):
```
CONCEPT_MODEL_PATH="path/to/your/concept/model"
LORA_MODEL_PATH="path/to/your/lora/model"
PROMPT="Your inference prompt goes here"
python inference.py \
--concept-model-path "$CONCEPT_MODEL_PATH" \
--lora-model-path "$LORA_MODEL_PATH" \
--prompt "$PROMPT" \
--output-path "image.png"
```
## 实验结果

## 引用
```
@article{zhu2026mokus,
title={MoKus: Leveraging Cross-Modal Knowledge Transfer for Knowledge-Aware Concept Customization},
author={Zhu, Chenyang and Li, Hongxiang and Li, Xiu and Chen, Long},
journal={arXiv preprint arXiv:2603.12743},
year={2026}
}
```
## 致谢
本代码库很大程度上基于 [EasyEdit](https://github.com/zjunlp/EasyEdit) 和 [Diffusers](https://huggingface.co/docs/diffusers/main/en/index) 构建。我们感谢作者们开源其代码和模型。
## 联系方式
本代码库伴随我们的研究项目,我们将持续完善代码库和文档。如果你有任何问题或希望探讨想法,请联系 [Chenyang Zhu](mailto:chenyangzhu.cs@gmail.com)。
标签:IaC 扫描, 人工智能, 凭据扫描, 图像生成, 概念定制, 深度学习, 用户模式Hook绕过, 计算机视觉, 跨模态, 逆向工具