# SenseNova-Vision:视觉作为统一的多模态生成
## 📣 最新消息
- `[2026.07.22]` 增强了端到端的[训练数据准备流程](./docs/train_data_prepare.md)。
- `[2026.07.17]` 发布了适配开源数据集的[训练 pipeline](./docs/TRAIN.md)。
- `[2026.07.17]` 增加了对多视角重建和相机位姿估计的[基准测试和评测支持](./docs/EVAL.md)。
- `[2026.07.08]` 发布了 [SenseNova-Vision-Corpus-50M](https://huggingface.co/datasets/sensenova/SenseNova-Vision-Corpus-50M) 数据集。
- `[2026.07.08]` 首次发布 [SenseNova-Vision-7B-MoT](https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT) 的权重。
- `[2026.07.08]` 首次发布 SenseNova-Vision 的[推理代码](./docs/INFERENCE.md)。
- `[2026.07.08]` 发布 SenseNova-Vision 的[技术报告](https://arxiv.org/abs/2607.06560)。
## 🌟 概述
🚀 **SenseNova-Vision** 将计算机视觉构建为统一的多模态生成,
其中异构的视觉任务通过统一多模态模型(UMM)的原生文本和图像生成空间来表达。
自然语言指令和可选的视觉 prompt 指定了任务、目标区域或视角、输出 schema 以及解码规则,而模型通过原生的文本、图像或混合文本-图像生成来进行回复。
文本生成用于表达符号化的视觉记录,如类别、边界框 (boxes)、点、OCR 字符串、关键点和相机参数。图像生成用于处理密集的空间目标,如分割掩码、深度图、表面法线和多视角点图。混合回复支持结合符号化输出和密集输出的复合任务。这种共享的公式表达让一个模型能够涵盖结构化的视觉理解、密集几何预测、分割以及多视角视觉几何,同时保持输出能够被标准 benchmark 解码。
为了实现大规模训练,我们将异构的计算机视觉标注转化为指令-回复样本,并构建了 **SenseNova-Vision Corpus**,包含可解码的文本、图像和混合文本-图像目标。SenseNova-Vision 基于现成的预训练 UMM 构建,主要在此语料库上进行训练,并辅以多模态数据以保持通用的理解与生成能力,且无需特定任务的预测头、解码器或架构分支。
### 🏗️ 核心贡献
- 🔗 我们引入了一种统一的多模态生成公式,将异构的计算机视觉任务转化为 UMM 的原生输入-输出空间。
- 🧩 我们构建了 SenseNova-Vision Corpus,这是一个大规模的计算机视觉指令-回复语料库,包含可解码的文本、图像和混合文本-图像目标。
- ✨ 我们训练了 SenseNova-Vision,并在结构化视觉理解、密集几何预测、分割以及多视角视觉几何方面展现出了优异的结果,同时支持超出固定 benchmark schema 的语言定义任务变体。
## 🛠️ 快速开始
本仓库为示例、单张图像推理、交互式推理和 benchmark 推理提供了一个入口。如需完整的运行指南,请参阅
[`docs/INFERENCE.md`](./docs/INFERENCE.md)。如需 benchmark 评测指南,请参阅
[`docs/EVAL.md`](./docs/EVAL.md)。
从仓库根目录创建环境:
```
git clone https://github.com/OpenSenseNova/SenseNova-Vision.git
cd SenseNova-Vision
bash setup.sh sensenova-vision
conda activate sensenova-vision
```
运行精选示例:
```
bash scripts/run_sensenova_vision.sh example
```
运行一个推理请求:
```
bash scripts/run_sensenova_vision.sh inference \
binary_seg \
"person" \
examples/images/2.jpg
```
启动 web demo。包装器将在启动 Gradio 之前打印本地 URL。
**推荐配置:** 1 张 80GB GPU 用于完整的 web demo。
```
MODEL_PATH=/path/to/SenseNova-Vision-7B-MoT \
bash scripts/run_sensenova_vision.sh demo
```
在按照 [`docs/data_prepare.md`](./docs/data_prepare.md) 准备好 `datas/` 和 `jsonl_generate/` 之后,运行完整的 benchmark。
**推荐配置:** 至少一台配备 8 张 80GB GPU 的机器用于完整的 benchmark。
```
bash scripts/run_sensenova_vision.sh benchmark all \
--num_gpus 8 \
--tasks_per_gpu 2
```
要训练 SenseNova-Vision,首先按照 [`docs/train_data_prepare.md`](./docs/train_data_prepare.md) 准备训练数据,然后按照 [`docs/TRAIN.md`](./docs/TRAIN.md) 中的说明启动训练。训练至少需要 2 台配备 8 张 80GB GPU 的机器;推荐使用 32 台或更多此类机器。
```
bash scripts/train_cv_unify.sh data/configs/cv_unify/cv_unify_baseline_v9.yaml
```
## 🏆 基准测试结果
SenseNova-Vision 在结构化视觉理解、密集几何预测、分割以及多视角视觉几何方面进行了评测。所有任务均采用自然语言指令构建:文本输出被解析为特定于 benchmark 的结构,如边界框、点、识别的文本、关键点和相机参数,而图像输出则被解码为掩码、深度图、法线图或 3D 点图。
### 结构化视觉理解
结构化视觉理解用于评估那些输出可以表示为结构化文本预测的任务,例如边界框、点、识别的文本和关键点坐标。
| Method |
Object Detection |
OCR |
GUI |
Keypoint |
| COCO-Com. |
HR/RefCOCOg V/T |
LVIS |
Dense200 |
VisDrone |
HierText |
ICDAR15 |
ScreenSpot-V2 |
COCO-Kpt. |
| bbox |
bbox |
bbox |
bbox |
bbox |
point |
bbox |
bbox |
bbox |
point |
| Grounding DINO-Swin-T |
56.6 |
25.2 / 45.9 / 46.8 |
38.8 |
33.1 |
38.5 |
-- |
-- |
-- |
-- |
-- |
| Bagel |
50.2 |
74.6 / 76.4 / 77.8 |
46.8 |
42.4 |
23.0 |
36.9 |
7.1 |
15.8 |
81.1 |
-- |
| Qwen3-VL-8B-Instruct |
46.6 |
70.4 / 72.3 / 72.6 |
43.2 |
13.5 |
28.7 |
35.7 |
22.4 |
25.4 |
90.5 |
-- |
| Qwen3.5-9B |
49.3 |
71.7 / 72.1 / 72.6 |
43.2 |
27.5 |
26.8 |
41.7 |
19.6 |
11.4 |
92.2 |
-- |
| LocateAnything |
54.7 |
78.7 / 76.7 / 77.6 |
50.7 |
58.7 |
39.9 |
60.4 |
29.1 |
26.4 |
85.5 |
-- |
| Rex-Omni |
52.9 |
79.9 / 73.6 / 74.3 |
46.9 |
58.3 |
35.8 |
58.9 |
28.0 |
28.1 |
88.4 |
32.6 |
| SenseNova-Vision |
56.6 |
80.2 / 79.6 / 80.5 |
54.8 |
66.8 |
43.3 |
62.9 |
31.2 |
49.5 |
85.9 |
34.6 |
### 密集几何预测
密集几何预测用于评估像素级对齐的几何输出,包括单目深度估计和表面法线估计。
| Method |
Depth |
Normal |
| NYUv2 |
KITTI |
ETH3D |
ScanNet |
DIODE |
ScanNet |
iBims-1 |
NYUv2 |
tr>
| AbsRel↓ / δ1↑ |
Mean↓ / 11.25°↑ |
| DSINE |
-- | -- | -- | -- | -- |
16.2 / 61.0 | 17.1 / 67.4 | 16.4 / 59.6 |
| DepthAnything |
4.3 / 98.1 | 7.6 / 94.7 | 12.7 / 88.2 | 4.3 / 98.1 | 26.0 / 75.9 |
-- | -- | -- |
| DepthAnything V2 |
4.5 / 97.9 | 7.4 / 94.6 | 13.1 / 86.5 | 4.2 / 97.8 | 26.5 / 73.4 |
-- | -- | -- |
| *MoGe-2 |
3.5 / 98.0 | 5.5 / 97.7 | 3.4 / 98.8 | 3.4 / 98.3 | 23.0 / 82.3 |
12.8 / 68.4 | 14.7 / 70.4 | 14.7 / 62.3 |
| Marigold |
5.5 / 96.4 | 9.9 / 91.6 | 6.5 / 95.9 | 6.4 / 95.2 | 30.8 / 77.3 |
21.3 / 45.6 | 18.5 / 64.7 | 20.9 / 50.5 |
| DICEPTION |
6.1 / 96.0 | 6.9 / 94.9 | 5.0 / 97.5 | 7.2 / 94.4 | 28.9 / 72.2 |
18.8 / 53.6 | -- | 18.3 / 52.9 |
| FE2E |
4.1 / 97.7 | 6.6 / 96.0 | 3.8 / 98.7 | 4.4 / 97.5 | 22.8 / 81.2 |
13.8 / 67.2 | 15.1 / 70.6 | 16.2 / 59.6 |
| Lotus-2 |
4.1 / 97.6 | 6.7 / 94.5 | 4.6 / 98.1 | 4.2 / 97.6 | 22.1 / 75.2 |
14.2 / 66.8 | 15.4 / 70.4 | 16.9 / 59.0 |
| SenseNova-Vision |
4.0 / 98.1 | 5.9 / 95.9 | 4.3 / 97.4 | 3.9 / 98.0 | 20.6 / 76.4 |
12.8 / 68.9 | 15.4 / 69.1 | 14.4 / 62.7 |
### 分割
分割用于评估在语义分割、指代分割、推理分割、基于对话的分割(grounded)以及交互式引导下的掩码预测。
| Method |
Gen. Seg. |
Ref. Seg. |
Rea. Seg. |
GCG Seg. |
Inter. Seg. |
| Pan. / Sem. |
RefCOCO / + / g |
Val / Test |
Val / Test |
Point / Box |
| LISA-7B | -- | 74.9 / 65.1 / 67.9 | 52.9 / 47.3 | 62.0 / 61.7 | -- |
| PSALM | 55.9 / 66.6 | 83.6 / 72.9 / 73.8 | -- | -- | 64.3 / 67.3 |
| Text4Seg | -- | 79.2 / 72.8 / 74.0 | 59.1 / 57.1 | -- | -- |
| LENS | -- | 84.2 / 79.4 / 81.2 | 62.1 / 57.2 | -- | -- |
| ConverSeg | -- | 79.4 / 74.3 / 74.9 | 61.9 / 57.0 | -- | -- |
| X-SAM | 54.7 / 66.5 | 85.1 / 78.0 / 83.8 | 56.6 / 57.8 | 69.4 / 69.0 | 65.4 / 70.0 |
| SenseNova-Vision | 48.8 / 64.0 | 81.3 / 76.0 / 80.3 | 63.2 / 60.7 | 65.7 / 66.2 | 60.9 / 73.9 |
### 多视角视觉几何
多视角视觉几何用于评估基于多张输入图像的几何预测,包括多视角点图重建和相机位姿估计。
| Method |
Multi-View Reconstruction |
Camera Pose |
| Acc.↓ / Comp.↓ / F1↑ |
RRA@30↑ / RTA@30↑ / AUC@30↑ |
| 7Scenes |
ETH3D |
Re10K |
CO3Dv2 |
| DUSt3R | 0.026 / 0.034 / 87.1 | 0.359 / 0.531 / 66.6 | 99.8 / 84.9 / 67.6 | 97.7 / 93.4 / 78.3 |
| DepthAnything3 | 0.020 / 0.026 / 90.5 | 0.228 / 0.212 / 76.6 | 100.0 / 96.4 / 89.6 | 99.3 / 98.0 / 91.8 |
| VGGT | 0.023 / 0.032 / 88.4 | 0.177 / 0.155 / 80.9 | 100.0 / 93.5 / 79.3 | 98.3 / 96.6 / 89.2 |
| MoRe | 0.038 / 0.039 / 77.1 | 0.348 / 0.318 / 62.7 | 100.0 / 94.0 / 79.1 | 98.4 / 96.3 / 83.0 |
| MapAnything | 0.027 / 0.029 / 87.8 | 0.400 / 0.524 / 67.0 | 100.0 / 93.5 / 80.7 | 95.5 / 91.6 / 70.9 |
| G2VLM | 0.084 / 0.056 / 59.2 | 0.784 / 0.553 / 36.7 | 99.8 / 77.5 / 51.8 | 96.3 / 92.0 / 55.2 |
| SenseNova-Vision | 0.028 / 0.026 / 87.9 | 0.301 / 0.175 / 72.2 | 99.8 / 94.2 / 77.3 | 97.4 / 95.4 / 80.1 |
### 与通用视觉模型的对比
我们进一步将 SenseNova-Vision 与近期涵盖多种视觉能力的通用视觉模型进行了对比。
<>
| Method | Detection | Sem. Seg. | Ref. Seg. | Depth |
| mAP | mIoU | cIoU | δ1 |
| COCO | Cityscapes | RefCOCO / + / g | NYUv2 |
| Youtu-VL | 47.1 | 70.4 | 80.7 / 76.2 / 76.5 | 90.4 |
| SenseNova-Vision | 53.7 | 71.2 | 81.3 / 76.0 / 80.3 | 98.1 |
| Method | Sem. Seg. | Ref. Seg. | Rea. Seg. | Depth | Normal |
| mIoU | cIoU | gIoU | δ1 | Mean Error↓ |
| Cityscapes | RefCOCOg | ReasonSeg | KITTI | NYUv2 | DIODE | ETH3D | NYUv2 | ScanNet | DIODE |
| Vision Banana | 69.9 | 73.8 | 79.3 | 91.5 | 94.8 | 91.7 | 93.5 | 17.8 | 15.1 | 13.8 |
| SenseNova-Vision | 71.2 | 80.3 | 63.2 | 95.9 | 98.1 | 76.4 | 97.4 | 14.4 | 12.8 | 15.3 |
## 🎨 展示
目标检测
| COCO-Com. |
LVIS |
Dense200 |
VisDrone |
 |
 |
 |
 |
指代检测
OCR
| Textline Level |
 |
 |
| Word Level |
 |
 |
视觉提示
布局定位
关键点检测
GUI 定位
密集几何预测
全景分割
语义分割
指代分割
推理分割
基于对话的生成分割
交互式分割
| Point Prompt |
 |
 |
| Box Prompt |
Scribble Prompt |
 |
 |
Multi-view Reconstruction
## 数据协议
SenseNova-Vision 将异构的计算机视觉标注转化为通用的指令-回复 schema。每个样本包含一个或多个视觉输入、一条定义任务和输出规则的自然语言指令,以及一个表示为文本、图像或混合文本-图像回复的可解码目标。
## ✒️ 引用
如果您发现 SenseNova-Vision 有用,请引用我们的技术报告:
```
@misc{sensenova2026sensenovavision,
title={Vision as Unified Multimodal Generation},
author={Xiaoyang Han and Jianhua Li and Kewang Deng and Zukai Chen and Xuanke Shi and Sihan Wang and Boxuan Li and Linyan Wang and Siyi Xie and Xin You and Jinsheng Quan and Zhongang Cai and Haiwen Diao and Ziwei Liu and Lei Yang and Dahua Lin and Quan Wang},
year={2026},
eprint={2607.06560},
archivePrefix={arXiv},
primaryClass={cs.CV},
url={https://arxiv.org/abs/2607.06560},
}
```
## License
本项目基于 [Apache 2.0 License](./LICENSE) 发布。