OpenSenseNova/SenseNova-Vision

GitHub: OpenSenseNova/SenseNova-Vision

SenseNova-Vision 是商汤开源的统一多模态视觉生成模型,通过将异构计算机视觉任务统一转化为原生多模态生成来解决多种视觉理解与几何预测问题。

Stars: 477 | Forks: 21

# SenseNova-Vision:视觉作为统一的多模态生成
English | 简体中文
arXiv 评测指南 HuggingFace 模型 HuggingFace 数据集 SenseNova-Vision Demo ModelScope 模型 License
SenseNova-Vision handles diverse vision tasks in a unified model
SenseNova-Vision system overview
## 📣 最新消息 - `[2026.07.22]` 增强了端到端的[训练数据准备流程](./docs/train_data_prepare.md)。 - `[2026.07.17]` 发布了适配开源数据集的[训练 pipeline](./docs/TRAIN.md)。 - `[2026.07.17]` 增加了对多视角重建和相机位姿估计的[基准测试和评测支持](./docs/EVAL.md)。 - `[2026.07.08]` 发布了 [SenseNova-Vision-Corpus-50M](https://huggingface.co/datasets/sensenova/SenseNova-Vision-Corpus-50M) 数据集。 - `[2026.07.08]` 首次发布 [SenseNova-Vision-7B-MoT](https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT) 的权重。 - `[2026.07.08]` 首次发布 SenseNova-Vision 的[推理代码](./docs/INFERENCE.md)。 - `[2026.07.08]` 发布 SenseNova-Vision 的[技术报告](https://arxiv.org/abs/2607.06560)。 ## 🌟 概述 🚀 **SenseNova-Vision** 将计算机视觉构建为统一的多模态生成, 其中异构的视觉任务通过统一多模态模型(UMM)的原生文本和图像生成空间来表达。 自然语言指令和可选的视觉 prompt 指定了任务、目标区域或视角、输出 schema 以及解码规则,而模型通过原生的文本、图像或混合文本-图像生成来进行回复。 文本生成用于表达符号化的视觉记录,如类别、边界框 (boxes)、点、OCR 字符串、关键点和相机参数。图像生成用于处理密集的空间目标,如分割掩码、深度图、表面法线和多视角点图。混合回复支持结合符号化输出和密集输出的复合任务。这种共享的公式表达让一个模型能够涵盖结构化的视觉理解、密集几何预测、分割以及多视角视觉几何,同时保持输出能够被标准 benchmark 解码。 为了实现大规模训练,我们将异构的计算机视觉标注转化为指令-回复样本,并构建了 **SenseNova-Vision Corpus**,包含可解码的文本、图像和混合文本-图像目标。SenseNova-Vision 基于现成的预训练 UMM 构建,主要在此语料库上进行训练,并辅以多模态数据以保持通用的理解与生成能力,且无需特定任务的预测头、解码器或架构分支。 ### 🏗️ 核心贡献 - 🔗 我们引入了一种统一的多模态生成公式,将异构的计算机视觉任务转化为 UMM 的原生输入-输出空间。 - 🧩 我们构建了 SenseNova-Vision Corpus,这是一个大规模的计算机视觉指令-回复语料库,包含可解码的文本、图像和混合文本-图像目标。 - ✨ 我们训练了 SenseNova-Vision,并在结构化视觉理解、密集几何预测、分割以及多视角视觉几何方面展现出了优异的结果,同时支持超出固定 benchmark schema 的语言定义任务变体。 ## 🛠️ 快速开始 本仓库为示例、单张图像推理、交互式推理和 benchmark 推理提供了一个入口。如需完整的运行指南,请参阅 [`docs/INFERENCE.md`](./docs/INFERENCE.md)。如需 benchmark 评测指南,请参阅 [`docs/EVAL.md`](./docs/EVAL.md)。 从仓库根目录创建环境: ``` git clone https://github.com/OpenSenseNova/SenseNova-Vision.git cd SenseNova-Vision bash setup.sh sensenova-vision conda activate sensenova-vision ``` 运行精选示例: ``` bash scripts/run_sensenova_vision.sh example ``` 运行一个推理请求: ``` bash scripts/run_sensenova_vision.sh inference \ binary_seg \ "person" \ examples/images/2.jpg ``` 启动 web demo。包装器将在启动 Gradio 之前打印本地 URL。 **推荐配置:** 1 张 80GB GPU 用于完整的 web demo。 ``` MODEL_PATH=/path/to/SenseNova-Vision-7B-MoT \ bash scripts/run_sensenova_vision.sh demo ``` 在按照 [`docs/data_prepare.md`](./docs/data_prepare.md) 准备好 `datas/` 和 `jsonl_generate/` 之后,运行完整的 benchmark。 **推荐配置:** 至少一台配备 8 张 80GB GPU 的机器用于完整的 benchmark。 ``` bash scripts/run_sensenova_vision.sh benchmark all \ --num_gpus 8 \ --tasks_per_gpu 2 ``` 要训练 SenseNova-Vision,首先按照 [`docs/train_data_prepare.md`](./docs/train_data_prepare.md) 准备训练数据,然后按照 [`docs/TRAIN.md`](./docs/TRAIN.md) 中的说明启动训练。训练至少需要 2 台配备 8 张 80GB GPU 的机器;推荐使用 32 台或更多此类机器。 ``` bash scripts/train_cv_unify.sh data/configs/cv_unify/cv_unify_baseline_v9.yaml ``` ## 🏆 基准测试结果 SenseNova-Vision 在结构化视觉理解、密集几何预测、分割以及多视角视觉几何方面进行了评测。所有任务均采用自然语言指令构建:文本输出被解析为特定于 benchmark 的结构,如边界框、点、识别的文本、关键点和相机参数,而图像输出则被解码为掩码、深度图、法线图或 3D 点图。 ### 结构化视觉理解 结构化视觉理解用于评估那些输出可以表示为结构化文本预测的任务,例如边界框、点、识别的文本和关键点坐标。
Method Object Detection OCR GUI Keypoint
COCO-Com. HR/RefCOCOg V/T LVIS Dense200 VisDrone HierText ICDAR15 ScreenSpot-V2 COCO-Kpt.
bbox bbox bbox bbox bbox point bbox bbox bbox point
Grounding DINO-Swin-T 56.6 25.2 / 45.9 / 46.8 38.8 33.1 38.5 -- -- -- -- --
Bagel 50.2 74.6 / 76.4 / 77.8 46.8 42.4 23.0 36.9 7.1 15.8 81.1 --
Qwen3-VL-8B-Instruct 46.6 70.4 / 72.3 / 72.6 43.2 13.5 28.7 35.7 22.4 25.4 90.5 --
Qwen3.5-9B 49.3 71.7 / 72.1 / 72.6 43.2 27.5 26.8 41.7 19.6 11.4 92.2 --
LocateAnything 54.7 78.7 / 76.7 / 77.6 50.7 58.7 39.9 60.4 29.1 26.4 85.5 --
Rex-Omni 52.9 79.9 / 73.6 / 74.3 46.9 58.3 35.8 58.9 28.0 28.1 88.4 32.6
SenseNova-Vision 56.6 80.2 / 79.6 / 80.5 54.8 66.8 43.3 62.9 31.2 49.5 85.9 34.6
### 密集几何预测 密集几何预测用于评估像素级对齐的几何输出,包括单目深度估计和表面法线估计。 tr>
Method Depth Normal
NYUv2 KITTI ETH3D ScanNet DIODE ScanNet iBims-1 NYUv2
AbsRel↓ / δ1↑ Mean↓ / 11.25°↑
DSINE ---------- 16.2 / 61.017.1 / 67.416.4 / 59.6
DepthAnything 4.3 / 98.17.6 / 94.712.7 / 88.24.3 / 98.126.0 / 75.9 ------
DepthAnything V2 4.5 / 97.97.4 / 94.613.1 / 86.54.2 / 97.826.5 / 73.4 ------
*MoGe-2 3.5 / 98.05.5 / 97.73.4 / 98.83.4 / 98.323.0 / 82.3 12.8 / 68.414.7 / 70.414.7 / 62.3
Marigold 5.5 / 96.49.9 / 91.66.5 / 95.96.4 / 95.230.8 / 77.3 21.3 / 45.618.5 / 64.720.9 / 50.5
DICEPTION 6.1 / 96.06.9 / 94.95.0 / 97.57.2 / 94.428.9 / 72.2 18.8 / 53.6--18.3 / 52.9
FE2E 4.1 / 97.76.6 / 96.03.8 / 98.74.4 / 97.522.8 / 81.2 13.8 / 67.215.1 / 70.616.2 / 59.6
Lotus-2 4.1 / 97.66.7 / 94.54.6 / 98.14.2 / 97.622.1 / 75.2 14.2 / 66.815.4 / 70.416.9 / 59.0
SenseNova-Vision 4.0 / 98.15.9 / 95.94.3 / 97.43.9 / 98.020.6 / 76.4 12.8 / 68.915.4 / 69.114.4 / 62.7
### 分割 分割用于评估在语义分割、指代分割、推理分割、基于对话的分割(grounded)以及交互式引导下的掩码预测。
Method Gen. Seg. Ref. Seg. Rea. Seg. GCG Seg. Inter. Seg.
Pan. / Sem. RefCOCO / + / g Val / Test Val / Test Point / Box
LISA-7B--74.9 / 65.1 / 67.952.9 / 47.362.0 / 61.7--
PSALM55.9 / 66.683.6 / 72.9 / 73.8----64.3 / 67.3
Text4Seg--79.2 / 72.8 / 74.059.1 / 57.1----
LENS--84.2 / 79.4 / 81.262.1 / 57.2----
ConverSeg--79.4 / 74.3 / 74.961.9 / 57.0----
X-SAM54.7 / 66.585.1 / 78.0 / 83.856.6 / 57.869.4 / 69.065.4 / 70.0
SenseNova-Vision48.8 / 64.081.3 / 76.0 / 80.363.2 / 60.765.7 / 66.260.9 / 73.9
### 多视角视觉几何 多视角视觉几何用于评估基于多张输入图像的几何预测,包括多视角点图重建和相机位姿估计。
Method Multi-View Reconstruction Camera Pose
Acc.↓ / Comp.↓ / F1↑ RRA@30↑ / RTA@30↑ / AUC@30↑
7Scenes ETH3D Re10K CO3Dv2
DUSt3R0.026 / 0.034 / 87.10.359 / 0.531 / 66.699.8 / 84.9 / 67.697.7 / 93.4 / 78.3
DepthAnything30.020 / 0.026 / 90.50.228 / 0.212 / 76.6100.0 / 96.4 / 89.699.3 / 98.0 / 91.8
VGGT0.023 / 0.032 / 88.40.177 / 0.155 / 80.9100.0 / 93.5 / 79.398.3 / 96.6 / 89.2
MoRe0.038 / 0.039 / 77.10.348 / 0.318 / 62.7100.0 / 94.0 / 79.198.4 / 96.3 / 83.0
MapAnything0.027 / 0.029 / 87.80.400 / 0.524 / 67.0100.0 / 93.5 / 80.795.5 / 91.6 / 70.9
G2VLM0.084 / 0.056 / 59.20.784 / 0.553 / 36.799.8 / 77.5 / 51.896.3 / 92.0 / 55.2
SenseNova-Vision0.028 / 0.026 / 87.90.301 / 0.175 / 72.299.8 / 94.2 / 77.397.4 / 95.4 / 80.1
### 与通用视觉模型的对比 我们进一步将 SenseNova-Vision 与近期涵盖多种视觉能力的通用视觉模型进行了对比。 <>
MethodDetectionSem. Seg.Ref. Seg.Depth
mAPmIoUcIoUδ1
COCOCityscapesRefCOCO / + / gNYUv2
Youtu-VL47.170.480.7 / 76.2 / 76.590.4
SenseNova-Vision53.771.281.3 / 76.0 / 80.398.1
MethodSem. Seg.Ref. Seg.Rea. Seg.DepthNormal
mIoUcIoUgIoUδ1Mean Error↓
CityscapesRefCOCOgReasonSegKITTINYUv2DIODEETH3DNYUv2ScanNetDIODE
Vision Banana69.973.879.391.594.891.793.517.815.113.8
SenseNova-Vision71.280.363.295.998.176.497.414.412.815.3
## 🎨 展示

SenseNova-Vision qualitative results across vision tasks

目标检测
COCO-Com. LVIS Dense200 VisDrone
common object detection COCO case long-tail object detection LVIS case dense object detection Dense200 case object detection VisDrone case
指代检测
referring detection case 1 referring detection case 2
OCR
Textline Level
OCR textline case 1 OCR textline case 2
Word Level
OCR word case 1 OCR word case 2
视觉提示
visual prompt bbox case 1 visual prompt bbox case 2
visual prompt bbox case 3 visual prompt bbox case 4
布局定位
layout grounding case 1 layout grounding case 2
关键点检测
Human
human keypoint case 1 human keypoint case 2
Animal
animal keypoint case 1 animal keypoint case 2
GUI 定位
GUI grounding case 1 GUI grounding case 2
密集几何预测
dense geometric prediction depth and normal cases
全景分割
panoptic segmentation case 1 panoptic segmentation case 2
panoptic segmentation case 3 panoptic segmentation case 4
语义分割
semantic segmentation case 1 semantic segmentation case 2
semantic segmentation case 3 semantic segmentation case 4
指代分割
referring segmentation case 1 referring segmentation case 2
referring segmentation case 3 referring segmentation case 4
推理分割
reasoning segmentation case 1 reasoning segmentation case 2
reasoning segmentation case 3 reasoning segmentation case 4
基于对话的生成分割
grounded conversation generation segmentation case 1 grounded conversation generation segmentation case 2
grounded conversation generation segmentation case 3 grounded conversation generation segmentation case 4
交互式分割
Point Prompt
interactive segmentation point prompt case 1 interactive segmentation point prompt case 2
Box Prompt Scribble Prompt
interactive segmentation box prompt case 1 interactive segmentation scribble prompt case 1
Multi-view Reconstruction
indoor 1 input indoor 1 output
indoor 2 input indoor 2 output
object 1 input object 1 output
object 2 input object 2 output
outdoor 1 input outdoor 1 output
outdoor 2 input outdoor 2 output
## 数据协议 SenseNova-Vision 将异构的计算机视觉标注转化为通用的指令-回复 schema。每个样本包含一个或多个视觉输入、一条定义任务和输出规则的自然语言指令,以及一个表示为文本、图像或混合文本-图像回复的可解码目标。

Representative SenseNova-Vision data protocol examples

## ✒️ 引用 如果您发现 SenseNova-Vision 有用,请引用我们的技术报告: ``` @misc{sensenova2026sensenovavision, title={Vision as Unified Multimodal Generation}, author={Xiaoyang Han and Jianhua Li and Kewang Deng and Zukai Chen and Xuanke Shi and Sihan Wang and Boxuan Li and Linyan Wang and Siyi Xie and Xin You and Jinsheng Quan and Zhongang Cai and Haiwen Diao and Ziwei Liu and Lei Yang and Dahua Lin and Quan Wang}, year={2026}, eprint={2607.06560}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2607.06560}, } ``` ## License 本项目基于 [Apache 2.0 License](./LICENSE) 发布。
标签:人工智能, 凭据扫描, 图像生成, 多模态大模型, 深度学习, 用户模式Hook绕过, 计算机视觉, 逆向工具