OpenBMB/MiniCPM-Robot

GitHub: OpenBMB/MiniCPM-Robot

MiniCPM-Robot 是 OpenBMB 开源的端侧具身智能模型家族,提供机器人通用操作和高性能目标跟踪能力,以小参数量实现超越更大模型的策略表现。

Stars: 25 | Forks: 3

MiniCPM-Robot

为机器人打造的更智能、更快速的端侧 AI 大脑

English · 中文

[![Github](https://img.shields.io/badge/MiniCPM--Robot-000000?style=for-the-badge&logo=github&logoColor=white)](https://github.com/OpenBMB/MiniCPM-Robot) [![Hugging Face Collection](https://img.shields.io/badge/Models-fcd022?style=for-the-badge&logo=huggingface&logoColor=000)](https://huggingface.co/collections/openbmb/minicpm-robot) [![Cookbook](https://img.shields.io/badge/%F0%9F%8D%B3_cookbook-ff69b4?style=for-the-badge)](#quick-start) [![Lark](https://img.shields.io/badge/Lark-00D6B9?style=for-the-badge&logo=data:image/png;base64,iVBORw0KGgoAAAANSUhEUgAAAEAAAABACAYAAACqaXHeAAAIIklEQVR4nO2ba2xUxxXHf3Pvvte7Xhu/8WKDH6SEuJDSRKGQiEeAhrbhFaVpRBMoJaFSKlVVWj5Ujfr4EqSqaqOoRGkhTdQWiFq1jUjLI5AQ8gClJQQSwFCDY7CNwcZr73qf904/2AvGb+/OspHin+QP3nvvmTP/mTlzztxdIaWUfI7Rsu1AtpkQINsOZJsJAbLtQLaZECDbDmQbSyoPxaTJ5XiYRIZTCKum4dNsuDUdIURG2khJgOZ4D8+2nqItEVPvUT8sCKbaXGwsrGaq3Y1AvQgi1Uzwza5Wnm9v4GAkSFi5Wzez2O7m2bKZ3ObIVW475Rhwr6eYX5bOZLnTR06GpmeS/dEQL1xtIGYaym2nPAOSdBlxXmg7y687LxEgszHhpeJaVudXoClcCmnvAl7dyhNFNWzO91Op6Wq8GoaXOy9SH+lSalPJNujVrWwqquVXpV+gRk8pro6JA9Ee/tjegKlwpinLA6xCY4m3lJ8WVlOn21SZHcSO7nY+CLajqopXmghpCB70+fl5yfSMLYc2abKzs5EuI67EnvJMUBeCRZ4SflFcQ51uVW0egP2hAPXRbiW2MpIKa0Lwjb6Z4M/ATDhnJtjd2azEVsZqAQuCRZ5SnimcRrWmPjC+FrpKWzz9FEwDSab+NAErfX6e8E1W0un+tBgJDnVfSdtOxqtBh6bz7YJpPO0tJk9hxhhAciTUkXYwHDQ3DRN0xbLk6BY2FdXSnIjwp56AMrtnYyE6ElGscTjdEKC5Lcily93Ejd4t0qJpeD02yos9VPu9lBa7B9kQUpo3bajb9ggiCVi3GJx2dQmHBM5Hu3my6RjvxKPpGTNB7zbJ+V+UBRfcNJxsJxCME40ZhOMGos9tKcCma9itOg67BX+JmxULqrj7iyVUTfHicloHC7Bll2DvcXhsoWTtovT8HIhEsqerhc2tZzhrJFKzEZE4DwexHgtjno+CMf5BKivI4alH7mDd6hlDnwcEwpI/7BfoOqyaa+KwqVm7gt4c4aloDz++eoHwOFJaS1wijvXgOBjCbIxiptDxJJpmMm9OOUKMEARDUcm2fSY7D2kkFFahVqGxwufnQbdnzM/YgybO17uwvXINsyGS0qgnKfI5+dF35lBT4UUIMfIuEAgLXtwr+c3foTOUcpuDyLfa+H5BLffZHKPea+800be3I/8dgJiZdtuPfn06Dy2tQdN6Z/Wo8T6agFffhxd3C6IxdUvhDqePx/L8I96nB0xsuzrg4zAy/b5TNdnDxjUz0bUb/RjThmcY8Ncjks3bof5i+o7Qly4v805mfU4eziGu69dMHNvbMf7bcz2qp4PdqrNhVR15PvvNfozVgCHh8BnJlr8JzqlJw/FarDzim0LFgDMEW5eJ/dUOxJmwks4DVJd7WDLPjzYgGRt3ynP8guS7z8E/3xOE0kzFBXCPp4j1uTdSZf2aie337Yj/9CiZ9kkeX3E7/tKcQZ+nlPMFo/Dcbsm2vYKeNOOCAL7qK+M+qwPZN/KcjaRlcyDVfi9L5lUMeS3lpLezB15+S7Lxt/DeJwIjjdGqtOewRpYyaXtH38iry0DtVp0NK2dSXDBUpFFQDJ1plvxsh+SlfaktCSklTc1BDmw7j3FG/RuGqWU5LJlfMWjtJ1FS9rQHYeseyabn4chpQXyMWa5hSI6eaGPdT/ax951GEmkkOMOxfuVMyocogpIorftONcMzf+5NnFqvCcwRlkU8brD7zQv8cMshTjV0qHTjOrdV+rj/K1NGvEf5UU17EHa+CwdPSB6eD8vvEkzy3jyyTS1BfrfjI/7yr3pCkdSKotGw23TWfm0GZUXDjz6ZECBJWzds3QNvfQxL7xQs+5JEFwneePdTtu46wfH6duLpRM5RmDW9kOULpjHaGUzm3mIAcQM+apScbIR/vA9ecZnX9x0lHA5msllcLjdPfvPLlBWOXmtkVIAkJlDfAlKW4Ju6CHtXM8Gr9RixENJUuwQsdhePrribhXcVje1+pa2PghA6NlchNlchnkk19AQuEu5sJBJsxUykeUoEWOweZs++m++tqcRpH8MDt1qA/mhWFzkFtbjyKklEu4kEmugJNJGIdGEaMeQ48mBNt+LwTKas6k5+8K18JheM3Y+sCZBE023YXJOwuQrwFNcRDbURDV0m2n2ZaOgKZmL4tFizOnF4SnHnVZI7aQqPL7Ywb8b42s+6AP0Rmo7DU4rDU4JREMNIhDFiQWLBVuLREFKaaJoFi82F7sjF4S5CszixWa0snwNrF4BjnO9lP1MC3ECgW+zoFjs4fDi95cPfKWD+DNiwlDGv+/58RgUYGxYN7pkOmx+CvBzZV1uO00ZGPLsFaBosmwUbH4B8Dyl1nqEEKPAp8C7D5Dph1VxYf//41/xABhVD824Htz2z3/pKh3y35OnVvW+u0u08Q70aMyW88SG8chBOX4Jb93uSkUW3W2Hu9N5gV10GmqIxGiRAkotXYNfbgtc+kATVnlAN58qwV8rz4eF74YE54HUpbnU4AQAShqS5Q2PbHjh6TnJF7TfUBrpy03+aBtXFsLCud737chi1skup1ZEESBKNCU42woEPYd9xybUe9Y70F6CqGJbMgoWzoaIwMx2/3upYBEhimpLOkODwScHbn0BjG7QEIBJLL1DkOgWl+TCjHBbUwewqsFrlsOd4KhmXAP0JRQUt7fDpVTjdBKebJGdbek+ERgucQsCUAkFloaRuKtSWCfyFUJrfO/VvJSkLoJ7sbL2f+1+MTAiQbQeyzYQA2XYg20wIkG0Hss3/Ad9m22xHQgjPAAAAAElFTkSuQmCC)](assets/feishu_group.png)
**MiniCPM-Robot** 是 MiniCPM 面向真实世界感知、决策和行动的具身智能模型家族。首批模型包括: - **MiniCPM-RobotManip**:🦾 用于机器人操作(仿真与真实)的 **1.5B** 通用 VLA。一套权重覆盖所有任务;在代表性评测中击败了 π₀.₅ (3B) 和 Qwen-VLA (5B+) 等更大的模型。流式推理保留了原生记忆能力,并保持了与以前相同的响应速度。 - **MiniCPM-RobotTrack**:🎯 **首个完全端侧**的具身目标跟踪器(**0.9B**)。覆盖静态、动态和对抗性目标;**在 EVT-Bench 上取得开源 SOTA**;在 Unitree Go2 EDU 上实现完全本地化、纯视觉的自然语言跟踪,运行速度达 **5+ FPS / ~180 ms**。

MiniCPM-RobotManip task demonstrations

## 🎉 新闻 * [2026.07.19] 🔥🔥🔥 我们发布并开源了 MiniCPM-Robot,这是 MiniCPM 首个用于与物理世界交互的具身智能模型家族。首批发布的是用于通用机器人操作的 [MiniCPM-RobotManip](https://huggingface.co/openbmb/MiniCPM-RobotManip) 和用于具身目标跟踪的 [MiniCPM-RobotTrack](https://huggingface.co/openbmb/MiniCPM-RobotTrack)。立即体验吧! * [2026.07.19] 🚀🚀🚀 [PhyAI](https://github.com/MEmbodied/phyai) 为 MiniCPM-Robot 增加了 Day-0 支持,通过 CUDA Graph 和自定义 Triton 融合内核将 NVIDIA H20 上的推理吞吐量从 10 Hz 提升至 37 Hz。 ## 目录 - [MiniCPM-RobotManip](#minicpm-robotmanip) - [基准测试结果](#benchmark-results) - [快速开始](#quick-start) - [推理](#inference) - [MiniCPM-RobotTrack](#minicpm-robottrack) - [基准测试结果](#evt-bench-results) - [快速开始](#quick-start-1) - [实战指南](#data-preparation) - [模型库](#model-zoo) ## MiniCPM-RobotManip MiniCPM-RobotManip 是一个用于具身操作的 1.5B 视觉-语言-动作模型,具有以下亮点:
  • 通用操作:一个统一的 1.5B 通用策略,仅用一套权重即可覆盖所有下游任务。
  • 流式上下文:历史观测通过流式推理被纳入模型上下文。对于 60 帧的历史记录,传统重新计算每个决策步骤需要 125 TFLOPs,而流式推理仅需 3.3 TFLOPs。该模型支持长达 1 分钟的视觉上下文记忆,同时保持与传统单帧反应式推理相当的在线成本。
  • 高效推理:继承了 MiniCPM-V 4.6 的视觉 token 压缩技术,将每一帧从 256 个视觉 token 减少到 64 个,实现了 4 倍压缩。在 H100、BF16 和单帧输入下,每个决策步骤的模型前向延迟为 120 ms,而 π0.5 为 234 ms。该测量结果不包括任务的自回归解码。
### 基准测试结果
方法 评测设置 开放权重 模型大小 LIBERO Calvin (ABC→D) RoboTwin2 (clean+random) RMBench
easyhard
π₀Specialist3B94.43.965.958.4
π₀.₅Specialist3B96.94.182.776.810.4
Abot-M0Specialist4B+98.686.185.1
StarVLA-αGeneralist4B+97.888.787.8
Qwen-VLAGeneralist5B+97.986.187.2
LingBot-VASpecialist5B+98.592.991.6
MiniCPM-RobotManipGeneralist1.5B97.54.191.391.653.3
### 快速开始

首先安装并初始化 Conda。配置规范遵循已测试的 Python 3.10 和 PyTorch 2.6.0 (CUDA 12.4) 设置。

cd MiniCPM-RobotManip

conda env create -f environment.yml

### 推理

使用 vla_infer.py 运行单样本推理。至少提供一张图像和一条语言指令;如果省略,机器人状态默认为零。模型返回形状为 (30, 80) 的动作块。

cd MiniCPM-RobotManip

python vla_infer.py \

    --image frame.jpg \

    --text "Pick up the red block." \

    --checkpoint ./checkpoint \

    --state-file state.npy \

    --embodiment-id 0 \

使用多个 --image 标志进行多视角输入。如果不加 --output,预测的动作将以 JSON 格式打印。

cd MiniCPM-RobotManip

python vla_infer.py \

    --image cam_front.jpg \

    --image cam_wrist.jpg \

    --text "Pick up the red block." \

## MiniCPM-RobotTrack

MiniCPM-RobotTrack 是基于 MiniCPM4-0.5B 构建的用于具身目标跟踪的紧凑型视觉-语言-动作策略,具有以下亮点:

  • 质量驱动的自演化数据 pipeline:自动化检查和人工审核可移除异常轨迹、错误动作和无效交互,同时持续的模型-环境交互会添加高价值的训练样本。
  • 用于具身跟踪的 DAgger:在大规模通用场景中进行学习后,模型会与模拟器和真实机器人进行交互,以暴露在目标交叉、急转弯、短暂遮挡和多人相交等长尾案例中的失败情况。由专家策略或规则纠正的样本将被聚合到下一轮训练中,以不断提高跟踪和泛化能力。
  • 端到端 Go2 优化:跨越视觉捕获、输入编码、推理、动作生成、指令传输和执行的联合优化,在 Unitree Go2 的原生板载计算上实现了稳定在 5+ FPS 的速度,以及大约 180 ms 的端到端延迟。
  • 一键式 Go2 Edu 部署和启动:本地部署流程涵盖了环境设置、依赖项、模型加载、相机输入、文本指令、机器人控制,以及一键部署和启动的工作流,无需重建单独的感知、规划和控制栈,即可实现完全本地化、纯视觉的自然语言跟踪。
### 示例
Outdoor obstacle-aware target-tracking demo Elevator target-tracking demo Underground parking target-tracking demo
Outdoor Obstacle-aware Tracking Elevator Tracking Underground Parking Tracking
### EVT-Bench 结果

结果报告为 SR / TR / CR:成功率和跟踪率越高越好,而碰撞率越低越好。所有数值均为百分比。

方法 开放权重 模型大小 STT DT AT
SR ↑TR ↑CR ↓ SR ↑TR ↑CR ↓ SR ↑TR ↑CR ↓
TrackVLA 7.8B+ 85.178.61.7 57.663.25.8 50.263.717.1
TrackVLA++ 7.8B+ 86.081.02.1 66.568.84.7 51.263.415.9
Qwen-RobotNav 4.4B+ 77.490.06.4
OmTrackVLA 1.0B+ 81.482.85.1 41.558.811.3 60.073.97.6
MiniCPM-RobotTrack 0.9B 84.189.8>3.0 53.273.413.6 58.080.49.0

在上述开源的 checkpoint 中,MiniCPM-RobotTrack 获得了最优的 STT SR/TR/CR 和最优的 DT SR/TR。它还在使用 0.5B 骨干网络的 AT 上达到了 80.35 TR

### 快速开始 #### 1. 创建环境

首先安装并初始化 Conda。配置规范遵循已测试的 Python 3.9、Habitat-Sim 0.3.1、Bullet、PyTorch 2.4.1 和 CUDA 12.1 设置。

cd MiniCPM-RobotTrack

conda env create -f environment.yml

#### 2. 准备模拟器数据和资产

按照 Habitat-Sim 数据指南TrackVLA 资产指南下载 HM3D、MP3D、人类模型和机器人资产。 在项目的 data/ 目录下保留其原始目录结构。

data/

├── datasets/

├── scene_datasets/

├── humanoids/

### 数据准备

#### 1. 未处理的 rollout

每次 Habitat rollout 都会保留其视频、逐步模拟器状态和回合结果。 可运行的 sim_data/raw_sample 示例包含以下格式的逐步记录:

{

  "base_velocity": [0.62, 0.00, 0.02],

  "collision": false,

  "target_distance": 1.72,

  "human_center_norm": [0.50, 0.48]

#### 2. 生成轨迹数据

以下命令会保留成功的回合,提取 RGB 帧,并将未来的动作转换为用于微调的轨迹 JSONL:

cd MiniCPM-RobotTrack

python tools/make_tracking_data.py \

  --input_root sim_data/raw_sample \

  --output_root sim_data/train/stt \

  --only_success \

  --history 31 \

  --horizon 8 \

  --dt 0.1 \

对于完整的数据集,请将原始的 STT、DT 和 AT rollout 放在 sim_data/raw/<task> 下,并对每个任务运行相同的命令。

#### 3. 预缓存视觉特征
cd MiniCPM-RobotTrack

for task in stt dt at; do

  python tools/precompute_features.py \

    --json "sim_data/train/${task}/jsonl" \

    --data-root "sim_data/train/${task}" \

    --cache-root "sim_data/train/${task}/vision_cache"

处理后的输出包含 frames/jsonl/vision_cache/sim_data/sample 为 STT、DT 和 AT 各提供了两条处理后的记录,展示了最终的训练数据格式。

### 微调

在为所有三个任务准备好数据和视觉缓存后,运行公开的微调入口:

cd MiniCPM-RobotTrack

可以在 scripts/train.sh 中调整数据路径、batch size、学习率和 epoch 数量。

### 评估

将已发布的完整 Hugging Face 快照下载到 minicpm_robot_track/checkpoints/MiniCPM-RobotTrack/。它包含微调后的 MiniCPM4 骨干网络,并使用 Transformers 的 from_pretrained 加载。评估仍然需要 DINOv3 ViT-S/16 和 SigLIP So400m;现有的本地视觉模型目录可以通过环境变量进行选择:

export DINOV3_MODEL_PATH=/path/to/dinov3-vits16

在环境、模型和模拟器资产准备就绪后,运行每个任务的评估脚本:

cd MiniCPM-RobotTrack

CKPT=minicpm_robot_track/checkpoints/MiniCPM-RobotTrack

bash scripts/eval_stt.sh "$CKPT" results/stt

bash scripts/eval_dt.sh  "$CKPT" results/dt

每条命令会运行相应任务的评估。

### Go2 部署

真实机器人的工作流针对搭载 Jetson Orin NX 16GB 的 Unitree Go2 EDU。 已验证的栈为 Jetson Linux R36.5、CUDA 12.6、TensorRT 10.7、 Python 3.10、ROS 2 Humble 和 MAXN 模式 0。部署使用单独的 Jetson 依赖项,且默认为 dry-run,即绝不发送运动 指令。

Go2/D435i RGB -> TCP JPEG -> DINO + SigLIP TensorRT

完整设置使用 Go2 EDU、Orin NX 16GB 和 D435i。内置的 Go2 前置摄像头是默认经过验证的来源;每次安装都必须分别验证 D435i RGB 路径。详细的硬件参数、网络设置、 资产下载说明、刷机说明和实时控制程序均保存在部署文档中:

#### 快速开始

以下步骤假设 JetPack 6 和载板补丁已经安装完毕:

openbmb/MiniCPM-RobotTrack 手动下载 checkpoint。 在运行飞行前检查之前,将完整的 Hugging Face 快照,包含自定义模型代码、 tokenizer 文件和 model.safetensors,放置在 MiniCPM-RobotTrack/minicpm_robot_track/checkpoints/MiniCPM-RobotTrack/ 中。

cd MiniCPM-RobotTrack



python3 scripts/download_upstream_assets.py



python3 -m pip install --user -r requirements-build.txt

./scripts/export_onnx.sh



sudo nvpmodel -m 0

sudo jetson_clocks

./scripts/build_engines.sh



./scripts/preflight.sh

状态查询与关闭:

cd MiniCPM-RobotTrack

./go2_runtime.py status

./go2_runtime.py stop-control



## 模型库

| 模型 | 描述 | 下载 |

| --- | --- | --- |

| MiniCPM-RobotManip | 用于机器人操作的 1.5B 视觉-语言-动作模型 | [🤗](https://huggingface.co/openbmb/MiniCPM-RobotManip) |

| MiniCPM-RobotTrack | 用于目标跟踪的 0.9B 视觉-语言-动作模型 | [🤗](https://huggingface.co/openbmb/MiniCPM-RobotTrack) |

## 许可证

模型权重和代码在 [Apache-2.0](./LICENSE) 许可证下开源。

## 致谢

MiniCPM-Robot 基于并参考了 MiniCPM、 starVLALeRobot、 DINOv3、SigLIP、Habitat-Lab、Habitat-Sim、EVT-Bench 和 TrackVLA。 我们感谢作者和社区的开源贡献。 第三方模型、模拟器代码、数据集和资产保留其各自的许可证;请参见 THIRD_PARTY_NOTICES.md

标签:IaC 扫描, MiniCPM, Vectored Exception Handling, 人工智能, 具身智能, 凭据扫描, 大模型, 机器人, 用户模式Hook绕过, 端侧AI, 逆向工具