xorcise-ai/xorcise
GitHub: xorcise-ai/xorcise
一个网络安全 AI agent 评估平台,在隔离的漏洞靶标环境中运行 agent 并通过 OpenTelemetry 证据对其真实行为进行评分,而非仅看任务完成结果。
Stars: 0 | Forks: 0
快速开始 ·
输出 ·
Agents ·
任务 ·
开源 ·
官网 ·
文档 ·
贡献 ·
安全
**在真实任务中运行你的 cyber-AI agent。监控它的每一步操作。对证据进行评分。**
基准测试分数只能告诉你 agent 是否完成了任务,却无法说明它在过程中尝试过哪些
破坏性的命令。XORCISE 在一个隔离的环境中针对活动目标运行 agent,将每一个命令、
工具调用和死胡同记录为 OpenTelemetry 证据,并根据任务自身的标准对证据进行评分。
信任不是口头声明的,而是通过实践证明的。
## 快速开始
已在 Ubuntu 上测试。需要 **Python 3.12+** 和 **Docker Engine**。
```
pip install xorcise
xorcise up # boots the stack, prints the console URL
```
```
xorcise agent register --name my-agent
xorcise mission list
xorcise run create --agent my-agent --mission demo
xorcise run prompt
# the ready-to-paste connect prompt
xorcise run status # score, breakdown, evidence
```
`xorcise doctor` 会首先检查宿主机。`xorcise down` 会停止所有进程。机器上没有 Docker?
`xorcise up --stub` 提供了独立的演示。`xorcise --help` 包含了其余的命令信息,
[docs.xorcise.ai](https://docs.xorcise.ai) 则完整介绍了首次运行的端到端流程。
更倾向于从源码开始?请参阅 [贡献 → 设置](CONTRIBUTING.md#setup)。
## 输出
| | |
|---|---|
| **实时 trace** | 发生时即时流式传输到控制台的每一个命令、工具调用和消息 |
| **评分** | 确定性检查加上自选模型(bring-your-own-model)的评判 |
| **报告** | 可导出的完整运行记录 — Markdown、HTML、JSONL |
| **排行榜** | 根据记录结果排名的 agents |
每次运行都会获得一个专属的私有网络和一个全新的环境,该环境为本次运行而创建,
并在运行结束后销毁。受评估的 agent 无法访问宿主机,也无法访问其他运行环境。
## 接入你的 agent
XORCISE 用于评估你正在使用的 agent。
| | |
|---|---|
| **OpenHands** | 完整的 trace + 工具调用捕获 |
| **Claude Code** | 通过 OTLP 遥测 |
| **Codex CLI** | 通过 OTLP 遥测 |
| **任何自定义项** | 注册它,使用连接提示词驱动它,通过 REST 提交 |
所有活动都会被标准化为统一的事件模型,因此无论由哪个 harness 产生运行,trace、评分和报告的呈现方式都是一致的。
## 任务
**任务(mission)** 是一个独立的靶标:包含服务、网络以及用于对 agent 进行评分的标准。它们被打包为 bundles,可按需拉取。
任务是**故意设计为存在漏洞的** — SQL 注入、IDOR、网络枢纽。这正是关键所在:它们的存在是为了让 agent 能够找到真实的内容。
## 开源
XORCISE 将分模块而非整体开源。本仓库是核心引擎 — 包含 CLI、harness
适配器、隔离环境、评分和控制台 — 采用 Apache-2.0 许可证,并开放 issue 和 pull request。
该评估技术是开源的。但商业层 — 托管部署、runtime、
命令控制以及私有化托管 — 则不开源。Agent 技能和文档源码将在准备就绪后单独发布。
## 文档与帮助
| | |
|---|---|
| [xorcise.ai](https://xorcise.ai) | 项目官网 — XORCISE 是什么以及它的受众是谁 |
| [文档](https://docs.xorcise.ai) | 首次运行、任务、评分、trace、完整的 CLI 和 API 参考 |
| [贡献](CONTRIBUTING.md) | 开发设置、测试通道、PR 流程、版本控制 |
| [安全](SECURITY.md) | 涵盖范围,以及如何私下报告漏洞 |
| [维护者](MAINTAINERS.md) · [行为准则](CODE_OF_CONDUCT.md) | 该问谁,以及我们如何工作 |
发现漏洞?**请不要公开提出 issue** — [私下报告](SECURITY.md)。
Harness、隔离边界或供应链中的缺陷在受理范围内;任务内部的缺陷则属于评估内容本身。
## 许可证
[Apache-2.0](LICENSE) © The XORCISE Authors
XORCISE.AI — 相信证据,而非声明。
标签:AI智能体, Python, 反取证, 安全评估, 无后门, 沙箱环境, 用户代理, 网络安全, 请求拦截, 逆向工具, 遥测审计, 隐私保护