harbor-framework/harbor
GitHub: harbor-framework/harbor
Harbor 是一个用于评估和优化 AI agent 与语言模型的开源框架,支持在本地或云端并行运行多种基准测试并生成强化学习训练数据。
Stars: 3669 | Forks: 1435
# Harbor
Harbor 是由 [Terminal-Bench](https://www.tbench.ai) 的创建者开发的一个框架,用于评估和优化 agent 与语言模型。你可以使用 Harbor 来:
- 评估任意 agent,如 Claude Code、OpenHands、Codex CLI 等。
- 构建并分享你自己的 benchmark 与环境。
- 通过 Daytona、Modal、LangSmith、Blaxel 和 Novita Sandbox 等 provider,在数千个环境中并行进行实验。
- 为 RL 优化生成 rollout。
请查看 [Harbor Cookbook](https://github.com/harbor-framework/harbor-cookbook) 以获取端到端的示例和指南。
## 安装说明
```
uv tool install harbor
```
或者
```
pip install harbor
```
## 示例:运行 Terminal-Bench-2.0
Harbor 是 [Terminal-Bench-2.0](https://github.com/laude-institute/terminal-bench-2) 的官方测试套件:
```
export ANTHROPIC_API_KEY=
harbor run --dataset terminal-bench@2.0 \
--agent claude-code \
--model anthropic/claude-opus-4-1 \
--n-concurrent 4
```
这将使用 Docker 在本地启动 benchmark。要在云 provider(如 Daytona)上运行它,请按如下方式传入 `--env` 标志:
```
export ANTHROPIC_API_KEY=
export DAYTONA_API_KEY=
harbor run --dataset terminal-bench@2.0 \
--agent claude-code \
--model anthropic/claude-opus-4-1 \
--n-concurrent 100 \
--env daytona
```
要查看所有支持的 agent 及其他选项,请运行:
```
harbor run --help
```
要探索所有支持的第三方 benchmark(如 SWE-Bench 和 Aider Polyglot),请运行:
```
harbor datasets list
```
要评估这些数据集之一中的 agent 和模型,你可以使用以下命令:
```
harbor run -d "" -m "" -a ""
```
## 引用
如果你在学术工作中使用了 **Harbor**,请使用 GitHub 上的 “Cite this repository” 按钮或以下 BibTeX 条目对其进行引用:
```
@software{Harbor_Framework,
author = {{Harbor Framework Team}},
title = {{Harbor: A framework for evaluating and optimizing agents and models in container environments}},
year = {2026},
version = {v0.16.1},
doi = {10.5281/zenodo.20953922},
url = {https://doi.org/10.5281/zenodo.20953922}
}
```
上面的 DOI 是 **概念 DOI**,它始终指向最新版本并汇总所有版本的引用。如果要引用特定版本,请使用 [Zenodo record](https://doi.org/10.5281/zenodo.20953922) 中该版本的 DOI。
标签:AI智能体, DLL 劫持, 人工智能, 大语言模型, 强化学习, 用户模式Hook绕过, 评估框架, 请求拦截, 逆向工具