harbor-framework/harbor

GitHub: harbor-framework/harbor

Harbor 是一个用于评估和优化 AI agent 与语言模型的开源框架,支持在本地或云端并行运行多种基准测试并生成强化学习训练数据。

Stars: 3669 | Forks: 1435

# Harbor Harbor 是由 [Terminal-Bench](https://www.tbench.ai) 的创建者开发的一个框架,用于评估和优化 agent 与语言模型。你可以使用 Harbor 来: - 评估任意 agent,如 Claude Code、OpenHands、Codex CLI 等。 - 构建并分享你自己的 benchmark 与环境。 - 通过 Daytona、Modal、LangSmith、Blaxel 和 Novita Sandbox 等 provider,在数千个环境中并行进行实验。 - 为 RL 优化生成 rollout。 请查看 [Harbor Cookbook](https://github.com/harbor-framework/harbor-cookbook) 以获取端到端的示例和指南。 ## 安装说明 ``` uv tool install harbor ``` 或者 ``` pip install harbor ``` ## 示例:运行 Terminal-Bench-2.0 Harbor 是 [Terminal-Bench-2.0](https://github.com/laude-institute/terminal-bench-2) 的官方测试套件: ``` export ANTHROPIC_API_KEY= harbor run --dataset terminal-bench@2.0 \ --agent claude-code \ --model anthropic/claude-opus-4-1 \ --n-concurrent 4 ``` 这将使用 Docker 在本地启动 benchmark。要在云 provider(如 Daytona)上运行它,请按如下方式传入 `--env` 标志: ``` export ANTHROPIC_API_KEY= export DAYTONA_API_KEY= harbor run --dataset terminal-bench@2.0 \ --agent claude-code \ --model anthropic/claude-opus-4-1 \ --n-concurrent 100 \ --env daytona ``` 要查看所有支持的 agent 及其他选项,请运行: ``` harbor run --help ``` 要探索所有支持的第三方 benchmark(如 SWE-Bench 和 Aider Polyglot),请运行: ``` harbor datasets list ``` 要评估这些数据集之一中的 agent 和模型,你可以使用以下命令: ``` harbor run -d "" -m "" -a "" ``` ## 引用 如果你在学术工作中使用了 **Harbor**,请使用 GitHub 上的 “Cite this repository” 按钮或以下 BibTeX 条目对其进行引用: ``` @software{Harbor_Framework, author = {{Harbor Framework Team}}, title = {{Harbor: A framework for evaluating and optimizing agents and models in container environments}}, year = {2026}, version = {v0.16.1}, doi = {10.5281/zenodo.20953922}, url = {https://doi.org/10.5281/zenodo.20953922} } ``` 上面的 DOI 是 **概念 DOI**,它始终指向最新版本并汇总所有版本的引用。如果要引用特定版本,请使用 [Zenodo record](https://doi.org/10.5281/zenodo.20953922) 中该版本的 DOI。
标签:AI智能体, DLL 劫持, 人工智能, 大语言模型, 强化学习, 用户模式Hook绕过, 评估框架, 请求拦截, 逆向工具