trgysvc/AgentTestMethodology
GitHub: trgysvc/AgentTestMethodology
一套与框架无关的 AI Agent 测试方法论,提供分层通用测试模块、行业基准地图、安全分类映射和可观测性指南,帮助开发者系统性地评估和验证 Agent 能力。
Stars: 0 | Forks: 0
# AgentTestMethodology
**通用 AI Agent 测试方法论 —— 以 PheronAgent 为参考案例研究**
版本 7 · 2026-07-14
## 这是什么
这是一个与框架无关、与架构无关的测试方法论和测试集,任何 Agent 开发者都可以直接将其应用到自己的项目中 —— 无论使用何种语言、runtime 或工具集。
主要文档以两种语言存在:`METHODOLOGY.md`(英文)和 `METHODOLOGY_TR.md`(土耳其语,原始版本 —— 这也是该方法论实际诞生的地方;参见 `STORY.md`)。两者均分为五个层级进行组织:
| 层级 | 内容 |
|---|---|
| **第一部分** | 行业基准地图 —— 61 个学术和行业来源的衡量标准,以及如何使用它们 |
| **第二部分** | 通用测试集 —— 58 个核心模块(L1–L4 / 错误恢复 / 多轮对话 / 安全),每个模块拆分为与工具无关的*通用能力*定义和具体的*参考实现* |
| **第三至四部分、第六部分** | PheronAgent 案例研究 —— 该方法论如何应用于一个拥有 50 多个原生/MCP 工具的真实 Agent(阅读以作参考;请勿照抄) |
| **第五部分** | 高级可验证性路线图 —— 密码学执行证明、基于 ZKP 的模型验证、防刷分协议(明确标记为展望性/尚未实现) |
| **第七至九部分** | 审计跟踪 —— 待解决问题、对账日志、包含每项外部声明验证状态的完整参考书目 |
**PheronAgent 只是一个案例研究。该方法论才是核心产物。**
## 快速开始
**要为您自己的 Agent 构建测试集:**
→ 参见第二部分,第 4–10 节。将“PheronAgent Reference Implementation”字段替换为您自己 Agent 的工具名称和预期输出。通用能力定义无需更改。
**要了解应该引用哪些基准:**
→ 参见第一部分(61 个基准/标准/工具,已分类)+ 第九部分参考书目。
**获取空白的项目中立模板:**
→ `templates/golden_dataset.template.json` 和 `templates/BLANK_TEST_BLOCK.template.md`
**审查本文档自身的声明:**
→ 参见第七至九部分 —— 检测到的不一致之处、解决记录,以及每项外部引用的验证状态。
**了解这一切是如何诞生的:**
→ `STORY.md` —— 真实的多周过程:在运行的 Agent 中发现的真实 bug、真实的测试运行、真实的修正。不是营销叙事。
## 覆盖范围
### 基准分类(第一部分)
- **函数调用 / 工具使用** — BFCL, API-Bank, ToolBench, NESTFUL, ToolSandbox, ComplexFuncBench, ACEBench, StableToolBench, MetaTool
- **多步推理** — GAIA, AgentBench, τ-bench, τ²-bench(双控、用户模拟器)
- **Web / 浏览器** — WebArena, Mind2Web, WebVoyager, BrowserGym, VisualWebArena, AssistantBench
- **OS / 桌面 / 终端** — OSWorld, AndroidWorld, Windows Agent Arena, Terminal-Bench
- **软件工程** — SWE-bench, SWE-Lancer, MLE-bench
- **安全 / 对抗** — InjecAgent, AgentDojo, AgentHarm, ToolEmu, R-Judge, SafeAgentBench, PrivacyLens, ST-WebAgentBench, Cybench + OWASP Top 10 for Agentic Applications 2026 (ASI01–ASI10) 完整分类体系
- **记忆 / 长上下文** — LongMemEval, LoCoMo, BEAM(1M 和 10M token 规模)
- **测试框架生态** — OpenClaw/Hermes, WildClawBench, HAL, CLEAR
### 方法论章节(第一部分,第 9 节)
| 章节 | 主题 |
|---|---|
| 9.1 | LLM-as-Judge —— 已知偏差和缓解策略 |
| 9.2 | pass@k 与 pass^k —— 各自的适用场景,实用坍缩表 |
| 9.3 | 精确匹配与部分得分 |
| 9.4 | 轨迹与终态评估 |
| 9.5 | 成本和延迟指标(CLEAR 框架,HAL 排行榜方法) |
| 9.6 | 生产环境可观测性 —— OpenTelemetry GenAI 语义约定,LangSmith / Arize Phoenix / Langfuse / W&B Weave |
| 9.7 | 评估框架选择指南 |
| 9.8 | 自动化红队测试 —— garak, PyRIT, DeepTeam |
| 9.9 | 基准可靠性与防刷分 |
| 9.10 | 多 Agent 系统测试 |
| 9.11 | 监管合规映射 —— NIST AI RMF, MITRE ATLAS, EU AI Act, ISO/IEC 42001 |
### 安全覆盖(第一部分,第 6.11–6.12 节)
包含 OWASP Top 10 for Agentic Applications 2026 (ASI01–ASI10) 的完整分类体系表,并与第二部分中的 6 个通用安全测试模块进行了交叉映射。包括 OWASP MCP Top 10 和 MCP 供应链安全方法论(第 8.5 节),外加对 2023 年 4 月至 2026 年 3 月期间发布的 40 个 Agent 安全基准的覆盖范围控制调查 (arXiv:2605.16282)。
### 测试集(第二部分)
跨越 7 个层级的 58 个通用核心模块:
| 层级 | 模块数 | 重点 |
|---|---|---|
| L1 基础 | 21 | 路由、工具选择、参数准确性 |
| L2 中级 | 11 | 链式工具调用、上下文继承 |
| L3 高级 | 7 | 嵌套输出传递、长周期规划 |
| L4 专业 | 5 | 实时推理、生产级任务 |
| 错误恢复 | 4 | 优雅失败、重试逻辑 |
| 多轮对话 | 4 | 策略一致性、会话记忆 |
| 安全 | 6 | 注入、权限提升、数据泄露 |
每个模块都指定了:前置层级、测试类型、输入提示、预期行为(通用)、验收标准、拒绝标准,以及一个用于对比的 PheronAgent 参考运行。
## 仓库结构
```
AgentTestMethodology/
├── METHODOLOGY.md # Primary document, English (v7, ~5750 lines)
├── METHODOLOGY_TR.md # Primary document, Turkish original (v7, ~5700 lines)
├── STORY.md # How this methodology actually came to be
├── README.md # This file
├── LICENSE # MIT — templates and code
├── LICENSE-docs.md # CC BY 4.0 — documentation and methodology
├── CHANGELOG.md # Version-by-version history
├── templates/
│ ├── BLANK_TEST_BLOCK.template.md # Empty test block — fill in for your agent
│ └── golden_dataset.template.json # Golden dataset schema
└── results/
└── PheronAgent/
├── README.md # What this folder contains
├── datasets/ # Filled-in golden-dataset examples (seed + smoke)
└── run_qwen3.5-9b_*.{md,jsonl} # 32 real result files, Section 2.7 naming — see folder README
```
## 复用
**文档和方法论**(METHODOLOGY.md, METHODOLOGY_TR.md, README.md,所有 `.md` 内容):[CC BY 4.0](LICENSE-docs.md) —— 在署名的前提下可自由使用、改编和分发。
**模板和代码**(`templates/`,任何脚本):[MIT](LICENSE) —— 无限制。
署名示例:*"基于 AgentTestMethodology,作者 Turgay Soysol (github.com/trgysvc/AgentTestMethodology),CC BY 4.0"*
## 范围与诚实的局限性
本文档做出以下声明 —— 且仅限以下声明:
- 第二部分中的 58 个通用测试模块可直接应用于任何 Agent 架构。
- 第一部分中的基准描述反映了已发布的学术和行业来源;每项外部声明都有引用,并在第九部分带有验证状态。
- PheronAgent 的结果反映了声明所在处的实际测试运行;标记为 "EXECUTION PENDING" 的部分尚未运行。
- 第五部分(密码学可验证性路线图)明确属于展望性质 —— 尚未实现,也未计划在近期实现,仅用于社区讨论。
本文档**未**声明的内容:它涵盖了所有可能的 Agent 评估场景;PheronAgent 的结果无需调整即可在其他硬件上复现;或者第一部分中的任何基准分数都适用于你的 Agent 而无需你自己运行。
## 版本历史
请参阅 [`CHANGELOG.md`](CHANGELOG.md) 获取完整的逐版历史(目前处于版本 7)。关于每个版本*为何*做出特定修改背后的故事 —— 包括导致这些修改的真实 bug 和死胡同 —— 请参阅 [`STORY.md`](STORY.md)。
标签:AI安全, AI智能体, Chat Copilot, Homebrew安装, 人工智能, 测试评估, 用户代理, 用户模式Hook绕过, 红队评估, 防御加固