trgysvc/AgentTestMethodology

GitHub: trgysvc/AgentTestMethodology

一套与框架无关的 AI Agent 测试方法论,提供分层通用测试模块、行业基准地图、安全分类映射和可观测性指南,帮助开发者系统性地评估和验证 Agent 能力。

Stars: 0 | Forks: 0

# AgentTestMethodology **通用 AI Agent 测试方法论 —— 以 PheronAgent 为参考案例研究** 版本 7 · 2026-07-14 ## 这是什么 这是一个与框架无关、与架构无关的测试方法论和测试集,任何 Agent 开发者都可以直接将其应用到自己的项目中 —— 无论使用何种语言、runtime 或工具集。 主要文档以两种语言存在:`METHODOLOGY.md`(英文)和 `METHODOLOGY_TR.md`(土耳其语,原始版本 —— 这也是该方法论实际诞生的地方;参见 `STORY.md`)。两者均分为五个层级进行组织: | 层级 | 内容 | |---|---| | **第一部分** | 行业基准地图 —— 61 个学术和行业来源的衡量标准,以及如何使用它们 | | **第二部分** | 通用测试集 —— 58 个核心模块(L1–L4 / 错误恢复 / 多轮对话 / 安全),每个模块拆分为与工具无关的*通用能力*定义和具体的*参考实现* | | **第三至四部分、第六部分** | PheronAgent 案例研究 —— 该方法论如何应用于一个拥有 50 多个原生/MCP 工具的真实 Agent(阅读以作参考;请勿照抄) | | **第五部分** | 高级可验证性路线图 —— 密码学执行证明、基于 ZKP 的模型验证、防刷分协议(明确标记为展望性/尚未实现) | | **第七至九部分** | 审计跟踪 —— 待解决问题、对账日志、包含每项外部声明验证状态的完整参考书目 | **PheronAgent 只是一个案例研究。该方法论才是核心产物。** ## 快速开始 **要为您自己的 Agent 构建测试集:** → 参见第二部分,第 4–10 节。将“PheronAgent Reference Implementation”字段替换为您自己 Agent 的工具名称和预期输出。通用能力定义无需更改。 **要了解应该引用哪些基准:** → 参见第一部分(61 个基准/标准/工具,已分类)+ 第九部分参考书目。 **获取空白的项目中立模板:** → `templates/golden_dataset.template.json` 和 `templates/BLANK_TEST_BLOCK.template.md` **审查本文档自身的声明:** → 参见第七至九部分 —— 检测到的不一致之处、解决记录,以及每项外部引用的验证状态。 **了解这一切是如何诞生的:** → `STORY.md` —— 真实的多周过程:在运行的 Agent 中发现的真实 bug、真实的测试运行、真实的修正。不是营销叙事。 ## 覆盖范围 ### 基准分类(第一部分) - **函数调用 / 工具使用** — BFCL, API-Bank, ToolBench, NESTFUL, ToolSandbox, ComplexFuncBench, ACEBench, StableToolBench, MetaTool - **多步推理** — GAIA, AgentBench, τ-bench, τ²-bench(双控、用户模拟器) - **Web / 浏览器** — WebArena, Mind2Web, WebVoyager, BrowserGym, VisualWebArena, AssistantBench - **OS / 桌面 / 终端** — OSWorld, AndroidWorld, Windows Agent Arena, Terminal-Bench - **软件工程** — SWE-bench, SWE-Lancer, MLE-bench - **安全 / 对抗** — InjecAgent, AgentDojo, AgentHarm, ToolEmu, R-Judge, SafeAgentBench, PrivacyLens, ST-WebAgentBench, Cybench + OWASP Top 10 for Agentic Applications 2026 (ASI01–ASI10) 完整分类体系 - **记忆 / 长上下文** — LongMemEval, LoCoMo, BEAM(1M 和 10M token 规模) - **测试框架生态** — OpenClaw/Hermes, WildClawBench, HAL, CLEAR ### 方法论章节(第一部分,第 9 节) | 章节 | 主题 | |---|---| | 9.1 | LLM-as-Judge —— 已知偏差和缓解策略 | | 9.2 | pass@k 与 pass^k —— 各自的适用场景,实用坍缩表 | | 9.3 | 精确匹配与部分得分 | | 9.4 | 轨迹与终态评估 | | 9.5 | 成本和延迟指标(CLEAR 框架,HAL 排行榜方法) | | 9.6 | 生产环境可观测性 —— OpenTelemetry GenAI 语义约定,LangSmith / Arize Phoenix / Langfuse / W&B Weave | | 9.7 | 评估框架选择指南 | | 9.8 | 自动化红队测试 —— garak, PyRIT, DeepTeam | | 9.9 | 基准可靠性与防刷分 | | 9.10 | 多 Agent 系统测试 | | 9.11 | 监管合规映射 —— NIST AI RMF, MITRE ATLAS, EU AI Act, ISO/IEC 42001 | ### 安全覆盖(第一部分,第 6.11–6.12 节) 包含 OWASP Top 10 for Agentic Applications 2026 (ASI01–ASI10) 的完整分类体系表,并与第二部分中的 6 个通用安全测试模块进行了交叉映射。包括 OWASP MCP Top 10 和 MCP 供应链安全方法论(第 8.5 节),外加对 2023 年 4 月至 2026 年 3 月期间发布的 40 个 Agent 安全基准的覆盖范围控制调查 (arXiv:2605.16282)。 ### 测试集(第二部分) 跨越 7 个层级的 58 个通用核心模块: | 层级 | 模块数 | 重点 | |---|---|---| | L1 基础 | 21 | 路由、工具选择、参数准确性 | | L2 中级 | 11 | 链式工具调用、上下文继承 | | L3 高级 | 7 | 嵌套输出传递、长周期规划 | | L4 专业 | 5 | 实时推理、生产级任务 | | 错误恢复 | 4 | 优雅失败、重试逻辑 | | 多轮对话 | 4 | 策略一致性、会话记忆 | | 安全 | 6 | 注入、权限提升、数据泄露 | 每个模块都指定了:前置层级、测试类型、输入提示、预期行为(通用)、验收标准、拒绝标准,以及一个用于对比的 PheronAgent 参考运行。 ## 仓库结构 ``` AgentTestMethodology/ ├── METHODOLOGY.md # Primary document, English (v7, ~5750 lines) ├── METHODOLOGY_TR.md # Primary document, Turkish original (v7, ~5700 lines) ├── STORY.md # How this methodology actually came to be ├── README.md # This file ├── LICENSE # MIT — templates and code ├── LICENSE-docs.md # CC BY 4.0 — documentation and methodology ├── CHANGELOG.md # Version-by-version history ├── templates/ │ ├── BLANK_TEST_BLOCK.template.md # Empty test block — fill in for your agent │ └── golden_dataset.template.json # Golden dataset schema └── results/ └── PheronAgent/ ├── README.md # What this folder contains ├── datasets/ # Filled-in golden-dataset examples (seed + smoke) └── run_qwen3.5-9b_*.{md,jsonl} # 32 real result files, Section 2.7 naming — see folder README ``` ## 复用 **文档和方法论**(METHODOLOGY.md, METHODOLOGY_TR.md, README.md,所有 `.md` 内容):[CC BY 4.0](LICENSE-docs.md) —— 在署名的前提下可自由使用、改编和分发。 **模板和代码**(`templates/`,任何脚本):[MIT](LICENSE) —— 无限制。 署名示例:*"基于 AgentTestMethodology,作者 Turgay Soysol (github.com/trgysvc/AgentTestMethodology),CC BY 4.0"* ## 范围与诚实的局限性 本文档做出以下声明 —— 且仅限以下声明: - 第二部分中的 58 个通用测试模块可直接应用于任何 Agent 架构。 - 第一部分中的基准描述反映了已发布的学术和行业来源;每项外部声明都有引用,并在第九部分带有验证状态。 - PheronAgent 的结果反映了声明所在处的实际测试运行;标记为 "EXECUTION PENDING" 的部分尚未运行。 - 第五部分(密码学可验证性路线图)明确属于展望性质 —— 尚未实现,也未计划在近期实现,仅用于社区讨论。 本文档**未**声明的内容:它涵盖了所有可能的 Agent 评估场景;PheronAgent 的结果无需调整即可在其他硬件上复现;或者第一部分中的任何基准分数都适用于你的 Agent 而无需你自己运行。 ## 版本历史 请参阅 [`CHANGELOG.md`](CHANGELOG.md) 获取完整的逐版历史(目前处于版本 7)。关于每个版本*为何*做出特定修改背后的故事 —— 包括导致这些修改的真实 bug 和死胡同 —— 请参阅 [`STORY.md`](STORY.md)。
标签:AI安全, AI智能体, Chat Copilot, Homebrew安装, 人工智能, 测试评估, 用户代理, 用户模式Hook绕过, 红队评估, 防御加固