itsual/agent-assurance-lab

GitHub: itsual/agent-assurance-lab

为生产级 AI Agent 提供基于证据的多维度评估与风险分级发布门禁,支持单 Agent、多 Agent 及 MCP 工具场景。

Stars: 0 | Forks: 0

# Agent Assurance Lab **为生产级 AI agent 提供基于证据的评估与发布门禁** 单 agent · 多 agent · MCP 工具 · 红队韧性 风险分级硬门禁 · 净编排收益 [![Python 3.10+](https://img.shields.io/badge/python-3.10+-blue.svg)](https://www.python.org/downloads/) [![License: MIT](https://img.shields.io/badge/License-MIT-yellow.svg)](https://opensource.org/licenses/MIT) ## 快速开始 ``` pip install -e . agentassure evaluate examples/run_records.jsonl -o report.json ``` ## 功能特性 - 针对不同模式的评分卡(有效性、可靠性、安全性、效率、可控性) - 硬安全门禁 —— 无论平均分如何,发生严重 / 高危违规将**阻止**发布 - 风险层级 1 / 2 / 3,对应目标分为 75 / 82 / 88 - 面向多 agent 系统的**净编排收益** ### 净编排收益 ``` Net orchestration benefit = Δ task effectiveness − 0.50 × cost-efficiency loss − 0.50 × latency-efficiency loss ``` 正值表示多 agent 系统在扣除协调成本后创造了净价值。 要求多 agent 记录中包含 `baseline_task_success`(或 `single_agent_task_success`)。 ## 证据契约 每行一个 JSON 对象(JSONL)。参见 `examples/run_records.jsonl`。 包含单 agent 基线的多 agent 记录将自动在评分卡中收到一个 `net_orchestration_benefit` 字段。 ## 推荐值含义 | 推荐值 | 含义 | |----------------|---------| | `RELEASE_CANDIDATE` | 达到层级目标且无硬安全违规 | | `CONDITIONAL` | 低于目标 —— 需修复并重新测试 | | `BLOCKED` | 发生严重或高危的安全 / 授权违规 | ## 许可证 MIT
标签:AI评估, LLMOps, Python, 人工智能, 反取证, 安全评估, 文档结构分析, 无后门, 时序数据库, 用户模式Hook绕过, 逆向工具