eddo-cto/adversarial-audit-engine
GitHub: eddo-cto/adversarial-audit-engine
一个五层对抗性审计引擎,通过确定性Python核心和多供应商独立视角对各类制品进行严格证伪,最终判定权始终保留在人类专家手中。
Stars: 1 | Forks: 0
[](https://doi.org/10.5281/zenodo.21288401)
# 对抗性审计引擎
**[阅读故事——了解它是如何在七个对抗性轮次中被构建和加固的](STORY.md)**
**状态:研究预览版 (v0.8.0)。** 经过了七个对抗性轮次以及
真实案例(共识协议、事件 RCA、威胁建模、多重法规
冲突、科学同行评审)的测试。它不是神谕:它是一个
*放大*胜任的人类审查员能力的工具——它不能替代人类。
**v0.8.0** 添加了**抗偏纵向指标**(`aae/run_metrics.py`,
`run_core.py --metrics`):一组*正交的*比率,**没有单一的综合
得分**(避免 Goodhart 效应),其中**弃权绝不被计为成功**,并且
*escape/precision/recall* 仅在拥有**人类 ground truth** 时才报告(否则
为 `n/d`,绝不填补为 0)。`bias_audit()` 会主动标记退化的特征
(橡皮图章、全部弃权、过度谴责)——这是应用于指标本身的
元治理器。已通过六项对抗性偏差测试验证。
**v0.7.0** 添加了确定性的**反幻觉接地门**
(`aae/grounding.py`):一项发现只能基于在源文件中*逐字*
存在的引文进行谴责;捏造或改写的引言会被可靠地降级为“必须
由人类阅读”。它本身在三个专门的
对抗性轮次中被破坏并加固,它所保证和不保证的内容都得到了精确陈述:
- **保证(确定性):** *存在性* —— 没有捏造或篡改的引文可以
进行谴责;以及 *召回稳健性* —— PDF 噪音(连字符、零宽字符、
弯引号)在 1,407 个真实跨度上产生了 **0 次假阴性**。
- **尽力而为,不提供保证:** *断章取义 / 引文采矿* —— 从否定从句中提取的
真实子字符串会被保守的
句子范围检查标记,该检查能捕捉大多数但非全部此类情况(测试中约为 3/4)。残余部分是不可减少的**语义**
限制,我们选择声明而非伪装;含义由人类验证。该检查会产生约 6% 的过度标记成本
(合法发现被交由人工处理)——这是安全的方向。
配套的**法律 oracle**(`aae/legal_oracle.py`)按需检查所引用的
规范是否*存在*并得到了忠实的表达——从不涉及其解释,也绝不
来自模型记忆。
## 它做什么(和不做什么)
给定一个 artifact —— spec、论文、模型、分析、代码 —— 引擎
部署盲测角色,从不同角度对其进行攻击并寻找其缺陷,
**为每项指控首先尝试最强有力的辩护**(defense-gate),
这将使假阳性率趋近于零。一个 *pattern* 可以标记但绝不会谴责:
只有阅读或执行才能进行谴责。
它不承诺真相。它承诺**严谨的证伪**:它要么
找到可证明的缺陷,要么诚实地声明它无法在内部做出决定
并将该案例交由人类专家处理。
## 核心原则
来自同一模型的 agent 共享相同的盲点。因此引擎绝不
自我认证:
| 独立性级别 | 审查者 | 可能的最佳判定 |
|---|---|---|
| 1 — 同一实例,不同角色 | 同一模型 | 自我证伪,*未*验证 |
| 2 — 不同模型,同一供应商 | — | 减少了保留意见 |
| 3 — **不同供应商** | 例如另一家提供商 | `CROSS_MODEL_REVIEWED`(可靠性 ↑,**未**验证) |
| 4 — **人类专家** | 胜任的个人 | `VALIDATED` |
独立的视野可以运行在不同的供应商上(包含适配器),但它
仍然是机器:级别 4 —— 人类 —— 是唯一提供验证的实例。
## 5 个层级
1. **Destruens** —— 逐点验证 + *非局部*缺陷的传播
(在一个地方被打破的前提会使其他地方的保证失效)。
2. **Construens** —— 带有反向 defense-gate 的缺失原因诊断。
3. **Generative** —— 演绎 → 归纳 → **溯因**(对立假设)。
4. **Deep-causal** —— 根聚类,前后交叉,门控场景。
5. **Meta-epistemic governor** —— 验证验证器(偏差、覆盖率、
独立性、“表观一致性”)。它不自我认证:它在
人类处终止。
## 混合架构
Claude Code / Cowork 编排角色(agent)和工具;
**确定性核心**(`aae/`,捆绑)在 *code* 中强制执行判定状态
机、defense-gate、按维度的覆盖率、去重、指标和
governor。LLM 提供语义;代码执行纪律。
## 安装 (Claude Code)
```
/plugin marketplace add
/plugin install adversarial-audit-engine
```
然后,在你想要审计的项目内部:
```
/audit
```
Python 核心仅在**标准库**上运行(无依赖项)。
跨供应商的独立视角需要所选提供商的凭证,
并在*你的*机器上进行配置。
## 声明的限制(方法诚实性)
- 它不替代专家:没有级别 4,判定将保持“未验证”。
- “标尺”(ground truth)可能是错误的:引擎将其视为易出错的。
- 覆盖率是*按缺陷类别*的,而非全局的:某些类别(例如真正新颖的
非局部概念)在设计上即交由人类处理。
- 它是一个研究预览版:将其用作决策支持,而不是最终权威。
## 文档
- `plugins/adversarial-audit-engine/ARCHITETTURA_confini.md` —— 角色边界和
契约(意大利语)。
- 另请参见项目中的架构文档和每轮判定。
## License & 免责声明
MIT(见 `LICENSE`)。参见 `DISCLAIMER.md`:软件按“原样”提供,不附带任何
保证;它不是专业建议(法律、财务、医疗)。其输出
必须始终由胜任的人士验证
## 0.10.0 —— 否定光谱分析(针对过度推翻的 Type-I gate)
一个强大的对抗性审计器也能推翻*有效*的 artifact —— 这是证伪的 **Type-I 误差**。
`aae/negation_spectrometry.py` 将“引擎推翻得太多”转化为一个
**可衡量、有界的数字**:在对照样本组(有效 + 损坏的 artifact)上校准每个审计器 → 假推翻率 `FDR` / 效力 `TDR` / `AUC`;仅当否定在 **k-of-m 个独立(不同供应商)审计器**中持续存在时才予以采纳;报告 **无假设**
残余 Type-I(`empirical_type1`),它捕捉了 `p^m` 独立性边界所忽略的共享盲点相关性。定理(二项尾控制)由
`python3 aae/negation_spectrometry.py` 进行数值验证。仅使用标准库。
### 0.11.0 —— 元子层:引擎运行的使用账本
`aae/usage_ledger.py` 为元分析添加了**持久化**层:每次引擎运行对应一个仅追加的 JSON 行,为现有的抗偏差面板(`aae/run_metrics.py`)提供数据。三个独立的目的——改进遥测、历史系列、自反元层——在两个不变量下运行:**反 Goodhart**(没有任何账本字段可以成为 gate 的*目标*,否则引擎会学会产生好的指标而不是好的审计)和**自反/非验证**(该子层本身就是一个自指评估器,因此它不会自我验证;闭合属于人类的视野)。参见 `plugins/adversarial-audit-engine/USAGE_LEDGER.md`。仅使用标准库。
### 0.10.1 —— 否定光谱分析已集成到 governor 中
`MetaGovernor.falsification_type1(scores_valid, scores_invalid, k=, m=)` 直接在元认知 governor 上暴露了 Type-I gate:给定审计器在对照样本组上的推翻得分,它会返回测得的假推翻率(FDR)、效力、AUC 和 k-of-m 持久性边界。领域无关(由调用者提供样本组)。该方法现在已*集成*,而不仅仅是存在。
## 论文
该仓库还托管了两篇论文,这些论文形式化了引擎的产出,并测试成熟的科学界是否在进行同样的操作。
- **`papers/managing-circularity/`** —— *管理自指评估中的认知循环:幸存者门,以及三种科学账本如何解决不确定性。* 主论文:幸存者门、声明的非闭合性,以及三个真实的可靠性账本(Kepler KOI、ClinVar/ACMG、NVD/CVE)—— 所有图表均来自开放的 endpoint,评分路径中没有 LLM 判断。
- **`papers/commensurability/`** —— *分级、不对称的可通约性不是 quantale-enriched distributor:一个传递性障碍,以及一个 persistence-module 替代方案。* 形式化配套(C₃ quantale,两个负面结果,interleaving distance)。
两篇论文和复现包均存档在 Zenodo 上并拥有永久 DOI(见 `CITATION.cff`)。
标签:Python, 人工智能, 元评估, 对抗性审计, 抗幻觉, 文本审计, 无后门, 用户模式Hook绕过, 逆向工具