eddo-cto/adversarial-audit-engine

GitHub: eddo-cto/adversarial-audit-engine

一个五层对抗性审计引擎,通过确定性Python核心和多供应商独立视角对各类制品进行严格证伪,最终判定权始终保留在人类专家手中。

Stars: 1 | Forks: 0

[![DOI](https://zenodo.org/badge/DOI/10.5281/zenodo.21288401.svg)](https://doi.org/10.5281/zenodo.21288401) # 对抗性审计引擎 **[阅读故事——了解它是如何在七个对抗性轮次中被构建和加固的](STORY.md)** **状态:研究预览版 (v0.8.0)。** 经过了七个对抗性轮次以及 真实案例(共识协议、事件 RCA、威胁建模、多重法规 冲突、科学同行评审)的测试。它不是神谕:它是一个 *放大*胜任的人类审查员能力的工具——它不能替代人类。 **v0.8.0** 添加了**抗偏纵向指标**(`aae/run_metrics.py`, `run_core.py --metrics`):一组*正交的*比率,**没有单一的综合 得分**(避免 Goodhart 效应),其中**弃权绝不被计为成功**,并且 *escape/precision/recall* 仅在拥有**人类 ground truth** 时才报告(否则 为 `n/d`,绝不填补为 0)。`bias_audit()` 会主动标记退化的特征 (橡皮图章、全部弃权、过度谴责)——这是应用于指标本身的 元治理器。已通过六项对抗性偏差测试验证。 **v0.7.0** 添加了确定性的**反幻觉接地门** (`aae/grounding.py`):一项发现只能基于在源文件中*逐字* 存在的引文进行谴责;捏造或改写的引言会被可靠地降级为“必须 由人类阅读”。它本身在三个专门的 对抗性轮次中被破坏并加固,它所保证和不保证的内容都得到了精确陈述: - **保证(确定性):** *存在性* —— 没有捏造或篡改的引文可以 进行谴责;以及 *召回稳健性* —— PDF 噪音(连字符、零宽字符、 弯引号)在 1,407 个真实跨度上产生了 **0 次假阴性**。 - **尽力而为,不提供保证:** *断章取义 / 引文采矿* —— 从否定从句中提取的 真实子字符串会被保守的 句子范围检查标记,该检查能捕捉大多数但非全部此类情况(测试中约为 3/4)。残余部分是不可减少的**语义** 限制,我们选择声明而非伪装;含义由人类验证。该检查会产生约 6% 的过度标记成本 (合法发现被交由人工处理)——这是安全的方向。 配套的**法律 oracle**(`aae/legal_oracle.py`)按需检查所引用的 规范是否*存在*并得到了忠实的表达——从不涉及其解释,也绝不 来自模型记忆。 ## 它做什么(和不做什么) 给定一个 artifact —— spec、论文、模型、分析、代码 —— 引擎 部署盲测角色,从不同角度对其进行攻击并寻找其缺陷, **为每项指控首先尝试最强有力的辩护**(defense-gate), 这将使假阳性率趋近于零。一个 *pattern* 可以标记但绝不会谴责: 只有阅读或执行才能进行谴责。 它不承诺真相。它承诺**严谨的证伪**:它要么 找到可证明的缺陷,要么诚实地声明它无法在内部做出决定 并将该案例交由人类专家处理。 ## 核心原则 来自同一模型的 agent 共享相同的盲点。因此引擎绝不 自我认证: | 独立性级别 | 审查者 | 可能的最佳判定 | |---|---|---| | 1 — 同一实例,不同角色 | 同一模型 | 自我证伪,*未*验证 | | 2 — 不同模型,同一供应商 | — | 减少了保留意见 | | 3 — **不同供应商** | 例如另一家提供商 | `CROSS_MODEL_REVIEWED`(可靠性 ↑,**未**验证) | | 4 — **人类专家** | 胜任的个人 | `VALIDATED` | 独立的视野可以运行在不同的供应商上(包含适配器),但它 仍然是机器:级别 4 —— 人类 —— 是唯一提供验证的实例。 ## 5 个层级 1. **Destruens** —— 逐点验证 + *非局部*缺陷的传播 (在一个地方被打破的前提会使其他地方的保证失效)。 2. **Construens** —— 带有反向 defense-gate 的缺失原因诊断。 3. **Generative** —— 演绎 → 归纳 → **溯因**(对立假设)。 4. **Deep-causal** —— 根聚类,前后交叉,门控场景。 5. **Meta-epistemic governor** —— 验证验证器(偏差、覆盖率、 独立性、“表观一致性”)。它不自我认证:它在 人类处终止。 ## 混合架构 Claude Code / Cowork 编排角色(agent)和工具; **确定性核心**(`aae/`,捆绑)在 *code* 中强制执行判定状态 机、defense-gate、按维度的覆盖率、去重、指标和 governor。LLM 提供语义;代码执行纪律。 ## 安装 (Claude Code) ``` /plugin marketplace add /plugin install adversarial-audit-engine ``` 然后,在你想要审计的项目内部: ``` /audit ``` Python 核心仅在**标准库**上运行(无依赖项)。 跨供应商的独立视角需要所选提供商的凭证, 并在*你的*机器上进行配置。 ## 声明的限制(方法诚实性) - 它不替代专家:没有级别 4,判定将保持“未验证”。 - “标尺”(ground truth)可能是错误的:引擎将其视为易出错的。 - 覆盖率是*按缺陷类别*的,而非全局的:某些类别(例如真正新颖的 非局部概念)在设计上即交由人类处理。 - 它是一个研究预览版:将其用作决策支持,而不是最终权威。 ## 文档 - `plugins/adversarial-audit-engine/ARCHITETTURA_confini.md` —— 角色边界和 契约(意大利语)。 - 另请参见项目中的架构文档和每轮判定。 ## License & 免责声明 MIT(见 `LICENSE`)。参见 `DISCLAIMER.md`:软件按“原样”提供,不附带任何 保证;它不是专业建议(法律、财务、医疗)。其输出 必须始终由胜任的人士验证 ## 0.10.0 —— 否定光谱分析(针对过度推翻的 Type-I gate) 一个强大的对抗性审计器也能推翻*有效*的 artifact —— 这是证伪的 **Type-I 误差**。 `aae/negation_spectrometry.py` 将“引擎推翻得太多”转化为一个 **可衡量、有界的数字**:在对照样本组(有效 + 损坏的 artifact)上校准每个审计器 → 假推翻率 `FDR` / 效力 `TDR` / `AUC`;仅当否定在 **k-of-m 个独立(不同供应商)审计器**中持续存在时才予以采纳;报告 **无假设** 残余 Type-I(`empirical_type1`),它捕捉了 `p^m` 独立性边界所忽略的共享盲点相关性。定理(二项尾控制)由 `python3 aae/negation_spectrometry.py` 进行数值验证。仅使用标准库。 ### 0.11.0 —— 元子层:引擎运行的使用账本 `aae/usage_ledger.py` 为元分析添加了**持久化**层:每次引擎运行对应一个仅追加的 JSON 行,为现有的抗偏差面板(`aae/run_metrics.py`)提供数据。三个独立的目的——改进遥测、历史系列、自反元层——在两个不变量下运行:**反 Goodhart**(没有任何账本字段可以成为 gate 的*目标*,否则引擎会学会产生好的指标而不是好的审计)和**自反/非验证**(该子层本身就是一个自指评估器,因此它不会自我验证;闭合属于人类的视野)。参见 `plugins/adversarial-audit-engine/USAGE_LEDGER.md`。仅使用标准库。 ### 0.10.1 —— 否定光谱分析已集成到 governor 中 `MetaGovernor.falsification_type1(scores_valid, scores_invalid, k=, m=)` 直接在元认知 governor 上暴露了 Type-I gate:给定审计器在对照样本组上的推翻得分,它会返回测得的假推翻率(FDR)、效力、AUC 和 k-of-m 持久性边界。领域无关(由调用者提供样本组)。该方法现在已*集成*,而不仅仅是存在。 ## 论文 该仓库还托管了两篇论文,这些论文形式化了引擎的产出,并测试成熟的科学界是否在进行同样的操作。 - **`papers/managing-circularity/`** —— *管理自指评估中的认知循环:幸存者门,以及三种科学账本如何解决不确定性。* 主论文:幸存者门、声明的非闭合性,以及三个真实的可靠性账本(Kepler KOI、ClinVar/ACMG、NVD/CVE)—— 所有图表均来自开放的 endpoint,评分路径中没有 LLM 判断。 - **`papers/commensurability/`** —— *分级、不对称的可通约性不是 quantale-enriched distributor:一个传递性障碍,以及一个 persistence-module 替代方案。* 形式化配套(C₃ quantale,两个负面结果,interleaving distance)。 两篇论文和复现包均存档在 Zenodo 上并拥有永久 DOI(见 `CITATION.cff`)。
标签:Python, 人工智能, 元评估, 对抗性审计, 抗幻觉, 文本审计, 无后门, 用户模式Hook绕过, 逆向工具