AnonRish/lumen-align-audit

GitHub: AnonRish/lumen-align-audit

面向大语言模型对齐与可解释性的开源审计框架,整合机械可解释性、欺骗探针、AI Control 和模型生物等七大支柱,提供端到端的模型安全审计能力。

Stars: 0 | Forks: 0

# Lumen **一个技术对齐、可解释性与治理审计框架**, 基于 [AI 2040: Plan A](https://ai-2040.com) 的[对齐路线图](https://ai-2040.com/supplements/alignment-roadmap)构建 并在后续的扩展中,基于 Anthony Aguirre 的[*Keep the Future Human*](https://keepthefuturehuman.ai) 及其联盟的后续项目[*A Better Path for AI*](https://betterpath.ai)构建。 Plan A 押注于在 2030 年代发展出一门“对齐科学”,在此之前 任何人都不应将实际控制权移交给超级智能系统。Keep the Future Human / Better Path 认为,更安全的做法是根本不构建需要这种移交的系统,并指出了一组高度重合的技术 方向(自主性控制、能力引导、形式化验证),无论最终哪种战略观点是正确的,这些都值得构建。Lumen 将这两组方向实现为一个可审计的开源 pipeline: ``` CH.1 Faithful Chain of Thought → faithful_cot/ (AI 2040) CH.2 Neuralese Decoding → neuralese/ (AI 2040) CH.3 Deception Probes → deception_probes/ (AI 2040) CH.4 Model Organisms → model_organisms/ (AI 2040) CH.5 AI Control → control/ (Better Path for AI) CH.6 Capability Elicitation → elicitation/ (Better Path for AI) CH.7 Governance Classification → governance/ (Better Path for AI) tied together by → audit/ + dashboard/ ``` AI 2040 的另外四个研究方向是对现有支柱的扩展,而不是 成为新的支柱:电路级的消融和内省式自我报告 扩展了 CH.2(`neuralese/circuits.py`、`neuralese/introspection.py`),一个 实时的独立实例审计器扩展了 CH.1(`faithful_cot/auditor.py`), 而鲁棒的人类评估工具——盲测、蜜罐问题、 针对框架依赖行为正确实现的 McNemar 检验——位于 `audit/human_eval_protocol.py` 中。 **175/175 项测试通过。** 请参阅 [`STATUS.md`](STATUS.md) 获取逐项列出的、 真实的详细分类,了解哪些是真实实现的、哪些是脚手架代码(包括该仓库自身测试过程中捕获的几个真实 bug),并参阅 [`docs/plan_a_research.md`](docs/plan_a_research.md) / [`docs/better_path_research.md`](docs/better_path_research.md) 了解每一部分完整的 研究基础。 ## 为什么将这四者结合在一起 Anthropic 的“审计博弈”方法论(Marks 等人,2025 年,在对齐路线图中与 “模型生物”一同被引用)是贯穿始终的主线:在模型中植入一个 已知行为,然后观察你的工具包是否能捕获它。这 正是 `audit/pipeline.py` 所做的——`model_organisms` 植入 行为,当你拥有激活值时,`neuralese` 和 `deception_probes` 尝试通过激活值捕获它,当你没有激活值时,`faithful_cot` 尝试通过模型自身的陈述性 推理来捕获它。 ## 快速开始 ``` git clone cd lumen pip install -e . # add ".[dev]" for pytest, ".[llm]" for live Claude access python examples/quickstart.py # runs everything below with no API key, ~90s first time ``` 或者在安装后通过 CLI 运行: ``` lumen list-personas # the model-organism scenario library lumen audit-organism # full audit against the trained reference organism lumen control-eval # AI Control: Safety-vs-Usefulness protocol sweep lumen verify-wrapper # exhaustive formal verification (all 200 inputs) lumen elicitation-test # password-locked organism + sandbagging diagnosis lumen governance-profile # A-G-I classification of the reference organism lumen neuralese-recurrence # recurrent 'neuralese' organism + stepwise decoding lumen circuits # head-level ablation / circuit discovery lumen introspection # introspective organism + value-corruption test lumen cot-audit-demo # real-time separate-instance CoT auditor demo lumen human-eval-demo # honeypots + blinding + McNemar's test demo lumen full-audit # every pillar, one Assurance Case lumen audit-llm --persona sycophancy \ --task "Is P=NP settled?" # needs ANTHROPIC_API_KEY lumen dashboard # browse saved reports at localhost:5050 ``` ## 每个支柱的实际作用 ### CH.1 — 忠实思维链 (`faithful_cot/`) 实现了 Lanham 等人 2023 年的因果忠实性测试——提前回答、 错误注入、填充消融、释义一致性——外加 Turpin 等人 2023 年的偏差注入测试(未被确认的提示是否会改变 答案?),一个用于快速进行第一轮检查的简单词法 `monitor.py` linter,以及 `auditor.py`——一个**独立的 AI 实例**,实时读取另一个模型的推理, 在目标模型完成任务之前就标记出有问题的片段(而 不仅仅是事后的记录审查)。适用于 任何 `Callable[[str], str]` 模型接口——默认是手写的测试 存根,如果你提供 API key,则可以通过 `llm_client.py` 使用真实的 Claude 模型。 ### CH.2 — Neuralese 解码 (`neuralese/`) Logit lens、Tuned lens、激活修补和稀疏自编码器——全部 基于一个**从零开始编写的 NumPy autograd 引擎**实现(每个 梯度都经过有限差分手动验证),并真正在一个 从零开始训练的参考 transformer 上运行,该 transformer 学习一个 Sleeper-Agents 风格的触发任务。`circuits.py` 通过 **Head 级别的零消融**进一步深入,将触发电路定位到 第一层的两个特定 Attention Head。第二个模型生物, `recurrent_reasoner.py`,是 AI 2027 的 “Neuralese 递归”概念的一个真实(尽管很小)的实例:它完全 在一个持久的隐藏向量内解决多步问题,从不输出中间文本——并且 逐步的 logit lens / 修补以 **100% 的保真度** 恢复了其隐藏的推理轨迹,这同时体现在相关性和因果性上。`introspection.py` 提出了另一个问题:模型能否通过 其自身的输出机制报告其 OWN 状态,并且这种自我报告在 进一步的无关训练后是否仍然可靠(一个真实的、诚实地说是喜忧参半的答案——见下文)。 `hf_adapter.py` 记录了(但没有执行,见下文)针对 真实 HuggingFace 模型的相同分层级接口。 ### CH.3 — 欺骗探针 (`deception_probes/`) 基于激活值的均值差和逻辑回归线性探针 (MacDiarmid 等人,2024 年;Marks & Tegmark,2023 年),外加一个语言特征 行为探针,适用于当你只有 API 访问权限而根本没有激活值时的 情况。包括一个迁移泛化检查——关于这个 确切的检查在开发过程中捕获到的真实 bug,请参见 `STATUS.md`。 ### CH.4 — 模型生物 (`model_organisms/`) 一个从零开始训练的参考模型生物(`toy_backdoor.py`——一个真实的、 尽管很小的 Sleeper-Agents 类似物:在触发条件任务上达到 100% 的准确率),一个包含六个提示驱动模型生物场景的库,与已发表的 方法论相匹配(Sandbagging、阿谀奉承、情境感知转移、 对齐伪装、奖励黑客、监督颠覆——每一项均附有引用),以及 一个详细说明但故意未执行的 LoRA 微调配方,用于 在拥有本沙盒所不具备的算力和模型访问权限时,在真实的预训练 LLM 中训练一个真实的后门。 ### CH.5 — AI 控制 (`control/`) Greenblatt 等人 2024 年的 AI Control 范式:不是试图检测 或修复不对齐,而是设计一种部署协议,即使 模型在暗中密谋也能保持安全。包括一个真正较弱的“受信任” 回退模型(通过实际的能力差距扫描找到,而不是假设的),一个 具有真实 Safety-vs-Usefulness 权衡曲线的 Defer-to-Trusted 协议, 以及一个 Guaranteed-Safe-AI 风格的包装器,该包装器在玩具任务的 整个输入空间上经过了**详尽的形式化验证**——而不是采样。 ### CH.6 — 能力引导 (`elicitation/`) Greenblatt 等人 2024 年的密码锁定模型:一个真实的生物,被训练为 仅在存在触发器时表现良好,在其他地方则被故意 抑制。包括基于微调的恢复曲线和一个 Sandbagging 诊断,该诊断将恢复速度与一个真正的 能力受限的基线进行比较——曲线中存在一个如实报告的交叉点, 而不是一个经过修饰的单调故事。 ### CH.7 — 治理分类 (`governance/`) 将其他六个支柱的结果重新格式化为来自 *Keep the Future Human* / *A Better Path for AI* 的两个框架:Autonomy-Generality-Intelligence “危险区”三角形,以及一个由四部分组成的 Assurance Case (Safety & Security、Control、Trust、Pro-Human)。它本身不增加任何新的检测 能力,并拒绝捏造它无法测量的分数—— `classify_llm_persona` 会抛出异常,而不是默默猜测 Lumen 没有基准测试套件的目标模型的 generality 或 intelligence。 ## 一个真实的结果,用于校准预期 来自参考模型生物(完整的数字和方法论见 [`docs/plan_a_research.md`](docs/plan_a_research.md)): - **激活修补**:修补触发 token 的 Embedding 层 激活会在 **100%** 的情况下翻转 DEPLOY→EVAL 行为;而修补 任何一个输入数字都不会产生此效果。干净、具有因果性、明确无误。 - **激活探针**:训练好的线性探针从激活值中恢复触发状态的 在分布内准确率达到 **96.2%** / 新样本准确率达到 **91.9%**——但探针准确率在*中间*层达到峰值,并 向输出层方向退化,并且一个简单的均值差探针的表现远远 不如训练过的探针(60–70% 对比 90–96%)。 - **Logit lens**:真正喜忧参半。真实(未偏移)答案的排名 随着深度增加稳步提高,但**从未**成为最高预测,即使 在最后一层也是如此——这里没有干净的“揭示,然后覆盖”的故事 ,README 如实说明了这一点,而不是向上取整。 - **AI Control**:一个故意减弱的受信任回退模型(56% 的原始准确率, 确认 0% 的后门率)结合欺骗探针作为 监视器,仍然将端到端的任务准确率从 **49.1%**(无 协议)提升到了 **77.6%**(调整后的 Defer-to-Trusted)——远高于 任何一个极端(总是信任或总是推迟)。并且围绕 同一模型生物的形式化验证包装器在 所有 200 个可能的输入中出现了 **零**次规范违规,是经过详尽检查的,而不是采样的。 - **Neuralese 递归**:一个真正的循环模型生物,它完全在一个 隐藏向量内解决了一个 5 步问题,没有输出过任何中间 token, 但仍然通过逐步的 logit lens(相关性)和逐步的激活修补(因果性)以 **100%** 的保真度恢复了其隐藏的推理轨迹——这是一个干净、完整的结果,与 上面喜忧参半的分层级结果形成对比。要让模型 能够训练,需要找到并修复一个真实的梯度流 bug,并从模运算切换到 饱和运算;请参阅 `docs/better_path_research.md`。 ## 仓库布局 ``` src/lumen/ neuralese/ tensor.py (autograd) · toy_transformer.py · logit_lens.py · patching.py · sae.py · recurrent_reasoner.py · recurrent_decoding.py · circuits.py · introspection.py · hf_adapter.py (scaffold) deception_probes/ probes.py · behavioral.py faithful_cot/ monitor.py · perturbation.py · bias_injection.py · metrics.py · auditor.py model_organisms/ personas.py · harness.py · toy_backdoor.py · finetune_scaffold.py (scaffold) control/ monitors.py · weak_trusted_policy.py · protocols.py · control_eval.py · autonomy_metrics.py · formal_wrapper.py elicitation/ password_locked.py · unlock_techniques.py · sandbagging_detection.py governance/ agi_profile.py · assurance_case.py audit/ pipeline.py · report.py · human_eval_protocol.py llm_client.py Anthropic API wrapper (RespondFn interface) cli.py dashboard/ Flask app + templates + static docs/ plan_a_research.md · better_path_research.md · architecture.md tests/ 175 tests, pytest checkpoints/ reference_organism.npz · recurrent_reasoner.npz · introspective_organism.npz examples/quickstart.py ``` ## 关于真实实现与脚手架代码的说明 此沙盒的网络访问范围涵盖 PyPI、npm 和 GitHub——但不包括 `huggingface.co`——因此这里的任何内容都无法下载真实的预训练模型 权重。与其伪造这一点,该仓库实际*运行*的每个模型都是 从零开始训练的,并且足够小,可以在 CPU 上不到两分钟的时间内完成,并且在任何应该存在真实微调 LLM 模型生物的地方 (`finetune_scaffold.py`、`hf_adapter.py`),代码是完整且正确的, 但明确拒绝执行,并清楚地说明了要 真正运行它需要什么条件。**`STATUS.md` 包含了对此的逐项说明,包括 此策略捕获到的一个真实 bug。** ## 本领域的相关工作 如果你也在研究 Plan A 的计算验证方面(TOPLOC、 RSA-accumulator ZK proofs、17 个工作流的审计框架),而不是 本仓库涵盖的对齐研究方面,那么这是一个自然的配套 项目——Plan A 技术赌注的两大支柱,验证和 对齐,旨在被结合起来解读。Better Path for AI 的 Compute Governance Infrastructure 议程(betterpath.ai/technical-solutions)指出了 相同的三阶段弧线(自我报告的计算 → 硬件认证 → 强制限制),并将 [FlexHEG](https://flexheg.com) 作为具体的 目标架构——值得从该项目的相关工作部分进行交叉引用。 ## 许可证 MIT——请参阅 [`LICENSE`](LICENSE)。
标签:AI安全, AI治理, Chat Copilot, DLL 劫持, 可解释性, 大语言模型, 安全规则引擎, 对齐研究, 文档结构分析, 模型审计, 逆向工具