AnonRish/lumen-align-audit
GitHub: AnonRish/lumen-align-audit
面向大语言模型对齐与可解释性的开源审计框架,整合机械可解释性、欺骗探针、AI Control 和模型生物等七大支柱,提供端到端的模型安全审计能力。
Stars: 0 | Forks: 0
# Lumen
**一个技术对齐、可解释性与治理审计框架**,
基于 [AI 2040: Plan A](https://ai-2040.com) 的[对齐路线图](https://ai-2040.com/supplements/alignment-roadmap)构建
并在后续的扩展中,基于 Anthony Aguirre 的[*Keep the Future Human*](https://keepthefuturehuman.ai)
及其联盟的后续项目[*A Better Path for AI*](https://betterpath.ai)构建。
Plan A 押注于在 2030 年代发展出一门“对齐科学”,在此之前
任何人都不应将实际控制权移交给超级智能系统。Keep the Future
Human / Better Path 认为,更安全的做法是根本不构建需要这种移交的系统,并指出了一组高度重合的技术
方向(自主性控制、能力引导、形式化验证),无论最终哪种战略观点是正确的,这些都值得构建。Lumen
将这两组方向实现为一个可审计的开源 pipeline:
```
CH.1 Faithful Chain of Thought → faithful_cot/ (AI 2040)
CH.2 Neuralese Decoding → neuralese/ (AI 2040)
CH.3 Deception Probes → deception_probes/ (AI 2040)
CH.4 Model Organisms → model_organisms/ (AI 2040)
CH.5 AI Control → control/ (Better Path for AI)
CH.6 Capability Elicitation → elicitation/ (Better Path for AI)
CH.7 Governance Classification → governance/ (Better Path for AI)
tied together by → audit/ + dashboard/
```
AI 2040 的另外四个研究方向是对现有支柱的扩展,而不是
成为新的支柱:电路级的消融和内省式自我报告
扩展了 CH.2(`neuralese/circuits.py`、`neuralese/introspection.py`),一个
实时的独立实例审计器扩展了 CH.1(`faithful_cot/auditor.py`),
而鲁棒的人类评估工具——盲测、蜜罐问题、
针对框架依赖行为正确实现的 McNemar 检验——位于
`audit/human_eval_protocol.py` 中。
**175/175 项测试通过。** 请参阅 [`STATUS.md`](STATUS.md) 获取逐项列出的、
真实的详细分类,了解哪些是真实实现的、哪些是脚手架代码(包括该仓库自身测试过程中捕获的几个真实 bug),并参阅
[`docs/plan_a_research.md`](docs/plan_a_research.md) /
[`docs/better_path_research.md`](docs/better_path_research.md) 了解每一部分完整的
研究基础。
## 为什么将这四者结合在一起
Anthropic 的“审计博弈”方法论(Marks 等人,2025 年,在对齐路线图中与
“模型生物”一同被引用)是贯穿始终的主线:在模型中植入一个
已知行为,然后观察你的工具包是否能捕获它。这
正是 `audit/pipeline.py` 所做的——`model_organisms` 植入
行为,当你拥有激活值时,`neuralese` 和
`deception_probes` 尝试通过激活值捕获它,当你没有激活值时,`faithful_cot` 尝试通过模型自身的陈述性
推理来捕获它。
## 快速开始
```
git clone
cd lumen
pip install -e . # add ".[dev]" for pytest, ".[llm]" for live Claude access
python examples/quickstart.py # runs everything below with no API key, ~90s first time
```
或者在安装后通过 CLI 运行:
```
lumen list-personas # the model-organism scenario library
lumen audit-organism # full audit against the trained reference organism
lumen control-eval # AI Control: Safety-vs-Usefulness protocol sweep
lumen verify-wrapper # exhaustive formal verification (all 200 inputs)
lumen elicitation-test # password-locked organism + sandbagging diagnosis
lumen governance-profile # A-G-I classification of the reference organism
lumen neuralese-recurrence # recurrent 'neuralese' organism + stepwise decoding
lumen circuits # head-level ablation / circuit discovery
lumen introspection # introspective organism + value-corruption test
lumen cot-audit-demo # real-time separate-instance CoT auditor demo
lumen human-eval-demo # honeypots + blinding + McNemar's test demo
lumen full-audit # every pillar, one Assurance Case
lumen audit-llm --persona sycophancy \
--task "Is P=NP settled?" # needs ANTHROPIC_API_KEY
lumen dashboard # browse saved reports at localhost:5050
```
## 每个支柱的实际作用
### CH.1 — 忠实思维链 (`faithful_cot/`)
实现了 Lanham 等人 2023 年的因果忠实性测试——提前回答、
错误注入、填充消融、释义一致性——外加 Turpin 等人
2023 年的偏差注入测试(未被确认的提示是否会改变
答案?),一个用于快速进行第一轮检查的简单词法 `monitor.py` linter,以及
`auditor.py`——一个**独立的 AI 实例**,实时读取另一个模型的推理,
在目标模型完成任务之前就标记出有问题的片段(而
不仅仅是事后的记录审查)。适用于
任何 `Callable[[str], str]` 模型接口——默认是手写的测试
存根,如果你提供 API key,则可以通过 `llm_client.py` 使用真实的 Claude 模型。
### CH.2 — Neuralese 解码 (`neuralese/`)
Logit lens、Tuned lens、激活修补和稀疏自编码器——全部
基于一个**从零开始编写的 NumPy autograd 引擎**实现(每个
梯度都经过有限差分手动验证),并真正在一个
从零开始训练的参考 transformer 上运行,该 transformer 学习一个
Sleeper-Agents 风格的触发任务。`circuits.py` 通过
**Head 级别的零消融**进一步深入,将触发电路定位到
第一层的两个特定 Attention Head。第二个模型生物,
`recurrent_reasoner.py`,是 AI 2027 的
“Neuralese 递归”概念的一个真实(尽管很小)的实例:它完全
在一个持久的隐藏向量内解决多步问题,从不输出中间文本——并且
逐步的 logit lens / 修补以 **100% 的保真度**
恢复了其隐藏的推理轨迹,这同时体现在相关性和因果性上。`introspection.py`
提出了另一个问题:模型能否通过
其自身的输出机制报告其 OWN 状态,并且这种自我报告在
进一步的无关训练后是否仍然可靠(一个真实的、诚实地说是喜忧参半的答案——见下文)。
`hf_adapter.py` 记录了(但没有执行,见下文)针对
真实 HuggingFace 模型的相同分层级接口。
### CH.3 — 欺骗探针 (`deception_probes/`)
基于激活值的均值差和逻辑回归线性探针
(MacDiarmid 等人,2024 年;Marks & Tegmark,2023 年),外加一个语言特征
行为探针,适用于当你只有 API 访问权限而根本没有激活值时的
情况。包括一个迁移泛化检查——关于这个
确切的检查在开发过程中捕获到的真实 bug,请参见 `STATUS.md`。
### CH.4 — 模型生物 (`model_organisms/`)
一个从零开始训练的参考模型生物(`toy_backdoor.py`——一个真实的、
尽管很小的 Sleeper-Agents 类似物:在触发条件任务上达到 100% 的准确率),一个包含六个提示驱动模型生物场景的库,与已发表的
方法论相匹配(Sandbagging、阿谀奉承、情境感知转移、
对齐伪装、奖励黑客、监督颠覆——每一项均附有引用),以及
一个详细说明但故意未执行的 LoRA 微调配方,用于
在拥有本沙盒所不具备的算力和模型访问权限时,在真实的预训练 LLM 中训练一个真实的后门。
### CH.5 — AI 控制 (`control/`)
Greenblatt 等人 2024 年的 AI Control 范式:不是试图检测
或修复不对齐,而是设计一种部署协议,即使
模型在暗中密谋也能保持安全。包括一个真正较弱的“受信任”
回退模型(通过实际的能力差距扫描找到,而不是假设的),一个
具有真实 Safety-vs-Usefulness 权衡曲线的 Defer-to-Trusted 协议,
以及一个 Guaranteed-Safe-AI 风格的包装器,该包装器在玩具任务的
整个输入空间上经过了**详尽的形式化验证**——而不是采样。
### CH.6 — 能力引导 (`elicitation/`)
Greenblatt 等人 2024 年的密码锁定模型:一个真实的生物,被训练为
仅在存在触发器时表现良好,在其他地方则被故意
抑制。包括基于微调的恢复曲线和一个 Sandbagging 诊断,该诊断将恢复速度与一个真正的
能力受限的基线进行比较——曲线中存在一个如实报告的交叉点,
而不是一个经过修饰的单调故事。
### CH.7 — 治理分类 (`governance/`)
将其他六个支柱的结果重新格式化为来自
*Keep the Future Human* / *A Better Path for AI* 的两个框架:Autonomy-Generality-Intelligence “危险区”三角形,以及一个由四部分组成的 Assurance Case
(Safety & Security、Control、Trust、Pro-Human)。它本身不增加任何新的检测
能力,并拒绝捏造它无法测量的分数——
`classify_llm_persona` 会抛出异常,而不是默默猜测 Lumen 没有基准测试套件的目标模型的 generality
或 intelligence。
## 一个真实的结果,用于校准预期
来自参考模型生物(完整的数字和方法论见
[`docs/plan_a_research.md`](docs/plan_a_research.md)):
- **激活修补**:修补触发 token 的 Embedding 层
激活会在 **100%** 的情况下翻转 DEPLOY→EVAL 行为;而修补
任何一个输入数字都不会产生此效果。干净、具有因果性、明确无误。
- **激活探针**:训练好的线性探针从激活值中恢复触发状态的
在分布内准确率达到 **96.2%** / 新样本准确率达到
**91.9%**——但探针准确率在*中间*层达到峰值,并
向输出层方向退化,并且一个简单的均值差探针的表现远远
不如训练过的探针(60–70% 对比 90–96%)。
- **Logit lens**:真正喜忧参半。真实(未偏移)答案的排名
随着深度增加稳步提高,但**从未**成为最高预测,即使
在最后一层也是如此——这里没有干净的“揭示,然后覆盖”的故事
,README 如实说明了这一点,而不是向上取整。
- **AI Control**:一个故意减弱的受信任回退模型(56% 的原始准确率,
确认 0% 的后门率)结合欺骗探针作为
监视器,仍然将端到端的任务准确率从 **49.1%**(无
协议)提升到了 **77.6%**(调整后的 Defer-to-Trusted)——远高于
任何一个极端(总是信任或总是推迟)。并且围绕
同一模型生物的形式化验证包装器在
所有 200 个可能的输入中出现了 **零**次规范违规,是经过详尽检查的,而不是采样的。
- **Neuralese 递归**:一个真正的循环模型生物,它完全在一个
隐藏向量内解决了一个 5 步问题,没有输出过任何中间 token,
但仍然通过逐步的 logit lens(相关性)和逐步的激活修补(因果性)以 **100%**
的保真度恢复了其隐藏的推理轨迹——这是一个干净、完整的结果,与
上面喜忧参半的分层级结果形成对比。要让模型
能够训练,需要找到并修复一个真实的梯度流 bug,并从模运算切换到
饱和运算;请参阅 `docs/better_path_research.md`。
## 仓库布局
```
src/lumen/
neuralese/ tensor.py (autograd) · toy_transformer.py · logit_lens.py
· patching.py · sae.py · recurrent_reasoner.py ·
recurrent_decoding.py · circuits.py · introspection.py ·
hf_adapter.py (scaffold)
deception_probes/ probes.py · behavioral.py
faithful_cot/ monitor.py · perturbation.py · bias_injection.py · metrics.py · auditor.py
model_organisms/ personas.py · harness.py · toy_backdoor.py · finetune_scaffold.py (scaffold)
control/ monitors.py · weak_trusted_policy.py · protocols.py · control_eval.py
· autonomy_metrics.py · formal_wrapper.py
elicitation/ password_locked.py · unlock_techniques.py · sandbagging_detection.py
governance/ agi_profile.py · assurance_case.py
audit/ pipeline.py · report.py · human_eval_protocol.py
llm_client.py Anthropic API wrapper (RespondFn interface)
cli.py
dashboard/ Flask app + templates + static
docs/ plan_a_research.md · better_path_research.md · architecture.md
tests/ 175 tests, pytest
checkpoints/ reference_organism.npz · recurrent_reasoner.npz · introspective_organism.npz
examples/quickstart.py
```
## 关于真实实现与脚手架代码的说明
此沙盒的网络访问范围涵盖 PyPI、npm 和 GitHub——但不包括
`huggingface.co`——因此这里的任何内容都无法下载真实的预训练模型
权重。与其伪造这一点,该仓库实际*运行*的每个模型都是
从零开始训练的,并且足够小,可以在 CPU 上不到两分钟的时间内完成,并且在任何应该存在真实微调 LLM 模型生物的地方
(`finetune_scaffold.py`、`hf_adapter.py`),代码是完整且正确的,
但明确拒绝执行,并清楚地说明了要
真正运行它需要什么条件。**`STATUS.md` 包含了对此的逐项说明,包括
此策略捕获到的一个真实 bug。**
## 本领域的相关工作
如果你也在研究 Plan A 的计算验证方面(TOPLOC、
RSA-accumulator ZK proofs、17 个工作流的审计框架),而不是
本仓库涵盖的对齐研究方面,那么这是一个自然的配套
项目——Plan A 技术赌注的两大支柱,验证和
对齐,旨在被结合起来解读。Better Path for AI 的 Compute
Governance Infrastructure 议程(betterpath.ai/technical-solutions)指出了
相同的三阶段弧线(自我报告的计算 → 硬件认证 →
强制限制),并将 [FlexHEG](https://flexheg.com) 作为具体的
目标架构——值得从该项目的相关工作部分进行交叉引用。
## 许可证
MIT——请参阅 [`LICENSE`](LICENSE)。
标签:AI安全, AI治理, Chat Copilot, DLL 劫持, 可解释性, 大语言模型, 安全规则引擎, 对齐研究, 文档结构分析, 模型审计, 逆向工具