paulchum/weight-space-observatory
GitHub: paulchum/weight-space-observatory
Weight-Space Observatory 是一个学习型信任网关,通过风险评分和新颖性检测对瞬态 LoRA 和 adapter 遥测数据进行有界策略决策与审计。
Stars: 0 | Forks: 0
Weight-Space Observatory
面向以权重进行思考的 AI 系统的防火墙。
运行演示 ·
查看架构 ·
阅读研究决策 ·
参与贡献
## 认识 `wso-brain`
**Autonomous Adapter Trust Gateway** 是一个本地、持久化的
观察 → 决策 → 行动 → 学习循环,用于处理派生的权重空间遥测数据。
- **学习风险:** 结合在线 AdaGrad 逻辑模型与快/慢速新颖性记忆。
- **选择有界响应:** LinUCB 在不可变的、由操作者拥有的行动上限内运行。
- **从结果中改进:** 经过验证的反馈会更新风险、策略和紧凑策略记忆。
- **安全地自我强化:** 封闭的特征空间自我博弈使用冻结的预留数据、
重复筛选以及精确的置信区间提升门控。
- **留下审计追踪:** 版本化状态、逐决策账本、本地一次性行动尝试以及失败即关闭的收据。
- **以 shadow 模式启动:** 记录建议而不调用 executor。
这是一种带有束缚的自主性:模型可以*在*边界内学习,但它不能
重写边界。
## 工作原理
默认的本地 executor 是特意设为只读的。它支持观察、
已注册的派生光谱扫描以及人工审查升级。隔离存在于
策略词汇表中,但位于默认的自主上限之外。
## 快速开始
```
git clone https://github.com/paulchum/weight-space-observatory.git
cd weight-space-observatory
python3 -m venv .venv
source .venv/bin/activate
python -m pip install -e .
wso-brain demo --out-dir artifacts/brain_demo
wso-brain status --state-dir artifacts/brain_demo/brain
```
确定性演示运行完整的本地循环:可信引导、shadow
决策、已验证的事件反馈、策略学习以及封闭的自我博弈。它会将
人类可读的决策以及机器可读的状态和账本写入到
`artifacts/brain_demo/` 下。
### 真实的演示结果
当前检入的合成固件会产生以下结果:
| 指标 | 结果 |
|---|---:|
| AUROC | 0.864 |
| Precision | 0.758 |
| Recall | 0.781 |
| 不安全的自我博弈提升 | 拒绝 |
这些数字证明了确定性的机制和门控执行——而非已部署系统的
检测。真实的性能需要来自目标
runtime 的冻结的、具有代表性的遥测数据。
## 为什么现在能够实现
各项独立要素并不新鲜。但产品机遇是全新的。
| 日期 | 发生了什么变化 | 为什么这在此时很重要 |
|---|---|---|
| 2025 年 9 月 | [ReasoningBank](https://arxiv.org/abs/2509.25140) 展示了 agent 如何从成功和失败的轨迹中学习紧凑的经验教训。 | 无需重放原始 trace 即可从已验证的结果中学习。 |
| 2026 年 2 月 | [Weight-space LoRA backdoor detection](https://arxiv.org/abs/2602.15195) 报告了从派生光谱特征中获得的强受控基准测试结果。 | 权重几何结构成为了一个可信的学习传感器表面。 |
| 2026 年 5 月 | [TFlow](https://arxiv.org/abs/2605.13839) 引入了通过瞬态 LoRA 扰动进行的特定于查询的 agent 间通信。 | 一个新的低于 prompt 的通信表面需要一个独立的监控器。 |
| 2026 年 6 月 | DeepMind 发布了 [AI Control Roadmap](https://deepmind.google/blog/securing-the-future-of-ai-agents/)。 | 学习型监控器仍然需要不可变的能力上限。 |
| 2026 年 7 月 | OpenAI 描述了使用 [GPT-Red](https://openai.com/index/unlocking-self-improvement-gpt-red/) 进行的自动化防御强化。 | 封闭的困难样本生成成为了一种实用的控制原语。|
完整的带有日期的论点、商业切入点、合同以及生产证明要求
均在 [2026 年 8 月 1 日的研究与构建决策](docs/autonomous_brain_2026.md) 中。
## CLI
```
wso-brain bootstrap initialize from trusted baseline and labeled outcomes
wso-brain decide score telemetry and choose a bounded response
wso-brain feedback learn from a verified realized outcome
wso-brain status inspect readiness, versions, and learning state
wso-brain reconcile-action resolve an orphaned local action intent
wso-brain self-play run sealed feature-space defensive hardening
wso-brain demo run the deterministic end-to-end fixture
```
原始的可观测性工具包仍然作为 `wso-audit` 提供,用于遥测
收集、任务条件基线、分析、OTEL 友好型导出和报告。
## TFlow 集成
`OfficialTFlowAdapter.solve(..., brain=brain)` 从真实的
瞬态推理中捕获派生遥测数据,并在生成返回后对其进行评分。捕获过程通过进程全局可重入锁进行序列化,并在清理期间恢复上游 hook。
**重要提示:** 这是一个生成后监控器,而不是针对当前
响应的拦截器。生产环境的预响应控制需要上游的请求范围捕获
hook,而不是临时的模块 monkey-patching。
## 信任边界
本项目拒绝假装的内容
- 合成固件不是部署证据。
- 来源布尔值是带外调用者证明,而不是加密证明。
- 本地文件权限不是加密或分布式共识。
- 重复筛选可减少明显的评估污染;它无法证明 i.i.d.
采样或数据集真实性。
- Executor 验证在 executor 返回之后进行,无法撤销
未授权的外部副作用。
- 默认的行动上限是 `deep_scan`;外部隔离需要明确的
操作者决策和具备特定能力范围的 executor。
详细的 schema 2.1 不变量、资源上限、锁定模型、提升数学计算以及
失败行为均记录在
[研究决策](docs/autonomous_brain_2026.md) 中。
## 项目状态
| 表面 | 状态 |
|---|---|
| 本地学习型信任网关 | 可用的原型 |
| Shadow 与执行的分离 | 已实现 |
| 本地一次性行动尝试日志 | 已实现 |
| 封闭的自我博弈提升门控 | 已实现 |
| 官方 TFlow 派生遥测桥接 | 生成后集成 |
| 生产环境预响应拦截 | 尚未实现 |
| 独立的真实部署验证 | 必须 |
## 贡献
最有价值的贡献包括:真实 runtime 的收集器、可重现的冻结
评估包、具有有限能力的 executor 适配器、校准工作以及
清晰的失败案例报告。请从 [CONTRIBUTING.md](CONTRIBUTING.md) 和
[负责任研究边界](SECURITY.md) 开始。
如果您希望解决这个问题,**请给本仓库点 Star,并带来一个我们可以诚实测量的真实适配器 runtime。**
## 许可证
[MIT](LICENSE) © 2026 Paul C.
标签:DLL 劫持, LoRA, Python, 人工智能安全, 信任网关, 合规性, 大语言模型, 强化学习, 无后门, 用户代理, 逆向工具