paulchum/weight-space-observatory

GitHub: paulchum/weight-space-observatory

Weight-Space Observatory 是一个学习型信任网关,通过风险评分和新颖性检测对瞬态 LoRA 和 adapter 遥测数据进行有界策略决策与审计。

Stars: 0 | Forks: 0

A stream of transient neural-weight updates passing through a learned trust boundary; trusted paths continue in blue while anomalous paths are diverted in amber for review.

Weight-Space Observatory

面向以权重进行思考的 AI 系统的防火墙。

Python CI Python 3.10 and newer MIT license GitHub stars

运行演示 · 查看架构 · 阅读研究决策 · 参与贡献

## 认识 `wso-brain` **Autonomous Adapter Trust Gateway** 是一个本地、持久化的 观察 → 决策 → 行动 → 学习循环,用于处理派生的权重空间遥测数据。 - **学习风险:** 结合在线 AdaGrad 逻辑模型与快/慢速新颖性记忆。 - **选择有界响应:** LinUCB 在不可变的、由操作者拥有的行动上限内运行。 - **从结果中改进:** 经过验证的反馈会更新风险、策略和紧凑策略记忆。 - **安全地自我强化:** 封闭的特征空间自我博弈使用冻结的预留数据、 重复筛选以及精确的置信区间提升门控。 - **留下审计追踪:** 版本化状态、逐决策账本、本地一次性行动尝试以及失败即关闭的收据。 - **以 shadow 模式启动:** 记录建议而不调用 executor。 这是一种带有束缚的自主性:模型可以*在*边界内学习,但它不能 重写边界。 ## 工作原理

Architecture diagram: transient LoRA and adapter telemetry is converted into 64 privacy-preserving features, scored by learned risk and novelty models, passed through a bounded policy, and routed to observe, deep scan, or human review. Verified outcomes feed back into learning.

默认的本地 executor 是特意设为只读的。它支持观察、 已注册的派生光谱扫描以及人工审查升级。隔离存在于 策略词汇表中,但位于默认的自主上限之外。 ## 快速开始 ``` git clone https://github.com/paulchum/weight-space-observatory.git cd weight-space-observatory python3 -m venv .venv source .venv/bin/activate python -m pip install -e . wso-brain demo --out-dir artifacts/brain_demo wso-brain status --state-dir artifacts/brain_demo/brain ``` 确定性演示运行完整的本地循环:可信引导、shadow 决策、已验证的事件反馈、策略学习以及封闭的自我博弈。它会将 人类可读的决策以及机器可读的状态和账本写入到 `artifacts/brain_demo/` 下。 ### 真实的演示结果 当前检入的合成固件会产生以下结果: | 指标 | 结果 | |---|---:| | AUROC | 0.864 | | Precision | 0.758 | | Recall | 0.781 | | 不安全的自我博弈提升 | 拒绝 | 这些数字证明了确定性的机制和门控执行——而非已部署系统的 检测。真实的性能需要来自目标 runtime 的冻结的、具有代表性的遥测数据。 ## 为什么现在能够实现 各项独立要素并不新鲜。但产品机遇是全新的。 | 日期 | 发生了什么变化 | 为什么这在此时很重要 | |---|---|---| | 2025 年 9 月 | [ReasoningBank](https://arxiv.org/abs/2509.25140) 展示了 agent 如何从成功和失败的轨迹中学习紧凑的经验教训。 | 无需重放原始 trace 即可从已验证的结果中学习。 | | 2026 年 2 月 | [Weight-space LoRA backdoor detection](https://arxiv.org/abs/2602.15195) 报告了从派生光谱特征中获得的强受控基准测试结果。 | 权重几何结构成为了一个可信的学习传感器表面。 | | 2026 年 5 月 | [TFlow](https://arxiv.org/abs/2605.13839) 引入了通过瞬态 LoRA 扰动进行的特定于查询的 agent 间通信。 | 一个新的低于 prompt 的通信表面需要一个独立的监控器。 | | 2026 年 6 月 | DeepMind 发布了 [AI Control Roadmap](https://deepmind.google/blog/securing-the-future-of-ai-agents/)。 | 学习型监控器仍然需要不可变的能力上限。 | | 2026 年 7 月 | OpenAI 描述了使用 [GPT-Red](https://openai.com/index/unlocking-self-improvement-gpt-red/) 进行的自动化防御强化。 | 封闭的困难样本生成成为了一种实用的控制原语。| 完整的带有日期的论点、商业切入点、合同以及生产证明要求 均在 [2026 年 8 月 1 日的研究与构建决策](docs/autonomous_brain_2026.md) 中。 ## CLI ``` wso-brain bootstrap initialize from trusted baseline and labeled outcomes wso-brain decide score telemetry and choose a bounded response wso-brain feedback learn from a verified realized outcome wso-brain status inspect readiness, versions, and learning state wso-brain reconcile-action resolve an orphaned local action intent wso-brain self-play run sealed feature-space defensive hardening wso-brain demo run the deterministic end-to-end fixture ``` 原始的可观测性工具包仍然作为 `wso-audit` 提供,用于遥测 收集、任务条件基线、分析、OTEL 友好型导出和报告。 ## TFlow 集成 `OfficialTFlowAdapter.solve(..., brain=brain)` 从真实的 瞬态推理中捕获派生遥测数据,并在生成返回后对其进行评分。捕获过程通过进程全局可重入锁进行序列化,并在清理期间恢复上游 hook。 **重要提示:** 这是一个生成后监控器,而不是针对当前 响应的拦截器。生产环境的预响应控制需要上游的请求范围捕获 hook,而不是临时的模块 monkey-patching。 ## 信任边界
本项目拒绝假装的内容 - 合成固件不是部署证据。 - 来源布尔值是带外调用者证明,而不是加密证明。 - 本地文件权限不是加密或分布式共识。 - 重复筛选可减少明显的评估污染;它无法证明 i.i.d. 采样或数据集真实性。 - Executor 验证在 executor 返回之后进行,无法撤销 未授权的外部副作用。 - 默认的行动上限是 `deep_scan`;外部隔离需要明确的 操作者决策和具备特定能力范围的 executor。 详细的 schema 2.1 不变量、资源上限、锁定模型、提升数学计算以及 失败行为均记录在 [研究决策](docs/autonomous_brain_2026.md) 中。
## 项目状态 | 表面 | 状态 | |---|---| | 本地学习型信任网关 | 可用的原型 | | Shadow 与执行的分离 | 已实现 | | 本地一次性行动尝试日志 | 已实现 | | 封闭的自我博弈提升门控 | 已实现 | | 官方 TFlow 派生遥测桥接 | 生成后集成 | | 生产环境预响应拦截 | 尚未实现 | | 独立的真实部署验证 | 必须 | ## 贡献 最有价值的贡献包括:真实 runtime 的收集器、可重现的冻结 评估包、具有有限能力的 executor 适配器、校准工作以及 清晰的失败案例报告。请从 [CONTRIBUTING.md](CONTRIBUTING.md) 和 [负责任研究边界](SECURITY.md) 开始。 如果您希望解决这个问题,**请给本仓库点 Star,并带来一个我们可以诚实测量的真实适配器 runtime。** ## 许可证 [MIT](LICENSE) © 2026 Paul C.
标签:DLL 劫持, LoRA, Python, 人工智能安全, 信任网关, 合规性, 大语言模型, 强化学习, 无后门, 用户代理, 逆向工具