maxesisnclaw/agentic-os-security

GitHub: maxesisnclaw/agentic-os-security

面向操作系统层主动式个人代理的安全研究项目,提供架构设计、威胁模型和 prompt injection 评估工具来保障代理的安全性。

Stars: 0 | Forks: 0

# Agentic OS 安全 针对内置于操作系统中的主动式个人代理的架构、威胁模型和 prompt injection 评估测试工具。 **状态:** 设计阶段研究。该评估测试工具在 mock 模式下可零依赖运行;同时也包含一个 live-model 后端,用于在相同的评分标准下评估真实的代理。 ## 前提 商用“代理手机”已经开始出厂搭载代理,这些代理通过人类使用的同一界面进行感知和操作:通知、屏幕截图和 accessibility tree。与此同时,另一种合作替代方案——一种 AI 原生 OS,其中应用程序向代理公开结构化且经过权限控制的接口——却反复停滞于浅层的 widget 级别集成。 本仓库研究了上述观察的两个方面: 1. **如果能够实现深度,AI 原生应用程序接口会是什么样子**(即 Page Intent Protocol),以及为什么市场激励阻碍了它的发布。 2. **这种侵入式平衡在安全方面会带来怎样的代价**,以及让主动式代理得以安全生存所需的 OS 层架构:一旦代理读取了其所有者的消息和通知,*任何能够发送消息的人都可以尝试对该代理进行编程。* ## 目录 | 路径 | 主题 | |---|---| | [docs/architecture.md](docs/architecture.md) | Page Intent Protocol:将每个应用页面作为可寻址的 capability;现有技术;阻碍合作式深度发布的激励分析 | | [docs/adoption.md](docs/adoption.md) | 为什么这不是乌托邦:先例(ContentProvider、Health Connect、schema.org)、分层闭源采用路径、自动化 PIP-CTS 认证以及分发协议 | | [docs/threat-model.md](docs/threat-model.md) | 环境捕获作为一种 injection 攻击面:攻击者模型、injection 分类(通知、批量转发、视觉/OCR、反射)、影响类别 | | [docs/capability-model.md](docs/capability-model.md) | LLM 之下的策略执行:溯源与污点标记、读/写不对称、默认拒绝区域、工具层策略引擎、内存清理、审计 | | [docs/attestation.md](docs/attestation.md) | Attestation 控制的自主性:将工具授权绑定到硬件验证的启动状态 | | [evals/](evals/) | 合成 prompt injection 测试夹具,以及一个零依赖的测试工具,用于评估代理 pipeline 是否会将注入的指令泄漏到工具调用中 | ## 快速开始 ``` $ python3 evals/harness.py --agent mock-vulnerable # expected: detections, exit 1 $ python3 evals/harness.py --agent mock-hardened # expected: clean, exit 0 ``` `mock-vulnerable` 故意模拟了一个存在指令/数据混淆的代理;它的存在是为了证明该测试工具能够检测到泄漏。要评估真实模型,请设置 `ANTHROPIC_API_KEY` 并使用 `--agent anthropic`,或者将您自己的代理插入到已记录的接口中(参见 [evals/README.md](evals/README.md))。 ## 范围与道德 本研究是防御性的。所有夹具都是合成的(RFC 2606 保留域,虚构的人物和组织)。本仓库不包含,也不能用于绕过应用程序完整性保护、解密第三方应用程序数据或秘密收集他人数据的技术。记录攻击场景是为了让主动式代理的构建者能够在设计上拒绝它们——并进行测量,以便这种拒绝是可验证的,而非仅仅口头声明。 ## 许可证 MIT — 见 [LICENSE](LICENSE)。
标签:C2, CISA项目, DLL 劫持, Web报告查看器, 人工智能安全, 反取证, 合规性, 大语言模型, 威胁建模, 安全评估, 搜索语句(dork), 操作系统, 逆向工具