Bobcatsfan33/Pharos

GitHub: Bobcatsfan33/Pharos

Pharos 是一套企业级 AI agent 的信任控制平面,在亚秒级延迟内对 agent 操作进行实时策略裁决,并为每次决策生成防篡改的法庭级证据记录。

Stars: 2 | Forks: 1

# Pharos **企业级 AI agent 的信任控制平面。** *Pharos 决策。Pharos 证明。* Pharos 对每一个重要的 AI agent 操作进行两次治理。**一次发生在操作执行之前** —— 在严格的延迟预算内,通过分层决策级联发出实时策略裁决(允许、拦截、修改、升级)。**一次发生在操作执行之后** —— 生成一份防篡改、带加密签名的证据记录,将操作与其授权委托、模型版本、策略裁决、监督状态和财务影响范围绑定在一起。 治理操作的同一事件,成为了证明其如何被治理的依据。一个 pipeline,两个输出:一个 agent 操作既不能脱离记录被治理,也不能脱离其治理上下文被记录。 ## 为什么选择 Pharos 现有任何类别都无法闭环: - **安全平台**(Cisco AI Defense、Palo Alto Prisma AIRS)可以拦截威胁,但无法生成可作为法庭呈堂证供的证据。 - **治理平台**(Credo AI、OneTrust)能将策略文档化,但从不触及 runtime。 - **保险机构**(AIUC、Armilla、Testudo)能对风险定价,但缺乏遥测数据。 Pharos 是唯一一款能让合规官授权 agent、审查员审计 agent、总法律顾问为 agent 辩护,以及承保人为 agent 定价的产品。 ## 两个平面 | | Pharos Beam — 决策 | Pharos Ledger — 证明 | |---|---|---| | 角色 | Runtime 决策平面 | 证据与责任平面 | | 交付物 | 策略包、编译器、dry-run、分层裁决级联、审核操作 | 证据浏览器、风险画像、就绪闸门、索赔包、交换门户 | 一次登录,一个 RBAC 模型,一个租户边界。 它的名字承载了其架构理念:亚历山大灯塔(Pharos of Alexandria)既能在实时引导船只,又作为港口位置的证明屹立了数个世纪。 ## 工作原理 每一个关键的 agent 操作都会流经单一的接入平面 —— 一次 SDK 调用,或者是无代码的 MCP/gateway 代理。裁决级联会在 800ms 的时间窗口内跨层级对其进行评估(确定性规则、统计风险评分,然后是已部署的 judge 模型),并具备确定性短路机制以及工程化的 fail-open / fail-closed 路径。本地开发默认使用测得的线性 baseline;生产环境配置现在要求并预加载每一个经过哈希验证的 ONNX transformer judge,然后才会开启监听器。[docs/LIMITATIONS.md](docs/LIMITATIONS.md) 中列出了 transformer artifacts 仍在等待的独立有效性、校准、漂移、模型卡和生产延迟证据。 裁决响应和密封的证据记录是同一事务的两个输出。通用的 `ActionRecord` 事件同时携带裁决上下文(到达层级、规则引用、风险评分、失败模式)和责任上下文(授权委托 ID 和范围、监督模式、影响范围、可逆性、模型元数据)—— 一次签名,一次链接。 ### 架构概览 - **操作状态** —— Postgres(策略、授权委托、队列、租户) - **证据链** —— WORM 对象存储(S3 Object Lock),哈希链接并持续验证 - **裁决缓存** —— Redis,受截止时间限制 - **签名** —— 可插拔的 `SigningProvider`;本地开发使用 Ed25519,生产环境强制要求使用带轮换、宕机熔断和链连续性的 AWS KMS P-256。 - **部署** —— SaaS(多租户)、专用 VPC 和客户自托管(Helm/Compose) 已实现的设计请参见 [docs/architecture.md](docs/architecture.md)。 ## 状态 根据[路线图](docs/ROADMAP.md)逐个 sprint 构建。时序和证明就是契约:在外部发布任何声明之前,其证明必须已存在;每一个里程碑都是一个带有可量化退出标准的现场演示 —— 而非纸上谈兵。 **Sprint 0 (Bedrock) —— 已完成。** 一个单一的可部署平台,agent 操作在此接收到裁决,并生成密封、持久、可外部验证的证据记录 —— 可在重启后幸存,并可从创世到链头进行验证。 **Sprint 1 (Gatehouse) —— 已完成。** 企业级 SSO(OIDC,已针对 Okta + Entra 验证)、范围受限且可轮换的 API key、默认拒绝的 RBAC、严格的多租户隔离(Postgres RLS 在 `NOBYPASSRLS` 应用角色下运行 + 每个租户独立的签名密钥)、哈希链接的访问审计,以及 CORS/速率限制加固。租户隔离攻击套件(跨租户读取、IDOR、权限提升、撤销密钥重用、数据库级 RLS)未发现任何越权行为。请参见 [docs/identity-and-tenancy.md](docs/identity-and-tenancy.md)。 **Sprint 2 (Lantern) —— 已完成。** 一个真正的分层决策级联(Tier 1 确定性规则 → Tier 2 统计风险 → Tier 3 带有版本化 registry 的已部署 judge 模型)、一个严格的 800ms 截止时间管理器(带有工程化的 fail-open/fail-closed 语义),以及一个可重现性(重放)工具。Registry 现在通过相同的契约分发测得的线性开发 baseline 或 CPU ONNX transformer;生产环境启动需要并验证所有三个 transformer artifacts,且绝不进行静默回退。**[Tier-3 judge 评估 baseline](docs/benchmarks/judge-evals.md)** 和 **[编码系统评估](docs/benchmarks/system-encoding-eval.md)** 对证据的边界保持了诚实的态度。p99 3.7ms / ~5,400 次裁决/秒的标头数据是使用线性 baseline 测得的,并非 transformer 生产环境声明;生产拓扑的重新基准测试仍未完成。请参见 [docs/decision-cascade.md](docs/decision-cascade.md)。 **Sprint 3 (Causeway) —— 已完成。** 生产级 SDK(TypeScript + Python —— 感知截止时间、重试、本地失败模式)、适用于 LangChain/LangGraph、OpenAI Agents、Anthropic SDK、CrewAI 和 MS Agent Framework 的框架中间件(全部通过了一致性契约)、零代码 HTTP 出口 **gateway**、可编程的 **mandates**(一个 $25k 的 mandate 在 Tier 1 拦截了一个 $30k 的操作),以及 **工作流延续** —— 被升级的操作会挂起,人类的裁决会密封一个 tier-`human` 的记录,并且一个原子索赔允许唯一的恢复程序。Gateway 延续在 Postgres 中加密,并能在进程重启后幸存;稳定的幂等性 key 让合规的上游能够对模棱两可的交付重试进行去重,并且生产环境启动现在会针对连接器拥有的一致性端点主动证明该契约。未经修改的 agent 纯粹通过 gateway 进行治理。请参见 [docs/sdks-and-integration.md](docs/sdks-and-integration.md)。 **Sprint 4 (Watchroom) —— 已完成。** 将审核操作作为一个 OS:一个根据操作类别/风险/法规包(资金控制、隐私办公室、注册负责人)路由升级请求的队列引擎,一个具有精确一次违约告警的截止时间感知 SLA 引擎,带有已审计交付日志的多通道通知,审核人分析(审核时间、SLA 达成率、吞吐量、测得的分歧率),以及一个分歧→规则草案的反馈循环。一个预设的 **500 个升级积压任务在三个审核角色中在 SLA 内排空**(100% 达成率),并且触发了每一个违约告警。请参见 [docs/review-operations.md](docs/review-operations.md)。 **Sprint 5 (Seal) —— 已完成。** 法律上可用的证据:在生产环境中绑定到独立批准的 TSA 证书固定上的 RFC 3161 可信时间锚定,**通过选择性披露实现字段级脱敏**(脱敏后的包在加密验证下通过;未脱敏的原始记录保持完整),诉讼保留(在保留记录上禁用脱敏),受众作用域内的 **claims packs**(草案→密封→发布),第三方可使用该 bundle 加上独立批准的 TSA 信任材料进行离线验证,FINRA / EU AI Act Art. 12 / SR 11-7 法规导出,以及一个基于同意、有访问审计的交换门户。完整的突发事件演练 —— 声明 → 保留 → 组装 → 密封 → 发布 → 离线验证 —— 实现了端到端通过。请参见 [docs/evidence-seal.md](docs/evidence-seal.md) 和[可采性白皮书](docs/legal/admissibility.md)。 **Sprint 6 (Codex) —— 已完成。** 引用级别的 **FINRA pack v2** (2210/3110/2150) 和 **HIPAA pack v2**(最小必要原则、上下文中的 PHI、授权状态、违约触发器)作为带版本的 artifacts —— 每条规则都标明了其条款,并生成审查员可读的解释。一个 **受约束语法的策略编译器 (v1)** —— 一种面向行的语法,将少数几个通俗英语策略模式映射为候选规则供人工审批(这不是通用的自然语言编译器;请参见 [docs/LIMITATIONS.md](docs/LIMITATIONS.md))—— 以及一个完整的**策略生命周期**:编译 → dry-run(影响仪表板)→ shadow(带偏差)→ 激活 → **不到一分钟内回滚**(链条不受干扰)。编译后的策略 dry-run 预测与激活后观察到的裁决相匹配。请参见 [docs/regulation-packs-and-policy.md](docs/regulation-packs-and-policy.md)。 **Sprint 7 (Beam Count) —— 已完成。** 运营化的信任数学:一个持续保证引擎,对裁决进行抽样交由人工审计,并报告一个**测得的 Wilson-score 验证准确率下限**(无建模的占位符),统一的 **risk profile v2**(自主率、不可逆比例、策略失败率、影响范围、监督覆盖率 + 升级/分歧/保证信号 → 综合评级),一个 **readiness gate**,在检查失败时通过所有者例外工作流阻止外部发布,以及一个带版本、基于同意的 **underwriter feed**。验证准确率从 1,000 多次真实审计中计算得出;在授予例外之前,如果授权委托覆盖率失败,readiness gate 会阻止 feed。请参见 [docs/assurance-and-risk.md](docs/assurance-and-risk.md)。 **Sprint 8 (Granite) —— 已完成。** 达到银行可采购标准:**observability**(Prometheus `/metrics`、OTel 风格的 tracing、告警 runbook)、**resilience**(多可用区、文档化的 RPO/RTO、一次实现 **零证据丢失** 且恢复后链条在恢复区域重新验证为绿的 region-failover 演习)、**客户自托管 GA**(加固的 Compose + Helm chart + install-from-docs,仅限 CPU judge),以及为三部分模型设计的 **metering/billing**,其发票**与记录的使用量完全对账**。准备了 SOC 2 控制映射、SIG/CAIQ 应答包和 DPA 模板。请参见 [docs/operations.md](docs/operations.md)、[deploy/INSTALL.md](deploy/INSTALL.md) 和 [docs/compliance/soc2-and-procurement.md](docs/compliance/soc2-and-procurement.md)。 **Sprint 9 (Signal) —— 已完成。** GA、标准和渠道:**开放的 PDP 规范 v1.0** 已公开,并带有一致性测试套件和一个**符合规范的独立参考实现**(与 Pharos 级联并存),一个返回带签名 **evidence binding** 的公共 `POST /v1/pdp` 端点,AIUC-1 问责支柱 + NAIC 映射,身份导轨集成(通过 OIDC 集成用于 AI Agents 的 Okta / Entra Agent ID),已发布的 GA 定价,以及保险机构渠道。请参见 [docs/spec/pdp-v1.md](docs/spec/pdp-v1.md) 和 [docs/standards-and-channel.md](docs/standards-and-channel.md)。 157 个 TS 测试 + 10 个 Python 测试通过(增加了针对真实 Postgres / S3 WORM / Redis 的 PDP 一致性 + Signal 集成)。 **所有十个原型 sprint(Bedrock → Signal)均已达到代码完成阶段,并根据** [docs/ROADMAP.md](docs/ROADMAP.md) **完成了里程碑验证** —— 每一个退出标准都通过了针对真实基础设施的测试验证。目前还剩下两类工作: - **生产加固工程。** 几个 sprint 交付物仍需推进工作,主要是对 transformer judge 进行独立验证、校准、文档化和生产环境基准测试,并上线获批的 KMS/TSA 信任。Gateway 的保留请求状态现在设置了大小上限、实现了租户隔离、在 Postgres 中进行了加密,并经过了重启测试。所有遗留的限制条件都在 **[docs/LIMITATIONS.md](docs/LIMITATIONS.md)** 中列出。 - **外部人工门槛。** 外部法律顾问和顾问审查、SOC 2 认证、委托的渗透测试、设计合作伙伴/试点/生产客户的签约、承保人 feed 的确认,以及将 SDK 发布到 PyPI/npm —— 这些都不是代码层面的事情。 ## Monorepo 布局 ``` packages/core domain: ActionRecord schema v1, hashing, sealing, chain verify, KMS signing, verdict engine, migration packages/config fail-fast environment configuration packages/storage Postgres + S3 WORM + Redis; transactional write path; chain-integrity service services/api Fastify ingestion API + composition root apps/console Next.js console (Beam / Ledger IA) scripts durability demo + standalone external verifier docs architecture, frozen schema, external-verification walkthrough, audits, roadmap ``` 这些包中开源与商业候选之间的边界已在 [docs/adr/0001-open-core-boundary.md](docs/adr/0001-open-core-boundary.md)(提案阶段)中起草。目前所有的 代码均采用 Apache-2.0 协议;该 ADR 不会更改任何协议许可。 ## 快速开始 ``` pnpm install pnpm infra:up # Postgres + Redis + MinIO (S3 WORM) via docker compose cp .env.example .env pnpm test # 157 tests against real Postgres/Redis/MinIO (needs infra:up) pnpm demo:durability # submit demo actions, seal records pnpm demo:durability --verify # cold restart: records persist, chain verifies genesis→head ``` API 和离线验证器运行在**两个终端**中 —— `verify:external` 会从运行中的 API 获取导出的 bundle: ``` # terminal 1 — 保持运行 pnpm api:dev # serve the ingestion API on :4000 # terminal 2 pnpm verify:external demo-tenant # third-party offline, zero-trust verification (needs api:dev) pnpm --filter @pharos/console dev # (optional) the Next.js console on :3000 ``` 有关带有预期输出的分步、纯净机器演练,请参见 [docs/ONBOARDING.md](docs/ONBOARDING.md)。 ## 统一事件 一个 `ActionRecord` 携带 Beam 的裁决上下文和 Ledger 的责任上下文,一次签名,一次链接。请参见 [docs/schema-v1.md](docs/schema-v1.md)。 ``` POST /v1/actions → { verdict, record } # two outputs of one transaction ``` ## 验证 证据链可由任何第三方进行验证,仅需导出的记录和已发布的公共密钥集 —— 无需 Pharos 基础设施。请参见 [docs/external-verification.md](docs/external-verification.md)。 *Pharos 决策。Pharos 证明。*
标签:AI代理, CNCF毕业项目, Streamlit, 企业级安全, 合规治理, 审计追踪, 搜索引擎查询, 测试用例, 版权保护, 用户代理, 策略引擎, 网络安全挑战, 自动化攻击, 自定义请求头, 访问控制, 逆向工具