CognitiveOps/cogniops-resilient-devsecops

GitHub: CognitiveOps/cogniops-resilient-devsecops

该项目是一个面向弹性 DevSecOps 的有限自主认知 AI Agent,通过确定性护栏将 LLM 规划能力安全地引入云 CI/CD 与边缘部署场景。

Stars: 0 | Forks: 0

# CogniOps — 面向弹性 DevSecOps 的有限自主认知 AI Agent [![CI](https://static.pigsec.cn/wp-content/uploads/repos/cas/ad/ad5834178f7599af9fdda11629d49cae07f2997beec49821b2920eff5bfd50e7.svg)](https://github.com/CognitiveOps/cogniops-resilient-devsecops/actions/workflows/ci.yml) [![Release](https://img.shields.io/github/v/release/CognitiveOps/cogniops-resilient-devsecops?include_prereleases&label=release)](https://github.com/CognitiveOps/cogniops-resilient-devsecops/releases) [![Evaluation data](https://img.shields.io/badge/evaluation-data%20available-blue)](evaluation/results/) [![Evidence](https://img.shields.io/badge/evidence-showcase--evidence%2Emd-green)](docs/showcase-evidence.md) [![Cite](https://img.shields.io/badge/cite-CITATION%2Ecff-9cf)](CITATION.cff) [![Python](https://img.shields.io/badge/python-3.12-blue.svg)](https://www.python.org/) [![License](https://img.shields.io/badge/license-MIT-green.svg)](LICENSE) ## 问题 现代 DevSecOps pipeline 涵盖了云 CI/CD、边缘部署、回滚弹性、加密验证以及人工审批(human-in-the-loop)。在严格的安全约束下协调这些问题非常困难: - 部署回滚必须迅速执行,且不能违反策略。 - 边缘 OTA 更新必须经过验证,即使在资源受限的硬件上也是如此。 - 认知 agent 可以提出优化建议,但绝不能为了刷指标而作弊(game the metrics)或绕过安全护栏(guardrails)。 CogniOps 将这些问题视为一个统一的控制问题:一个**认知控制平面**负责监督一个**确定性基座(deterministic substrate)**,具备受限的操作、结构化的输出以及因果推理能力。 ## 架构 ``` flowchart TB subgraph control["Cognitive Control Plane"] runtime["Runtime Agent\nperceive → plan → guard → act\nmitigate"] design["Design-Time Agent\nmetrics → causal graph → proposal\nimprove"] security["Security Compliance Agent\nfeed → audit → proposal\naudit"] end subgraph substrate["Deterministic Substrate"] direction LR gh["GitHub Actions"] opa["OPA"] pqc["PQC / ML-DSA"] cr["Cloud Run"] bq["BigQuery"] end runtime -->|bounded actions| substrate design -->|validated proposals| substrate security -->|compliance proposals| substrate style control fill:#f0f7ff,stroke:#0969da style substrate fill:#f6f8fa,stroke:#656d76 ``` ### 设计原则 - **运行时绝不修改结构** — 不涉及 PR,也不修改 YAML。 - **设计时绝不执行缓解措施** — 仅提供建议,在提升(promotion)前必须经过验证。 - **LLM 仅用于规划 agent** — 所有其他模块均为确定性模块。 - **每次 LLM 调用都有兜底方案** — 安全默认值(NO_OP)、审计日志、schema 验证。 - **受限的操作面** — 仅支持 `NO_OP`、`BLOCK`、`ROLLBACK`、`QUARANTINE`、`ESCALATE`。 ## 功能说明 | 场景 | 关注点 | 测量指标 | |----------|---------|------------------| | **S1** | 云 CI/CD | 部署前置时间 (TTD)、变更失败率 (CFR)、部署频率 (DF) | | **S2** | 边缘 OTA | 下载延迟 (TDL)、部署成功率 (DSR)、边缘 TTD | | **S3** | 弹性 | 云端和边缘故障的平均检测/恢复时间 (MTTD/MTTR) | | **S4** | PQC 验证 | 验证时间 (TTV)、验证成功率 (VSR)、失败检测率 (FDR) | | **S5** | 可解释性 | 审批延迟 (AL)、审计完整率 (ACR) | | **SS1** | 策略审计 | 确定性 OPA 策略案例的 CFR、FDR | | **SS2** | 自适应威胁 | 注入完整性/运行时故障下的 MTTD、AL、ACR | ## 证据 该系统基于**跨越 54 项对比的 5,833 个指标样本**(阶段 1)以及随后的**阶段 2**修复流程进行了评估。详见 [`docs/showcase-evidence.md`](docs/showcase-evidence.md) 中的详细证据。 ### 部分结果 | 场景 | 指标 | 提升 | 效应量 | 备注 | |----------|--------|------------:|------------:|------| | S3 云端 | MTTD | **−65%** | d = −0.94 (大) | 运行时 agent 比静态阈值检测并升级(escalate)得更快 | | S3 云端 | MTTR | **−32%** | d = −0.47 (小) | 完整变体(运行时 + 设计时)恢复得更快 | | SS2 | AL | **−23%** | d = −1.25 (大) | 设计时 agent 减少了人工审批延迟 | | S4 | FDR/VSR | 100% | — | 所有被篡改的 artifact 均被检测出;所有有效签名均通过验证 | | S1 | CFR | 0% | — | 在基线或 agent 变体中均未出现部署失败 | ![阶段 1 效应量热图](https://static.pigsec.cn/wp-content/uploads/repos/cas/82/8202ebd66f90a0b451556909590873215266f95c5b0c4ccfef2b25e02358f25b.png) *阶段 1 效应量热图(涵盖 8 个场景的 54 项对比)。蓝色 = 提升,红色 = 恶化。完整表格请参见 [docs/showcase-evidence.md](docs/showcase-evidence.md)。* ### 客观的局限性 评估也暴露了实际的开销成本: - **S3 边缘 MTTR** 在运行时 agent 介入下恶化了约 150%,这是由于 Cloud Run 的往返延迟所致。 - **S5 AL** 恶化了约 200%,因为认知 `/decide` 调用增加了约 23 秒的系统开销。 - 设计时 agent 自主提出了基座调优建议,改善了原始指标,但其中一些提升是休眠门控(sleep-gate)产生的假象,而非真正的延迟降低(已作为 Goodhart 定律记录在案)。 这些权衡均已被如实报告,未作隐瞒。详见 [`docs/showcase-evidence.md`](docs/showcase-evidence.md)。 ### 可复现性 评估产物已进行版本控制并带有时间戳: - 原始指标导出:[`evaluation/results/raw/`](evaluation/results/raw/) - 统计学对比:[`evaluation/results/analysis/`](evaluation/results/analysis/) - 实验运行脚本:[`evaluation/scripts/run_experiment.py`](evaluation/scripts/run_experiment.py) - 标记快照:[`v0.1.0-alpha`](https://github.com/CognitiveOps/cogniops-resilient-devsecops/releases/tag/v0.1.0-alpha) 每份原始导出文件均包含 CSV schema 和 BigQuery 表元数据。分析文件包含上表中使用的 Mann–Whitney U 统计量、Cohen's *d* 效应量以及 bootstrap 置信区间。 ## 技术栈 | 层级 | 组件 | |-------|-----------| | Agent 框架 | Google ADK (`LlmAgent`)、Vertex AI Gemini 2.0 Flash | | 语言 | Python 3.12、类型提示、Pydantic v2、FastAPI、pytest | | CI/CD | GitHub Actions、Workload Identity Federation (OIDC) | | 基础设施 | Terraform — Artifact Registry、Cloud Run、BigQuery、IAM | | 安全 | OPA (Rego)、通过 liboqs 实现的后量子 ML-DSA (FIPS 204) | | 可观测性 | BigQuery `agent_metrics.runs`、结构化 JSON 日志 | ## 仓库结构 ``` ├── baseline/ # Deterministic DevSecOps scenarios S1–S5, SS1–SS2 ├── runtime-agent/ # ADK runtime agent: perceive → plan → guard → act ├── design-agent/ # ADK design-time agent: metrics → causal graph → proposal ├── security-agent/ # ADK compliance agent: feed ingestion → audit proposal ├── evaluation/ # 2-axis evaluation framework, SQL, plots, tests ├── infra/ # Terraform IaC ├── security/ # OPA policies ├── functions/ # Cloud Functions for metrics ingest ├── docs/ # Architecture, guardrails, evaluation evidence └── scripts/ # Integration and dispatch scripts ``` ## 快速开始 ``` # 克隆 git clone git@github.com:CognitiveOps/cogniops-resilient-devsecops.git cd cogniops-resilient-devsecops # 创建 virtual environment python -m venv .venv . .venv/bin/activate # or .venv\Scripts\activate on Windows # 安装 dependencies pip install -r requirements.txt # 运行 tests pytest ``` 运行完整场景需要一个配置了 Workload Identity Federation 的 GCP 项目。详细设置请参见 [`docs/thesis-setup.md`](docs/thesis-setup.md)(保留自原始论文文档)。 ## 意义与价值 这项工作展示了: - 如何构建一个**安全第一的认知 agent**,具备显式的护栏和受限的操作。 - 如何**将确定性基座与 AI 推理分离**,从而使故障具备可解释性。 - 如何**利用统计学效应量(而不仅是准确性)严格评估 agent 系统**。 - 如何**客观地报告局限性** — 包括 agent 表现得更差的情况。 ## 论文 Yanna Koutroumpi,*“面向边缘环境的弹性 DevSecOps 认知 AI Agent”*,硕士论文,2026 年。 注:软件实现强调**有限自主性** — 每一个操作都被限制在一个小型的确定性操作面上,并由护栏进行验证。 ## 未来工作 本次发布是论文基线的稳定快照。评估工作揭示了具体的扩展方向: - **边缘本地推理** — 将运行时 agent 的推理移至边缘(量化 Gemma / 蒸馏分类器 / 编译规则引擎),以消除导致 S3 边缘 MTTR 占主导地位的 Cloud Run 往返延迟。 - **多 agent 协作** — 通过协商协议协调运行时、设计时和安全 agent,而不是让它们独立运行。 - **情景记忆与自学习** — 将 `runtime_decisions` 和 metric 追踪反馈给 agent,以闭环实现持续改进。 - **扩展场景覆盖** — 增加供应链安全、多云部署和跨司法管辖区合规场景。 - **渐进式信任提升** — 基于积累的安全运行记录,形式化自动跨越 影子(shadow) → 建议(advisory) → 强制(enforce)模式的演进。 - **跨组织评估** — 将基座移植到 GitLab CI、Azure DevOps 和 AWS,以测试架构的可移植性。 ## 致谢 这项工作是在西阿提卡大学 [人工智能与深度学习硕士项目](https://aidl.uniwa.gr/) 攻读硕士学位论文 *“面向边缘环境的弹性 DevSecOps 认知 AI Agent”* 期间完成的。本仓库的代码将其实现为一个具有确定性护栏的**有限自主性**系统。 - **论文导师:** [Christoforos Kachris 教授](https://www.linkedin.com/in/christoforos-kachris-69b70b15/) ## 许可证 MIT — 详见 [LICENSE](LICENSE)。
标签:DevSecOps, 上游代理, 人工智能代理, 后量子密码学(PQC), 学术研究, 安全规则引擎, 策略引擎(OPA), 边缘计算, 运维自动化