thulisa-n/llm-eval-ci-starter

GitHub: thulisa-n/llm-eval-ci-starter

基于 Promptfoo 与 GitHub Actions 的 LLM 评估 CI/CD 模板,在代码或 prompt 变更合入生产前自动捕获幻觉、注入风险和成本超标。

Stars: 0 | Forks: 0

# 🛡️ LLM 质量、安全与评估 CI/CD 入门模板 [![CI](https://static.pigsec.cn/wp-content/uploads/repos/cas/56/56f1183b3cff1782493aa3715becdc01c12dddd83540ee1234778a7c2bafa2ea.svg)](https://github.com/thulisa-n/llm-eval-ci-starter/actions/workflows/ai-evals.yml) [![License: MIT](https://img.shields.io/badge/License-MIT-yellow.svg)](LICENSE) 这个公开的入门模板展示了工程团队所需的**核心模式**:在将 prompt 或代码变更合并到生产环境**之前**,捕获幻觉、prompt 注入和 API 成本激增。 它被刻意设计得很轻量——这是一个准备好用于演示的基础,你可以在几分钟内克隆它。**Langfuse 可观测性被故意未接入此公开仓库**(保持克隆并运行的路径只需一个 API 密钥)。追踪与更深度的治理将在计划下一步交付的私有化 **AI Quality Sprint** 中落地。 完整的冲刺周期(领域断言、治理评分门禁、Langfuse 追踪以及私有 CI 强化)将作为定制化服务进行交付。 ## ⚡ 快速开始(本地运行) **要求 Node.js `^20.20.0` 或 `>=22.22.0`**(通过 `node -v` 检查)。 1. **克隆仓库:** git clone https://github.com/thulisa-n/llm-eval-ci-starter.git cd llm-eval-ci-starter npm install 2. **添加你的 API 密钥:** cp .env.example .env # 设置 ANTHROPIC_API_KEY(可选 PROMPTFOO_AUTHOR=you@email.com) 3. **运行质量与安全评估:** npx promptfoo eval npx promptfoo view 4. **可选 — 红队演示(约 9 个低成本探测):** npm run redteam npm run redteam:report 5. **可选 — ModelAudit(扫描导出的 ML 模型文件):** python3 -m venv .venv source .venv/bin/activate # Windows: .venv\Scripts\activate pip install -r requirements.txt # 将 .pkl / .pt / .onnx / .safetensors 放入 ./models 目录,然后执行: modelaudit scan ./models ## 🚀 此公开入门模板包含的内容 - **延迟与 Token 成本上限:** 如果 prompt 变更导致延迟或 API 支出预算超标,则 CI 不通过。 - **评分式幻觉准则:** 通过模型评分检查,拒绝捏造的 policies 和事实。 - **OWASP 风格注入测试套件:** 包含直接越狱 + 间接的“不可信工单” payload。 - **凭证规范检查:** 拒绝捏造或共享的密钥。 - **红队演示:** 通过 `npm run redteam` 进行轻量级对抗性探测(`system-prompt-override`、`hijacking`、`hallucination`)。 - **集成 ModelAudit:** 针对机器学习模型文件的可选静态安全扫描。 - **集成 GitHub Actions:** 每次向 `main` 分支 push/PR 时都会运行评估扫描。 **未包含在此模板中(设计如此):** Langfuse 追踪 / 生产环境可观测性。`.env.example` 仅包含占位符密钥——完整的接入属于 AI Quality Sprint 的一部分。 ## 🔒 客户在 AI Quality Sprint 中能获得什么 私有化交付在此入门模板的基础上,提供针对公司业务的专属覆盖范围: - 自定义领域断言和 critic 风格的评分阈值 - 针对高风险 AI 变更的治理风格允许/阻断门禁 - 映射到你的产品风险的更广泛的红队测试套件 - **将 Langfuse(或等效工具)追踪接入你的评估与应用 pipeline 中** - 交接文档,确保你的团队在冲刺结束后能完全接管评估套件 ## 💼 预约 AI Quality Sprint 在 72 小时内,为你的团队代码库接入自动化的 LLM 评估 pipeline、自定义领域断言以及追踪。 👉 [发邮件给我](mailto:thulie1@gmail.com) | 💬 [在 LinkedIn 上联系我](https://www.linkedin.com/in/thulisa-n-2053a32a2/) ## 许可证 MIT License © 2026 Thulisa Nikani
标签:Clair, DevSecOps, DLL 劫持, LLM评测, MITM代理, 上游代理, 大语言模型, 红队评估, 质量保证, 逆向工具