thulisa-n/llm-eval-ci-starter
GitHub: thulisa-n/llm-eval-ci-starter
基于 Promptfoo 与 GitHub Actions 的 LLM 评估 CI/CD 模板,在代码或 prompt 变更合入生产前自动捕获幻觉、注入风险和成本超标。
Stars: 0 | Forks: 0
# 🛡️ LLM 质量、安全与评估 CI/CD 入门模板
[](https://github.com/thulisa-n/llm-eval-ci-starter/actions/workflows/ai-evals.yml)
[](LICENSE)
这个公开的入门模板展示了工程团队所需的**核心模式**:在将 prompt 或代码变更合并到生产环境**之前**,捕获幻觉、prompt 注入和 API 成本激增。
它被刻意设计得很轻量——这是一个准备好用于演示的基础,你可以在几分钟内克隆它。**Langfuse 可观测性被故意未接入此公开仓库**(保持克隆并运行的路径只需一个 API 密钥)。追踪与更深度的治理将在计划下一步交付的私有化 **AI Quality Sprint** 中落地。
完整的冲刺周期(领域断言、治理评分门禁、Langfuse 追踪以及私有 CI 强化)将作为定制化服务进行交付。
## ⚡ 快速开始(本地运行)
**要求 Node.js `^20.20.0` 或 `>=22.22.0`**(通过 `node -v` 检查)。
1. **克隆仓库:**
git clone https://github.com/thulisa-n/llm-eval-ci-starter.git
cd llm-eval-ci-starter
npm install
2. **添加你的 API 密钥:**
cp .env.example .env
# 设置 ANTHROPIC_API_KEY(可选 PROMPTFOO_AUTHOR=you@email.com)
3. **运行质量与安全评估:**
npx promptfoo eval
npx promptfoo view
4. **可选 — 红队演示(约 9 个低成本探测):**
npm run redteam
npm run redteam:report
5. **可选 — ModelAudit(扫描导出的 ML 模型文件):**
python3 -m venv .venv
source .venv/bin/activate # Windows: .venv\Scripts\activate
pip install -r requirements.txt
# 将 .pkl / .pt / .onnx / .safetensors 放入 ./models 目录,然后执行:
modelaudit scan ./models
## 🚀 此公开入门模板包含的内容
- **延迟与 Token 成本上限:** 如果 prompt 变更导致延迟或 API 支出预算超标,则 CI 不通过。
- **评分式幻觉准则:** 通过模型评分检查,拒绝捏造的 policies 和事实。
- **OWASP 风格注入测试套件:** 包含直接越狱 + 间接的“不可信工单” payload。
- **凭证规范检查:** 拒绝捏造或共享的密钥。
- **红队演示:** 通过 `npm run redteam` 进行轻量级对抗性探测(`system-prompt-override`、`hijacking`、`hallucination`)。
- **集成 ModelAudit:** 针对机器学习模型文件的可选静态安全扫描。
- **集成 GitHub Actions:** 每次向 `main` 分支 push/PR 时都会运行评估扫描。
**未包含在此模板中(设计如此):** Langfuse 追踪 / 生产环境可观测性。`.env.example` 仅包含占位符密钥——完整的接入属于 AI Quality Sprint 的一部分。
## 🔒 客户在 AI Quality Sprint 中能获得什么
私有化交付在此入门模板的基础上,提供针对公司业务的专属覆盖范围:
- 自定义领域断言和 critic 风格的评分阈值
- 针对高风险 AI 变更的治理风格允许/阻断门禁
- 映射到你的产品风险的更广泛的红队测试套件
- **将 Langfuse(或等效工具)追踪接入你的评估与应用 pipeline 中**
- 交接文档,确保你的团队在冲刺结束后能完全接管评估套件
## 💼 预约 AI Quality Sprint
在 72 小时内,为你的团队代码库接入自动化的 LLM 评估 pipeline、自定义领域断言以及追踪。
👉 [发邮件给我](mailto:thulie1@gmail.com) | 💬 [在 LinkedIn 上联系我](https://www.linkedin.com/in/thulisa-n-2053a32a2/)
## 许可证
MIT License © 2026 Thulisa Nikani
标签:Clair, DevSecOps, DLL 劫持, LLM评测, MITM代理, 上游代理, 大语言模型, 红队评估, 质量保证, 逆向工具