prekshajain22/AI-Test-Orchestrator
GitHub: prekshajain22/AI-Test-Orchestrator
AI 质量工程框架,通过自动化 prompt 测试、幻觉检测和多维度评估指标,帮助团队在 LLM 和 RAG 应用上线前系统验证其质量与可靠性。
Stars: 0 | Forks: 0
# AI-Test-Orchestrator



# 概述
AI Test Orchestrator 是一个开源框架,用于评估 AI 驱动应用程序的质量、可靠性和可信度。
该项目通过自动化 prompt 测试、幻觉检测、答案评估和回归测试,将质量工程(Quality Engineering)原则应用于大语言模型(LLM)和检索增强生成(RAG)系统。
其目标是帮助工程团队在将 AI 应用程序部署到生产环境之前建立信心。
# 愿景
传统软件拥有自动化测试。
AI 应用程序也应当如此。
AI Test Orchestrator 旨在提供一种可重复、自动化的方法,使用可衡量的质量指标来验证 AI 系统。
# 目标
- 评估 LLM 响应
- 检测幻觉
- 测试 prompt 质量
- 衡量答案相关性
- 评估 RAG 系统
- 生成质量报告
- 支持 AI 回归测试
# 计划功能
## Prompt 测试
- prompt 执行
- prompt 回归
- 边缘场景 prompt
- 对抗性 prompt
## AI 评估
- 幻觉检测
- 答案相关性
- 忠实度
- 偏见检测
- 毒性检测
## RAG 评估
- 检索质量
- 上下文准确率
- 上下文召回率
- 答案正确性
## 报告
- HTML 报告
- JSON 报告
- PDF 报告
- 评估仪表板
# 架构(宏观)
测试用例
↓
LLM
↓
评估引擎
↓
报告
# 技术栈
- Python
- Hugging Face
- Promptfoo
- DeepEval
- Ragas
- Pytest
- GitHub Actions
# 路线图
| 版本 | 目标 |
| ------- | ----------------------- |
| v0.1 | 基础架构 |
| v0.2 | Prompt 测试 |
| v0.3 | DeepEval |
| v0.4 | 幻觉检测 |
| v0.5 | RAG 评估 |
| v0.6 | 报告 |
| v1.0 | 生产就绪 |
# 仓库结构
docs/
reports/
sample_data/
src/
tests/
examples/
# 当前状态
🚧 项目正在积极开发中。
# 学习之旅
该仓库记录了我从传统质量工程向 AI 质量工程的转变。
该项目采用增量方式构建,遵循软件工程的最佳实践,每个功能都经过了文档化和测试。
# 许可证
MIT
标签:Clair, DLL 劫持, IaC 扫描, Python, RAG, 人工智能, 大语言模型, 无后门, 测试框架, 用户模式Hook绕过, 质量保证, 逆向工具