prekshajain22/AI-Test-Orchestrator

GitHub: prekshajain22/AI-Test-Orchestrator

AI 质量工程框架,通过自动化 prompt 测试、幻觉检测和多维度评估指标,帮助团队在 LLM 和 RAG 应用上线前系统验证其质量与可靠性。

Stars: 0 | Forks: 0

# AI-Test-Orchestrator ![状态](https://img.shields.io/badge/status-In%20Development-blue) ![Python](https://img.shields.io/badge/Python-3.x-green) ![许可证](https://img.shields.io/badge/license-MIT-orange) # 概述 AI Test Orchestrator 是一个开源框架,用于评估 AI 驱动应用程序的质量、可靠性和可信度。 该项目通过自动化 prompt 测试、幻觉检测、答案评估和回归测试,将质量工程(Quality Engineering)原则应用于大语言模型(LLM)和检索增强生成(RAG)系统。 其目标是帮助工程团队在将 AI 应用程序部署到生产环境之前建立信心。 # 愿景 传统软件拥有自动化测试。 AI 应用程序也应当如此。 AI Test Orchestrator 旨在提供一种可重复、自动化的方法,使用可衡量的质量指标来验证 AI 系统。 # 目标 - 评估 LLM 响应 - 检测幻觉 - 测试 prompt 质量 - 衡量答案相关性 - 评估 RAG 系统 - 生成质量报告 - 支持 AI 回归测试 # 计划功能 ## Prompt 测试 - prompt 执行 - prompt 回归 - 边缘场景 prompt - 对抗性 prompt ## AI 评估 - 幻觉检测 - 答案相关性 - 忠实度 - 偏见检测 - 毒性检测 ## RAG 评估 - 检索质量 - 上下文准确率 - 上下文召回率 - 答案正确性 ## 报告 - HTML 报告 - JSON 报告 - PDF 报告 - 评估仪表板 # 架构(宏观) 测试用例 ↓ LLM ↓ 评估引擎 ↓ 报告 # 技术栈 - Python - Hugging Face - Promptfoo - DeepEval - Ragas - Pytest - GitHub Actions # 路线图 | 版本 | 目标 | | ------- | ----------------------- | | v0.1 | 基础架构 | | v0.2 | Prompt 测试 | | v0.3 | DeepEval | | v0.4 | 幻觉检测 | | v0.5 | RAG 评估 | | v0.6 | 报告 | | v1.0 | 生产就绪 | # 仓库结构 docs/ reports/ sample_data/ src/ tests/ examples/ # 当前状态 🚧 项目正在积极开发中。 # 学习之旅 该仓库记录了我从传统质量工程向 AI 质量工程的转变。 该项目采用增量方式构建,遵循软件工程的最佳实践,每个功能都经过了文档化和测试。 # 许可证 MIT
标签:Clair, DLL 劫持, IaC 扫描, Python, RAG, 人工智能, 大语言模型, 无后门, 测试框架, 用户模式Hook绕过, 质量保证, 逆向工具