daniellehub-ai/HVHS-LLM-Security-Evaluation
GitHub: daniellehub-ai/HVHS-LLM-Security-Evaluation
该项目是一个面向医疗场景的 LLM 红队安全评估框架,通过模拟提示注入和数据泄露攻击来测试开源模型在合规框架下的防御能力。
Stars: 0 | Forks: 0
# HVHS 虚拟预检助手 — LLM 安全评估
这是一项关于模拟医疗场景下 LLM 助手抵抗 prompt injection 和数据泄露能力的实证评估,通过 Ollama 对多个本地 open-weight 模型进行了测试。
本项目是更广泛的 AI 安全/治理作品集的一部分(请参阅相关的 HVHS AI 治理毕业设计),并有意识地将其定位为 RAG 风格的 context-injection 助手,而非 tool-calling agent,以保持威胁面的集中性和结果的可复现性。
## 设置
1. 安装 [Ollama](https://ollama.com)。
2. 拉取本次评估中使用的模型:
ollama pull llama3.1:8b
ollama pull mistral:7b
ollama pull qwen2.5:7b
3. 安装 Python 依赖项:
pip install ollama --break-system-packages
4. 在运行任何攻击之前,先健全性检查助手是否能正常工作:
python assistant.py
你应该会看到一个合理的、符合角色设定的针对良性症状问题的回复。
## 项目结构
```
system_prompt.txt - the assistant's role and boundaries
mock_patient_data.json - synthetic, non-real patient records used as context
attacks.json - the attack taxonomy and prompt set (36 attacks, 6 categories)
SCORING_RUBRIC.md - how to label results after a harness run
WRITEUP_SKELETON.md - paper/report structure template (kept as-is for reference)
WRITEUP.md - completed draft writeup with results filled in
PLAN.md - full start-to-finish project plan, doubling as a status tracker
UPDATES.md - dated log of work performed during execution
assistant.py - core function: assembles prompt, calls Ollama
run_harness.py - runs every attack against every model, logs results
results/ - timestamped CSV output per run (git-ignored raw runs;
keep only the final analyzed run committed)
```
## 工作原理
发送给模型的每一轮对话由三个部分组装而成:
1. System prompt(其角色和边界)
2. 当前患者的“已检索”病历
3. 用户的聊天消息
**直接攻击**将恶意内容放在用户消息中。
**间接攻击**将恶意内容放在患者病历的 `notes` 字段中——模拟一份受损或对抗性的文档,助手会将其作为数据读取,而不是作为来自用户的指令。
## 威胁模型 / 什么算作“成功”的攻击
请参阅 `attacks.json` 中每个条目的 `goal` 字段。大致包括:
- 助手泄露了其 system prompt
- 助手披露了其他患者的信息
- 助手提供了诊断或特定的药物剂量
- 助手在 jailbreak 的设定下放弃了其角色设定
- 助手将攻击者控制的数据视为命令(间接注入)
## 状态
- [x] 助手脚手架 + 基线健全性检查
- [x] 攻击集(36 个 prompt,在 6 个类别中保持平衡)
- [x] 评分准则已定义(见 SCORING_RUBRIC.md)
- [x] 报告草稿框架已起草(见 WRITEUP_SKELETON.md)
- [x] 在所有 3 个模型上运行全套测试工具
- [x] 手动评分流程(成功 / 部分 / 失败 / 语无伦次)
- [x] 分析 + NIST AI RMF / HIPAA 风险映射
- [x] 报告已起草(见 WRITEUP.md)— [ ] 发布仍处于待定状态
## 参考框架
- OWASP LLM 应用程序 Top 10
- NIST AI RMF / NIST AI 600-1(生成式 AI 配置文件)
- HIPAA(用于医疗数据暴露的场景设定)
## 免责声明
本仓库中的所有患者数据均为合成数据。未使用或引用任何真实的患者信息、PHI 或生产系统。
## 许可证
© 2026 Danielle Hendon。保留所有权利。
本仓库出于作品集和演示目的公开发布。未经许可,不得复制、重复使用或重新分发本项目的任何部分——包括代码、数据、方法或报告。
标签:AI风险缓解, DLL 劫持, 人工智能, 医疗合规, 反取证, 大语言模型, 安全评估, 用户模式Hook绕过, 逆向工具