lava-security-research/forge-framework
GitHub: lava-security-research/forge-framework
FORGE 框架系统性梳理了数据中心与 AI 基础设施层面临的最关键安全风险,帮助供应商和客户识别、排序并缓解从硬件固件到管理平面、供应链和电网等基础设施级别的威胁。
Stars: 16 | Forks: 0
# 数据中心与 AI 基础设施十大安全风险

## 执行摘要
**AI 数据中心的构建速度超过了其安全防护的建设速度。**
**数据中心与 AI 基础设施十大安全风险**提供了一个实用框架,用于识别、优先处理和降低为 AI 提供动力的基础设施层中最重要的安全风险。该框架定义了 AI 基础设施中最关键的故障模式,并有助于将其转化为具体的安全要求。
### 本框架涵盖的内容
它不关注 AI 模型本身或应用层风险,如 prompt 注入、不安全的 agent 行为、模型滥用或模型级别的评估。这些风险由专注于 AI 技术栈其他部分的框架来解决,包括 [OWASP LLM 应用十大风险](https://owasp.org/www-project-top-10-for-large-language-model-applications/)、[MITRE ATLAS](https://atlas.mitre.org/)、[NIST AI 风险管理框架](https://www.nist.gov/itl/ai-risk-management-framework) 和 [ISO/IEC 42001](https://www.iso.org/standard/81230.html)。综合来看,这些资源为从业者提供了一幅更完整的 AI 安全图景,涵盖了从治理、应用层风险到底层计算基础设施的各个方面。
本文档中的一些风险也存在于传统的数据中心和云环境中。它们被收录在此是因为 AI 基础设施使这些风险变得更加严重:共享的高价值计算、复杂的加速器集群、密集的管理层以及多租户操作,可能会将普通的基础设施弱点转化为更严重的安全风险,因为任何事件发生的可能性和影响范围都比传统的企业级软件和服务部署要高得多。
### 本框架的目标读者
**新型云服务商**可以将本框架作为实用指南,用于了解 AI 基础设施威胁态势、审查攻击面、强化环境、确定安全优先级以及展示安全成熟度。
**AI 基础设施客户**可以将本框架作为实用指南,用于采购、安全审查、合同要求、供应商比较,以及评估在面对真实的租户到基础设施攻击时的抵御能力。
**混合云安全团队**可以将本框架作为实用指南,用于配置、维护和保护其本地业务部署免受现代攻击,这些攻击可以在不同环境之间迅速切换。
## 致谢
我们要感谢并确认所有参与审查和验证本文档的专家。
有反馈或想要贡献?[research@lavalabs.io](mailto:research@lavalabs.io)
### 作者
- Michael Katchinskiy (Lava 安全研究主管)
- Yakir Kadkoda (Lava CTO)
### 审查者
- Tony Rea (Dell 全球 AI 基础设施负责人)
- Daniel Iziourov (Nebius 平台安全总监)
- Vjaceslavs Klimovs (Roblox 高级技术总监)
- Assaf Namer (Google AI 安全主管)
- Tyson Macaulay (NC CIPSER 副主任)
- Golan Ben-Oni (IDT CIO/CISO)
- Florina Ciorba (巴塞尔大学副教授,高性能计算小组负责人)
- Arthur Reed (PNNL 安全工程师)
- Deumens Erik (佛罗里达大学研究计算总监)
- Saad Malik (Spectro Cloud CTO)
- Selim Aissi (Visa & Intel 前全球信息安全副总裁)
- Guy Bilitski (SDS AI AI 运营负责人)
- Dan Farmer (安全研究员)
- Michael Bargury (Zenity CTO)
- Amir Jerbi (Aqua Security 前任 CTO)
- Bill Stout (ServiceNow 前技术总监,AI 产品安全)
- Roey Yaacovi (IBM DSPM 与 AI 安全 CTO)
- Guy Shanny (联合创始人兼 CEO,Polar Security,已被 IBM 收购)
- Ziv Karliner (Pillar CTO)
- Assaf Morag (安全研究员)
- James Berthoty (Latio 创始人兼 CEO)
## FORGE 视角的五大领域
FORGE 领域定义了评估视角:即 AI 安全风险所在的基础设施区域。下面的风险矩阵将各项具体风险映射到这些领域中。
| 领域 | 名称 | 描述 |
|--------|------|-------------|
| **F** | Fleet 完整性 | 对构成 AI 基础设施 Fleet 的硬件、固件、软件制品、镜像、依赖项和供应链的信任。 |
| **O** | 运营与管理平面 | 用于控制、自动化和管理 AI 基础设施的特权系统,包括 BMC、调度器、编排、自动化和管理工具。 |
| **R** | 资源隔离 | 在共享的 AI 系统中,将租户、工作负载、执行环境和重用基础设施隔离开来的边界。 |
| **G** | 电网 | 连接 AI 集群并为其提供电力、冷却和运行保障的网络架构和设施系统。 |
| **E** | 证据与暴露面管理 | 客户了解供应商安全成熟度、架构范围、暴露服务和补丁更新速度所需的证据。 |
## 十大风险
FORGE ID 按严重程度从高到低排序。该矩阵按领域对每项风险进行了分组,并显示了其发生的可能性、影响程度和检测难度。
| ID | 领域 | 风险 | 风险等级 | 可能性 | 影响 | 检测难度 |
|---|---|---|---|---|---|---|
| [FORGE-01](Risks/FORGE-01-Hardware-And-Firmware-Integrity-Compromise.md) | F | 硬件与固件完整性破坏 | 严重 | 中 | 严重 | 高 |
| [FORGE-02](Risks/FORGE-02-Network-And-Interconnect-Vulnerabilities.md) | G | 网络与互联漏洞 | 严重 | 中 | 严重 | 高 |
| [FORGE-03](Risks/FORGE-03-Unsafe-Multi-Tenant-Isolation-And-Resource-Reuse.md) | R | 不安全的多租户隔离与资源重用 | 严重 | 低 | 严重 | 极高 |
| [FORGE-04](Risks/FORGE-04-Insecure-Out-Of-Band-Management-Plane.md) | O | 不安全的带外管理平面 | 严重 | 中 | 高 | 极高 |
| [FORGE-05](Risks/FORGE-05-AI-Infrastructure-Supply-Chain-Compromise.md) | F | AI 基础设施供应链破坏 | 严重 | 高 | 高 | 高 |
| [FORGE-06](Risks/FORGE-06-Insecure-Facility-And-Datacenter-Management-Systems.md) | G | 不安全的设施与数据中心管理系统 | 高 | 低 | 高 | 极高 |
| [FORGE-07](Risks/FORGE-07-Insecure-Data-And-Artifact-Handling.md) | R | 不安全的数据与制品处理 | 高 | 高 | 高 | 中 |
| [FORGE-08](Risks/FORGE-08-Certification-Gaps-And-Provider-Transparency-Failures.md) | E | 认证缺失与供应商透明度问题 | 高 | 中 | 高 | 中 |
| [FORGE-09](Risks/FORGE-09-Insecure-Operational-Infrastructure-Services.md) | O | 不安全的运营基础设施服务 | 高 | 高 | 中 | 中 |
| [FORGE-10](Risks/FORGE-10-Vendor-Embargo-Gaps-And-Patch-Velocity-Failures.md) | E | 供应商 embargo 缺口与补丁更新速度问题 | 中 | 中 | 中 | 低 |
每项风险都遵循一致的结构:**定义**、**描述**、**影响与故障模式**、**预防与缓解策略**(针对供应商和客户)、**攻击场景**以及**参考**。
## 简介
现代数据中心和 AI 基础设施的建设速度远远超过了对其进行安全防护的能力。当这些基础设施——GPU 集群、训练 pipeline、高性能网络和推理 endpoint——遭到破坏时,其影响范围与传统计算截然不同。攻击者可以获得代表数亿美元价值的专有模型、破坏基础训练数据的能力,并在最高级别的特权环境中建立持久的立足点。
这种态势因结构性的市场失衡而加剧:GPU 的稀缺性赋予了供应商极大的杠杆。当对加速计算的需求远远超过供应时,客户往往无法根据安全态势来选择供应商——他们只能选择可用资源。供应商几乎没有面临投资于安全成熟度的市场压力,而客户也接受了他们在传统云中无法容忍的风险。这种失衡正是阅读本文档中每一项风险时的背景。随着 AI 驱动的安全研究和漏洞利用能力压缩了防御者的响应时间,这种市场压力正变得更加危险。那些曾经可能多年未被发现的安全弱点,现在可能会被更快地发现、串联并付诸实施。
**同时,AI 驱动的安全研究和漏洞利用能力正在压缩防御者的响应时间:**那些曾经可能多年未被发现的弱点,现在可能会被更快地发现、串联并付诸实施。
### 为什么 AI 基础设施安全与众不同
AI 基础设施处于云计算、高性能计算和物理数据中心运营的交汇处。它使用了服务器、存储、网络、调度器、管理平面和身份系统等熟悉的组件,但将它们组合在一起的方式改变了安全模型。
保护 AI 基础设施和数据中心需要云服务提供商、硬件和网络供应商、安全公司、系统集成商以及客户之间的协作。这在高性能网络、东西向可见性、微分段、管理平面保护和基础设施安全控制等领域尤为重要。
### 近期报道
- **针对美国 AI 数据中心的攻击报道** - 2025 年 4 月,[*TIME* 报道](https://time.com/7279123/ai-datacenter-superintelligence-china-trump-report/) 称,与国家安全官员和数据中心运营商交流的研究人员了解到一个案例:一家美国顶尖科技公司的 AI 数据中心遭到攻击,知识产权被盗。他们还描述了另一个案例,一家类似的设施通过某个未具名的特定组件成为攻击目标;如果攻击成功,可能会导致整个数据中心下线数月之久。
- **国家级攻击者针对 AI 基础设施知识产权** - 联邦政府的起诉书证实,国家级攻击者正在硬件和系统层面直接瞄准 AI 数据中心架构。[在一个案例中](https://www.justice.gov/opa/pr/former-google-engineer-found-guilty-economic-espionage-and-theft-confidential-ai-technology),一家美国大型科技公司的前工程师因窃取了数千页 AI 数据中心设计图纸(包括用于大规模模型训练的芯片架构、系统集成规格和编排软件)而被判犯有经济间谍罪。
- **关于天津国家超级计算中心数据泄露的报道** - 2026 年 4 月,[公开报道](https://covertaccessteam.substack.com/p/hacker-claims-10-petabytes-stolen) 描述了有关超过 10 PB 数据从天津超级计算中心被盗的说法,据报道,该设施为数千名研究、工业和政府用户提供服务。声称源自此次泄露的数据在 Telegram 频道上被公开出售。该事件说明了当高价值的工作负载、数据和研究成果集中在同一个先进的计算环境中时所造成的集中化风险。
这些只是早期的例子。随着技术栈的成熟,攻击面可能会进一步扩大,本文档也将随之不断演进。
## 威胁行为者
通过分析潜在的攻击者可以最好地理解这些风险。威胁模型远远超出了经典的“外部攻击者”的范畴,本文档中的控制措施是针对全套威胁进行校准的:
- **外部攻击者** - 具有网络访问权限的未经身份验证或未经授权的行为者。
- **遭到入侵的云客户** - 一个合法的客户账户、租户或工作负载,已被攻破并在供应商的共享基础设施上运行。
- **恶意企业内部人员** - AI 消费组织的员工或承包商,拥有合法访问权限。
- **恶意的云承包商** - 对供应商环境具有受限访问权限的第三方,例如硬件技术人员、系统集成商、物流供应商或故障维修供应商。
- **恶意的云员工** - 供应商端的员工,对 hypervisor、BMC、物理主机、存储系统或租户数据平面拥有特权访问权限。
- **在途威胁者** - 在硬件或组件抵达供应商的安全数据中心环境之前,在制造、暂存、仓储、运输、海关处理或交付过程中能够接触到这些硬件或组件的行为者。
- **系统集成商** - 负责从单个组件组装、配置或发运完整系统的组织。
- **供应商** - 上游的硬件、固件或驱动程序供应商。
- **AI agent** - 任何代表并冒充上述任何身份的 AI agent。
### 企业系统入侵作为初始访问向量
本框架中的风险侧重于 AI 基础设施特有或被 AI 基础设施放大的故障模式。它们不能替代强大的企业安全控制需求。实际上,许多针对 AI 基础设施的攻击可能始于常见的企业入侵路径,包括 MFA 薄弱或缺失、网络钓鱼、凭证盗窃、SaaS 入侵以及薄弱的身份控制。
这些路径应被视为横向的初始访问向量。遭到入侵的身份、endpoint、SaaS 账户、CI/CD 系统或管理凭据可能会提供必要的立足点,从而触及本框架中描述的多项风险。因此,以下章节将重点关注一旦攻击者到达或能够影响 AI 基础设施环境本身时,可能会发生什么。
## 风险筛选方式
候选风险来源于:
- 对影响 AI 特定组件的安全研究、事件报告和已发布的 CVE 分析。
- 对来自 NVIDIA、AMD 和主要云供应商的安全文档的审查。
- 在 GPU 云环境和 ML 编排平台中观察到的漏洞模式。
- 与在多个垂直领域的 AI 基础设施中工作的安全从业者的讨论。
每项候选风险都从四个维度进行了评估:可能性、影响、可利用性和检测难度,并选出了得分最高的风险列入其中。
## 版本控制与贡献
这是一份动态更新的文档。AI 基础设施正在快速发展,针对它的攻击也是如此。未来的修订版将增加新的风险,完善现有的风险,并纳入从实践中汲取的经验教训。我们欢迎从业者提供反馈和提出补充建议,并将在发布新版本时予以署名。
## 许可证
本仓库中的内容根据 [CC BY-NC-SA 4.0](LICENSE) 获得许可。
标签:人工智能基础设施, 数据中心, 防御加固