【学习笔记】主流 AI 安全防护框架研究报告
一、摘要
生成式 AI 与智能体(Agent)的规模化落地,使传统以"边界防御+漏洞管理"为核心的网络安全体系在 AI 场景下出现系统性盲区。
本报告将主流框架归纳为五类角色,并给出可落地的统一防护架构。
关键发现 1: 框架已从"单一清单"走向"分层组合" 没有任何单一框架能覆盖治理、技术控制、威胁对抗与合规全部维度。成熟组织普遍采用NIST AI RMF(治理)+ISO 42001(管理体系)+OWASP LLM Top 10(应用层风险)+MITRE ATLAS(红队/威胁)的组合范式。 | 关键发现 2: 2025 年风险版图被 Agent 与 RAG 重写 OWASP LLM Top 102025 版相对 2023 版重构:新增系统提示泄露、向量/嵌入弱点,将"过度代理(Excessive Agency)"提前,并以无界资源消耗取代"模型窃取",直接呼应 Agent 与多模型部署的安全现实。 | 关键发现 3: 合规时钟已经开始走动 EU AI Act 自2025-02起分阶段生效,GPAI 义务已于 2025-08 落地,高风险与既有模型全面合规期限延伸至2027-08。所有受监管行业(制造、医疗、政务、能源等)须把"合规即控制"前置到架构设计阶段。 |
核心结论:AI 安全不是"再买一套安全产品",而是建立"治理—风险—控制—对抗—合规"五位一体的工程化能力。本报告第 7 章给出的分层参考架构与第 11 章的四阶段路线图,可作为各类组织从 0 到 1 建设的通用基线模板。 |
二、研究背景与范围
AI 系统相较于传统软件,引入了三类本质性新风险面,这正是传统安全框架"够不着"的地方:
非确定性(Non-determinism):相同输入可能产生不同输出,难以用传统单元测试覆盖,需要"概率性保障"与持续监控。
数据驱动脆弱性:训练数据投毒、成员推断、模型逆向可在"无漏洞"的情况下泄露敏感信息。
工具调用与自主性:Agent 通过插件/函数调用接入真实系统,攻击面从"提示词"延伸到"操作权限",过度代理成为高危风险。
本报告聚焦"已发布、可操作、被行业广泛引用"的框架,按角色而非按发布方组织内容,便于读者按需取用。
纳入标准 权威机构发布、具备可执行指引、有真实落地案例或被监管引用。 | 时间范围 覆盖 2023–2026 已发布版本,重点纳入 2025–2026 更新。 | 视角 以建设方/运营方( defend )为主,兼顾监管方与红队方视角。 | 行业适配 面向全行业通用;互联网、医疗、政务、制造、零售、教育等均适用,按风险等级取用。 |
三、AI 安全框架分类体系
将 12 个主流框架按"在 AI 安全生命周期中扮演的角色"划分为五类。读懂这张图,就理解了"为什么需要组合使用"。
图 1 AI 安全框架五角色分类体系(基于发布方角色与能力取向归纳)
监管合规 定义"必须做",具法律约束力,强制风险分级与评估。 |
风险管理 提供"如何想",结构化识别、度量与处置 AI 风险。 |
安全设计 给出"如何建",将安全控制嵌入 AI 工程链路。 |
威胁对抗 模拟"如何攻",以攻击者视角暴露系统与战术。 |
负责任/可信 锚定"为何做",以公平、透明、隐私等价值底线。 |
四、核心框架深度解读
以下对 6 个最具代表性的框架做深度拆解,其余框架在第 4.7 节概览。
4.1 NIST AI Risk Management Framework (AI RMF 1.0)
发布方:美国国家标准与技术研究院(NIST)|版本:1.0(2023-01 发布,2024 起配套 Generative AI Profile)|性质:自愿性、风险导向、行业中立。
AI RMF 以四个核心职能(Functions)组织 AI 风险管理活动,治理(Govern)为横切职能贯穿始终,之上叠加可信 AI 八大特征。
图 2 NIST AI RMF 四职能模型与可信 AI 特征
落地要点:AI RMF 不直接给控制项,而是给"思考框架"。建议将其与 ISO 42001 的条款结构对齐——Govern≈条款 5(领导)/4(环境),Map/Measure/Manage≈条款 6–10(策划/支持/运行/评价/改进),形成"战略+执行"的治理闭环。 |
4.2 OWASP Top 10 for LLM Applications(2025 版)
发布方:OWASP 社区|版本:2025 Edition v2.0(2025-05 发布)|性质:应用层安全风险清单,面向开发/安全/红队。
2025 版相对 2023 版做了结构性重构,以适配 Agentic AI 与多模型/RAG 部署:将"过度代理"提前、新增"系统提示泄露"与"向量/嵌入弱点"、以"无界资源消耗"取代"模型窃取"。下表自上而下按攻击面聚合呈现。
2023 → 2025 关键变化:① 敏感信息泄露由第 6 升至第 2;② 过度代理由第 8 升至第 6 并成为 Agent 头号风险;③ 移除"模型拒绝服务/插件设计/模型窃取"单独条目,转化为"无界资源消耗"与"系统提示泄露/向量弱点"等新形态;④ 明确覆盖多模型与 Agentic 部署。 |
4.3 MITRE ATLAS(Adversarial Threat Landscape for AI Systems)
发布方:MITRE|版本:v5.4.0(2026-02 更新)|性质:对抗性威胁知识库(TTP),类 ATT&CK 风格,STIX 2.1 机器可读。
ATLAS 当前包含16 个战术(Tactics)、84 个技术(Techniques)、56 个子技术、32 个缓解措施、42 个真实案例。其价值在于把"AI 攻击"从零散漏洞上升为可编排的攻击链,直接服务于红队、SOC 检测规则与威胁狩猎。
图 3 MITRE ATLAS 战术链(对抗性杀伤链视角)
红队用法:将 ATLAS 技术映射到检测规则。例如AML.T0051 提示注入→ 在输入网关部署注入特征检测;AML.T0020 投毒训练数据→ 对训练集做来源与统计异常校验;AML.T0048 从 RAG 收集→ 限制检索范围并监控外泄。42 个真实案例(如 iProov 深度伪造、SesameOp 后门)可直接用于 Purple Team 演练。 |
4.4 ISO/IEC 42001 与 23894 / 38507
发布方:ISO/IEC JTC 1/SC 42|版本:ISO/IEC 42001:2023(AI 管理体系 AIMS)、ISO/IEC 23894:2023(AI 风险管理指南)、ISO/IEC 38507:2022(AI 使用的治理含义)。
ISO/IEC 42001 是首个可认证的 AI 管理体系标准,采用高阶结构(HLS)与 Annex A 控制措施,可与 ISO 27001 一体化审核。其条款 4–10 构成 PDCA 闭环。
图 4 ISO/IEC 42001 的 PDCA 闭环与 SC 42 标准族关系
SC 42 标准族构成互补矩阵:38507解决"组织如何使用 AI 的治理含义"(董事会/管理层视角),23894给出风险管理方法论,42001将其落地为可认证管理体系,5338定义 AI 生命周期,TR 5469处理 AI 功能安全。受监管行业客户常将 42001 与 27001 合并建设,形成"信息安全 + AI 安全"双体系。
4.5 Google Secure AI Framework(SAIF)
发布方:Google|版本:2024 发布,持续更新|性质:工程化安全控制框架,含风险地图(Risk Map)与 15 项重点风险/控制。
SAIF 的核心主张是:把过去 20 年积累的基础设施安全能力扩展到 AI 生态,并以自动化对抗对抗。其六大核心要素如下。
要素 1 扩展安全基础到 AI 生态 将既有安全基础设施(身份、密钥、网络隔离)覆盖到训练/推理/数据链路。 | 要素 2 将检测响应延伸至 AI 把 AI 系统纳入组织威胁宇宙,统一 SIEM/SOC 检测与事件响应。 | 要素 3 自动化防御 以自动化跟上已知与新生威胁,包括对抗性训练与红队自动化。 |
要素 4 平台级控制统一 在平台层而非逐应用实现一致安全,降低碎片化。 | 要素 5 自适应控制 根据反馈快速调整缓解措施,形成部署闭环。 | 要素 6 业务情境化风险 将 AI 系统风险置于 surrounding 业务流程中评估,而非孤立看模型。 |
风险地图(Risk Map):SAIF 以"数据源 → 训练管线 → 模型/服务"三段式识别 15 项重点风险,例如数据源投毒、训练管线权限滥用、推理端点提示注入、模型抽取等。其落地抓手是"以基础设施安全承载 AI 安全",对已有成熟安全中台的大型机构尤为友好。 |
4.6 EU AI Act(Regulation 2024/1689)
发布方:欧盟|性质:具有法律约束力的横向 AI 法规,全球首个全面 AI 立法。
采用风险分级思路:不可接受风险(禁止)、高风险(强合规义务)、有限风险(透明性义务)、最小风险(自愿)。其合规时钟已启动。
图 5 EU AI Act 四级风险金字塔 | 合规时间线(关键节点) 2025-02-02禁止性实践 + AI 素养义务生效社会评分、操纵性 AI 等被禁;供应商须履行 AI 素养培训。 2025-08-02通用目的 AI(GPAI)义务生效第 51–56 条 GPAI 模型义务、AI 办公室与成员国主管机关开始运作。 2026-08-02高风险系统主要义务生效多数高风险 AI 系统的合规、评估、登记与监督义务落地(含过渡期安排)。 2027-08-02既有模型全面合规2025 年前投放市场的 GPAI/高风险系统的完全合规期限。 |
对各类组织的含义:招聘筛选、医疗诊断辅助、关键基础设施调度、内容审核、教育评测等被明确列为高风险场景,须满足风险管理、数据治理、技术文档、人类监督、可追溯与事件通报等义务。EU AI Act 与 ISO 42001 / NIST AI RMF 高度互补——可用后者作为前者的"合格评定"证据基础。无论是否受欧盟管辖,其高强度要求都可作为全球 AI 治理的对标上限。 |
4.7 其他重要框架概览
框架 | 发布方 | 定位 | 关键产出 |
Microsoft Responsible AI Standard | Microsoft | 负责任 AI 原则工程化 | 6 原则(公平/可靠安全/隐私安全/包容/透明/可问责)+ Impact Assessment 工具 |
NIST Generative AI Profile (AI 600-1) | NIST | GenAI 风险映射 | 将幻觉、越狱、数据污染等 GenAI 风险逐条映射到 AI RMF 四职能 |
CSA AI Security / Top Threats | 云安全联盟 | 云上 AI 威胁 taxonomy | AI 威胁分类、Securing AI 报告、AI 供应链安全指引 |
Singapore Model AI Governance Framework | IMDA/PDPC | 治理框架+测试工具 | 第二版(2020):内部治理/风险管理/用户交互原则 + AI Verify 测试框架 |
UK AISI / Frontier AI Safety | 英国 AI 安全研究所 | 前沿模型安全评估 | Inspect 评估平台、模型能力/危险红队评估方法学 |
NSA/CISA 安全部署 AI 指南 | 美国家安全局等 | 采购与部署基线 | 《Deploying AI Systems Securely》——提供方/使用方双向安全检查清单 |
五、六维能力对比雷达
将 5 个代表性框架在 6 个能力维度(1–5 分,主观评估用于说明取向)上对比,直观呈现"各有所长、需组合使用"。
图 6 主流框架六维能力雷达(1–5 分,取向性评估) | 如何读这张图 ·NIST AI RMF治理/伦理维度饱满,但技术控制与威胁建模偏薄——它是"大脑"不是"手脚"。 ·OWASP LLM技术控制与操作性极强,但治理与合规覆盖弱——它是"攻击面清单"。 ·MITRE ATLAS威胁建模拉满,治理/伦理几乎为零——它是"红队地图"。 ·ISO 42001治理+合规双高,且可认证——它是"体系底座"。 ·Google SAIF技术控制与操作性均衡——它是"工程抓手"。 结论:没有任何单点能覆盖全部维度。 推荐基线组合 =ISO 42001(体系)+ NIST AI RMF(治理方法论)+ OWASP LLM(应用风险)+ MITRE ATLAS(红队)。 |
六、横向对比矩阵
从发布方、性质、核心维度、是否可认证、对行业落地价值等角度横向对比。单元格颜色:高/中/低/不适用。
维度 | NIST AI RMF | OWASP LLM 2025 | MITRE ATLAS | ISO/IEC 42001 | Google SAIF | EU AI Act |
发布方性质 | 政府标准院 | 开源社区 | 政府/国防实验室 | 国际标准化组织 | 科技企业 | 立法机构 |
框架类型 | 风险管理 | 风险清单 | 威胁知识库 | 管理体系 | 工程控制 | 法规 |
治理成熟度 | 高 | 低 | 低 | 高 | 中 | 高 |
技术控制深度 | 中 | 高 | 高 | 中 | 高 | 低 |
威胁建模能力 | 低 | 中 | 高 | 低 | 中 | 低 |
合规可映射性 | 中 | 低 | 低 | 高 | 中 | 高 |
可认证 | 否 | 否 | 否 | 是 | 否 | 法定 |
开发侧友好 | 中 | 高 | 中 | 中 | 高 | 低 |
行业落地价值 | 治理蓝图 | 应用防护 | 红队验证 | 认证合规 | 工程落地 | 强制合规 |
七、统一 AI 安全防护参考架构
将前述框架"翻译"为一套可落地的分层防御架构。自上而下五层,每层标注对应框架与控制抓手。该架构可作为各类组织 AI 系统安全设计的通用基线,与具体行业强监管叠加适用。
图 7 统一 AI 安全防护分层参考架构(治理→数据→模型→应用→检测,横切安全底座)
设计原则:①纵深防御——任一层失效不导致全局失守;②安全左移——治理与数据控制前置到训练前;③最小权限——Agent 工具调用必须受约束;④可观测——所有层输出统一接入检测响应层;⑤合规嵌入——将 EU AI Act / 42001 要求映射为具体控制项而非事后整改。 |
八、威胁建模方法论:OWASP × ATLAS 联动
把"风险清单(OWASP)"与"攻击链(ATLAS)"联动,形成可执行的威胁建模闭环:识别风险 → 映射攻击技术 → 部署控制 → 红队验证。
OWASP 2025 风险 | 对应 ATLAS 技术 | 推荐控制(对应架构层) |
LLM01 提示注入 | AML.T0051 提示注入(直接/间接) | 指令/数据上下文隔离、结构化输出(③④层) |
LLM02 敏感信息泄露 | AML.T0048 从 RAG 收集;AML.T0091 泄露 | 输出过滤器、PII 脱敏、检索范围限制(③④层) |
LLM03 供应链漏洞 | AML.T0018 获取/构造恶意 ML 模型 | SBOM、模型签名校验、第三方评测(②⑤层) |
LLM04 数据/模型投毒 | AML.T0020 投毒训练数据;AML.T0046 后门 | 数据出处追踪、统计异常检测(②层) |
LLM06 过度代理 | AML.T0054 访问 AI 代理配置;AML.T0086 执行 | 最小权限工具矩阵、人审确认、限流(④层) |
LLM08 向量/嵌入弱点 | AML.T0048 从 AI 服务收集;AML.T0049 检索操纵 | RAG 文档消毒、检索访问控制(②③层) |
LLM10 无界资源消耗 | AML.T0040 模型拒绝服务;推理 API 滥用 | token 预算、超时、成本告警(③层) |
闭环建议:每季度基于 ATLAS 案例库做一次 Purple Team 演练,将发现回填至 OWASP 风险登记册,并同步更新 42001 的风险评估与 EU AI Act 的事件通报流程。威胁建模不是一次性活动,而是与架构演进同步的"活文档"。 |
九、跨行业落地实践
AI 已渗透各行业,但"高风险"的形态各异:互联网平台怕内容/推荐失控、医疗怕误诊、制造怕产线误控、政务怕歧视与滥用。框架的取法相同,场景化的风险重点不同。下面先给通用落地四支柱,再给出分行业"风险—框架"映射。
9.1 分行业风险与框架映射
行业 | 典型 AI 应用 | 首要安全风险 | 重点适用框架 |
企业生产力 | 智能办公、代码助手、企业知识库问答 | 提示注入致数据泄露、过度代理误操作系统、代码生成含漏洞 | OWASP LLM01/06 · Google SAIF · MITRE ATLAS |
医疗健康 | 诊断辅助、影像识别、病历摘要 | 幻觉致误诊、PHI 隐私泄露、偏见致漏诊 | OWASP LLM09/02 · EU 高风险 · NIST Measure |
政务与公共服务 | 审批辅助、智能问答、舆情分析<o:page> | 算法歧视、深度伪造、数据滥用 | EU 高风险 · ISO 38507 · OWASP LLM09 |
制造与能源 | 质检视觉、调度预测、运维 Agent | 对抗样本致误判、OT/ICS 安全、Agent 误控设备 | MITRE ATLAS · Google SAIF · ISO 5338 |
零售与电商 | 推荐、客服、营销内容生成 | 提示注入、品牌误导、成本滥用 | OWASP LLM01/10 · Google SAIF |
教育 | 智能辅导、自动阅卷、招生筛选 | 成绩/录取偏差、未成年数据隐私 | OWASP LLM09/02 · 隐私增强技术 |
9.2 通用落地四支柱
① 治理与合规(满足监管预期) ·以ISO 42001建立 AI 管理体系,与既有 ISO 27001 合并审核,降低合规成本。 ·以NIST AI RMF的 Govern/Map 明确 AI 资产台账与风险偏好。 ·对高风险场景(医疗诊断、审批、调度、内容审核等)按EU AI Act 高风险逻辑做影响评估与人工监督(即使非欧盟机构,亦可借鉴其高强度要求)。 ·对齐所在行业的监管要求(医疗、政务、制造等),将治理要求固化为制度与审批流。 | ② 应用与模型防护(抵御攻击) ·对面向用户的 Agent / RAG 系统重点防护OWASP LLM01/06/07:提示注入、过度代理、系统提示泄露。 ·对知识库(制度/产品/病历文档)落实LLM08文档消毒与检索鉴权。 ·推理端点配置LLM10限流与成本预算,防止提示膨胀型 DoS。 ·用MITRE ATLAS对关键模型做对抗样本与投毒红队(如质检视觉、内容审核模型)。 |
③ 数据与隐私(守住底线) ·训练/微调数据落实出处追踪与投毒检测(对应LLM04)。 ·个人与敏感信息(PII/PHI)在提示与检索中强制脱敏(对应LLM02)。 ·采用隐私增强技术(联邦学习、差分隐私)满足数据保护法规要求。 | ④ 监测与应急(持续可信) ·将 AI 威胁信号接入既有 SOC,按SAIF 要素2统一检测响应。 ·建立 AI 事件通报流程,对齐EU AI Act与所在行业监管报送要求。 ·对生成内容做幻觉率/越狱率持续度量(NIST Measure)。 |
跨行业风险提醒: ① 企业生产力——代码助手泄露内部代码、知识库 Agent 过度代理误删数据; ② 医疗——诊断助手幻觉致误诊、PHI 泄露; ③ 制造——对抗样本致质检/调度误判、运维 Agent 误控设备; ④ 政务——算法歧视与深度伪造滥用。凡涉及"人、财、物、命"的高影响决策,必须将"人审确认"与"最小权限"作为强制控制,不可依赖模型自我约束。 |
十、AI 安全成熟度模型
以四级模型评估组织 AI 安全能力,便于定位现状与设定目标。
Level 1 被动 Ad-hoc 临时应对 无专门治理;安全靠个人经验;AI 上线无安全评审;出现事故才响应。 | Level 2 定义 Defined 制度建立 建立 AI 资产台账;采用 OWASP LLM 做上线前检查;有基础提示注入防护。 | Level 3 量化 Measured 度量驱动 落地 42001/AI RMF;红队常态化;幻觉/越狱率纳入度量;事件可溯源。 | Level 4 优化 Optimizing 自适应 安全能力平台化、自动化;ATLAS 联动 SOC;合规嵌入 CI/CD;持续对抗演进。 |
十一、实施路线图(四阶段)
面向从 0 到 1 的组织(无论行业),给出 6–12 个月可执行的路线。各阶段均标注主导框架。
阶段 | 时间 | 目标 | 主导框架 | 关键交付物 |
阶段一 · 立基 | 0–2 月 | 摸清家底、明确责任 | ISO 42001 / NIST Govern | AI 资产台账、AI 伦理委员会、政策制度 v1 |
阶段二 · 防护 | 2–5 月 | 堵住应用层高危风险 | OWASP LLM 2025 / SAIF | 提示注入防护、输出校验、限流、RAG 消毒、Agent 最小权限 |
阶段三 · 验证 | 5–9 月 | 红队验证与体系化 | MITRE ATLAS / AI RMF | 红队报告、度量看板、42001 内审、风险评估文档 |
阶段四 · 合规 | 9–12 月 | 认证与持续运营 | ISO 42001 认证 / EU AI Act | 外审认证、合规映射、事件通报流程、年度复审 |
节奏建议:阶段一、二可并行启动,避免"先治理后安全"导致线上风险暴露;阶段三的度量数据应回流支撑阶段四的认证证据。对于已具备 ISO 27001 基础的机构,阶段四可显著提速。 |
十二、挑战与趋势
关键挑战 ·标准碎片化:多框架术语不一,企业"拼图"成本高,需建立内部映射字典。 ·度量难题:AI 安全缺乏如"漏洞数"的通用指标,幻觉率/鲁棒性度量尚未标准化。 ·Agent 新面:自主智能体的权限与工具调用使传统"边界"失效,过度代理成头号难题。 ·供应链黑箱:第三方模型/数据集不可见,SBOM 与模型出处仍不成熟。 | 演进趋势 ·合规驱动收敛:EU AI Act 与各国立法将倒逼框架"互认",42001 有望成国际通用底座。 ·红队常态化:ATLAS + 自动化红队工具将成为安全运营标配。 ·安全左移到训练:从"推理防护"前移到"数据/训练安全"。 ·AI 守护 AI:用模型监测模型行为,异常检测走向自适应。 |
十三、结论
AI 安全框架已经形成"治理(ISO 42001 / NIST AI RMF)— 风险(OWASP LLM)— 对抗(MITRE ATLAS)— 工程(Google SAIF)— 合规(EU AI Act)"的完整生态。
对各类组织而言,关键不是"选哪个框架",而是建立组合能力:以可认证的 42001 为体系底座,以 AI RMF 为治理方法论,以 OWASP LLM 2025 守住应用风险,以 ATLAS 持续红队验证,并将 EU AI Act 的高强度要求作为合规上限。
本报告第 7 章的分层参考架构与第 11 章的四阶段路线图,提供了从"临时应对"走向"自适应优化"的可执行路径。在智能体时代,最小权限、人审确认与安全左移将不再是可选实践,而是 AI 安全的底线工程。
一句话总结:用 ISO 42001 立体系,用 NIST AI RMF 想清楚,用 OWASP LLM 防住面,用 MITRE ATLAS 攻验真,用 EU AI Act 兜底线——五位一体,方能在跨行业 AI 落地中行稳致远。 |
十四、参考文献
1.NIST,AI Risk Management Framework (AI RMF 1.0), NIST AI 100-1, 2023;配套Generative AI Profile(AI 600-1), 2024.
2.OWASP,Top 10 for Large Language Model Applications – 2025 Edition (v2.0), 2025-05.
3.MITRE,ATLAS – Adversarial Threat Landscape for AI Systems(v5.4.0, 2026-02).
4.ISO/IEC 42001:2023AI Management System;ISO/IEC 23894:2023;ISO/IEC 38507:2022;ISO/IEC 5338;ISO/IEC TR 5469.
5.Google,Secure AI Framework (SAIF)与 SAIF Risk Map / Controls, 2024.
6.European Union,Regulation (EU) 2024/1689 (AI Act);AI Act implementation timeline (European Commission / European Parliament).
7.Microsoft,Responsible AI Standard与 Impact Assessment 工具.
8.Cloud Security Alliance (CSA),AI Security Threat Taxonomy/Securing AI系列报告.
9.IMDA & PDPC (Singapore),Model AI Governance Framework (2nd ed.)与 AI Verify.
10.NSA / CISA / CSI,Guidance on Deploying AI Systems Securely, 2024.
11.UK AI Safety Institute (AISI),Inspect评估平台与方法学.
说明:本报告框架版本与数据截至 2026-07;雷达图评分为取向性说明,非官方定量评级。具体落地请结合最新官方文档与本地监管要求。
原文链接:
主流 AI 安全防护框架研究报告