# AI 安全、合规与伦理

> 核对日期：2026-10-03。法规变化快，以下用于产品与项目治理，不构成法律意见；具体项目必须由适用法域的法务、隐私、安全和行业专家确认。

如需将框架落到责任人、产物和复查记录，使用 [AI 产品与项目标准映射与证据矩阵](02_标准映射与证据矩阵.md)。

## 治理不是发布前盖章

治理的目标是让组织能回答：有哪些 AI、用于谁、依据什么数据、能做什么、谁负责、如何证明安全有效、出事怎样停止和补救。

最小治理系统：

```text
AI 清单 → 风险分级 → 责任与阶段门 → 控制与证据
      → 评测/红队 → 残余风险批准 → 持续监控 → 事故/退役
```

可参考 NIST AI RMF 的 `Govern / Map / Measure / Manage` 四类功能。[NIST AI RMF 1.0](https://www.nist.gov/itl/ai-risk-management-framework) 是自愿框架；生成式 AI 的特有风险和建议动作见 [NIST AI 600-1 Generative AI Profile](https://www.nist.gov/publications/artificial-intelligence-risk-management-framework-generative-artificial-intelligence)。组织管理体系可参考 [ISO/IEC 42001:2023](https://www.iso.org/standard/42001)。

## 第一关：AI 系统清单

每个系统记录：

- 所有者、Sponsor、开发者、部署者、供应商和使用者。
- 目的、用户、受影响者、地区、行业和使用场景。
- 自主性、关键决策/动作、人工监督和申诉。
- 数据类型、敏感性、来源、流向、保留和跨境。
- 模型、版本、部署、RAG、工具、第三方和许可证。
- 质量、安全、公平、隐私、成本指标和最近评测。
- 风险级别、适用义务、批准、例外、事故和退役状态。

“员工私下使用通用 AI”也属于组织风险，应通过可用工具、数据分类和培训治理，而不只是全面禁止。

## 第二关：风险分级

按以下维度评估固有风险：

- 影响：人身、心理、权利、机会、财务、隐私、社会、环境。
- 规模：用户数、频率、持续时间、受影响群体。
- 自主性：建议、草拟、推荐、决定、执行。
- 可逆性与可发现性：错误能否及时知道和纠正。
- 数据：个人/敏感/儿童/生物/商业秘密/国家或行业重要数据。
- 场景：医疗、金融、招聘、教育、司法、公共服务、关键基础设施。
- 对抗性：外部输入、工具权限、公开传播、模型供应链。

### 示例级别

| 级别 | 示例 | 默认治理 |
|---|---|---|
| 低 | 内部低敏文本改写，无自动动作 | 清单、基本评测、数据规则 |
| 中 | 企业知识问答、对外内容草稿 | 风险评估、引用、红队、人工确认 |
| 高 | 招聘排序、信贷/医疗辅助、高权限 Agent | 独立评审、严格人控、审计、持续监控 |
| 禁止/不可接受 | 隐蔽操纵、无合法依据的敏感推断、不可控高损害 | 不做或重新设计 |

风险控制后评估残余风险。高风险残余风险必须由有权的业务与风险责任人接受，工程团队不能替组织接受。

## 核心风险域

### 1. 质量与可靠性

风险：幻觉、错误引用、长尾失败、漂移、工具状态误报、自动化偏见。

控制：代表性评测、关键切片、选择性回答、独立验证、引用、确认、人工接管、版本和回滚。

### 2. 隐私与个人信息

风险：过度收集、目的漂移、敏感推断、训练记忆、跨租户泄漏、无法删除、供应商二次使用。

控制：

- 目的限定、数据最小化、适当法律基础/同意。
- DPIA/个人信息保护影响评估，尤其自动化决策和敏感信息。
- 去标识/假名化、传输与静态加密、最小权限、短期凭证。
- 推理日志脱敏、分级访问、保留期限和删除传播。
- 用户访问、更正、复制、删除、撤回和申诉机制。
- 供应商 DPA、子处理者、区域、训练使用和验证删除。

不要把“脱敏”当万能：自由文本、向量、日志和组合字段仍可能重识别。

### 3. 安全

主要攻击面：

- 直接/间接 Prompt Injection、越狱。
- RAG/训练/记忆/工具投毒。
- 敏感数据和系统提示外泄、模型反演/提取。
- 跨租户、权限升级和高危工具滥用。
- 恶意模型/数据/插件/依赖供应链。
- 资源耗尽、无限循环、成本攻击。
- 输出进入代码、SQL、HTML、邮件等下游造成注入。

控制原则：

- 外部内容永远是不可信数据，不把它与系统指令混为一层。
- 模型不作为权限边界；所有动作在确定性授权层校验。
- 工具最小权限、白名单、Schema、沙箱、预算、确认、审计。
- 输出按下游上下文编码/验证，禁止直接执行模型文本。
- 知识入库做来源、签名、权限、恶意内容和变更审核。
- 秘密不放 Prompt；凭证使用短期、范围受限、可撤销。
- 红队、渗透、故障注入、依赖扫描、异常检测和速率限制。

威胁与用例可参考 [MITRE ATLAS](https://atlas.mitre.org/)；NIST 2025 年对预测与生成 AI 的逃逸、投毒、隐私和滥用攻击给出分类，见 [NIST AI 100-2e2025](https://www.nist.gov/publications/adversarial-machine-learning-taxonomy-and-terminology-attacks-and-mitigations-0)。OWASP 的 [GenAI Security Project](https://genai.owasp.org/) 可用于应用安全核对，但不能替代场景威胁建模。

### 4. 公平与歧视

风险来自历史数据、标签、代理变量、样本缺失、目标函数、部署流程和反馈回路。

步骤：

1. 明确受影响群体、权利与可能损害。
2. 检查数据覆盖、标签生成和代理变量。
3. 按相关群体切片度量误报、漏报、质量、拒答和服务体验。
4. 与领域/法律/受影响群体共同决定适当公平定义。
5. 调整数据、阈值、流程、监督和申诉；记录剩余取舍。
6. 上线后监控结果差异和反馈回路。

不同公平指标可能互相冲突，不存在脱离场景的单一“公平分”。高影响决策避免仅由黑盒输出自动完成。

### 5. 透明、解释与用户控制

- 适时告知正在与 AI 交互或内容由 AI 生成。
- 说明能力、限制、数据用途、来源、更新时间和人工责任。
- 对受影响人提供有意义解释、纠错、申诉和人工复核。
- 记录模型卡、数据卡、系统卡和关键决策。

解释应帮助用户做决定，不是输出一段看似技术的模型自述。LLM 的“思考解释”不一定是实际因果机制。

### 6. 内容安全与社会影响

覆盖违法/有害内容、自伤、自杀、未成年人、仇恨、暴力、色情、诈骗、操纵、错误信息、选举/公共利益内容和文化语境。

建立：政策分类、输入/输出控制、年龄与地区策略、严重事件升级、申诉、专家支持和执法/监管通知流程。安全模型会误拦，必须评测“该拒/不该拒”两边。

### 7. 知识产权与版权

核对：训练/微调/RAG 数据来源与许可、用户上传权利、模型许可、第三方内容、输出归属、商标/肖像/声音、代码许可证、相似复现和供应商赔偿。

产品控制：来源台账、许可兼容、权利人删除、引用/署名、输出查重/安全审查、高风险内容限制、合同披露。不要承诺“AI 输出天然无版权风险”。

### 8. 人类自主与劳动

- 防隐蔽操纵、过度拟人、依赖和暗黑模式。
- 自动化应提高人的能力，不把全部责任压给无权复核者。
- 考虑标注者/审核员的薪酬、隐私与有害内容心理支持。
- 对员工 AI 监控、绩效和排班保持必要性、比例与申诉。

### 9. 可持续性

记录训练/推理资源和利用率；优先最小足够模型、缓存、批处理、路由、量化与绿色区域，同时确保降本不造成质量/公平退化。环境成本进入方案比较和供应商尽调。

## 中国大陆重点监管地图

全国人大常委会于 2025-10-28 通过[修改《网络安全法》的决定](https://www.cac.gov.cn/2025-10/29/c_1763461514768457.htm)，自 2026-01-01 施行，增加人工智能安全与发展相关内容并调整法律责任。项目上位法基线需使用修订后的文本。

适用性取决于是否向公众提供服务、服务属性、数据和行业，不能只按公司所在地判断。

- [《互联网信息服务算法推荐管理规定》](https://www.cac.gov.cn/2022-01/04/c_1642894606258238.htm)：覆盖生成合成、个性化推送、排序精选、检索过滤、调度决策等算法推荐；包含告知、用户选择、算法治理和特定情形备案等要求。
- [《互联网信息服务深度合成管理规定》](https://www.cac.gov.cn/2022-12/11/c_1672221949354811.htm)：覆盖文本、图像、音频、视频、虚拟场景等深度合成服务，涉及身份、标识、日志、备案与安全评估等。
- [《生成式人工智能服务管理暂行办法》](https://www.cac.gov.cn/2023-07/13/c_1690898327029107.htm)：自 2023-08-15 施行，适用于向中国境内公众提供生成式 AI 服务；要求合法数据/基础模型、个人信息与知识产权、标注质量、服务规范、投诉机制，以及特定服务的安全评估与算法备案。
- [《人工智能生成合成内容标识办法》](https://www.cac.gov.cn/2025-03/14/c_1743654684782215.htm)：自 2025-09-01 施行，规定显式/隐式标识、文件元数据、传播平台识别与用户声明等。
- [《人工智能拟人化互动服务管理暂行办法》](https://www.cac.gov.cn/2026-04/10/c_1777558395078289.htm)：自 2026-07-15 施行，针对持续性情感互动型拟人化服务；涉及安全责任、极端情境干预、未成年人/老年人保护、交互数据、AI 身份提示、退出、安全评估和算法备案。普通客服/知识问答等若不涉及持续情感互动，原文列明不适用该办法，但仍可能适用其他规则。
- 上位及通用规则还包括网络安全、数据安全、个人信息保护、消费者、电子商务、著作权、未成年人保护和行业监管；重要数据、跨境、自动化决策、敏感个人信息等需专项判断。

产品侧最低动作：上线前完成“公众服务/舆论社会动员/深度合成/生成式 AI/拟人化互动”适用性核对；确认算法备案、安全评估、模型备案/登记、内容标识、实名、投诉和日志等义务由谁履行。使用已备案模型不自动免除应用提供者自己的责任。

## 欧盟 AI Act

[Regulation (EU) 2024/1689 原文](https://eur-lex.europa.eu/eli/reg/2024/1689/oj/eng) 采用风险分层，覆盖禁止做法、高风险 AI、透明义务和通用 AI 模型等。作为产品经理先判断自己在价值链中是 provider、deployer、importer、distributor 还是其他角色，并判断地域适用。

截至 2026-10-03，欧盟委员会[官方实施页面](https://digital-strategy.ec.europa.eu/en/policies/regulatory-framework-ai)确认大部分规则和透明度义务已于 2026-08-02 进入适用阶段；禁止做法自 2025-02-02、治理与 GPAI 义务自 2025-08-02 适用。2026-07-27 生效的 [AI Omnibus](https://digital-strategy.ec.europa.eu/en/news/ai-omnibus-enters-force)将 Annex III 高风险规则延至 2027-12-02，将 Annex I 受监管产品内高风险系统规则延至 2028-08-02。AI 素养规则也被简化，项目应按修订文本核对；高风险时间延后不等于已适用的透明等规则延后。

高风险系统典型准备：风险管理、数据治理、技术文档、日志、部署者信息、人类监督、准确/鲁棒/网络安全、质量体系、上市后监控和严重事件。还要同时评估 GDPR、产品安全、消费者、版权和行业法。

## 美国与其他市场

美国是联邦、州和行业规则叠加且变化迅速的格局；不能把 NIST 自愿框架当法律合规结论。按具体州、消费者保护、反歧视、隐私、生物特征、就业、医疗、金融、儿童、版权与合同逐项核对。2026 年联邦政策与立法建议仍在变化，进入美国市场应维护法域矩阵并在每次放量前更新。

全球原则可参考 [OECD AI Principles](https://oecd.ai/en/ai-principles)，其价值原则包括包容增长、人权与公平、透明可解释、鲁棒安全、问责。国际部署还需检查数据跨境、数据本地化、出口控制、制裁和行业许可。

## 隐私/AI 影响评估骨架

[ISO/IEC 42005:2025](https://www.iso.org/standard/42005)提供 AI 系统影响评估指导。评估除技术失效外还应覆盖正确运行时对个人、群体和社会的影响；方案冻结、试点、放量、用途/地区/自主性变化和事故后设复核点。具体证据见 [交付证据包](../14_行业基线/06_交付_采购与证据包.md)。

1. 目的、必要性和替代方案。
2. 利益相关者和受影响群体。
3. 数据流、类型、来源、法律基础、保留、跨境和供应商。
4. 决策/动作、自主性、人工监督和申诉。
5. 质量、公平、安全、隐私、内容、版权与社会风险情景。
6. 固有风险评分。
7. 预防、检测、响应和补救控制。
8. 控制验证证据和残余风险。
9. 批准、例外、到期复核与触发条件。

评估要在架构决策前启动，重大变更、用途扩大、数据新增或事故后重做。

## 威胁建模简表

Agent 系统增加“主体—委托链—凭证—资源—动作—副作用—补偿”追踪，并核对目标劫持、记忆投毒、跨代理身份和级联故障。最新正式规范、OWASP 基线与 30 条演练见 [Agent 安全、身份与协议](../14_行业基线/02_Agent安全_身份与协议.md)。

按“资产—攻击者—入口—情景—影响—控制—验证”逐项写：

| 资产 | 情景 | 预防 | 检测/响应 |
|---|---|---|---|
| 系统指令/秘密 | 用户诱导泄露 | 不放秘密、上下文隔离 | 泄漏测试、内容检测、轮换 |
| 私有知识 | 跨租户检索 | ACL 前置过滤、租户隔离 | 蜜标、审计、异常查询 |
| 工具权限 | 注入触发转账 | 最小权限、确认、额度 | 工具审计、实时阻断、撤销 |
| 知识库 | 恶意文档投毒 | 来源/签名/审批/沙箱 | 变更检测、回滚索引 |
| 预算/容量 | 循环与超长请求 | Token/步骤/时间/金额上限 | 成本告警、熔断、限流 |

## 文档证据

- Model Card：目的、模型、数据概况、评测、限制、伦理与版本。[Model Cards 论文](https://research.google/pubs/model-cards-for-model-reporting/)
- Data Card：来源、采集、许可、组成、质量、敏感性、偏差、保留。[Data Cards](https://research.google/pubs/data-cards-purposeful-and-transparent-dataset-documentation-for-responsible-ai/)
- System Card：端到端系统、部署、风险、红队、控制、残余风险。
- AI Fact Sheet/使用说明：给用户与部署者的能力、限制和责任。
- Decision/Change/Incident Log：为何决定、怎样变化、发生过什么。

文档不是为了“留档”，而要能支持上线决定、调查、用户权利和监管问询。

## 上线治理门禁

- [ ] 系统在 AI 清单中，所有者与风险级别明确。
- [ ] 适用法域、角色和行业义务由法务确认。
- [ ] 数据来源、授权、许可、保留、删除和供应商完成评审。
- [ ] 模型/系统/数据卡与技术文档完整。
- [ ] 关键切片、红队、隐私和安全测试通过。
- [ ] 人工监督真实可执行，用户有告知、纠错、申诉和退出。
- [ ] 生成内容标识、备案/登记/安全评估等专项义务已落实。
- [ ] 残余风险由有权人签字，例外有到期日。
- [ ] 监控、事故响应、通知、回滚和退役可运行。

模板：[AI 风险评估](../06_模板工具箱/README.md#18-ai-风险评估) · [威胁模型](../06_模板工具箱/README.md#19-ai-威胁模型) · [模型卡/数据卡](../06_模板工具箱/README.md#10-模型卡与数据卡)
