典 · AI PM 永乐大典

行业知识 · v2.3.0 · 资料核对 2026-10-03

AI 安全、合规与伦理

核对日期:2026-10-03。法规变化快,以下用于产品与项目治理,不构成法律意见;具体项目必须由适用法域的法务、隐私、安全和行业专家确认。

如需将框架落到责任人、产物和复查记录,使用 AI 产品与项目标准映射与证据矩阵。

治理不是发布前盖章

治理的目标是让组织能回答:有哪些 AI、用于谁、依据什么数据、能做什么、谁负责、如何证明安全有效、出事怎样停止和补救。

最小治理系统:

AI 清单 → 风险分级 → 责任与阶段门 → 控制与证据
      → 评测/红队 → 残余风险批准 → 持续监控 → 事故/退役

可参考 NIST AI RMF 的 Govern / Map / Measure / Manage 四类功能。NIST AI RMF 1.0 是自愿框架;生成式 AI 的特有风险和建议动作见 NIST AI 600-1 Generative AI Profile。组织管理体系可参考 ISO/IEC 42001:2023。

第一关:AI 系统清单

每个系统记录:

“员工私下使用通用 AI”也属于组织风险,应通过可用工具、数据分类和培训治理,而不只是全面禁止。

第二关:风险分级

按以下维度评估固有风险:

示例级别

级别示例默认治理
低内部低敏文本改写,无自动动作清单、基本评测、数据规则
中企业知识问答、对外内容草稿风险评估、引用、红队、人工确认
高招聘排序、信贷/医疗辅助、高权限 Agent独立评审、严格人控、审计、持续监控
禁止/不可接受隐蔽操纵、无合法依据的敏感推断、不可控高损害不做或重新设计

风险控制后评估残余风险。高风险残余风险必须由有权的业务与风险责任人接受,工程团队不能替组织接受。

核心风险域

1. 质量与可靠性

风险:幻觉、错误引用、长尾失败、漂移、工具状态误报、自动化偏见。

控制:代表性评测、关键切片、选择性回答、独立验证、引用、确认、人工接管、版本和回滚。

2. 隐私与个人信息

风险:过度收集、目的漂移、敏感推断、训练记忆、跨租户泄漏、无法删除、供应商二次使用。

控制:

不要把“脱敏”当万能:自由文本、向量、日志和组合字段仍可能重识别。

3. 安全

主要攻击面:

控制原则:

威胁与用例可参考 MITRE ATLAS;NIST 2025 年对预测与生成 AI 的逃逸、投毒、隐私和滥用攻击给出分类,见 NIST AI 100-2e2025。OWASP 的 GenAI Security Project 可用于应用安全核对,但不能替代场景威胁建模。

4. 公平与歧视

风险来自历史数据、标签、代理变量、样本缺失、目标函数、部署流程和反馈回路。

步骤:

  1. 明确受影响群体、权利与可能损害。
  2. 检查数据覆盖、标签生成和代理变量。
  3. 按相关群体切片度量误报、漏报、质量、拒答和服务体验。
  4. 与领域/法律/受影响群体共同决定适当公平定义。
  5. 调整数据、阈值、流程、监督和申诉;记录剩余取舍。
  6. 上线后监控结果差异和反馈回路。

不同公平指标可能互相冲突,不存在脱离场景的单一“公平分”。高影响决策避免仅由黑盒输出自动完成。

5. 透明、解释与用户控制

解释应帮助用户做决定,不是输出一段看似技术的模型自述。LLM 的“思考解释”不一定是实际因果机制。

6. 内容安全与社会影响

覆盖违法/有害内容、自伤、自杀、未成年人、仇恨、暴力、色情、诈骗、操纵、错误信息、选举/公共利益内容和文化语境。

建立:政策分类、输入/输出控制、年龄与地区策略、严重事件升级、申诉、专家支持和执法/监管通知流程。安全模型会误拦,必须评测“该拒/不该拒”两边。

7. 知识产权与版权

核对:训练/微调/RAG 数据来源与许可、用户上传权利、模型许可、第三方内容、输出归属、商标/肖像/声音、代码许可证、相似复现和供应商赔偿。

产品控制:来源台账、许可兼容、权利人删除、引用/署名、输出查重/安全审查、高风险内容限制、合同披露。不要承诺“AI 输出天然无版权风险”。

8. 人类自主与劳动

9. 可持续性

记录训练/推理资源和利用率;优先最小足够模型、缓存、批处理、路由、量化与绿色区域,同时确保降本不造成质量/公平退化。环境成本进入方案比较和供应商尽调。

中国大陆重点监管地图

全国人大常委会于 2025-10-28 通过修改《网络安全法》的决定,自 2026-01-01 施行,增加人工智能安全与发展相关内容并调整法律责任。项目上位法基线需使用修订后的文本。

适用性取决于是否向公众提供服务、服务属性、数据和行业,不能只按公司所在地判断。

产品侧最低动作:上线前完成“公众服务/舆论社会动员/深度合成/生成式 AI/拟人化互动”适用性核对;确认算法备案、安全评估、模型备案/登记、内容标识、实名、投诉和日志等义务由谁履行。使用已备案模型不自动免除应用提供者自己的责任。

欧盟 AI Act

Regulation (EU) 2024/1689 原文 采用风险分层,覆盖禁止做法、高风险 AI、透明义务和通用 AI 模型等。作为产品经理先判断自己在价值链中是 provider、deployer、importer、distributor 还是其他角色,并判断地域适用。

截至 2026-10-03,欧盟委员会官方实施页面确认大部分规则和透明度义务已于 2026-08-02 进入适用阶段;禁止做法自 2025-02-02、治理与 GPAI 义务自 2025-08-02 适用。2026-07-27 生效的 AI Omnibus将 Annex III 高风险规则延至 2027-12-02,将 Annex I 受监管产品内高风险系统规则延至 2028-08-02。AI 素养规则也被简化,项目应按修订文本核对;高风险时间延后不等于已适用的透明等规则延后。

高风险系统典型准备:风险管理、数据治理、技术文档、日志、部署者信息、人类监督、准确/鲁棒/网络安全、质量体系、上市后监控和严重事件。还要同时评估 GDPR、产品安全、消费者、版权和行业法。

美国与其他市场

美国是联邦、州和行业规则叠加且变化迅速的格局;不能把 NIST 自愿框架当法律合规结论。按具体州、消费者保护、反歧视、隐私、生物特征、就业、医疗、金融、儿童、版权与合同逐项核对。2026 年联邦政策与立法建议仍在变化,进入美国市场应维护法域矩阵并在每次放量前更新。

全球原则可参考 OECD AI Principles,其价值原则包括包容增长、人权与公平、透明可解释、鲁棒安全、问责。国际部署还需检查数据跨境、数据本地化、出口控制、制裁和行业许可。

隐私/AI 影响评估骨架

ISO/IEC 42005:2025提供 AI 系统影响评估指导。评估除技术失效外还应覆盖正确运行时对个人、群体和社会的影响;方案冻结、试点、放量、用途/地区/自主性变化和事故后设复核点。具体证据见 交付证据包。

  1. 目的、必要性和替代方案。
  2. 利益相关者和受影响群体。
  3. 数据流、类型、来源、法律基础、保留、跨境和供应商。
  4. 决策/动作、自主性、人工监督和申诉。
  5. 质量、公平、安全、隐私、内容、版权与社会风险情景。
  6. 固有风险评分。
  7. 预防、检测、响应和补救控制。
  8. 控制验证证据和残余风险。
  9. 批准、例外、到期复核与触发条件。

评估要在架构决策前启动,重大变更、用途扩大、数据新增或事故后重做。

威胁建模简表

Agent 系统增加“主体—委托链—凭证—资源—动作—副作用—补偿”追踪,并核对目标劫持、记忆投毒、跨代理身份和级联故障。最新正式规范、OWASP 基线与 30 条演练见 Agent 安全、身份与协议。

按“资产—攻击者—入口—情景—影响—控制—验证”逐项写:

资产情景预防检测/响应
系统指令/秘密用户诱导泄露不放秘密、上下文隔离泄漏测试、内容检测、轮换
私有知识跨租户检索ACL 前置过滤、租户隔离蜜标、审计、异常查询
工具权限注入触发转账最小权限、确认、额度工具审计、实时阻断、撤销
知识库恶意文档投毒来源/签名/审批/沙箱变更检测、回滚索引
预算/容量循环与超长请求Token/步骤/时间/金额上限成本告警、熔断、限流

文档证据

文档不是为了“留档”,而要能支持上线决定、调查、用户权利和监管问询。

上线治理门禁

模板:AI 风险评估 · 威胁模型 · 模型卡/数据卡