行业知识 · v2.3.0 · 资料核对 2026-10-03
全生命周期检查清单
行业项目同时维护 12 项证据台账:影响评估、法域/角色、数据权利、动作授权、风险测试追踪、评分器/区间、透明标识、放量、恢复、退出、收益与退役。勾选表示已找到有效证据,不表示专业认证。
清单只保证“问过”,不保证“做对”。高风险项目需由对应责任人审查证据。
想法初筛
- [ ] 用户和真实任务明确,不是“做一个 AI 助手”。
- [ ] 最近真实案例、频率、痛点、基线和替代方案有证据。
- [ ] 比较了不做、流程、规则、搜索、传统 ML 与人工。
- [ ] AI 有可解释的增量价值。
- [ ] 错误可发现、可逆或可由流程限制。
- [ ] 数据可得、合法、代表,结果可评测。
- [ ] 单位经济存在成立可能。
- [ ] 高风险用户/动作/数据已初筛。
- [ ] 写了停止条件和下一最小实验。
用户发现
- [ ] 访谈问过去行为,不只问偏好。
- [ ] 覆盖主用户、边缘用户、审批者和受影响者。
- [ ] 观察真实流程、返工、等待和异常。
- [ ] 事实、原话与研究者解释分离。
- [ ] 包含反证和不愿使用的原因。
- [ ] 研究同意、隐私与数据保留清楚。
- [ ] 用户价值和业务价值分别定义。
AI PRD 评审
- [ ] 目标、非目标、用户、场景、自主性和范围外明确。
- [ ] 有现状基线和为何 AI。
- [ ] 正常、澄清、拒答、错误、取消、撤销、申诉、转人工完整。
- [ ] 输入/输出 Schema、来源、敏感性和权限明确。
- [ ] 模型、Prompt、RAG、工具、规则和降级方案清楚。
- [ ] 数据来源、权利、质量、标注、更新、保留和删除明确。
- [ ] 黄金集、Rubric、切片、阈值、基线和红队写入验收。
- [ ] AI UX 包含能力告知、来源、不确定、纠错和确认。
- [ ] SLO、容量、成本、监控、回滚和运营归属明确。
- [ ] 开放问题都有 Owner 和截止日。
数据与知识
- [ ] 每个来源有 Owner、用途、权利基础/许可和时间。
- [ ] 只收必要数据;敏感/儿童/生物/商业秘密分类。
- [ ] 数据流、区域、跨境、子处理者和访问可视化。
- [ ] 训练、推理、评测、日志用途分别控制。
- [ ] 去标识和重识别风险评估。
- [ ] 样本代表真实用户、语言、时间、难度和高风险切片。
- [ ] 标注规范、培训、双标、仲裁、一致性和返工。
- [ ] 血缘、版本、质量、漂移、保留、删除和备份传播可追溯。
- [ ] 知识文档有生效/失效、权限、冲突和更新 SLA。
- [ ] 数据卡完成。
RAG 专项
- [ ] 解析覆盖表格、扫描、页码、代码、图片和元数据。
- [ ] 切块策略用检索评测证明,而非凭经验。
- [ ] ACL 在检索前/中强制,不靠生成后过滤。
- [ ] 关键词、向量、混合与重排有同集对比。
- [ ] 检索 Recall@K、上下文相关/充分、引用支持分别评测。
- [ ] 无来源、冲突、过期和低质量来源有处理。
- [ ] 文档/索引/Embedding/切块版本可回滚。
- [ ] 入库防投毒、恶意指令和供应链内容。
Agent 专项
- [ ] 已证明确定 Workflow 不足以产生相同价值。
- [ ] 自主性是最低足够级别。
- [ ] 读取/写入、草稿/提交、高低风险工具分离。
- [ ] 最小权限、短期凭证、白名单、Schema、业务规则。
- [ ] 高影响动作预览和独立确认。
- [ ] Token/步骤/时间/金额/频率预算与熔断。
- [ ] 超时、重试上限、幂等、循环检测、补偿事务。
- [ ] 外部内容按不可信数据隔离,间接注入已测。
- [ ] 执行结果由环境状态核验,不信 Agent 自报。
- [ ] 沙箱、攻击、工具故障、并发和恢复评测完成。
- [ ] 目标、计划、工具、参数、结果、确认、版本可审计。
评测设计
- [ ] 评测要支持的决定明确。
- [ ] “好”的 Rubric 有等级锚点和严重度。
- [ ] 样本来自真实分布并包含长尾、拒答、对抗、事故。
- [ ] 训练/开发/测试/holdout 正确隔离并防污染。
- [ ] 总体与用户、任务、语言、风险、难度切片同时报告。
- [ ] 确定性可验证项不用 LLM Judge 替代。
- [ ] 人评盲化、双评、校准、一致性和仲裁明确。
- [ ] 自动评审已用人工金标准校准并测试位置/风格偏差。
- [ ] 样本量、置信区间、配对差异和业务意义报告。
- [ ] 同时看质量、关键失败、延迟、成本和风险。
- [ ] 版本指纹包含模型、Prompt、数据、索引、工具、参数和评审器。
项目计划
- [ ] 章程由 Sponsor 授权,目标、范围、预算和责任清楚。
- [ ] 明确探索/PoC/试点/产品化/规模化阶段。
- [ ] WBS 包含数据、评测、安全、运营和变更,不只开发。
- [ ] 关键路径和外部依赖有 Owner/日期/应急。
- [ ] 研究任务有时间盒、阈值和停止条件。
- [ ] 三点/情景估算与应急/管理储备合理。
- [ ] RACI 每项只有一个 A;Stop-the-line 与升级明确。
- [ ] RAID 每周验证,假设有到期日。
- [ ] 阶段门以证据事件而非“完成百分比”定义。
- [ ] 变更覆盖模型、Prompt、数据、索引、工具和规则。
供应商
- [ ] 使用同一真实、脱敏、授权评测集比较候选。
- [ ] 所有后台人工干预披露。
- [ ] 输入输出/反馈的训练使用、保留、区域和删除清楚。
- [ ] 子处理者、安全认证、隔离、事件通知和审计清楚。
- [ ] 模型卡、限制、版本锁定、变更和弃用期清楚。
- [ ] 计价、失败/缓存/重试、峰值和三年 TCO 清楚。
- [ ] IP、训练数据、许可证、赔偿和输出权利经法务核对。
- [ ] SLA、配额、灾备、支持和根因报告可验收。
- [ ] 数据/配置/日志导出、删除证明和迁移演练可执行。
安全、隐私、合规
- [ ] AI 清单、Owner、法域、行业、风险级别和系统角色明确。
- [ ] 适用法规、备案/登记、安全评估、标识、实名/投诉等已核对。
- [ ] DPIA/AI 影响评估、威胁模型和残余风险批准完成。
- [ ] 数据最小化、权限、加密、保留、删除和用户权利可执行。
- [ ] 直接/间接注入、越狱、泄漏、跨租户、越权、投毒、资源攻击已测。
- [ ] 输出进入代码/SQL/HTML/工具前确定性验证和编码。
- [ ] 公平切片、受影响群体、代理变量和申诉机制核对。
- [ ] 内容安全同时测正确拦截和误拦截。
- [ ] 训练/RAG/输出的版权、许可、肖像、声音和来源核对。
- [ ] 用户明确知道 AI 身份、能力、限制、数据用途和责任。
- [ ] 高风险人工监督有能力、时间、证据和干预权。
上线 Go / No-Go
- [ ] 发布范围、用户、区域、流量、自主性和功能开关明确。
- [ ] 离线、人评、红队、UAT、压测、成本和合规证据齐全。
- [ ] 核心/关键切片达标,P0/P1 关闭。
- [ ] 残余风险、例外和条件上线由有权人签字。
- [ ] 数据/模型/Prompt/索引/工具版本锁定并可复现。
- [ ] 影子/金丝雀级别、观察窗口、放量/停止/回滚阈值明确。
- [ ] SLO、看板、告警、质量/错误/成本预算就绪。
- [ ] 降级、回滚、人工接管、灾备和供应商故障已演练。
- [ ] Runbook、值班、客服、培训、用户告知和状态沟通就绪。
- [ ] 事故证据保护、内外通知、用户补救和监管流程就绪。
上线后 7/30/90 天
- [ ] 随机代表性抽检 + 风险优先抽检持续运行。
- [ ] 对比北极星、领先、护栏、系统、成本和分层指标。
- [ ] 检查采用失败、工作流绕过、人工负荷和自动化偏见。
- [ ] 失败/投诉/事故进入错误分类和黄金回归集。
- [ ] 检查数据、知识、行为、反馈和供应商漂移。
- [ ] 验证时间节省/收入/风险收益是否真实兑现。
- [ ] 复核残余风险、例外到期和供应商 SLA/账单。
- [ ] 决定放量、修复、缩小、暂停或退役。
项目关闭/退役
- [ ] 验收、遗留项、Owner 和期限签字。
- [ ] 运营团队可独立处置一次演练。
- [ ] 临时账号、密钥、环境、工具和供应商权限撤销。
- [ ] 数据按约定导出、归档或删除并传播到备份/下游。
- [ ] 合同、资产、预算和许可证结清。
- [ ] 用户/客户/员工获得变更与迁移说明。
- [ ] 评测、决策、版本、风险、事故和审计证据归档。
- [ ] 复盘行动进入 Owner 的工作计划并跟踪关闭。