典 · AI PM 永乐大典

行业知识 · v2.3.0 · 资料核对 2026-10-03

数据治理与知识工程

数据的行业级要求是:能说明来源、使用权、质量、版本、访问边界和删除后果。训练数据、检索知识、评测集、反馈和日志用途不同,应分别治理。

数据资产合同

每份资产设单一 Owner,并记录:目的与非用途、来源/采集方式、授权/许可、个人信息类别、代表性、标注规则、质量指标、刷新周期、保留期限、ACL、下游消费者、版本、例外与退役。供应商声称“数据可用”需要对应许可或合同,公开可读不等于可训练、可商业再发布。

数据卡可参考 Datasheets for Datasets 原始论文。正式治理体系参考 ISO/IEC 5259-5:2025公开摘要;本库表格是实践建议,不复制标准条款。

资产核心质量指标特有风险接受证据
训练/微调覆盖、标签一致、重复与污染目标代理、权利、记忆泄漏数据卡、标注审计、隔离证明
评测任务分布、难度、参考正确、独立性调参污染、评分偏差样本版本、人工校准、隐藏集
RAG 知识来源、时效、权限、解析与检索错版本、跨租户、投毒入库报告、ACL 测试、刷新记录
用户反馈来源、选择偏差、有效性满意≠正确、机器人/重度用户偏差原始事件到标签的血缘
合成数据多样性、真实性、审查和比例模型共享盲点、错误标签生成版本、专家验证、合成标签
日志完整、关联、可解释与脱敏敏感原文、再识别、过度保留字段策略、采样、访问与删除

RAG 的六道工程关

来源:权威资料、Owner、有效期、版本冲突处理。解析:标题、表格、OCR、页码、脚注和跨页结构保留。切块:能恢复语义与上下文,块 ID 稳定并关联原文。检索:任务集验证 Recall、排序与时间/权限过滤。生成:主张对应出处,缺证据时拒答或追问。运营:更新、删除、冲突、缓存、索引和回滚有责任人。

业务数据权限在检索前与结果返回前都做检查。文档、块、向量、缓存和生成引用都带租户/ACL/版本信息;不能只隐藏 UI 按钮。测试使用两个权限不同的账号,验证同一问题返回不同的合法资料,撤权后缓存不再回传旧答案。

可测的数据质量

建立 维度 → 任务影响 → 度量 → 阈值 → Owner → 修复 → 复验 链。阈值从任务要求制定:财务单据金额需要逐字段校验;知识文章可以允许部分 OCR 噪声,但不能影响关键结论。整体“99% 数据准确”无法说明哪个字段、哪个时间段和哪个用户。

完整性:缺字段/缺文档/缺时间段比例;有效性:格式、单位与业务约束;一致性:同实体跨源冲突;时效:源更新至可用延迟;代表性:任务与群体覆盖;标签:分歧/仲裁/专家漏报;权利:授权与下游用途可追溯。发现变化先评估任务影响,再决定重标、重建索引、重测或暂停。

观测字段与敏感内容分开

最小观测建议:trace_id、任务 ID、匿名租户、操作、模型/Prompt/工具/索引版本、时延、Token、缓存、重试、策略决定、工具回执、结果与费用。原始 Prompt、系统指令、用户内容和工具参数单列敏感级别、用途、访问角色、采样和期限。

OpenTelemetry GenAI 语义约定提供跨系统字段参考,部分字段处于 Development。采用时固定版本并建立字段迁移,避免升级导致成本看板和告警断裂。敏感原文默认不为“方便调试”无限保留。

删除与更正传播

删除工单列出原文、派生块、向量、缓存、反馈标签、评测副本、导出件、日志、备份和供应商副本。记录可立即删除、按备份策略到期删除、依法保留或技术上尚不能删除的边界。训练进权重的数据删除不同于删除检索文档,必须与供应商和模型治理一起判断。

更正同样传播:错误原文修正后重建相关派生资产,测“新资料能检索、旧答案不再返回、引用时间正确”。关闭工单需要回读或抽样验证,不能只有“删除 API 调用成功”。

数据漂移与任务漂移

输入分布、用户任务、来源更新、模型供应商、策略与标签变化分别监测。漂移指标是调查信号,不自动等于业务退化。先抽样人工核验并跑相关切片,再制定修复;避免对每次统计波动自动重训。

下一步:公开数据与基准 · 项目证据台账