# 数据治理与知识工程

数据的行业级要求是：能说明来源、使用权、质量、版本、访问边界和删除后果。训练数据、检索知识、评测集、反馈和日志用途不同，应分别治理。

## 数据资产合同

每份资产设单一 Owner，并记录：目的与非用途、来源/采集方式、授权/许可、个人信息类别、代表性、标注规则、质量指标、刷新周期、保留期限、ACL、下游消费者、版本、例外与退役。供应商声称“数据可用”需要对应许可或合同，公开可读不等于可训练、可商业再发布。

数据卡可参考 [Datasheets for Datasets 原始论文](https://arxiv.org/abs/1803.09010)。正式治理体系参考 [ISO/IEC 5259-5:2025](https://www.iso.org/standard/5259-5)公开摘要；本库表格是实践建议，不复制标准条款。

| 资产 | 核心质量指标 | 特有风险 | 接受证据 |
|---|---|---|---|
| 训练/微调 | 覆盖、标签一致、重复与污染 | 目标代理、权利、记忆泄漏 | 数据卡、标注审计、隔离证明 |
| 评测 | 任务分布、难度、参考正确、独立性 | 调参污染、评分偏差 | 样本版本、人工校准、隐藏集 |
| RAG 知识 | 来源、时效、权限、解析与检索 | 错版本、跨租户、投毒 | 入库报告、ACL 测试、刷新记录 |
| 用户反馈 | 来源、选择偏差、有效性 | 满意≠正确、机器人/重度用户偏差 | 原始事件到标签的血缘 |
| 合成数据 | 多样性、真实性、审查和比例 | 模型共享盲点、错误标签 | 生成版本、专家验证、合成标签 |
| 日志 | 完整、关联、可解释与脱敏 | 敏感原文、再识别、过度保留 | 字段策略、采样、访问与删除 |

## RAG 的六道工程关

来源：权威资料、Owner、有效期、版本冲突处理。解析：标题、表格、OCR、页码、脚注和跨页结构保留。切块：能恢复语义与上下文，块 ID 稳定并关联原文。检索：任务集验证 Recall、排序与时间/权限过滤。生成：主张对应出处，缺证据时拒答或追问。运营：更新、删除、冲突、缓存、索引和回滚有责任人。

业务数据权限在检索前与结果返回前都做检查。文档、块、向量、缓存和生成引用都带租户/ACL/版本信息；不能只隐藏 UI 按钮。测试使用两个权限不同的账号，验证同一问题返回不同的合法资料，撤权后缓存不再回传旧答案。

## 可测的数据质量

建立 `维度 → 任务影响 → 度量 → 阈值 → Owner → 修复 → 复验` 链。阈值从任务要求制定：财务单据金额需要逐字段校验；知识文章可以允许部分 OCR 噪声，但不能影响关键结论。整体“99% 数据准确”无法说明哪个字段、哪个时间段和哪个用户。

完整性：缺字段/缺文档/缺时间段比例；有效性：格式、单位与业务约束；一致性：同实体跨源冲突；时效：源更新至可用延迟；代表性：任务与群体覆盖；标签：分歧/仲裁/专家漏报；权利：授权与下游用途可追溯。发现变化先评估任务影响，再决定重标、重建索引、重测或暂停。

## 观测字段与敏感内容分开

最小观测建议：`trace_id`、任务 ID、匿名租户、操作、模型/Prompt/工具/索引版本、时延、Token、缓存、重试、策略决定、工具回执、结果与费用。原始 Prompt、系统指令、用户内容和工具参数单列敏感级别、用途、访问角色、采样和期限。

[OpenTelemetry GenAI 语义约定](https://opentelemetry.io/docs/specs/semconv/registry/attributes/gen-ai/)提供跨系统字段参考，部分字段处于 Development。采用时固定版本并建立字段迁移，避免升级导致成本看板和告警断裂。敏感原文默认不为“方便调试”无限保留。

## 删除与更正传播

删除工单列出原文、派生块、向量、缓存、反馈标签、评测副本、导出件、日志、备份和供应商副本。记录可立即删除、按备份策略到期删除、依法保留或技术上尚不能删除的边界。训练进权重的数据删除不同于删除检索文档，必须与供应商和模型治理一起判断。

更正同样传播：错误原文修正后重建相关派生资产，测“新资料能检索、旧答案不再返回、引用时间正确”。关闭工单需要回读或抽样验证，不能只有“删除 API 调用成功”。

## 数据漂移与任务漂移

输入分布、用户任务、来源更新、模型供应商、策略与标签变化分别监测。漂移指标是调查信号，不自动等于业务退化。先抽样人工核验并跑相关切片，再制定修复；避免对每次统计波动自动重训。

下一步：[公开数据与基准](07_公开数据与基准目录.md) · [项目证据台账](assets/evidence-register.csv)
