行业知识 · v2.3.0 · 资料核对 2026-10-03
数据治理与知识工程
数据的行业级要求是:能说明来源、使用权、质量、版本、访问边界和删除后果。训练数据、检索知识、评测集、反馈和日志用途不同,应分别治理。
数据资产合同
每份资产设单一 Owner,并记录:目的与非用途、来源/采集方式、授权/许可、个人信息类别、代表性、标注规则、质量指标、刷新周期、保留期限、ACL、下游消费者、版本、例外与退役。供应商声称“数据可用”需要对应许可或合同,公开可读不等于可训练、可商业再发布。
数据卡可参考 Datasheets for Datasets 原始论文。正式治理体系参考 ISO/IEC 5259-5:2025公开摘要;本库表格是实践建议,不复制标准条款。
| 资产 | 核心质量指标 | 特有风险 | 接受证据 |
|---|---|---|---|
| 训练/微调 | 覆盖、标签一致、重复与污染 | 目标代理、权利、记忆泄漏 | 数据卡、标注审计、隔离证明 |
| 评测 | 任务分布、难度、参考正确、独立性 | 调参污染、评分偏差 | 样本版本、人工校准、隐藏集 |
| RAG 知识 | 来源、时效、权限、解析与检索 | 错版本、跨租户、投毒 | 入库报告、ACL 测试、刷新记录 |
| 用户反馈 | 来源、选择偏差、有效性 | 满意≠正确、机器人/重度用户偏差 | 原始事件到标签的血缘 |
| 合成数据 | 多样性、真实性、审查和比例 | 模型共享盲点、错误标签 | 生成版本、专家验证、合成标签 |
| 日志 | 完整、关联、可解释与脱敏 | 敏感原文、再识别、过度保留 | 字段策略、采样、访问与删除 |
RAG 的六道工程关
来源:权威资料、Owner、有效期、版本冲突处理。解析:标题、表格、OCR、页码、脚注和跨页结构保留。切块:能恢复语义与上下文,块 ID 稳定并关联原文。检索:任务集验证 Recall、排序与时间/权限过滤。生成:主张对应出处,缺证据时拒答或追问。运营:更新、删除、冲突、缓存、索引和回滚有责任人。
业务数据权限在检索前与结果返回前都做检查。文档、块、向量、缓存和生成引用都带租户/ACL/版本信息;不能只隐藏 UI 按钮。测试使用两个权限不同的账号,验证同一问题返回不同的合法资料,撤权后缓存不再回传旧答案。
可测的数据质量
建立 维度 → 任务影响 → 度量 → 阈值 → Owner → 修复 → 复验 链。阈值从任务要求制定:财务单据金额需要逐字段校验;知识文章可以允许部分 OCR 噪声,但不能影响关键结论。整体“99% 数据准确”无法说明哪个字段、哪个时间段和哪个用户。
完整性:缺字段/缺文档/缺时间段比例;有效性:格式、单位与业务约束;一致性:同实体跨源冲突;时效:源更新至可用延迟;代表性:任务与群体覆盖;标签:分歧/仲裁/专家漏报;权利:授权与下游用途可追溯。发现变化先评估任务影响,再决定重标、重建索引、重测或暂停。
观测字段与敏感内容分开
最小观测建议:trace_id、任务 ID、匿名租户、操作、模型/Prompt/工具/索引版本、时延、Token、缓存、重试、策略决定、工具回执、结果与费用。原始 Prompt、系统指令、用户内容和工具参数单列敏感级别、用途、访问角色、采样和期限。
OpenTelemetry GenAI 语义约定提供跨系统字段参考,部分字段处于 Development。采用时固定版本并建立字段迁移,避免升级导致成本看板和告警断裂。敏感原文默认不为“方便调试”无限保留。
删除与更正传播
删除工单列出原文、派生块、向量、缓存、反馈标签、评测副本、导出件、日志、备份和供应商副本。记录可立即删除、按备份策略到期删除、依法保留或技术上尚不能删除的边界。训练进权重的数据删除不同于删除检索文档,必须与供应商和模型治理一起判断。
更正同样传播:错误原文修正后重建相关派生资产,测“新资料能检索、旧答案不再返回、引用时间正确”。关闭工单需要回读或抽样验证,不能只有“删除 API 调用成功”。
数据漂移与任务漂移
输入分布、用户任务、来源更新、模型供应商、策略与标签变化分别监测。漂移指标是调查信号,不自动等于业务退化。先抽样人工核验并跑相关切片,再制定修复;避免对每次统计波动自动重训。