典 · AI PM 永乐大典

行业知识 · v2.3.0 · 资料核对 2026-10-03

数据、工程与 LLMOps

行业落地要求把数据质量阈值、责任和修复证据写入数据合同,把 Trace/Metric/Log/Event 统一关联到任务与版本。敏感原文、系统指令和工具参数单独制定用途、采样、访问与保留;OpenTelemetry 动态字段须固定版本并验证迁移。实施细节见 数据治理与知识工程。

AI 产品的真实架构

生产系统通常不是“前端直接连模型”:

客户端
  → 身份/权限/限流/API 网关
  → AI 编排层(Prompt、路由、状态、策略)
      ├─ 模型服务
      ├─ 检索/向量库/知识源
      ├─ 工具与业务系统
      └─ 安全过滤/验证器
  → 日志、追踪、评测、监控、成本、反馈

模型应被当成一个会变化、会失败、可能被攻击的依赖;编排层负责控制、验证、降级和可观测。

数据生命周期

  1. 目的与最小化:先写用途,再决定收什么;不因“以后可能有用”无限收集。
  2. 来源与授权:自有、用户提交、采购、公开抓取、合成数据分别记录权利基础。
  3. 获取与传输:加密、鉴权、完整性、区域和跨境要求。
  4. 清洗与去标识:重复、噪声、PII、版权、恶意内容和质量问题。
  5. 标注:指南、培训、双标、仲裁、一致性和劳动者保护。
  6. 版本与血缘:能追溯每个模型/评测使用了哪份数据。
  7. 使用控制:训练、推理、评测、分析用途分离,最小权限。
  8. 监控与修订:质量、漂移、偏差和用户纠错。
  9. 保留与删除:到期删除、用户请求、备份传播和下游影响。

数据质量六维

数据多不等于好。优先收集能区分方案、揭示错误和代表实际流量的数据。

标注项目设计

一份可用标注规范包含:任务定义、正负例、边界例、无法判断选项、证据要求、敏感内容处理、抽检与仲裁。

度量:

领域任务要让 SME 参与,但专家时间昂贵,可用主动学习或错误优先抽样聚焦最有信息量样本。

API 基础

AI PM 至少能读懂:

不要让模型自由拼接未校验参数调用高权限接口。参数经过 Schema、业务规则和权限检查后再执行。

MLOps 与 LLMOps

MLOps 把数据、训练、部署、监控和治理工程化;LLMOps 在此基础上还管理 Prompt、上下文、检索索引、模型 API、工具和人工反馈。

必须版本化

一个可复现结果的“版本指纹”应能指向所有这些组成。

发布流水线

变更 → 静态/单元测试 → 离线回归 → 安全红队 → 影子流量
     → 小流量金丝雀 → 指标观察 → 逐步放量 → 复核/回滚

模型供应商静默更新也可能改变行为。合同和技术层面要争取版本锁定、变更通知和回归窗口。

可观测性

三层信号

单次 Trace 建议记录

在隐私与最小化前提下:请求 ID、用户/租户匿名标识、模型/Prompt/索引版本、Token、检索文档 ID、工具调用、延迟、成本、过滤结果、反馈、错误码。敏感原文应脱敏或受严格访问控制。

漂移

监控漂移不等于自动重训。先判断是否影响业务和高风险切片,再决定数据、规则、检索、模型或产品流程的修复。

SLO、降级与恢复

SLO 示例:99.9% 可用、P95 首 Token < 2 秒、P95 完成 < 8 秒、关键任务成功率 ≥ 阈值。

降级阶梯:

  1. 关闭非必要增强能力。
  2. 缩短上下文/限制输出/关闭昂贵工具。
  3. 路由备用模型或备用区域。
  4. 回退为搜索、模板、规则或只读模式。
  5. 转人工或暂停高风险动作。

业务连续性不能只写“重试”。重试可能放大拥塞和重复执行,必须退避、限次并保证幂等。

成本工程

单任务成本

C_task = C_model + C_embedding + C_retrieval + C_rerank
       + C_tools + C_storage/log + C_review + C_retry + C_infra

月度情景

月成本 = 活跃用户 × 每人任务数 × 单任务成本 + 固定成本 + 峰值储备

同时计算:

Build、Buy、Partner

评分维度:战略差异化、能力匹配、数据控制、时延区域、合规认证、可定制、集成、SLA、三年 TCO、锁定、退出和团队能力。

关键条款:数据是否用于训练、保留期、子处理者、事故通知、模型变更、服务等级、审计、知识产权、赔偿、出口/区域、终止后数据返还与删除。

生产就绪 DoD

经典工程阅读:Hidden Technical Debt in Machine Learning Systems 与 The ML Test Score。