# 案例演练：从答案倒推方法

这些案例不是行业标准答案，而是训练“证据—决策—取舍”。建议先只读题目，用模板独立完成，再看参考拆解。

案例中数值为教学假设，不代表真实客户成果。每个练习补交基线/数据卡、影响与权限、冻结评测及区间、单位成功成本、放量/恢复和退役证据。八行业入口和完整客服演练见 [行业场景与端到端案例](../14_行业基线/05_行业场景与端到端案例.md)。

## 案例一：企业客服 RAG 助手

### 题目

某 SaaS 公司每月 8 万工单，坐席平均处理 12 分钟；知识分散在 4 套系统，政策更新后错误率上升。管理层要求“一个月上 AI 客服，自动回复 80%”。

你是 AI PM，怎样从 0 到试点？

### 参考拆解

#### 1. 重写目标

不直接承诺自动回复 80%。首阶段目标：为坐席提供**有权限、有引用、可编辑**的答复草稿，使合格答案的一次采纳率提高、平均处理时长下降，同时不增加高风险政策错误。

#### 2. 建立基线

- 按工单类型、客户等级、语言、政策风险统计量、时长、一次解决率、返工和投诉。
- 抽样 500 条，区分“知识检索慢”“流程操作慢”“需要判断/协商”“系统故障”。
- 发现若只有 35% 工单属于稳定知识问答，80% 自动化目标本身无依据。

#### 3. 缩窄 MVP

- 只做登录后坐席工作台，不直接面向终端用户。
- 只覆盖产品使用与订单政策；不处理安全事件、合同争议、退款执行。
- 草稿必须引用当前有效文档，坐席确认后发送。

#### 4. 数据与知识

- 建知识 Owner 和生效/失效日期；解决冲突文档。
- 文档块带产品、版本、客户等级、语言、权限和更新时间。
- 工单去标识后抽样；不把客户原文默认用于模型训练。

#### 5. 方案

`意图/实体 → ACL 混合检索 → 重排 → 生成草稿/引用 → 政策规则校验 → 坐席确认`。

低延迟小模型做分类和查询改写，较强模型只做复杂生成；找不到可靠来源时拒绝并给搜索结果。

#### 6. 评测

- 600 条冻结测试，按意图、客户、语言、文档时效和风险分层。
- 检索 Recall@5、引用支持、事实正确、完整、拒答、P95、每成功草稿成本。
- 高风险错误硬门槛为 0；总体一次采纳率不是离线模型指标，进入试点测。

#### 7. 试点

20 名坐席 4 周，按团队随机或分阶段推出。看采用、重大编辑、处理时长、一次解决、升级、投诉、人工认知负荷。每周把失败归入知识、检索、生成、规则或体验。

#### 8. Go/No-Go

若处理时长下降但一次解决率下降，不放量；若质量达标但采用低，先修工作流而非换模型；若 30% 失败来自过期知识，投资知识治理优先于微调。

### 练习交付

- [ ] 一页产品简报。
- [ ] 机会评分与范围外清单。
- [ ] 50 条示例黄金集 Schema。
- [ ] AI PRD 的失败模式表。
- [ ] 试点 Go/No-Go 单。

---

## 案例二：销售会议 Copilot

### 题目

B2B 销售需要自动录音、总结、更新 CRM、生成跟进邮件，并由系统识别成交概率。销售负责人希望“会议结束后全自动更新”。客户涉及多个国家。

### 参考拆解

#### 用户与受影响者

销售、销售经理、客户、合规、运营。客户是被录音和分析者，不能只研究内部销售体验。

#### 原子任务与风险

| 任务 | 能力 | 主要风险 | 初始自主性 |
|---|---|---|---|
| 录音/转写 | ASR | 同意、口音、敏感信息 | 明示同意，可暂停 |
| 摘要/行动项 | LLM | 错归因、遗漏承诺 | 草稿，可回听定位 |
| CRM 字段 | 抽取/规则 | 错覆盖正式记录 | 差异预览后确认 |
| 跟进邮件 | 生成 | 虚假承诺/泄密 | 草稿 |
| 成交概率 | 预测 | 偏差、管理误用 | 建议，解释因素，不直接绩效处分 |

#### 产品设计

- 会前按法域/客户政策获得录音同意；提供不录音替代。
- 摘要每个关键主张链接时间戳，姓名/数字/日期突出验证。
- CRM 更新采用字段 diff；不覆盖手工更正，支持撤销。
- 邮件发送永远是独立明确确认。
- 用户可删除录音/转写，数据保留与训练用途清楚。

#### 评测

- ASR 按语言、口音、噪声和专有名词测 WER 与关键实体正确率。
- 摘要测事实/归因/完整/行动项，不能只用 ROUGE。
- CRM 测字段级 precision/recall，金额/时间等关键字段单列。
- 在线测会后行政时间、CRM 完整度、邮件修改、错误恢复和客户投诉。

#### 项目计划关键路径

法域同意和隐私 → 录音供应商区域/合同 → ASR 领域词表 → CRM 沙箱/权限 → 评测 → 试点。若法务最后才加入，技术完成也可能无法上线。

### 练习交付

- [ ] 跨境数据流和保留表。
- [ ] RACI 与三类高风险变更审批。
- [ ] 模型/供应商评分卡。
- [ ] 用户可控记忆和删除流程原型。

---

## 案例三：采购执行 Agent

### 题目

企业想让 Agent 根据邮件和预算自动询价、比较供应商、创建采购申请并发送订单。管理层认为“Agent 才是真 AI”。

### 参考拆解

#### 先挑战价值假设

流程瓶颈可能是审批、供应商准入或预算冻结，而非录入。先用流程数据确认等待和返工位置。若 70% 时间在人工审批队列，Agent 自动写表只改善小部分。

#### 自主性设计

首阶段使用确定 Workflow：

1. 从授权邮件抽取需求，用户确认。
2. 只向已批准供应商生成询价草稿，采购确认发送。
3. 工具确定性计算价格/税/交期，模型只解释差异。
4. 采购申请预览后提交。
5. 订单发送属于高影响动作，采购与预算 Owner 双确认。

不让开放式 Agent 自由访问邮箱、浏览器、ERP 和支付。

#### 权限与安全

- 读邮件、写草稿、提交申请、发订单使用不同身份和 Scope。
- 邮件/附件可能包含间接 Prompt Injection，只当数据解析。
- 金额、供应商、银行信息用主数据验证；新供应商走独立准入。
- 每任务步骤、金额、Token、时间有限额；工具调用幂等。
- 所有决策和人类确认可审计，支持取消/补偿。

#### Agent 评测

建立模拟 ERP/邮箱沙箱，测试：正常采购、信息缺失、报价冲突、恶意附件、工具超时、重复请求、预算变化、供应商改账号、并发审批。指标包括端到端成功、错误动作、权限违规、人工介入、恢复和每成功任务成本。

#### 什么时候提高自主性

只对低金额、重复、白名单、可逆、历史稳定的采购，在长期零严重事故和监控成熟后逐步减少确认；每扩大权限都重新做风险评估和阶段门。

### 练习交付

- [ ] 工具权限矩阵。
- [ ] 10 条 Agent 攻击/故障测试。
- [ ] 预算和循环熔断规则。
- [ ] 从 L1 草稿到 L3 监督自治的晋级门槛。

---

## 案例四：招聘筛选失败案例

### 题目

团队用历史“优秀员工”简历微调模型，自动给候选人打分。离线准确率 91%，两个月后发现某些学校、职业中断和非标准简历候选人分数明显偏低。

### 根因树

- 目标错误：历史录用/绩效不是无偏的“人才质量”。
- 数据选择：只看已录用员工，缺失被拒者的反事实表现。
- 标签偏差：绩效受经理、岗位机会和组织环境影响。
- 代理变量：学校、地址、职业路径关联受保护特征。
- 指标失真：总体准确率掩盖群体漏报与岗位差异。
- 流程放大：自动排序让低分候选永远不被人看到，形成反馈回路。
- 治理失败：高影响场景没有独立评估、申诉和持续监控。

### 纠偏

1. 暂停自动筛除，保护证据并评估影响人群。
2. 通知内部风险/法务，按义务处理候选人补救和监管。
3. 重新定义任务：辅助提取与结构化，而非输出单一“人才分”。
4. 专业人员制定与岗位直接相关、可解释的标准；限制代理变量。
5. 按岗位和相关群体做漏报/误报、交叉切片与定性评估。
6. 候选人获得告知、纠错和人工复核；招聘者看到完整候选池。
7. 监控流程结果，不只监控模型分数。

### 关键教训

高离线分不代表目标正当；历史数据会编码过去的制度；“人最终决定”若人只看 AI 排序顶部，不能消除自动化影响。

---

## 通用评分 Rubric

用以下问题评价自己的案例方案（每项 0–3）：

- 问题与基线是否真实可量化？
- 是否比较非 AI 方案并缩窄范围？
- 数据来源、权利、代表性是否明确？
- 评测是否覆盖端到端、切片、风险、成本和线上价值？
- 自主性是否与可逆性/损害匹配？
- 失败、拒答、确认、撤销、人工接管是否设计？
- 项目依赖、责任、阶段门和停止条件是否明确？
- 监控、回滚、事故、供应商退出和退役是否可执行？

总分不重要；任一高风险底线为 0 都应先补齐。
