行业知识 · v2.3.0 · 资料核对 2026-10-03
案例演练:从答案倒推方法
这些案例不是行业标准答案,而是训练“证据—决策—取舍”。建议先只读题目,用模板独立完成,再看参考拆解。
案例中数值为教学假设,不代表真实客户成果。每个练习补交基线/数据卡、影响与权限、冻结评测及区间、单位成功成本、放量/恢复和退役证据。八行业入口和完整客服演练见 行业场景与端到端案例。
案例一:企业客服 RAG 助手
题目
某 SaaS 公司每月 8 万工单,坐席平均处理 12 分钟;知识分散在 4 套系统,政策更新后错误率上升。管理层要求“一个月上 AI 客服,自动回复 80%”。
你是 AI PM,怎样从 0 到试点?
参考拆解
1. 重写目标
不直接承诺自动回复 80%。首阶段目标:为坐席提供有权限、有引用、可编辑的答复草稿,使合格答案的一次采纳率提高、平均处理时长下降,同时不增加高风险政策错误。
2. 建立基线
- 按工单类型、客户等级、语言、政策风险统计量、时长、一次解决率、返工和投诉。
- 抽样 500 条,区分“知识检索慢”“流程操作慢”“需要判断/协商”“系统故障”。
- 发现若只有 35% 工单属于稳定知识问答,80% 自动化目标本身无依据。
3. 缩窄 MVP
- 只做登录后坐席工作台,不直接面向终端用户。
- 只覆盖产品使用与订单政策;不处理安全事件、合同争议、退款执行。
- 草稿必须引用当前有效文档,坐席确认后发送。
4. 数据与知识
- 建知识 Owner 和生效/失效日期;解决冲突文档。
- 文档块带产品、版本、客户等级、语言、权限和更新时间。
- 工单去标识后抽样;不把客户原文默认用于模型训练。
5. 方案
意图/实体 → ACL 混合检索 → 重排 → 生成草稿/引用 → 政策规则校验 → 坐席确认。
低延迟小模型做分类和查询改写,较强模型只做复杂生成;找不到可靠来源时拒绝并给搜索结果。
6. 评测
- 600 条冻结测试,按意图、客户、语言、文档时效和风险分层。
- 检索 Recall@5、引用支持、事实正确、完整、拒答、P95、每成功草稿成本。
- 高风险错误硬门槛为 0;总体一次采纳率不是离线模型指标,进入试点测。
7. 试点
20 名坐席 4 周,按团队随机或分阶段推出。看采用、重大编辑、处理时长、一次解决、升级、投诉、人工认知负荷。每周把失败归入知识、检索、生成、规则或体验。
8. Go/No-Go
若处理时长下降但一次解决率下降,不放量;若质量达标但采用低,先修工作流而非换模型;若 30% 失败来自过期知识,投资知识治理优先于微调。
练习交付
- [ ] 一页产品简报。
- [ ] 机会评分与范围外清单。
- [ ] 50 条示例黄金集 Schema。
- [ ] AI PRD 的失败模式表。
- [ ] 试点 Go/No-Go 单。
案例二:销售会议 Copilot
题目
B2B 销售需要自动录音、总结、更新 CRM、生成跟进邮件,并由系统识别成交概率。销售负责人希望“会议结束后全自动更新”。客户涉及多个国家。
参考拆解
用户与受影响者
销售、销售经理、客户、合规、运营。客户是被录音和分析者,不能只研究内部销售体验。
原子任务与风险
| 任务 | 能力 | 主要风险 | 初始自主性 |
|---|---|---|---|
| 录音/转写 | ASR | 同意、口音、敏感信息 | 明示同意,可暂停 |
| 摘要/行动项 | LLM | 错归因、遗漏承诺 | 草稿,可回听定位 |
| CRM 字段 | 抽取/规则 | 错覆盖正式记录 | 差异预览后确认 |
| 跟进邮件 | 生成 | 虚假承诺/泄密 | 草稿 |
| 成交概率 | 预测 | 偏差、管理误用 | 建议,解释因素,不直接绩效处分 |
产品设计
- 会前按法域/客户政策获得录音同意;提供不录音替代。
- 摘要每个关键主张链接时间戳,姓名/数字/日期突出验证。
- CRM 更新采用字段 diff;不覆盖手工更正,支持撤销。
- 邮件发送永远是独立明确确认。
- 用户可删除录音/转写,数据保留与训练用途清楚。
评测
- ASR 按语言、口音、噪声和专有名词测 WER 与关键实体正确率。
- 摘要测事实/归因/完整/行动项,不能只用 ROUGE。
- CRM 测字段级 precision/recall,金额/时间等关键字段单列。
- 在线测会后行政时间、CRM 完整度、邮件修改、错误恢复和客户投诉。
项目计划关键路径
法域同意和隐私 → 录音供应商区域/合同 → ASR 领域词表 → CRM 沙箱/权限 → 评测 → 试点。若法务最后才加入,技术完成也可能无法上线。
练习交付
- [ ] 跨境数据流和保留表。
- [ ] RACI 与三类高风险变更审批。
- [ ] 模型/供应商评分卡。
- [ ] 用户可控记忆和删除流程原型。
案例三:采购执行 Agent
题目
企业想让 Agent 根据邮件和预算自动询价、比较供应商、创建采购申请并发送订单。管理层认为“Agent 才是真 AI”。
参考拆解
先挑战价值假设
流程瓶颈可能是审批、供应商准入或预算冻结,而非录入。先用流程数据确认等待和返工位置。若 70% 时间在人工审批队列,Agent 自动写表只改善小部分。
自主性设计
首阶段使用确定 Workflow:
- 从授权邮件抽取需求,用户确认。
- 只向已批准供应商生成询价草稿,采购确认发送。
- 工具确定性计算价格/税/交期,模型只解释差异。
- 采购申请预览后提交。
- 订单发送属于高影响动作,采购与预算 Owner 双确认。
不让开放式 Agent 自由访问邮箱、浏览器、ERP 和支付。
权限与安全
- 读邮件、写草稿、提交申请、发订单使用不同身份和 Scope。
- 邮件/附件可能包含间接 Prompt Injection,只当数据解析。
- 金额、供应商、银行信息用主数据验证;新供应商走独立准入。
- 每任务步骤、金额、Token、时间有限额;工具调用幂等。
- 所有决策和人类确认可审计,支持取消/补偿。
Agent 评测
建立模拟 ERP/邮箱沙箱,测试:正常采购、信息缺失、报价冲突、恶意附件、工具超时、重复请求、预算变化、供应商改账号、并发审批。指标包括端到端成功、错误动作、权限违规、人工介入、恢复和每成功任务成本。
什么时候提高自主性
只对低金额、重复、白名单、可逆、历史稳定的采购,在长期零严重事故和监控成熟后逐步减少确认;每扩大权限都重新做风险评估和阶段门。
练习交付
- [ ] 工具权限矩阵。
- [ ] 10 条 Agent 攻击/故障测试。
- [ ] 预算和循环熔断规则。
- [ ] 从 L1 草稿到 L3 监督自治的晋级门槛。
案例四:招聘筛选失败案例
题目
团队用历史“优秀员工”简历微调模型,自动给候选人打分。离线准确率 91%,两个月后发现某些学校、职业中断和非标准简历候选人分数明显偏低。
根因树
- 目标错误:历史录用/绩效不是无偏的“人才质量”。
- 数据选择:只看已录用员工,缺失被拒者的反事实表现。
- 标签偏差:绩效受经理、岗位机会和组织环境影响。
- 代理变量:学校、地址、职业路径关联受保护特征。
- 指标失真:总体准确率掩盖群体漏报与岗位差异。
- 流程放大:自动排序让低分候选永远不被人看到,形成反馈回路。
- 治理失败:高影响场景没有独立评估、申诉和持续监控。
纠偏
- 暂停自动筛除,保护证据并评估影响人群。
- 通知内部风险/法务,按义务处理候选人补救和监管。
- 重新定义任务:辅助提取与结构化,而非输出单一“人才分”。
- 专业人员制定与岗位直接相关、可解释的标准;限制代理变量。
- 按岗位和相关群体做漏报/误报、交叉切片与定性评估。
- 候选人获得告知、纠错和人工复核;招聘者看到完整候选池。
- 监控流程结果,不只监控模型分数。
关键教训
高离线分不代表目标正当;历史数据会编码过去的制度;“人最终决定”若人只看 AI 排序顶部,不能消除自动化影响。
通用评分 Rubric
用以下问题评价自己的案例方案(每项 0–3):
- 问题与基线是否真实可量化?
- 是否比较非 AI 方案并缩窄范围?
- 数据来源、权利、代表性是否明确?
- 评测是否覆盖端到端、切片、风险、成本和线上价值?
- 自主性是否与可逆性/损害匹配?
- 失败、拒答、确认、撤销、人工接管是否设计?
- 项目依赖、责任、阶段门和停止条件是否明确?
- 监控、回滚、事故、供应商退出和退役是否可执行?
总分不重要;任一高风险底线为 0 都应先补齐。