典 · AI PM 永乐大典

行业知识 · v2.3.0 · 资料核对 2026-10-03

案例演练:从答案倒推方法

这些案例不是行业标准答案,而是训练“证据—决策—取舍”。建议先只读题目,用模板独立完成,再看参考拆解。

案例中数值为教学假设,不代表真实客户成果。每个练习补交基线/数据卡、影响与权限、冻结评测及区间、单位成功成本、放量/恢复和退役证据。八行业入口和完整客服演练见 行业场景与端到端案例。

案例一:企业客服 RAG 助手

题目

某 SaaS 公司每月 8 万工单,坐席平均处理 12 分钟;知识分散在 4 套系统,政策更新后错误率上升。管理层要求“一个月上 AI 客服,自动回复 80%”。

你是 AI PM,怎样从 0 到试点?

参考拆解

1. 重写目标

不直接承诺自动回复 80%。首阶段目标:为坐席提供有权限、有引用、可编辑的答复草稿,使合格答案的一次采纳率提高、平均处理时长下降,同时不增加高风险政策错误。

2. 建立基线

3. 缩窄 MVP

4. 数据与知识

5. 方案

意图/实体 → ACL 混合检索 → 重排 → 生成草稿/引用 → 政策规则校验 → 坐席确认。

低延迟小模型做分类和查询改写,较强模型只做复杂生成;找不到可靠来源时拒绝并给搜索结果。

6. 评测

7. 试点

20 名坐席 4 周,按团队随机或分阶段推出。看采用、重大编辑、处理时长、一次解决、升级、投诉、人工认知负荷。每周把失败归入知识、检索、生成、规则或体验。

8. Go/No-Go

若处理时长下降但一次解决率下降,不放量;若质量达标但采用低,先修工作流而非换模型;若 30% 失败来自过期知识,投资知识治理优先于微调。

练习交付


案例二:销售会议 Copilot

题目

B2B 销售需要自动录音、总结、更新 CRM、生成跟进邮件,并由系统识别成交概率。销售负责人希望“会议结束后全自动更新”。客户涉及多个国家。

参考拆解

用户与受影响者

销售、销售经理、客户、合规、运营。客户是被录音和分析者,不能只研究内部销售体验。

原子任务与风险

任务能力主要风险初始自主性
录音/转写ASR同意、口音、敏感信息明示同意,可暂停
摘要/行动项LLM错归因、遗漏承诺草稿,可回听定位
CRM 字段抽取/规则错覆盖正式记录差异预览后确认
跟进邮件生成虚假承诺/泄密草稿
成交概率预测偏差、管理误用建议,解释因素,不直接绩效处分

产品设计

评测

项目计划关键路径

法域同意和隐私 → 录音供应商区域/合同 → ASR 领域词表 → CRM 沙箱/权限 → 评测 → 试点。若法务最后才加入,技术完成也可能无法上线。

练习交付


案例三:采购执行 Agent

题目

企业想让 Agent 根据邮件和预算自动询价、比较供应商、创建采购申请并发送订单。管理层认为“Agent 才是真 AI”。

参考拆解

先挑战价值假设

流程瓶颈可能是审批、供应商准入或预算冻结,而非录入。先用流程数据确认等待和返工位置。若 70% 时间在人工审批队列,Agent 自动写表只改善小部分。

自主性设计

首阶段使用确定 Workflow:

  1. 从授权邮件抽取需求,用户确认。
  2. 只向已批准供应商生成询价草稿,采购确认发送。
  3. 工具确定性计算价格/税/交期,模型只解释差异。
  4. 采购申请预览后提交。
  5. 订单发送属于高影响动作,采购与预算 Owner 双确认。

不让开放式 Agent 自由访问邮箱、浏览器、ERP 和支付。

权限与安全

Agent 评测

建立模拟 ERP/邮箱沙箱,测试:正常采购、信息缺失、报价冲突、恶意附件、工具超时、重复请求、预算变化、供应商改账号、并发审批。指标包括端到端成功、错误动作、权限违规、人工介入、恢复和每成功任务成本。

什么时候提高自主性

只对低金额、重复、白名单、可逆、历史稳定的采购,在长期零严重事故和监控成熟后逐步减少确认;每扩大权限都重新做风险评估和阶段门。

练习交付


案例四:招聘筛选失败案例

题目

团队用历史“优秀员工”简历微调模型,自动给候选人打分。离线准确率 91%,两个月后发现某些学校、职业中断和非标准简历候选人分数明显偏低。

根因树

纠偏

  1. 暂停自动筛除,保护证据并评估影响人群。
  2. 通知内部风险/法务,按义务处理候选人补救和监管。
  3. 重新定义任务:辅助提取与结构化,而非输出单一“人才分”。
  4. 专业人员制定与岗位直接相关、可解释的标准;限制代理变量。
  5. 按岗位和相关群体做漏报/误报、交叉切片与定性评估。
  6. 候选人获得告知、纠错和人工复核;招聘者看到完整候选池。
  7. 监控流程结果,不只监控模型分数。

关键教训

高离线分不代表目标正当;历史数据会编码过去的制度;“人最终决定”若人只看 AI 排序顶部,不能消除自动化影响。


通用评分 Rubric

用以下问题评价自己的案例方案(每项 0–3):

总分不重要;任一高风险底线为 0 都应先补齐。