典 · AI PM 永乐大典

行业知识 · v2.3.0 · 资料核对 2026-10-03

AI 产品与项目决策速查表

这是桌面速查版。它帮助快速找到下一步,不代替完整评审。涉及高风险人身、财务、就业、教育、医疗、法律或公共决策时,应启动专业和合规评审。

1. 这个问题要不要用 AI

是否有清晰用户任务与可衡量价值?
├─ 否 → 先做问题发现,不选模型
└─ 是
   是否可用流程优化、规则或普通搜索稳定解决?
   ├─ 是 → 先采用更简单方案,AI 只处理剩余不确定部分
   └─ 否
      是否有合法可用的数据/上下文与可接受的错误边界?
      ├─ 否 → 补数据、缩范围、加入人工或停止
      └─ 是 → 建立非 AI 基线,做时间盒 AI 原型与评测

2. Prompt、RAG、微调、工具还是 Agent

主要问题优先选择说明
行为、格式、语气不稳定Prompt + 结构化输出先明确指令、示例、边界和验证
缺少私有、动态或可引用知识RAG同时处理权限、时效、引用和拒答
需要实时查询或执行动作工具调用工具层做鉴权、参数验证、审计和幂等
固定多步流程确定性工作流更可控、可测、可追踪
路径无法预先穷举且需动态决策受限 Agent设置工具白名单、预算、停止条件和人工确认
大量稳定行为/风格偏差,Prompt 已到瓶颈微调需要高质量数据、基线、回归评测和维护能力
事实错误先定位根因不要默认用微调;可能是检索、工具、数据或任务边界问题

3. 选模型

按顺序过滤:

  1. 硬性约束:数据地域、隐私、部署、输入类型、上下文、工具与语言。
  2. 自有任务质量:核心、长尾、高风险、拒答和回归集。
  3. 运行表现:P50/P95 延迟、稳定性、限额、并发和可用性。
  4. 单位经济:每个成功任务的总成本,而非每百万 Token 单价。
  5. 运营风险:版本变更、可替代性、供应商锁定、支持和合同。

若质量相近,优先选更简单、更便宜、更稳定、可替换的方案。可按任务路由,不必让一个模型承担全部场景。

4. API、自托管还是混合

情况倾向
需要快速验证、流量不确定、团队运维能力有限托管 API
有严格数据/部署控制、规模稳定且具备模型运维能力自托管评估
不同任务在质量、隐私、成本上差异明显混合与路由

决策必须比较 2–3 年 TCO:算力、闲置、工程、监控、安全、升级、容灾和人才,而不是只比推理单价。

5. Agent 自主等级

等级系统行为适合场景
L0 建议只给建议,不行动高风险或早期验证
L1 草稿生成待编辑内容邮件、文案、方案
L2 确认后执行展示动作与后果,用户批准后执行写入系统、发送、预订
L3 限域自动在明确范围、额度和规则内自动执行低风险重复任务
L4 高自主长程规划并跨系统执行仅限可恢复、强监控且风险成熟的场景

选择规则:影响越大、可逆性越低、置信越低,等级越低。自主性不是越高越先进。

6. 是否需要人工确认

满足任一项就应考虑确认或复核:

确认界面应显示:准备做什么、对谁/什么做、使用哪些关键数据、可能后果、能否撤销。

7. 选评测方法

输出类型首选评测补充方式
分类/抽取精确率、召回率、F1、字段正确率错误成本、分群、公平性
检索Recall@K、MRR、nDCG权限、时效、人工相关性
摘要/问答事实支持、完整性、引用、拒答专家评审、用户任务成功
代码编译、单元测试、任务通过率安全审查、人工代码评审
Agent端到端成功、工具/参数正确、步数不可逆错误、接管率、成本
创意内容符合 Brief、偏好比较、品牌一致多样性、安全与采用结果

所有类型都要补充:延迟、成本、稳定性、安全和线上行为。

8. 是否可以上线

核心功能和回归评测是否达标? ─ 否 → 不上线
             │是
高风险场景、权限和数据测试是否通过? ─ 否 → 不上线
             │是
监控、告警、降级、回滚、人工接管是否可用? ─ 否 → 不上线
             │是
业务、技术、运营和风险负责人是否明确? ─ 否 → 不上线
             │是
从内部/影子/小流量灰度开始,逐级放量

灰度放量同时满足:质量达标、无重大安全事件、成本在预算内、用户任务结果改善、运营有能力承接。

9. 何时立即降级或回滚

回滚条件应在上线前定义,不能等事故发生后临场争论。

10. 事故前 30 分钟

时段必做动作
0–5 分钟确认事故、指定指挥人和记录人、判断是否仍在扩大
5–15 分钟止血:关闭动作、降级、回滚、限流;保存日志和版本证据
15–30 分钟明确影响范围;通知必要负责人;形成已知事实、未知项、下一次同步时间

原则:先保护用户和系统,再恢复服务,最后做根因与归责分析。

11. 项目延期怎么选

先确认:延期来自范围、资源、依赖、质量目标,还是未知技术风险?

若目标日期不可变:缩范围 / 分阶段 / 替代方案 / 增加有效资源
若范围不可变:延时间 / 增资源 / 降低非关键质量要求
若质量与风险底线不可变:缩范围 / 延时间 / 改方案,不能带病上线
若关键假设尚未验证:暂停全面开发,先做时间盒 Spike

禁止做法:范围、日期、资源和质量同时不变,却要求团队“想办法”。

12. 变更是否需要正式审批

满足任一项进入变更流程:

变更单最少包含:原因、收益、成本、影响、风险、备选方案、决策人和新基线。

13. Build、Buy 还是 Partner

问题是时倾向自建否时倾向采购/合作
是否直接形成核心差异化?✓
是否有独有数据/工作流与团队能力?✓
是否必须掌握控制、审计或部署?✓
市场方案是否无法达到关键质量/成本?✓
能否承担持续维护、评测、安全和升级?✓
时间窗口是否允许建设?✓

常见答案是组合:采购基础模型,自建领域数据、评测、工作流、权限和用户体验。

14. 定价模型速选

客户价值形态可考虑的计价
团队持续使用、价值与人数近似相关席位订阅
资源消耗差异大、使用可量化用量计费
任务完成可清晰定义并可归因按成功任务/结果
平台底座 + 波动使用基础订阅 + 用量
企业需要预算确定性和服务保障年度合同 + 配额/SLA

计价单位要满足:客户理解、可预测、难操纵、与价值正相关、不会鼓励错误行为。

15. 是否要平台化

出现以下信号再平台化:

如果只有一个用例、需求仍剧烈变化,优先把产品做好,不要过早抽象平台。

16. 继续、转向还是停止

证据状态动作
用户价值强,技术与单位经济达标扩大投入
用户价值强,技术暂未达标缩任务、换架构、保留人工,继续限时验证
技术可行,用户价值弱回到问题发现,不继续堆能力
价值和技术都不确定最小实验,设置明确时限和退出条件
风险底线无法满足或经济性长期无解停止/转向

沉没成本不是继续理由。停止时保存数据字典、评测集、失败知识、技术结论和决策记录。

17. 一页评审检查

深入判断时配合阅读:AI 产品 0 到 1、AI 项目管理和进阶专题。