# AI 产品与项目决策速查表

> 这是桌面速查版。它帮助快速找到下一步，不代替完整评审。涉及高风险人身、财务、就业、教育、医疗、法律或公共决策时，应启动专业和合规评审。

## 1. 这个问题要不要用 AI

```text
是否有清晰用户任务与可衡量价值？
├─ 否 → 先做问题发现，不选模型
└─ 是
   是否可用流程优化、规则或普通搜索稳定解决？
   ├─ 是 → 先采用更简单方案，AI 只处理剩余不确定部分
   └─ 否
      是否有合法可用的数据/上下文与可接受的错误边界？
      ├─ 否 → 补数据、缩范围、加入人工或停止
      └─ 是 → 建立非 AI 基线，做时间盒 AI 原型与评测
```

## 2. Prompt、RAG、微调、工具还是 Agent

| 主要问题 | 优先选择 | 说明 |
|---|---|---|
| 行为、格式、语气不稳定 | Prompt + 结构化输出 | 先明确指令、示例、边界和验证 |
| 缺少私有、动态或可引用知识 | RAG | 同时处理权限、时效、引用和拒答 |
| 需要实时查询或执行动作 | 工具调用 | 工具层做鉴权、参数验证、审计和幂等 |
| 固定多步流程 | 确定性工作流 | 更可控、可测、可追踪 |
| 路径无法预先穷举且需动态决策 | 受限 Agent | 设置工具白名单、预算、停止条件和人工确认 |
| 大量稳定行为/风格偏差，Prompt 已到瓶颈 | 微调 | 需要高质量数据、基线、回归评测和维护能力 |
| 事实错误 | 先定位根因 | 不要默认用微调；可能是检索、工具、数据或任务边界问题 |

## 3. 选模型

按顺序过滤：

1. 硬性约束：数据地域、隐私、部署、输入类型、上下文、工具与语言。
2. 自有任务质量：核心、长尾、高风险、拒答和回归集。
3. 运行表现：P50/P95 延迟、稳定性、限额、并发和可用性。
4. 单位经济：每个成功任务的总成本，而非每百万 Token 单价。
5. 运营风险：版本变更、可替代性、供应商锁定、支持和合同。

若质量相近，优先选更简单、更便宜、更稳定、可替换的方案。可按任务路由，不必让一个模型承担全部场景。

## 4. API、自托管还是混合

| 情况 | 倾向 |
|---|---|
| 需要快速验证、流量不确定、团队运维能力有限 | 托管 API |
| 有严格数据/部署控制、规模稳定且具备模型运维能力 | 自托管评估 |
| 不同任务在质量、隐私、成本上差异明显 | 混合与路由 |

决策必须比较 2–3 年 TCO：算力、闲置、工程、监控、安全、升级、容灾和人才，而不是只比推理单价。

## 5. Agent 自主等级

| 等级 | 系统行为 | 适合场景 |
|---|---|---|
| L0 建议 | 只给建议，不行动 | 高风险或早期验证 |
| L1 草稿 | 生成待编辑内容 | 邮件、文案、方案 |
| L2 确认后执行 | 展示动作与后果，用户批准后执行 | 写入系统、发送、预订 |
| L3 限域自动 | 在明确范围、额度和规则内自动执行 | 低风险重复任务 |
| L4 高自主 | 长程规划并跨系统执行 | 仅限可恢复、强监控且风险成熟的场景 |

选择规则：影响越大、可逆性越低、置信越低，等级越低。自主性不是越高越先进。

## 6. 是否需要人工确认

满足任一项就应考虑确认或复核：

- 涉及付款、签约、发布、删除、外发或权限变更。
- 错误会影响人身、权益、财务、声誉或合规。
- 动作难以撤销，或恢复成本高。
- 系统置信不足、输入冲突或证据缺失。
- 操作对象、范围或后果可能被用户误解。

确认界面应显示：准备做什么、对谁/什么做、使用哪些关键数据、可能后果、能否撤销。

## 7. 选评测方法

| 输出类型 | 首选评测 | 补充方式 |
|---|---|---|
| 分类/抽取 | 精确率、召回率、F1、字段正确率 | 错误成本、分群、公平性 |
| 检索 | Recall@K、MRR、nDCG | 权限、时效、人工相关性 |
| 摘要/问答 | 事实支持、完整性、引用、拒答 | 专家评审、用户任务成功 |
| 代码 | 编译、单元测试、任务通过率 | 安全审查、人工代码评审 |
| Agent | 端到端成功、工具/参数正确、步数 | 不可逆错误、接管率、成本 |
| 创意内容 | 符合 Brief、偏好比较、品牌一致 | 多样性、安全与采用结果 |

所有类型都要补充：延迟、成本、稳定性、安全和线上行为。

## 8. 是否可以上线

```text
核心功能和回归评测是否达标？ ─ 否 → 不上线
             │是
高风险场景、权限和数据测试是否通过？ ─ 否 → 不上线
             │是
监控、告警、降级、回滚、人工接管是否可用？ ─ 否 → 不上线
             │是
业务、技术、运营和风险负责人是否明确？ ─ 否 → 不上线
             │是
从内部/影子/小流量灰度开始，逐级放量
```

灰度放量同时满足：质量达标、无重大安全事件、成本在预算内、用户任务结果改善、运营有能力承接。

## 9. 何时立即降级或回滚

- 发生越权访问、敏感数据泄露或跨租户污染。
- 产生可能造成重大现实伤害的错误动作。
- 核心任务成功率跌破预设下限。
- 错误率、延迟或成本快速扩大且无法及时控制。
- 模型/数据版本不可追溯，无法判断影响范围。
- 监控或人工接管失效，系统处于不可观测状态。

回滚条件应在上线前定义，不能等事故发生后临场争论。

## 10. 事故前 30 分钟

| 时段 | 必做动作 |
|---|---|
| 0–5 分钟 | 确认事故、指定指挥人和记录人、判断是否仍在扩大 |
| 5–15 分钟 | 止血：关闭动作、降级、回滚、限流；保存日志和版本证据 |
| 15–30 分钟 | 明确影响范围；通知必要负责人；形成已知事实、未知项、下一次同步时间 |

原则：先保护用户和系统，再恢复服务，最后做根因与归责分析。

## 11. 项目延期怎么选

```text
先确认：延期来自范围、资源、依赖、质量目标，还是未知技术风险？

若目标日期不可变：缩范围 / 分阶段 / 替代方案 / 增加有效资源
若范围不可变：延时间 / 增资源 / 降低非关键质量要求
若质量与风险底线不可变：缩范围 / 延时间 / 改方案，不能带病上线
若关键假设尚未验证：暂停全面开发，先做时间盒 Spike
```

禁止做法：范围、日期、资源和质量同时不变，却要求团队“想办法”。

## 12. 变更是否需要正式审批

满足任一项进入变更流程：

- 影响关键里程碑、预算或已承诺范围。
- 改变模型/数据供应商、数据用途或部署地域。
- 增加新用户群、自动化动作或高风险场景。
- 降低质量、安全、隐私、审计或可用性标准。
- 影响其他团队关键依赖。

变更单最少包含：原因、收益、成本、影响、风险、备选方案、决策人和新基线。

## 13. Build、Buy 还是 Partner

| 问题 | 是时倾向自建 | 否时倾向采购/合作 |
|---|---|---|
| 是否直接形成核心差异化？ | ✓ |  |
| 是否有独有数据/工作流与团队能力？ | ✓ |  |
| 是否必须掌握控制、审计或部署？ | ✓ |  |
| 市场方案是否无法达到关键质量/成本？ | ✓ |  |
| 能否承担持续维护、评测、安全和升级？ | ✓ |  |
| 时间窗口是否允许建设？ | ✓ |  |

常见答案是组合：采购基础模型，自建领域数据、评测、工作流、权限和用户体验。

## 14. 定价模型速选

| 客户价值形态 | 可考虑的计价 |
|---|---|
| 团队持续使用、价值与人数近似相关 | 席位订阅 |
| 资源消耗差异大、使用可量化 | 用量计费 |
| 任务完成可清晰定义并可归因 | 按成功任务/结果 |
| 平台底座 + 波动使用 | 基础订阅 + 用量 |
| 企业需要预算确定性和服务保障 | 年度合同 + 配额/SLA |

计价单位要满足：客户理解、可预测、难操纵、与价值正相关、不会鼓励错误行为。

## 15. 是否要平台化

出现以下信号再平台化：

- 多个团队重复建设模型接入、RAG、评测、权限或观测；固定数量不作为硬门槛。
- 重复成本和风险已经高于标准化成本。
- 通用能力边界稳定，团队之间确有共性。
- 有明确平台负责人、服务等级、路线图和运营能力。

如果只有一个用例、需求仍剧烈变化，优先把产品做好，不要过早抽象平台。

## 16. 继续、转向还是停止

| 证据状态 | 动作 |
|---|---|
| 用户价值强，技术与单位经济达标 | 扩大投入 |
| 用户价值强，技术暂未达标 | 缩任务、换架构、保留人工，继续限时验证 |
| 技术可行，用户价值弱 | 回到问题发现，不继续堆能力 |
| 价值和技术都不确定 | 最小实验，设置明确时限和退出条件 |
| 风险底线无法满足或经济性长期无解 | 停止/转向 |

沉没成本不是继续理由。停止时保存数据字典、评测集、失败知识、技术结论和决策记录。

## 17. 一页评审检查

- [ ] 用户、任务、痛点、现有替代和基线清楚。
- [ ] AI 方案优于更简单方案的证据清楚。
- [ ] 数据来源、权限、时效和保留策略清楚。
- [ ] Prompt/RAG/工具/Agent 的选择能解释。
- [ ] 成功、失败、拒答、人工接管和不可逆动作清楚。
- [ ] 离线评测、线上指标、护栏和回归集清楚。
- [ ] 延迟、容量、每成功任务成本和预算清楚。
- [ ] 安全、隐私、公平、透明和合规责任清楚。
- [ ] 依赖、风险、里程碑、负责人和验收清楚。
- [ ] 灰度、监控、回滚、运营和停止条件清楚。

深入判断时配合阅读：[AI 产品 0 到 1](../03_AI产品0到1/00_总流程.md)、[AI 项目管理](../04_AI项目管理/01_立项与计划.md)和[进阶专题](../12_进阶专题/01_AI产品战略与竞争壁垒.md)。
