行业知识 · v2.3.0 · 资料核对 2026-10-03
AI 产品与项目决策速查表
这是桌面速查版。它帮助快速找到下一步,不代替完整评审。涉及高风险人身、财务、就业、教育、医疗、法律或公共决策时,应启动专业和合规评审。
1. 这个问题要不要用 AI
是否有清晰用户任务与可衡量价值?
├─ 否 → 先做问题发现,不选模型
└─ 是
是否可用流程优化、规则或普通搜索稳定解决?
├─ 是 → 先采用更简单方案,AI 只处理剩余不确定部分
└─ 否
是否有合法可用的数据/上下文与可接受的错误边界?
├─ 否 → 补数据、缩范围、加入人工或停止
└─ 是 → 建立非 AI 基线,做时间盒 AI 原型与评测
2. Prompt、RAG、微调、工具还是 Agent
| 主要问题 | 优先选择 | 说明 |
|---|---|---|
| 行为、格式、语气不稳定 | Prompt + 结构化输出 | 先明确指令、示例、边界和验证 |
| 缺少私有、动态或可引用知识 | RAG | 同时处理权限、时效、引用和拒答 |
| 需要实时查询或执行动作 | 工具调用 | 工具层做鉴权、参数验证、审计和幂等 |
| 固定多步流程 | 确定性工作流 | 更可控、可测、可追踪 |
| 路径无法预先穷举且需动态决策 | 受限 Agent | 设置工具白名单、预算、停止条件和人工确认 |
| 大量稳定行为/风格偏差,Prompt 已到瓶颈 | 微调 | 需要高质量数据、基线、回归评测和维护能力 |
| 事实错误 | 先定位根因 | 不要默认用微调;可能是检索、工具、数据或任务边界问题 |
3. 选模型
按顺序过滤:
- 硬性约束:数据地域、隐私、部署、输入类型、上下文、工具与语言。
- 自有任务质量:核心、长尾、高风险、拒答和回归集。
- 运行表现:P50/P95 延迟、稳定性、限额、并发和可用性。
- 单位经济:每个成功任务的总成本,而非每百万 Token 单价。
- 运营风险:版本变更、可替代性、供应商锁定、支持和合同。
若质量相近,优先选更简单、更便宜、更稳定、可替换的方案。可按任务路由,不必让一个模型承担全部场景。
4. API、自托管还是混合
| 情况 | 倾向 |
|---|---|
| 需要快速验证、流量不确定、团队运维能力有限 | 托管 API |
| 有严格数据/部署控制、规模稳定且具备模型运维能力 | 自托管评估 |
| 不同任务在质量、隐私、成本上差异明显 | 混合与路由 |
决策必须比较 2–3 年 TCO:算力、闲置、工程、监控、安全、升级、容灾和人才,而不是只比推理单价。
5. Agent 自主等级
| 等级 | 系统行为 | 适合场景 |
|---|---|---|
| L0 建议 | 只给建议,不行动 | 高风险或早期验证 |
| L1 草稿 | 生成待编辑内容 | 邮件、文案、方案 |
| L2 确认后执行 | 展示动作与后果,用户批准后执行 | 写入系统、发送、预订 |
| L3 限域自动 | 在明确范围、额度和规则内自动执行 | 低风险重复任务 |
| L4 高自主 | 长程规划并跨系统执行 | 仅限可恢复、强监控且风险成熟的场景 |
选择规则:影响越大、可逆性越低、置信越低,等级越低。自主性不是越高越先进。
6. 是否需要人工确认
满足任一项就应考虑确认或复核:
- 涉及付款、签约、发布、删除、外发或权限变更。
- 错误会影响人身、权益、财务、声誉或合规。
- 动作难以撤销,或恢复成本高。
- 系统置信不足、输入冲突或证据缺失。
- 操作对象、范围或后果可能被用户误解。
确认界面应显示:准备做什么、对谁/什么做、使用哪些关键数据、可能后果、能否撤销。
7. 选评测方法
| 输出类型 | 首选评测 | 补充方式 |
|---|---|---|
| 分类/抽取 | 精确率、召回率、F1、字段正确率 | 错误成本、分群、公平性 |
| 检索 | Recall@K、MRR、nDCG | 权限、时效、人工相关性 |
| 摘要/问答 | 事实支持、完整性、引用、拒答 | 专家评审、用户任务成功 |
| 代码 | 编译、单元测试、任务通过率 | 安全审查、人工代码评审 |
| Agent | 端到端成功、工具/参数正确、步数 | 不可逆错误、接管率、成本 |
| 创意内容 | 符合 Brief、偏好比较、品牌一致 | 多样性、安全与采用结果 |
所有类型都要补充:延迟、成本、稳定性、安全和线上行为。
8. 是否可以上线
核心功能和回归评测是否达标? ─ 否 → 不上线
│是
高风险场景、权限和数据测试是否通过? ─ 否 → 不上线
│是
监控、告警、降级、回滚、人工接管是否可用? ─ 否 → 不上线
│是
业务、技术、运营和风险负责人是否明确? ─ 否 → 不上线
│是
从内部/影子/小流量灰度开始,逐级放量
灰度放量同时满足:质量达标、无重大安全事件、成本在预算内、用户任务结果改善、运营有能力承接。
9. 何时立即降级或回滚
- 发生越权访问、敏感数据泄露或跨租户污染。
- 产生可能造成重大现实伤害的错误动作。
- 核心任务成功率跌破预设下限。
- 错误率、延迟或成本快速扩大且无法及时控制。
- 模型/数据版本不可追溯,无法判断影响范围。
- 监控或人工接管失效,系统处于不可观测状态。
回滚条件应在上线前定义,不能等事故发生后临场争论。
10. 事故前 30 分钟
| 时段 | 必做动作 |
|---|---|
| 0–5 分钟 | 确认事故、指定指挥人和记录人、判断是否仍在扩大 |
| 5–15 分钟 | 止血:关闭动作、降级、回滚、限流;保存日志和版本证据 |
| 15–30 分钟 | 明确影响范围;通知必要负责人;形成已知事实、未知项、下一次同步时间 |
原则:先保护用户和系统,再恢复服务,最后做根因与归责分析。
11. 项目延期怎么选
先确认:延期来自范围、资源、依赖、质量目标,还是未知技术风险?
若目标日期不可变:缩范围 / 分阶段 / 替代方案 / 增加有效资源
若范围不可变:延时间 / 增资源 / 降低非关键质量要求
若质量与风险底线不可变:缩范围 / 延时间 / 改方案,不能带病上线
若关键假设尚未验证:暂停全面开发,先做时间盒 Spike
禁止做法:范围、日期、资源和质量同时不变,却要求团队“想办法”。
12. 变更是否需要正式审批
满足任一项进入变更流程:
- 影响关键里程碑、预算或已承诺范围。
- 改变模型/数据供应商、数据用途或部署地域。
- 增加新用户群、自动化动作或高风险场景。
- 降低质量、安全、隐私、审计或可用性标准。
- 影响其他团队关键依赖。
变更单最少包含:原因、收益、成本、影响、风险、备选方案、决策人和新基线。
13. Build、Buy 还是 Partner
| 问题 | 是时倾向自建 | 否时倾向采购/合作 |
|---|---|---|
| 是否直接形成核心差异化? | ✓ | |
| 是否有独有数据/工作流与团队能力? | ✓ | |
| 是否必须掌握控制、审计或部署? | ✓ | |
| 市场方案是否无法达到关键质量/成本? | ✓ | |
| 能否承担持续维护、评测、安全和升级? | ✓ | |
| 时间窗口是否允许建设? | ✓ |
常见答案是组合:采购基础模型,自建领域数据、评测、工作流、权限和用户体验。
14. 定价模型速选
| 客户价值形态 | 可考虑的计价 |
|---|---|
| 团队持续使用、价值与人数近似相关 | 席位订阅 |
| 资源消耗差异大、使用可量化 | 用量计费 |
| 任务完成可清晰定义并可归因 | 按成功任务/结果 |
| 平台底座 + 波动使用 | 基础订阅 + 用量 |
| 企业需要预算确定性和服务保障 | 年度合同 + 配额/SLA |
计价单位要满足:客户理解、可预测、难操纵、与价值正相关、不会鼓励错误行为。
15. 是否要平台化
出现以下信号再平台化:
- 多个团队重复建设模型接入、RAG、评测、权限或观测;固定数量不作为硬门槛。
- 重复成本和风险已经高于标准化成本。
- 通用能力边界稳定,团队之间确有共性。
- 有明确平台负责人、服务等级、路线图和运营能力。
如果只有一个用例、需求仍剧烈变化,优先把产品做好,不要过早抽象平台。
16. 继续、转向还是停止
| 证据状态 | 动作 |
|---|---|
| 用户价值强,技术与单位经济达标 | 扩大投入 |
| 用户价值强,技术暂未达标 | 缩任务、换架构、保留人工,继续限时验证 |
| 技术可行,用户价值弱 | 回到问题发现,不继续堆能力 |
| 价值和技术都不确定 | 最小实验,设置明确时限和退出条件 |
| 风险底线无法满足或经济性长期无解 | 停止/转向 |
沉没成本不是继续理由。停止时保存数据字典、评测集、失败知识、技术结论和决策记录。
17. 一页评审检查
- [ ] 用户、任务、痛点、现有替代和基线清楚。
- [ ] AI 方案优于更简单方案的证据清楚。
- [ ] 数据来源、权限、时效和保留策略清楚。
- [ ] Prompt/RAG/工具/Agent 的选择能解释。
- [ ] 成功、失败、拒答、人工接管和不可逆动作清楚。
- [ ] 离线评测、线上指标、护栏和回归集清楚。
- [ ] 延迟、容量、每成功任务成本和预算清楚。
- [ ] 安全、隐私、公平、透明和合规责任清楚。
- [ ] 依赖、风险、里程碑、负责人和验收清楚。
- [ ] 灰度、监控、回滚、运营和停止条件清楚。
深入判断时配合阅读:AI 产品 0 到 1、AI 项目管理和进阶专题。