# AI 产品经理与 AI 项目经理评审/面试题库

> 用法：这不是背标准答案的题库，而是检查是否能把用户、技术、评测、项目、商业和风险放进同一个决策框架。每题建议先用 2 分钟回答，再按评分标准复盘。

## 1. 通用评分标准

每题按 0–4 分评分：

| 分数 | 表现 |
|---|---|
| 0 | 不理解问题，或给出明显错误/危险结论 |
| 1 | 会讲名词，但没有场景、证据和决策逻辑 |
| 2 | 有基本框架，能识别部分约束，但缺少量化与闭环 |
| 3 | 能结合用户、技术、指标、风险和实施进行完整判断 |
| 4 | 在 3 分基础上能识别反例、边界、权衡和验证路径 |

优秀回答通常包含：先澄清目标和边界；建立非 AI 基线；给出选项与权衡；定义指标与失败模式；说明验证、灰度和停止条件。

危险信号通常包括：把模型能力当产品价值；只谈准确率；不区分演示与生产；忽略数据权限、成本和失败后果；没有回滚或人工接管；所有问题都用 Agent。

## 2. 产品与战略题

### 1. 如何判断一个问题是否值得使用 AI？

好答案要点：用户任务真实且高频/高价值；存在模式识别、生成、预测或复杂决策空间；输入输出可定义；有可接受的错误边界；AI 相比人工、规则、搜索或流程改造有净收益；能获得合法数据并建立评测。

追问：如果规则能覆盖 80% 场景，还要不要上大模型？

### 2. “做一个公司知识库问答”为什么不是合格需求？

好答案要点：没有用户、任务、知识范围、权限、答案标准、失败后果和采用场景。应改写为具体人群在具体决策中获取何种可引用信息，并定义拒答、时效与权限。

### 3. 如何定义 AI 产品的 North Star Metric？

好答案要点：围绕完成有价值的用户任务，而不是调用量；能反映质量并防止刷量；搭配安全、成本和体验护栏。例如“每周被用户确认成功完成的合格任务数”。

### 4. 如何区分功能、产品和平台？

好答案要点：功能解决一个局部动作；产品覆盖可持续的端到端任务并形成价值闭环；平台让多个团队以标准化方式复用能力并承担治理与运营责任。

### 5. AI 产品怎样形成壁垒？

好答案要点：不只说模型或数据；关注工作流嵌入、合法数据反馈闭环、专有评测与错误知识、领域运营、信任与分发、成本结构、生态网络效应，并说明竞争者复制难度。

### 6. 如何选择 ICP？

好答案要点：问题痛、频率高、预算/权限明确、数据可得、部署阻力可控、价值易证明；区分使用者、受益者、决策者和付款者。

### 7. 一个功能用户反馈很好，但留存不升，怎么判断？

好答案要点：检查新奇效应、核心任务频率、触发入口、结果可信度、替代方案、用户分层；看真实行为而非口头满意；做任务级漏斗和队列访谈。

### 8. 什么时候应该停止 AI 项目？

好答案要点：问题价值不存在；合法数据不可得；质量/风险无法达到底线；单位经济不可行；长期依赖无解；替代方案显著更优。停止前保留已学知识和可复用资产。

## 3. 技术基础题

### 9. Token、上下文窗口和输出长度分别是什么？

好答案要点：Token 是模型处理文本的基本单位；上下文窗口是单次可参与推理的输入与输出容量边界；输出长度是生成上限。还应提到长上下文不等于有效利用，且直接影响延迟与成本。

### 10. Temperature 的作用是什么？

好答案要点：影响采样随机性，不等价于事实准确率按钮；结构化、稳定任务通常较低，创意探索可提高；必须结合固定评测而非凭单个案例调参。

### 11. Fine-tuning、RAG、Prompt 和工具调用如何选择？

好答案要点：Prompt 管行为与格式；RAG 注入动态或私有知识；微调改善稳定行为、风格或特定能力；工具调用获取实时信息或执行动作。它们可以组合，选择依据是问题根因。

### 12. 为什么模型排行榜第一不代表最适合产品？

好答案要点：公开基准与真实任务分布不同；还受延迟、价格、上下文、稳定性、语言、工具能力、隐私、部署和供应商风险影响；必须用自有评测集验证。

### 13. 什么是幻觉？怎样降低？

好答案要点：输出不受可靠证据支持或与事实冲突；通过任务边界、检索与引用、工具查询、拒答、结构化输出、验证器、人工确认和持续评测降低。不能承诺完全消除。

### 14. 为什么结构化输出仍可能失败？

好答案要点：模型可能不满足 Schema、语义值错误、字段缺失、工具/SDK处理异常；要做 Schema 约束、解析验证、重试与降级，并验证语义而不只验证 JSON 合法。

### 15. 大模型产品中的缓存可以有哪些层？

好答案要点：静态内容、Prompt 前缀、检索结果、嵌入、模型响应、工具结果；需要考虑个性化、权限、时效、污染和失效策略。

### 16. 如何解释 Embedding？

好答案要点：把对象映射为向量以表达可比较的语义或特征关系；常用于检索、聚类、推荐。相似不等于事实正确，也不自动处理权限与时效。

## 4. RAG 专题题

### 17. RAG 的完整链路是什么？

好答案要点：数据接入、清洗、切分、元数据与权限、索引/嵌入、查询改写、召回、重排、上下文构建、生成、引用/拒答、日志与评测。

### 18. RAG 答错时如何定位根因？

好答案要点：先区分知识库是否有答案；再看权限、切分、查询理解、召回、排序、上下文截断、模型遵循和引用；分别测检索与生成，不能只改 Prompt。

### 19. Chunk 越小越好吗？

好答案要点：小块利于精确召回但容易丢上下文，大块保留语义但引入噪声和成本；应按文档结构、任务粒度、模型窗口和评测选择，必要时父子块或层次检索。

### 20. 如何评测 RAG？

好答案要点：检索看 Recall@K、MRR、nDCG、权限正确性；生成看答案正确、证据支持、引用准确、完整性、拒答；端到端看任务成功、延迟、成本和用户信任。

### 21. 知识库经常更新，怎么办？

好答案要点：增量同步、版本/时间戳、删除传播、索引一致性、缓存失效、源头状态监控、过期内容提示与可追溯引用。

### 22. RAG 如何防止越权泄露？

好答案要点：检索前执行身份与权限过滤；索引和元数据保留 ACL；生成前后防护不能替代源级授权；测试跨租户、提示注入、缓存隔离和日志脱敏。

## 5. Agent 与工具调用题

### 23. 什么场景需要 Agent，什么场景不需要？

好答案要点：目标需要多步规划、动态选择工具或根据结果迭代时才考虑；固定、可预测流程优先工作流或规则；高风险动作降低自主性并增加确认。

### 24. Agent 与工作流有什么区别？

好答案要点：工作流路径由开发者预定义，Agent 在约束内动态决定步骤；实际系统常用“确定性骨架 + 局部自主”。

### 25. 如何设计工具权限？

好答案要点：最小权限、读写分离、参数约束、租户隔离、凭据不暴露给模型、高风险动作二次确认、幂等、速率限制、审计和撤销。

### 26. Agent 陷入循环怎么办？

好答案要点：步数/时间/成本预算、状态去重、无进展检测、失败计数、工具错误分类、人工接管、保存可恢复状态；评测中加入循环样本。

### 27. 如何防止 Prompt Injection？

好答案要点：把外部内容视为不可信数据；隔离指令与数据；工具执行做独立权限检查；限制可调用工具和参数；输入输出检测；敏感操作确认；持续红队。不能只靠一句系统提示。

### 28. Agent 的成功指标是什么？

好答案要点：端到端任务成功、正确工具和参数、不可逆错误率、人工接管率、步数、延迟、成本、可恢复性与安全事件；按任务风险分层。

### 29. 如何设计人工确认？

好答案要点：在高影响、低可逆或低置信动作前确认；展示将执行的动作、对象、范围和后果；允许编辑、取消和预览；不能用频繁确认制造“同意疲劳”。

### 30. Agent 记忆应该保存什么？

好答案要点：只保存对未来任务有持续价值、得到授权且可更正/删除的信息；区分会话状态、用户偏好、任务记录和长期知识；设置来源、时效、范围和隐私控制。

## 6. 评测与实验题

### 31. 如何从零建立评测集？

好答案要点：从真实任务和失败样本采集；覆盖主流、长尾、高风险和拒答；定义标注准则与严重度；双人/仲裁保证一致性；版本化并防止测试集污染。

### 32. 离线评测好，线上为什么可能差？

好答案要点：任务分布、上下文、用户行为、延迟、UI、工具/数据新鲜度不同；离线指标可能未覆盖真实价值或失败成本；需要线上实验和持续采样。

### 33. LLM-as-a-Judge 能否替代人工？

好答案要点：适合规模化初筛和一致维度评分，但有位置、风格、自偏好与标准漂移；需校准、盲评、顺序随机、人工金标准和分歧抽查。

### 34. 如何评测开放式回答？

好答案要点：拆成可评分维度，如事实支持、完整性、相关性、可执行性、风格和安全；组合规则、模型评审、专家评审和用户任务结果。

### 35. 什么是回归评测？

好答案要点：每次模型、Prompt、检索、工具或代码变化后，验证历史能力和已修错误没有退化；应有核心集、高风险集和新问题集，并设阻断阈值。

### 36. A/B 实验显著，但是否一定上线？

好答案要点：不一定；检查实际效应、护栏、安全、成本、分层、长期影响、样本污染与实施复杂度。统计显著只是证据之一。

### 37. 如何评价一个摘要功能？

好答案要点：覆盖关键事实、无新增事实、忠于来源、结构与长度符合任务、敏感信息处理正确；端到端看阅读/决策时间和错误决策率。

### 38. 两个模型差异很小，怎么选择？

好答案要点：做配对评测与置信区间；看高风险子集、稳定性、延迟、成本、运营和供应风险；必要时灰度或按任务路由。

## 7. 数据、指标与分析题

### 39. 如何定义“任务成功率”？

好答案要点：以用户目标是否达成为准；明确定义任务单位、判定者、时间窗和部分成功；避免用生成完成率或点赞率直接代替。

### 40. 用户点赞率上升，可能有哪些误判？

好答案要点：选择偏差、只有极端用户反馈、UI改动、讨好型输出、样本结构变化；需要与任务结果、留存、重试、编辑和投诉交叉验证。

### 41. 什么是数据泄漏？

好答案要点：训练/验证使用了预测时不可获得的信息，或测试内容进入训练与调参；导致离线表现虚高。还要关注时间泄漏、用户泄漏和标签派生泄漏。

### 42. 如何监控模型漂移？

好答案要点：输入分布、任务分布、输出质量、错误类型、工具/知识源变化和业务结果；设分层基线、阈值、人工抽样和重新评测触发器。

### 43. 预测准确率 95% 是否足够？

好答案要点：不能判断；看类别不平衡、基线、混淆矩阵、阈值、校准和错误成本。例如欺诈率 1% 时全预测正常也有 99% 准确率。

### 44. 如何避免指标被“刷”？

好答案要点：选择贴近真实价值的结果指标；配套质量和风险护栏；审查分层和异常模式；定期回到真实任务，避免把代理指标变成目标。

## 8. 项目管理与交付题

### 45. AI 项目为何比普通软件项目更难估时？

好答案要点：模型与数据能力有实验不确定性；质量非二元；外部模型和数据依赖变化；评测、标注、运营和风险治理工作容易被漏估。用阶段门、Spike 和区间估算管理。

### 46. 如何制定 AI 项目里程碑？

好答案要点：按不确定性消除和可验证结果，而不是只按功能；例如问题验证、数据可用、基线建立、离线达标、影子运行、灰度达标、规模上线。

### 47. 项目延期时怎么办？

好答案要点：先找关键路径和根因；量化影响；给出缩范围、加资源、延时间、降目标或改方案选项；让有权者做显式取舍；更新基线和沟通。

### 48. 如何处理范围蔓延？

好答案要点：记录变更目的、收益、成本、风险和对里程碑影响；不把新需求偷偷塞入；小变更走约定阈值，大变更由决策人批准并调整承诺。

### 49. 研发说效果做不到，产品怎么办？

好答案要点：把“做不到”拆成数据、模型、指标、成本、时间还是风险；核对基线和最小可用目标；做时间盒实验；调整任务边界、交互或人工协同，而不是只压进度。

### 50. 如何验收 AI 项目？

好答案要点：功能、质量、性能、成本、安全、权限、可观测、回滚、运营和文档共同验收；使用冻结版本的评测集并包含真实灰度结果，不以演示通过代替。

### 51. 如何管理模型供应商？

好答案要点：能力、SLA、价格、数据使用、隐私安全、地域、变更通知、退出/迁移、审计、限额；保存替代方案并定期做回归测试。

### 52. 复盘会议怎样避免甩锅？

好答案要点：围绕时间线、系统条件和决策机制；区分直接原因和系统原因；行动项可验证且有负责人；不把“加强意识”当唯一整改。

## 9. 安全、合规与伦理题

### 53. AI 产品上线前最低安全检查是什么？

好答案要点：数据来源与授权、敏感信息、访问控制、提示注入、越权工具调用、输出伤害、日志与审计、滥用、人工接管、事故响应和回滚；按场景风险分级。

### 54. 用户授权了，是否什么数据都能收？

好答案要点：不能；还需目的正当、最小必要、透明、限定用途和保留期限，并考虑敏感数据、第三方权利、撤回与删除。授权不应是无限免责。

### 55. 如何处理高风险模型输出？

好答案要点：限制适用范围；要求来源/置信或结构化证据；设置专家或用户确认；拒答与升级；日志审计；定期红队；明确系统不是最终决策者。

### 56. 公平性如何进入产品决策？

好答案要点：识别受影响群体与潜在伤害；按子群体评测表现和错误成本；检查数据代表性、代理变量、反馈机制；提供申诉与人工复核；记录可接受权衡。

### 57. 如何设计 AI 身份披露？

好答案要点：用户应知道正在与 AI 交互、其能力边界、数据如何使用、重要内容来源以及如何获得人工帮助；披露不能藏在冗长条款里。

### 58. 收到删除数据请求时，为什么不只是删数据库一行？

好答案要点：数据可能存在缓存、日志、索引、向量库、备份、标注集和下游系统；需要数据血缘、删除传播、例外保留规则和完成证明。

## 10. 商业化题

### 59. AI 产品如何定价？

好答案要点：先量化客户价值，再选择与价值相关且可理解的计价单位；结合成本下限、竞争替代和预算习惯；考虑席位、用量、任务结果或混合模式及防滥用。

### 60. 为什么不能只看单次推理成本？

好答案要点：还包括重试、多步工具、检索、存储、网络、人工审核、标注评测、监控、安全、客服、销售和失败补偿；应算每个成功任务的全成本。

### 61. 什么时候适合按结果收费？

好答案要点：结果定义清晰、可归因、可验证、争议成本可控且价值足够高；否则会产生归因和作弊问题。通常要设置基础费或风险边界。

### 62. 如何判断应该自研还是采购？

好答案要点：比较战略差异化、能力成熟度、时间、全生命周期成本、合规/控制、人才、迁移和供应风险；不是简单比较 API 单价与开发工资。

## 11. 案例题

### 63. 设计一个企业客服 AI

回答至少覆盖：用户与渠道、任务分层、知识/订单工具、身份与权限、答案引用、转人工、质量指标、成本、灰度、事故与运营闭环。

### 64. 设计一个销售会议助手

回答至少覆盖：录音授权、多语言转写、人物和主题识别、CRM 写入确认、敏感信息、摘要正确性、任务提取、销售采用、单位经济。

### 65. 设计一个代码 Agent

回答至少覆盖：代码上下文、环境隔离、读写/执行权限、测试、变更预览、密钥保护、循环预算、人工批准、可回滚提交和评测任务集。

### 66. 将传统搜索升级为 AI 搜索

回答至少覆盖：查询意图、召回与排序、生成摘要、来源引用、时效、权限、无答案、延迟、广告/商业规则、搜索成功指标和渐进式上线。

### 67. 管理一个跨部门 AI 项目

回答至少覆盖：项目章程、决策权、阶段门、数据/模型/产品/合规依赖、风险、变更、验收、上线责任与复盘；说明产品不确定性如何进入计划。

### 68. 模型供应商突然涨价 80%

回答至少覆盖：影响测算、短期预算和限流、模型路由/缓存/压缩、替代模型回归测试、合同条款、客户定价影响和长期降低锁定风险。

### 69. 上线后任务成功率提高，但投诉也增加

回答至少覆盖：分层分析、严重错误尾部、用户规模效应、投诉口径、自动化范围、不可逆动作；必要时降级，并更新护栏而不是只守均值。

### 70. 高管要求两周内上线 Agent

回答至少覆盖：澄清业务目标与风险；提出受限范围、只读/影子模式、人工确认和明确验收的两周版本；展示全面自动化所需阶段与风险，不简单说“做不到”。

## 12. 反向评审：拿任何方案追问这 20 句

1. 用户是谁，真正要完成的任务是什么？
2. 当前替代方案和基线是多少？
3. 为什么必须用 AI？
4. 哪项假设证据最弱？
5. 输入从哪里来，是否合法、及时、有权限？
6. 输出如何被使用，错了会发生什么？
7. 成功、部分成功和失败分别如何定义？
8. 哪些场景必须拒答或转人工？
9. 是否需要 RAG、工具、微调或 Agent，为什么？
10. 最小权限与人工确认在哪里？
11. 离线评测集是否代表真实任务？
12. 高风险和长尾样本覆盖了吗？
13. 线上主指标和护栏是什么？
14. 延迟与每个成功任务成本是多少？
15. 如何灰度、回滚和恢复？
16. 谁负责上线后的质量与运营？
17. 供应商或模型变化时怎么办？
18. 什么结果出现时停止或转向？
19. 这个能力如何形成复用或壁垒？
20. 三个月后如何证明它创造了净价值？

## 13. 自测方法

- 第一轮：每题 2 分钟口答，不看资料。
- 第二轮：选择低于 3 分的题，补充一个真实案例和一个量化指标。
- 第三轮：让同伴随机追问“为什么、证据呢、错了怎么办”。
- 第四轮：用 30 分钟完成一个案例题，输出一页方案与一页评测/项目计划。
- 达标建议：基础题平均不低于 3 分；所有安全、权限、回滚题不得为 0 或 1 分。

延伸学习可返回：[能力地图](../00_如何使用/02_能力地图.md)、[论文书单](../09_论文书单/README.md)和[案例演练](../07_案例演练/README.md)。
