行业知识 · v2.3.0 · 资料核对 2026-10-03
AI 产品经理与 AI 项目经理评审/面试题库
用法:这不是背标准答案的题库,而是检查是否能把用户、技术、评测、项目、商业和风险放进同一个决策框架。每题建议先用 2 分钟回答,再按评分标准复盘。
1. 通用评分标准
每题按 0–4 分评分:
| 分数 | 表现 |
|---|---|
| 0 | 不理解问题,或给出明显错误/危险结论 |
| 1 | 会讲名词,但没有场景、证据和决策逻辑 |
| 2 | 有基本框架,能识别部分约束,但缺少量化与闭环 |
| 3 | 能结合用户、技术、指标、风险和实施进行完整判断 |
| 4 | 在 3 分基础上能识别反例、边界、权衡和验证路径 |
优秀回答通常包含:先澄清目标和边界;建立非 AI 基线;给出选项与权衡;定义指标与失败模式;说明验证、灰度和停止条件。
危险信号通常包括:把模型能力当产品价值;只谈准确率;不区分演示与生产;忽略数据权限、成本和失败后果;没有回滚或人工接管;所有问题都用 Agent。
2. 产品与战略题
1. 如何判断一个问题是否值得使用 AI?
好答案要点:用户任务真实且高频/高价值;存在模式识别、生成、预测或复杂决策空间;输入输出可定义;有可接受的错误边界;AI 相比人工、规则、搜索或流程改造有净收益;能获得合法数据并建立评测。
追问:如果规则能覆盖 80% 场景,还要不要上大模型?
2. “做一个公司知识库问答”为什么不是合格需求?
好答案要点:没有用户、任务、知识范围、权限、答案标准、失败后果和采用场景。应改写为具体人群在具体决策中获取何种可引用信息,并定义拒答、时效与权限。
3. 如何定义 AI 产品的 North Star Metric?
好答案要点:围绕完成有价值的用户任务,而不是调用量;能反映质量并防止刷量;搭配安全、成本和体验护栏。例如“每周被用户确认成功完成的合格任务数”。
4. 如何区分功能、产品和平台?
好答案要点:功能解决一个局部动作;产品覆盖可持续的端到端任务并形成价值闭环;平台让多个团队以标准化方式复用能力并承担治理与运营责任。
5. AI 产品怎样形成壁垒?
好答案要点:不只说模型或数据;关注工作流嵌入、合法数据反馈闭环、专有评测与错误知识、领域运营、信任与分发、成本结构、生态网络效应,并说明竞争者复制难度。
6. 如何选择 ICP?
好答案要点:问题痛、频率高、预算/权限明确、数据可得、部署阻力可控、价值易证明;区分使用者、受益者、决策者和付款者。
7. 一个功能用户反馈很好,但留存不升,怎么判断?
好答案要点:检查新奇效应、核心任务频率、触发入口、结果可信度、替代方案、用户分层;看真实行为而非口头满意;做任务级漏斗和队列访谈。
8. 什么时候应该停止 AI 项目?
好答案要点:问题价值不存在;合法数据不可得;质量/风险无法达到底线;单位经济不可行;长期依赖无解;替代方案显著更优。停止前保留已学知识和可复用资产。
3. 技术基础题
9. Token、上下文窗口和输出长度分别是什么?
好答案要点:Token 是模型处理文本的基本单位;上下文窗口是单次可参与推理的输入与输出容量边界;输出长度是生成上限。还应提到长上下文不等于有效利用,且直接影响延迟与成本。
10. Temperature 的作用是什么?
好答案要点:影响采样随机性,不等价于事实准确率按钮;结构化、稳定任务通常较低,创意探索可提高;必须结合固定评测而非凭单个案例调参。
11. Fine-tuning、RAG、Prompt 和工具调用如何选择?
好答案要点:Prompt 管行为与格式;RAG 注入动态或私有知识;微调改善稳定行为、风格或特定能力;工具调用获取实时信息或执行动作。它们可以组合,选择依据是问题根因。
12. 为什么模型排行榜第一不代表最适合产品?
好答案要点:公开基准与真实任务分布不同;还受延迟、价格、上下文、稳定性、语言、工具能力、隐私、部署和供应商风险影响;必须用自有评测集验证。
13. 什么是幻觉?怎样降低?
好答案要点:输出不受可靠证据支持或与事实冲突;通过任务边界、检索与引用、工具查询、拒答、结构化输出、验证器、人工确认和持续评测降低。不能承诺完全消除。
14. 为什么结构化输出仍可能失败?
好答案要点:模型可能不满足 Schema、语义值错误、字段缺失、工具/SDK处理异常;要做 Schema 约束、解析验证、重试与降级,并验证语义而不只验证 JSON 合法。
15. 大模型产品中的缓存可以有哪些层?
好答案要点:静态内容、Prompt 前缀、检索结果、嵌入、模型响应、工具结果;需要考虑个性化、权限、时效、污染和失效策略。
16. 如何解释 Embedding?
好答案要点:把对象映射为向量以表达可比较的语义或特征关系;常用于检索、聚类、推荐。相似不等于事实正确,也不自动处理权限与时效。
4. RAG 专题题
17. RAG 的完整链路是什么?
好答案要点:数据接入、清洗、切分、元数据与权限、索引/嵌入、查询改写、召回、重排、上下文构建、生成、引用/拒答、日志与评测。
18. RAG 答错时如何定位根因?
好答案要点:先区分知识库是否有答案;再看权限、切分、查询理解、召回、排序、上下文截断、模型遵循和引用;分别测检索与生成,不能只改 Prompt。
19. Chunk 越小越好吗?
好答案要点:小块利于精确召回但容易丢上下文,大块保留语义但引入噪声和成本;应按文档结构、任务粒度、模型窗口和评测选择,必要时父子块或层次检索。
20. 如何评测 RAG?
好答案要点:检索看 Recall@K、MRR、nDCG、权限正确性;生成看答案正确、证据支持、引用准确、完整性、拒答;端到端看任务成功、延迟、成本和用户信任。
21. 知识库经常更新,怎么办?
好答案要点:增量同步、版本/时间戳、删除传播、索引一致性、缓存失效、源头状态监控、过期内容提示与可追溯引用。
22. RAG 如何防止越权泄露?
好答案要点:检索前执行身份与权限过滤;索引和元数据保留 ACL;生成前后防护不能替代源级授权;测试跨租户、提示注入、缓存隔离和日志脱敏。
5. Agent 与工具调用题
23. 什么场景需要 Agent,什么场景不需要?
好答案要点:目标需要多步规划、动态选择工具或根据结果迭代时才考虑;固定、可预测流程优先工作流或规则;高风险动作降低自主性并增加确认。
24. Agent 与工作流有什么区别?
好答案要点:工作流路径由开发者预定义,Agent 在约束内动态决定步骤;实际系统常用“确定性骨架 + 局部自主”。
25. 如何设计工具权限?
好答案要点:最小权限、读写分离、参数约束、租户隔离、凭据不暴露给模型、高风险动作二次确认、幂等、速率限制、审计和撤销。
26. Agent 陷入循环怎么办?
好答案要点:步数/时间/成本预算、状态去重、无进展检测、失败计数、工具错误分类、人工接管、保存可恢复状态;评测中加入循环样本。
27. 如何防止 Prompt Injection?
好答案要点:把外部内容视为不可信数据;隔离指令与数据;工具执行做独立权限检查;限制可调用工具和参数;输入输出检测;敏感操作确认;持续红队。不能只靠一句系统提示。
28. Agent 的成功指标是什么?
好答案要点:端到端任务成功、正确工具和参数、不可逆错误率、人工接管率、步数、延迟、成本、可恢复性与安全事件;按任务风险分层。
29. 如何设计人工确认?
好答案要点:在高影响、低可逆或低置信动作前确认;展示将执行的动作、对象、范围和后果;允许编辑、取消和预览;不能用频繁确认制造“同意疲劳”。
30. Agent 记忆应该保存什么?
好答案要点:只保存对未来任务有持续价值、得到授权且可更正/删除的信息;区分会话状态、用户偏好、任务记录和长期知识;设置来源、时效、范围和隐私控制。
6. 评测与实验题
31. 如何从零建立评测集?
好答案要点:从真实任务和失败样本采集;覆盖主流、长尾、高风险和拒答;定义标注准则与严重度;双人/仲裁保证一致性;版本化并防止测试集污染。
32. 离线评测好,线上为什么可能差?
好答案要点:任务分布、上下文、用户行为、延迟、UI、工具/数据新鲜度不同;离线指标可能未覆盖真实价值或失败成本;需要线上实验和持续采样。
33. LLM-as-a-Judge 能否替代人工?
好答案要点:适合规模化初筛和一致维度评分,但有位置、风格、自偏好与标准漂移;需校准、盲评、顺序随机、人工金标准和分歧抽查。
34. 如何评测开放式回答?
好答案要点:拆成可评分维度,如事实支持、完整性、相关性、可执行性、风格和安全;组合规则、模型评审、专家评审和用户任务结果。
35. 什么是回归评测?
好答案要点:每次模型、Prompt、检索、工具或代码变化后,验证历史能力和已修错误没有退化;应有核心集、高风险集和新问题集,并设阻断阈值。
36. A/B 实验显著,但是否一定上线?
好答案要点:不一定;检查实际效应、护栏、安全、成本、分层、长期影响、样本污染与实施复杂度。统计显著只是证据之一。
37. 如何评价一个摘要功能?
好答案要点:覆盖关键事实、无新增事实、忠于来源、结构与长度符合任务、敏感信息处理正确;端到端看阅读/决策时间和错误决策率。
38. 两个模型差异很小,怎么选择?
好答案要点:做配对评测与置信区间;看高风险子集、稳定性、延迟、成本、运营和供应风险;必要时灰度或按任务路由。
7. 数据、指标与分析题
39. 如何定义“任务成功率”?
好答案要点:以用户目标是否达成为准;明确定义任务单位、判定者、时间窗和部分成功;避免用生成完成率或点赞率直接代替。
40. 用户点赞率上升,可能有哪些误判?
好答案要点:选择偏差、只有极端用户反馈、UI改动、讨好型输出、样本结构变化;需要与任务结果、留存、重试、编辑和投诉交叉验证。
41. 什么是数据泄漏?
好答案要点:训练/验证使用了预测时不可获得的信息,或测试内容进入训练与调参;导致离线表现虚高。还要关注时间泄漏、用户泄漏和标签派生泄漏。
42. 如何监控模型漂移?
好答案要点:输入分布、任务分布、输出质量、错误类型、工具/知识源变化和业务结果;设分层基线、阈值、人工抽样和重新评测触发器。
43. 预测准确率 95% 是否足够?
好答案要点:不能判断;看类别不平衡、基线、混淆矩阵、阈值、校准和错误成本。例如欺诈率 1% 时全预测正常也有 99% 准确率。
44. 如何避免指标被“刷”?
好答案要点:选择贴近真实价值的结果指标;配套质量和风险护栏;审查分层和异常模式;定期回到真实任务,避免把代理指标变成目标。
8. 项目管理与交付题
45. AI 项目为何比普通软件项目更难估时?
好答案要点:模型与数据能力有实验不确定性;质量非二元;外部模型和数据依赖变化;评测、标注、运营和风险治理工作容易被漏估。用阶段门、Spike 和区间估算管理。
46. 如何制定 AI 项目里程碑?
好答案要点:按不确定性消除和可验证结果,而不是只按功能;例如问题验证、数据可用、基线建立、离线达标、影子运行、灰度达标、规模上线。
47. 项目延期时怎么办?
好答案要点:先找关键路径和根因;量化影响;给出缩范围、加资源、延时间、降目标或改方案选项;让有权者做显式取舍;更新基线和沟通。
48. 如何处理范围蔓延?
好答案要点:记录变更目的、收益、成本、风险和对里程碑影响;不把新需求偷偷塞入;小变更走约定阈值,大变更由决策人批准并调整承诺。
49. 研发说效果做不到,产品怎么办?
好答案要点:把“做不到”拆成数据、模型、指标、成本、时间还是风险;核对基线和最小可用目标;做时间盒实验;调整任务边界、交互或人工协同,而不是只压进度。
50. 如何验收 AI 项目?
好答案要点:功能、质量、性能、成本、安全、权限、可观测、回滚、运营和文档共同验收;使用冻结版本的评测集并包含真实灰度结果,不以演示通过代替。
51. 如何管理模型供应商?
好答案要点:能力、SLA、价格、数据使用、隐私安全、地域、变更通知、退出/迁移、审计、限额;保存替代方案并定期做回归测试。
52. 复盘会议怎样避免甩锅?
好答案要点:围绕时间线、系统条件和决策机制;区分直接原因和系统原因;行动项可验证且有负责人;不把“加强意识”当唯一整改。
9. 安全、合规与伦理题
53. AI 产品上线前最低安全检查是什么?
好答案要点:数据来源与授权、敏感信息、访问控制、提示注入、越权工具调用、输出伤害、日志与审计、滥用、人工接管、事故响应和回滚;按场景风险分级。
54. 用户授权了,是否什么数据都能收?
好答案要点:不能;还需目的正当、最小必要、透明、限定用途和保留期限,并考虑敏感数据、第三方权利、撤回与删除。授权不应是无限免责。
55. 如何处理高风险模型输出?
好答案要点:限制适用范围;要求来源/置信或结构化证据;设置专家或用户确认;拒答与升级;日志审计;定期红队;明确系统不是最终决策者。
56. 公平性如何进入产品决策?
好答案要点:识别受影响群体与潜在伤害;按子群体评测表现和错误成本;检查数据代表性、代理变量、反馈机制;提供申诉与人工复核;记录可接受权衡。
57. 如何设计 AI 身份披露?
好答案要点:用户应知道正在与 AI 交互、其能力边界、数据如何使用、重要内容来源以及如何获得人工帮助;披露不能藏在冗长条款里。
58. 收到删除数据请求时,为什么不只是删数据库一行?
好答案要点:数据可能存在缓存、日志、索引、向量库、备份、标注集和下游系统;需要数据血缘、删除传播、例外保留规则和完成证明。
10. 商业化题
59. AI 产品如何定价?
好答案要点:先量化客户价值,再选择与价值相关且可理解的计价单位;结合成本下限、竞争替代和预算习惯;考虑席位、用量、任务结果或混合模式及防滥用。
60. 为什么不能只看单次推理成本?
好答案要点:还包括重试、多步工具、检索、存储、网络、人工审核、标注评测、监控、安全、客服、销售和失败补偿;应算每个成功任务的全成本。
61. 什么时候适合按结果收费?
好答案要点:结果定义清晰、可归因、可验证、争议成本可控且价值足够高;否则会产生归因和作弊问题。通常要设置基础费或风险边界。
62. 如何判断应该自研还是采购?
好答案要点:比较战略差异化、能力成熟度、时间、全生命周期成本、合规/控制、人才、迁移和供应风险;不是简单比较 API 单价与开发工资。
11. 案例题
63. 设计一个企业客服 AI
回答至少覆盖:用户与渠道、任务分层、知识/订单工具、身份与权限、答案引用、转人工、质量指标、成本、灰度、事故与运营闭环。
64. 设计一个销售会议助手
回答至少覆盖:录音授权、多语言转写、人物和主题识别、CRM 写入确认、敏感信息、摘要正确性、任务提取、销售采用、单位经济。
65. 设计一个代码 Agent
回答至少覆盖:代码上下文、环境隔离、读写/执行权限、测试、变更预览、密钥保护、循环预算、人工批准、可回滚提交和评测任务集。
66. 将传统搜索升级为 AI 搜索
回答至少覆盖:查询意图、召回与排序、生成摘要、来源引用、时效、权限、无答案、延迟、广告/商业规则、搜索成功指标和渐进式上线。
67. 管理一个跨部门 AI 项目
回答至少覆盖:项目章程、决策权、阶段门、数据/模型/产品/合规依赖、风险、变更、验收、上线责任与复盘;说明产品不确定性如何进入计划。
68. 模型供应商突然涨价 80%
回答至少覆盖:影响测算、短期预算和限流、模型路由/缓存/压缩、替代模型回归测试、合同条款、客户定价影响和长期降低锁定风险。
69. 上线后任务成功率提高,但投诉也增加
回答至少覆盖:分层分析、严重错误尾部、用户规模效应、投诉口径、自动化范围、不可逆动作;必要时降级,并更新护栏而不是只守均值。
70. 高管要求两周内上线 Agent
回答至少覆盖:澄清业务目标与风险;提出受限范围、只读/影子模式、人工确认和明确验收的两周版本;展示全面自动化所需阶段与风险,不简单说“做不到”。
12. 反向评审:拿任何方案追问这 20 句
- 用户是谁,真正要完成的任务是什么?
- 当前替代方案和基线是多少?
- 为什么必须用 AI?
- 哪项假设证据最弱?
- 输入从哪里来,是否合法、及时、有权限?
- 输出如何被使用,错了会发生什么?
- 成功、部分成功和失败分别如何定义?
- 哪些场景必须拒答或转人工?
- 是否需要 RAG、工具、微调或 Agent,为什么?
- 最小权限与人工确认在哪里?
- 离线评测集是否代表真实任务?
- 高风险和长尾样本覆盖了吗?
- 线上主指标和护栏是什么?
- 延迟与每个成功任务成本是多少?
- 如何灰度、回滚和恢复?
- 谁负责上线后的质量与运营?
- 供应商或模型变化时怎么办?
- 什么结果出现时停止或转向?
- 这个能力如何形成复用或壁垒?
- 三个月后如何证明它创造了净价值?
13. 自测方法
- 第一轮:每题 2 分钟口答,不看资料。
- 第二轮:选择低于 3 分的题,补充一个真实案例和一个量化指标。
- 第三轮:让同伴随机追问“为什么、证据呢、错了怎么办”。
- 第四轮:用 30 分钟完成一个案例题,输出一页方案与一页评测/项目计划。
- 达标建议:基础题平均不低于 3 分;所有安全、权限、回滚题不得为 0 或 1 分。