行业知识 · v2.3.0 · 资料核对 2026-10-03
90 天学习、作品集与求职路线
文中的访谈数、黄金集数和练习周期是教学起始样例,不是行业统一门槛。真实项目根据任务覆盖、风险和统计把握度确定样本量;作品集以完整证据链验收,参考 行业基线与证据包。
目标
90 天后不是“懂所有概念”,而是能拿出证据证明:你能定义一个 AI 产品、构建评测、组织交付、处理风险并解释取舍。
建议每周 8–12 小时,比例:30% 学习 + 50% 动手 + 20% 写作/复盘。
第 1–2 周:角色与技术底座
学
- AI PM 与 AI 项目经理边界。
- ML/DL/LLM、Token、Embedding、上下文、Prompt、RAG、微调、Agent。
- 分类与生成指标、训练/验证/测试、过拟合与漂移。
- API、JSON、鉴权、延迟和成本。
做
- 用同一 30 条任务比较两个模型/方案,记录质量、方差、延迟、Token 和成本。
- 调一个模型 API,要求结构化 JSON;实现解析失败、超时和重试处理。
交付
- 一张端到端 AI 系统图。
- 20 个术语的白话解释。
- 一份候选对比评测小报告。
第 3–4 周:用户发现与产品定义
学
- 访谈、观察、JTBD、旅程、现状基线。
- 机会评分、假设地图、Wizard-of-Oz、商业论证。
- AI UX:能力告知、引用、纠错、确认、撤销、人工接管。
做
- 选一个你能接触到用户的真实工作流,完成 8–10 次行为访谈。
- 记录时间、返工、错误和现有替代,不问“要不要 AI”。
- 用人工模拟服务验证至少 3 次真实任务。
交付
- 研究计划、匿名访谈记录、洞察聚类。
- 机会评分与停止条件。
- Product Brief 与低保真原型。
第 5–6 周:RAG/工作流原型
学
- 文档解析、切块、Embedding、混合检索、重排、引用。
- Workflow 与 Agent 的区别、工具 Schema 与权限。
- Prompt/数据/索引版本化。
做
- 用 20–50 份合法公开或自有文档做一个 RAG 原型。
- 建 100 条黄金集:常规 60、长尾 20、无法回答 10、对抗 10。
- 分别测检索 Recall@K 与答案忠实性。
交付
- 架构与 ADR。
- 数据卡、Prompt 规格、黄金集。
- 错误分类和三轮改进记录。
第 7–8 周:评测、实验与单位经济
学
- Rubric、人评一致性、LLM Judge 校准、置信区间。
- 影子、A/B、主指标/护栏、因果与新奇效应。
- 每成功任务成本、流量和敏感性分析。
做
- 让两名评审盲评 50 条,计算一致/分歧并仲裁。
- 用人评校准自动评审,找出偏差。
- 计算 1 千、10 万、100 万任务/月的成本和降级策略。
交付
- 完整评测计划与报告。
- 成本模型和质量—延迟—成本 Pareto 图。
- 试点实验设计。
第 9–10 周:项目、工程与治理
学
- 章程、WBS、关键路径、三点估算、RACI、RAID、变更。
- LLMOps、SLO、监控、灰度、回滚和事故。
- 隐私、安全、提示注入、内容、版权、公平与法规。
做
- 给作品补齐章程、WBS、阶段门、预算和 Top 10 风险。
- 设计间接 Prompt Injection、跨权限、工具失败等 20 条红队测试。
- 完成一次桌面事故演练:模型不可用或知识库投毒。
交付
- 项目治理包。
- 威胁模型、风险评估和上线门禁。
- Runbook、事故报告与复盘。
第 11–12 周:产品化与求职
做
- 邀请 5–10 名真实用户试用,记录采用、重大编辑、任务时长和反馈。
- 对作品做一轮发布前审计;删掉无法证明的营销话术。
- 录制 5 分钟演示:问题 1 分钟、产品 1 分钟、技术/评测 2 分钟、结果/反思 1 分钟。
交付
- 最终 Case Study。
- 作品集主页、简历项目段、面试故事库。
- 30/60/90 天入职计划。
作品集标准结构
不要只展示聊天 UI。一个强作品包含:
- 问题证据:目标用户、行为、基线和替代方案。
- 选择:为何 AI、为何这个场景、自主性和范围外。
- 产品:关键流程、失败/纠错/人工协作。
- 技术:架构、数据、RAG/工具/模型取舍。
- 评测:样本、Rubric、基线、切片、错误和不确定性。
- 项目:里程碑、依赖、风险、成本和组织协作。
- 治理:隐私、安全、版权、公平和运营控制。
- 结果:用户行为、业务价值、限制和下一步。
- 反思:哪个假设错了,你改变了什么决定。
涉及真实公司材料必须获得授权并脱敏;不能把客户数据、Prompt 秘密或内部指标泄露进作品集。
简历写法
弱
“负责 AI 客服产品设计,使用 RAG 和大模型提升体验。”
强
以下为虚构教学示例,禁止作为真实经历或真实成果使用;真实简历请把每个数值替换为自己的可复核记录。
“针对每月 8 万工单的政策检索瓶颈,访谈 12 名坐席并建立 600 条分层黄金集;设计 ACL 混合检索 + 引用草稿工作流,使试点一次采纳率从 41% 提至 68%、P95 处理时长下降 24%,关键政策错误保持 0;建立模型/索引回归和灰度回滚门禁。”
结构:问题/规模 → 你的决策与动作 → 可核验证据 → 结果/边界。没有真实上线结果就如实写“离线/试点”,不要伪装生产影响。
占位符版本:“针对【任务量/期间】的【问题】,完成【你的研究与决策】;在【样本量/试点范围】中使【指标及基线】达到【真实结果/区间】,同时【护栏与限制】;留下【评测/上线/复盘证据】。”
职位识别
“AI 产品经理”JD 可能实际是:
- 平台型:模型平台、数据、评测、开发者体验。
- 应用型:面向用户的 AI 工作流与业务结果。
- 增长型:获客、激活、留存、商业化。
- 交付/解决方案型:客户需求、集成、项目和验收。
- 策略/治理型:风险、政策、标准和运营。
看责任和指标,不只看标题。若 JD 只有“跟进需求、写文档、对接算法”而没有用户、指标和决策权,可能是协调岗;若要求训练模型但不给算法资源,也可能角色设计有问题。
AI PM 高频面试题
产品与战略
- 什么场景不应该用大模型?
- 你如何从 100 个 AI 点子选第一个?
- AI 产品如何建立护城河?模型越来越商品化怎么办?
- 如何判断 Copilot 应变成 Agent?
- 一个效果很好但用户不采用的产品怎样诊断?
技术与数据
- RAG 与微调怎么选?
- 上下文长度更大是否就不需要 RAG?
- 怎样排查 RAG 回答错误?
- 温度、Token、Embedding 分别影响什么?
- 自托管与 API 如何比较?
评测
- 没有标准答案的生成任务怎样评?
- 100 条评测集怎样抽样?
- LLM-as-a-Judge 有什么偏差,如何校准?
- 离线分提高、线上指标下降可能为什么?
- 模型升级的回归门禁怎样设计?
交付与风险
- AI 项目效果未知,怎样承诺时间和预算?
- 项目延期两周,你怎样给 Sponsor 选项?
- 供应商突然弃用模型怎么办?
- 如何防 Prompt Injection 与工具越权?
- 线上出现严重错误如何处置和复盘?
回答框架
先澄清用户/场景/风险 → 给决策框架 → 说明证据与指标 → 讲取舍/失败路径 → 给下一最小动作。不要立即背技术名词。
AI 项目经理面试题
- PoC、试点、产品化的验收分别是什么?
- 如何把模型研究不确定性放进计划?
- 数据获取延误如何影响关键路径?
- 如何设计阶段门和 Stop-the-line?
- 怎样管理模型、Prompt、索引和工具的联合变更?
- 如何做三年 TCO 与供应商退出演练?
- 什么情况下接受残余风险,谁签字?
- 上线后项目何时才算真正关闭?
面试故事库
准备 8 个 STAR/反思故事:
- 你停止了一个不该做的项目。
- 你用用户证据改变了高层假设。
- 你在质量、成本、时间之间做取舍。
- 你发现评测或数据有问题。
- 你处理跨团队冲突和决策延迟。
- 你管理一次重大风险/事故。
- 你推动采用而非只发布功能。
- 你犯错、复盘并改变系统机制。
每个故事说清你的角色,不把团队成果全说成个人,也不把自己藏在“我们”后面。
入职 30/60/90 天
0–30:理解
- 用户、业务、系统、数据、模型、团队、供应商、风险和指标地图。
- 跟听用户/客服/销售,抽样生产失败。
- 识别一个小而高置信的改进,不急于重写路线图。
31–60:建立共同语言
- 统一指标、评测集、错误分类和决策/风险台账。
- 审计产品路线图与实际证据。
- 推动一个跨职能实验从假设到结论。
61–90:交付与机制
- 交付一个可衡量的产品改进或明确停止一个方向。
- 建立变更回归、成本看板或风险门禁中的一项长期机制。
- 给出未来两个季度基于证据的路线图和资源取舍。
毕业自检
- [ ] 能在白板上画完整 AI 系统与数据流。
- [ ] 能不写“智能/精准”而写出可验收 PRD。
- [ ] 有至少 100 条黄金集和分层评测报告。
- [ ] 能计算每成功任务成本与三种流量情景。
- [ ] 有项目章程、WBS、RACI、RAID 和阶段门。
- [ ] 有威胁模型、红队、残余风险和 Runbook。
- [ ] 有真实用户行为证据,不只有朋友点赞。
- [ ] 能说明一次失败假设和因此做出的决策。