# 90 天学习、作品集与求职路线

文中的访谈数、黄金集数和练习周期是教学起始样例，不是行业统一门槛。真实项目根据任务覆盖、风险和统计把握度确定样本量；作品集以完整证据链验收，参考 [行业基线与证据包](../14_行业基线/README.md)。

## 目标

90 天后不是“懂所有概念”，而是能拿出证据证明：你能定义一个 AI 产品、构建评测、组织交付、处理风险并解释取舍。

建议每周 8–12 小时，比例：`30% 学习 + 50% 动手 + 20% 写作/复盘`。

## 第 1–2 周：角色与技术底座

### 学

- AI PM 与 AI 项目经理边界。
- ML/DL/LLM、Token、Embedding、上下文、Prompt、RAG、微调、Agent。
- 分类与生成指标、训练/验证/测试、过拟合与漂移。
- API、JSON、鉴权、延迟和成本。

### 做

- 用同一 30 条任务比较两个模型/方案，记录质量、方差、延迟、Token 和成本。
- 调一个模型 API，要求结构化 JSON；实现解析失败、超时和重试处理。

### 交付

- 一张端到端 AI 系统图。
- 20 个术语的白话解释。
- 一份候选对比评测小报告。

## 第 3–4 周：用户发现与产品定义

### 学

- 访谈、观察、JTBD、旅程、现状基线。
- 机会评分、假设地图、Wizard-of-Oz、商业论证。
- AI UX：能力告知、引用、纠错、确认、撤销、人工接管。

### 做

- 选一个你能接触到用户的真实工作流，完成 8–10 次行为访谈。
- 记录时间、返工、错误和现有替代，不问“要不要 AI”。
- 用人工模拟服务验证至少 3 次真实任务。

### 交付

- 研究计划、匿名访谈记录、洞察聚类。
- 机会评分与停止条件。
- Product Brief 与低保真原型。

## 第 5–6 周：RAG/工作流原型

### 学

- 文档解析、切块、Embedding、混合检索、重排、引用。
- Workflow 与 Agent 的区别、工具 Schema 与权限。
- Prompt/数据/索引版本化。

### 做

- 用 20–50 份合法公开或自有文档做一个 RAG 原型。
- 建 100 条黄金集：常规 60、长尾 20、无法回答 10、对抗 10。
- 分别测检索 Recall@K 与答案忠实性。

### 交付

- 架构与 ADR。
- 数据卡、Prompt 规格、黄金集。
- 错误分类和三轮改进记录。

## 第 7–8 周：评测、实验与单位经济

### 学

- Rubric、人评一致性、LLM Judge 校准、置信区间。
- 影子、A/B、主指标/护栏、因果与新奇效应。
- 每成功任务成本、流量和敏感性分析。

### 做

- 让两名评审盲评 50 条，计算一致/分歧并仲裁。
- 用人评校准自动评审，找出偏差。
- 计算 1 千、10 万、100 万任务/月的成本和降级策略。

### 交付

- 完整评测计划与报告。
- 成本模型和质量—延迟—成本 Pareto 图。
- 试点实验设计。

## 第 9–10 周：项目、工程与治理

### 学

- 章程、WBS、关键路径、三点估算、RACI、RAID、变更。
- LLMOps、SLO、监控、灰度、回滚和事故。
- 隐私、安全、提示注入、内容、版权、公平与法规。

### 做

- 给作品补齐章程、WBS、阶段门、预算和 Top 10 风险。
- 设计间接 Prompt Injection、跨权限、工具失败等 20 条红队测试。
- 完成一次桌面事故演练：模型不可用或知识库投毒。

### 交付

- 项目治理包。
- 威胁模型、风险评估和上线门禁。
- Runbook、事故报告与复盘。

## 第 11–12 周：产品化与求职

### 做

- 邀请 5–10 名真实用户试用，记录采用、重大编辑、任务时长和反馈。
- 对作品做一轮发布前审计；删掉无法证明的营销话术。
- 录制 5 分钟演示：问题 1 分钟、产品 1 分钟、技术/评测 2 分钟、结果/反思 1 分钟。

### 交付

- 最终 Case Study。
- 作品集主页、简历项目段、面试故事库。
- 30/60/90 天入职计划。

## 作品集标准结构

不要只展示聊天 UI。一个强作品包含：

1. **问题证据**：目标用户、行为、基线和替代方案。
2. **选择**：为何 AI、为何这个场景、自主性和范围外。
3. **产品**：关键流程、失败/纠错/人工协作。
4. **技术**：架构、数据、RAG/工具/模型取舍。
5. **评测**：样本、Rubric、基线、切片、错误和不确定性。
6. **项目**：里程碑、依赖、风险、成本和组织协作。
7. **治理**：隐私、安全、版权、公平和运营控制。
8. **结果**：用户行为、业务价值、限制和下一步。
9. **反思**：哪个假设错了，你改变了什么决定。

涉及真实公司材料必须获得授权并脱敏；不能把客户数据、Prompt 秘密或内部指标泄露进作品集。

## 简历写法

### 弱

“负责 AI 客服产品设计，使用 RAG 和大模型提升体验。”

### 强

以下为虚构教学示例，禁止作为真实经历或真实成果使用；真实简历请把每个数值替换为自己的可复核记录。

“针对每月 8 万工单的政策检索瓶颈，访谈 12 名坐席并建立 600 条分层黄金集；设计 ACL 混合检索 + 引用草稿工作流，使试点一次采纳率从 41% 提至 68%、P95 处理时长下降 24%，关键政策错误保持 0；建立模型/索引回归和灰度回滚门禁。”

结构：问题/规模 → 你的决策与动作 → 可核验证据 → 结果/边界。没有真实上线结果就如实写“离线/试点”，不要伪装生产影响。

占位符版本：“针对【任务量/期间】的【问题】，完成【你的研究与决策】；在【样本量/试点范围】中使【指标及基线】达到【真实结果/区间】，同时【护栏与限制】；留下【评测/上线/复盘证据】。”

## 职位识别

“AI 产品经理”JD 可能实际是：

- 平台型：模型平台、数据、评测、开发者体验。
- 应用型：面向用户的 AI 工作流与业务结果。
- 增长型：获客、激活、留存、商业化。
- 交付/解决方案型：客户需求、集成、项目和验收。
- 策略/治理型：风险、政策、标准和运营。

看责任和指标，不只看标题。若 JD 只有“跟进需求、写文档、对接算法”而没有用户、指标和决策权，可能是协调岗；若要求训练模型但不给算法资源，也可能角色设计有问题。

## AI PM 高频面试题

### 产品与战略

1. 什么场景不应该用大模型？
2. 你如何从 100 个 AI 点子选第一个？
3. AI 产品如何建立护城河？模型越来越商品化怎么办？
4. 如何判断 Copilot 应变成 Agent？
5. 一个效果很好但用户不采用的产品怎样诊断？

### 技术与数据

6. RAG 与微调怎么选？
7. 上下文长度更大是否就不需要 RAG？
8. 怎样排查 RAG 回答错误？
9. 温度、Token、Embedding 分别影响什么？
10. 自托管与 API 如何比较？

### 评测

11. 没有标准答案的生成任务怎样评？
12. 100 条评测集怎样抽样？
13. LLM-as-a-Judge 有什么偏差，如何校准？
14. 离线分提高、线上指标下降可能为什么？
15. 模型升级的回归门禁怎样设计？

### 交付与风险

16. AI 项目效果未知，怎样承诺时间和预算？
17. 项目延期两周，你怎样给 Sponsor 选项？
18. 供应商突然弃用模型怎么办？
19. 如何防 Prompt Injection 与工具越权？
20. 线上出现严重错误如何处置和复盘？

### 回答框架

先澄清用户/场景/风险 → 给决策框架 → 说明证据与指标 → 讲取舍/失败路径 → 给下一最小动作。不要立即背技术名词。

## AI 项目经理面试题

- PoC、试点、产品化的验收分别是什么？
- 如何把模型研究不确定性放进计划？
- 数据获取延误如何影响关键路径？
- 如何设计阶段门和 Stop-the-line？
- 怎样管理模型、Prompt、索引和工具的联合变更？
- 如何做三年 TCO 与供应商退出演练？
- 什么情况下接受残余风险，谁签字？
- 上线后项目何时才算真正关闭？

## 面试故事库

准备 8 个 STAR/反思故事：

1. 你停止了一个不该做的项目。
2. 你用用户证据改变了高层假设。
3. 你在质量、成本、时间之间做取舍。
4. 你发现评测或数据有问题。
5. 你处理跨团队冲突和决策延迟。
6. 你管理一次重大风险/事故。
7. 你推动采用而非只发布功能。
8. 你犯错、复盘并改变系统机制。

每个故事说清你的角色，不把团队成果全说成个人，也不把自己藏在“我们”后面。

## 入职 30/60/90 天

### 0–30：理解

- 用户、业务、系统、数据、模型、团队、供应商、风险和指标地图。
- 跟听用户/客服/销售，抽样生产失败。
- 识别一个小而高置信的改进，不急于重写路线图。

### 31–60：建立共同语言

- 统一指标、评测集、错误分类和决策/风险台账。
- 审计产品路线图与实际证据。
- 推动一个跨职能实验从假设到结论。

### 61–90：交付与机制

- 交付一个可衡量的产品改进或明确停止一个方向。
- 建立变更回归、成本看板或风险门禁中的一项长期机制。
- 给出未来两个季度基于证据的路线图和资源取舍。

## 毕业自检

- [ ] 能在白板上画完整 AI 系统与数据流。
- [ ] 能不写“智能/精准”而写出可验收 PRD。
- [ ] 有至少 100 条黄金集和分层评测报告。
- [ ] 能计算每成功任务成本与三种流量情景。
- [ ] 有项目章程、WBS、RACI、RAID 和阶段门。
- [ ] 有威胁模型、红队、残余风险和 Runbook。
- [ ] 有真实用户行为证据，不只有朋友点赞。
- [ ] 能说明一次失败假设和因此做出的决策。
