# AI 技术全景：产品经理需要懂到什么程度

## 先建立正确心智模型

人工智能不是一个技术，而是一组让机器从规则、数据或环境反馈中产生预测、内容、推荐或动作的方法。产品决策时至少区分四层：

```text
业务应用：客服、搜索、推荐、创作、风控、诊断辅助、流程自动化
AI 系统：数据 + 模型 + Prompt/RAG/工具 + 规则 + 评测 + 人机流程
模型能力：分类、回归、排序、生成、理解、规划、视觉、语音
基础设施：数据管道、训练/推理、存储、API、权限、监控、算力
```

多数“AI 产品事故”不是模型单点造成，而是系统边界、数据、权限、检索、工具、体验或运营共同造成。

## AI、ML、DL、生成式 AI、LLM 的关系

- **AI（人工智能）**：总称，既包括规则专家系统，也包括机器学习。
- **ML（机器学习）**：从数据学习映射或策略，而非把每条规则手写出来。
- **DL（深度学习）**：用多层神经网络学习复杂表示，是现代视觉、语音和大模型基础。
- **Foundation Model（基础模型）**：在广泛数据上训练、可适配多任务的大模型。
- **Generative AI（生成式 AI）**：生成文本、图像、音频、视频、代码等内容。
- **LLM（大语言模型）**：以语言 Token 为主要输入输出的大规模生成模型。

LLM 是生成式 AI 的一类，生成式 AI 是 AI 的一部分；“AI 产品”不一定需要 LLM。

## 五类学习范式

| 范式 | 信号 | 典型任务 | 产品风险 |
|---|---|---|---|
| 监督学习 | 已标注输入—答案 | 分类、预测、识别 | 标签偏差、分布漂移 |
| 无监督/自监督 | 数据自身结构 | 表征、聚类、预训练 | 难解释、继承语料偏差 |
| 半监督/弱监督 | 少量真标签 + 大量弱信号 | 标签稀缺任务 | 噪声放大 |
| 强化学习 | 环境奖励 | 策略、控制、偏好优化 | 奖励黑客、探索风险 |
| 在线/持续学习 | 线上反馈 | 个性化、动态策略 | 反馈回路、不可控变化 |

产品经理无需手推优化公式，但要知道：模型学到的是数据和目标函数鼓励的相关性，不自动等于因果、常识、公平或业务意图。

## 常见任务类型

### 判别式任务

- 分类：垃圾邮件、意图、风险等级。
- 回归：销量、时长、价格。
- 排序/推荐：搜索结果、内容、商品。
- 异常检测：欺诈、设备故障、质量异常。
- 识别/抽取：OCR、实体、表格、语音转文字。

适合有明确输出空间、可收集标签、可用指标稳定评测的场景。

### 生成式任务

- 生成与改写、摘要、问答、翻译、代码。
- 图像、音频、视频和 3D 生成。
- 结构化抽取、函数调用、计划与工具编排。

生成输出空间巨大，不能只用“看起来不错”验收，需要 Rubric、人工评测、事实/引用验证和安全测试。

## 训练、推理与适配

- **训练（Training）**：调整参数，让模型从数据学到模式，成本高、周期长。
- **推理（Inference）**：使用已训练模型处理新输入，是线上延迟和持续成本来源。
- **Prompting**：不改权重，用指令、示例和上下文引导输出。
- **RAG**：推理前检索外部资料并放入上下文。
- **Fine-tuning**：用特定数据调整权重，适合稳定行为/风格/任务分布。
- **Preference Optimization**：用偏好数据让输出更符合人类或政策偏好。
- **Distillation**：用大模型知识训练更小模型，以降低延迟或成本。
- **Quantization**：降低数值精度，减少内存与计算，可能损失质量。

选择顺序通常是：先流程和规则基线 → Prompt → RAG/工具 → 微调 → 训练专用模型。越往后越需要数据、工程和治理投入。

## 数据集三分法

- **训练集**：用于学习参数或适配。
- **验证/开发集**：用于选方案、调参数和定阈值。
- **测试集**：仅用于最终无偏估计，不能反复调参看到答案。

还应保留：

- **黄金回归集**：线上关键场景与历史事故，版本变更必跑。
- **挑战/红队集**：恶意、极端、边界和高风险输入。
- **线上抽检集**：按真实分布持续采样，发现漂移和新失败。

数据泄漏是把答案、未来信息或测试信息意外暴露给训练/开发过程，会造成虚高成绩。

## 指标基础

### 分类

- Accuracy：整体正确比例；类别极不平衡时会骗人。
- Precision：被判为正的样本里有多少真是正。
- Recall：所有真正例里找回多少。
- F1：Precision 与 Recall 的调和平均。
- ROC-AUC / PR-AUC：跨阈值排序能力；罕见正例常更关注 PR-AUC。

产品阈值应由漏报与误报的业务代价决定，不由“0.5 看起来标准”决定。

### 生成

- 任务正确性、事实性/忠实性、相关性、完整性、可操作性、格式遵循。
- 词面指标（BLEU/ROUGE）只衡量与参考文本的表面相似，不能单独代表好答案。
- LLM-as-a-Judge 可规模化，但会有位置、风格、自偏好和提示敏感等偏差，需用人工校准。

### 推荐/排序

- Offline：Precision@K、Recall@K、NDCG、覆盖率、多样性。
- Online：点击、转化、停留、长期留存、投诉与生态健康。
- 防止只优化短期互动导致回音室、低质刺激或供给受损。

## 欠拟合、过拟合与泛化

- **欠拟合**：连训练/开发场景都表现差，能力或特征不足。
- **过拟合**：记住训练或 benchmark，换真实分布就失效。
- **泛化**：对未见但同分布或合理变化的样本仍有效。

对产品而言，泛化不只是一个总分：要测试新用户、新语言、新领域、新时间段、不同输入长度、噪声、对抗与供应商变更。

## 不确定性、置信度与校准

模型输出概率不一定等于真实正确率。**校准**关注“自称 80% 置信的样本，是否约 80% 真正确”。LLM 生成概率也不宜直接展示为答案可信度。

更可行的产品策略：

- 按证据完整度、检索支持、规则一致性和独立验证器组合风险分。
- 对高风险/低证据样本拒答、澄清或转人工。
- 展示来源和不确定点，而非伪精确百分比。
- 用选择性预测评估：覆盖率下降时，已回答样本质量能提升多少。

## 因果与相关

预测“谁会流失”不等于知道“给谁优惠能阻止流失”；模型相关性不等于干预效果。产品决策要区分：

- 预测问题：接下来可能发生什么？
- 因果问题：若采取动作，相比不采取会改变什么？
- 决策问题：在约束和成本下应该做什么？

需要判断增量效果时，用随机实验、准实验或因果推断，不用单纯相关模型替代。

## 产品经理应能与技术团队讨论的 15 个问题

1. 当前非 AI/人工基线是多少？
2. 目标变量和标签由谁、按什么规则产生？
3. 数据覆盖真实线上分布吗？哪些人群/场景缺失？
4. 训练、验证、测试是否按用户或时间正确切分？
5. 最重要的误报和漏报分别有什么代价？
6. 哪些场景模型明确做不到？
7. 结果如何校准、拒答、解释和被用户纠正？
8. 模型变化会影响哪些下游流程？
9. P50/P95 延迟和峰值吞吐是多少？
10. 单任务全链路成本是多少？
11. 数据、模型、代码、Prompt、索引如何版本化？
12. 漂移如何检测，谁响应？
13. 最坏攻击与误用是什么？
14. 供应商不可用或质量下降如何降级？
15. 什么证据足以扩大流量，什么触发回滚？

下一步：[大模型与生成式 AI](02_大模型与生成式AI.md) · [术语词典](../08_术语词典/AI_PM词典.md)
