行业知识 · v2.3.0 · 资料核对 2026-10-03
AI 技术全景:产品经理需要懂到什么程度
先建立正确心智模型
人工智能不是一个技术,而是一组让机器从规则、数据或环境反馈中产生预测、内容、推荐或动作的方法。产品决策时至少区分四层:
业务应用:客服、搜索、推荐、创作、风控、诊断辅助、流程自动化
AI 系统:数据 + 模型 + Prompt/RAG/工具 + 规则 + 评测 + 人机流程
模型能力:分类、回归、排序、生成、理解、规划、视觉、语音
基础设施:数据管道、训练/推理、存储、API、权限、监控、算力
多数“AI 产品事故”不是模型单点造成,而是系统边界、数据、权限、检索、工具、体验或运营共同造成。
AI、ML、DL、生成式 AI、LLM 的关系
- AI(人工智能):总称,既包括规则专家系统,也包括机器学习。
- ML(机器学习):从数据学习映射或策略,而非把每条规则手写出来。
- DL(深度学习):用多层神经网络学习复杂表示,是现代视觉、语音和大模型基础。
- Foundation Model(基础模型):在广泛数据上训练、可适配多任务的大模型。
- Generative AI(生成式 AI):生成文本、图像、音频、视频、代码等内容。
- LLM(大语言模型):以语言 Token 为主要输入输出的大规模生成模型。
LLM 是生成式 AI 的一类,生成式 AI 是 AI 的一部分;“AI 产品”不一定需要 LLM。
五类学习范式
| 范式 | 信号 | 典型任务 | 产品风险 |
|---|---|---|---|
| 监督学习 | 已标注输入—答案 | 分类、预测、识别 | 标签偏差、分布漂移 |
| 无监督/自监督 | 数据自身结构 | 表征、聚类、预训练 | 难解释、继承语料偏差 |
| 半监督/弱监督 | 少量真标签 + 大量弱信号 | 标签稀缺任务 | 噪声放大 |
| 强化学习 | 环境奖励 | 策略、控制、偏好优化 | 奖励黑客、探索风险 |
| 在线/持续学习 | 线上反馈 | 个性化、动态策略 | 反馈回路、不可控变化 |
产品经理无需手推优化公式,但要知道:模型学到的是数据和目标函数鼓励的相关性,不自动等于因果、常识、公平或业务意图。
常见任务类型
判别式任务
- 分类:垃圾邮件、意图、风险等级。
- 回归:销量、时长、价格。
- 排序/推荐:搜索结果、内容、商品。
- 异常检测:欺诈、设备故障、质量异常。
- 识别/抽取:OCR、实体、表格、语音转文字。
适合有明确输出空间、可收集标签、可用指标稳定评测的场景。
生成式任务
- 生成与改写、摘要、问答、翻译、代码。
- 图像、音频、视频和 3D 生成。
- 结构化抽取、函数调用、计划与工具编排。
生成输出空间巨大,不能只用“看起来不错”验收,需要 Rubric、人工评测、事实/引用验证和安全测试。
训练、推理与适配
- 训练(Training):调整参数,让模型从数据学到模式,成本高、周期长。
- 推理(Inference):使用已训练模型处理新输入,是线上延迟和持续成本来源。
- Prompting:不改权重,用指令、示例和上下文引导输出。
- RAG:推理前检索外部资料并放入上下文。
- Fine-tuning:用特定数据调整权重,适合稳定行为/风格/任务分布。
- Preference Optimization:用偏好数据让输出更符合人类或政策偏好。
- Distillation:用大模型知识训练更小模型,以降低延迟或成本。
- Quantization:降低数值精度,减少内存与计算,可能损失质量。
选择顺序通常是:先流程和规则基线 → Prompt → RAG/工具 → 微调 → 训练专用模型。越往后越需要数据、工程和治理投入。
数据集三分法
- 训练集:用于学习参数或适配。
- 验证/开发集:用于选方案、调参数和定阈值。
- 测试集:仅用于最终无偏估计,不能反复调参看到答案。
还应保留:
- 黄金回归集:线上关键场景与历史事故,版本变更必跑。
- 挑战/红队集:恶意、极端、边界和高风险输入。
- 线上抽检集:按真实分布持续采样,发现漂移和新失败。
数据泄漏是把答案、未来信息或测试信息意外暴露给训练/开发过程,会造成虚高成绩。
指标基础
分类
- Accuracy:整体正确比例;类别极不平衡时会骗人。
- Precision:被判为正的样本里有多少真是正。
- Recall:所有真正例里找回多少。
- F1:Precision 与 Recall 的调和平均。
- ROC-AUC / PR-AUC:跨阈值排序能力;罕见正例常更关注 PR-AUC。
产品阈值应由漏报与误报的业务代价决定,不由“0.5 看起来标准”决定。
生成
- 任务正确性、事实性/忠实性、相关性、完整性、可操作性、格式遵循。
- 词面指标(BLEU/ROUGE)只衡量与参考文本的表面相似,不能单独代表好答案。
- LLM-as-a-Judge 可规模化,但会有位置、风格、自偏好和提示敏感等偏差,需用人工校准。
推荐/排序
- Offline:Precision@K、Recall@K、NDCG、覆盖率、多样性。
- Online:点击、转化、停留、长期留存、投诉与生态健康。
- 防止只优化短期互动导致回音室、低质刺激或供给受损。
欠拟合、过拟合与泛化
- 欠拟合:连训练/开发场景都表现差,能力或特征不足。
- 过拟合:记住训练或 benchmark,换真实分布就失效。
- 泛化:对未见但同分布或合理变化的样本仍有效。
对产品而言,泛化不只是一个总分:要测试新用户、新语言、新领域、新时间段、不同输入长度、噪声、对抗与供应商变更。
不确定性、置信度与校准
模型输出概率不一定等于真实正确率。校准关注“自称 80% 置信的样本,是否约 80% 真正确”。LLM 生成概率也不宜直接展示为答案可信度。
更可行的产品策略:
- 按证据完整度、检索支持、规则一致性和独立验证器组合风险分。
- 对高风险/低证据样本拒答、澄清或转人工。
- 展示来源和不确定点,而非伪精确百分比。
- 用选择性预测评估:覆盖率下降时,已回答样本质量能提升多少。
因果与相关
预测“谁会流失”不等于知道“给谁优惠能阻止流失”;模型相关性不等于干预效果。产品决策要区分:
- 预测问题:接下来可能发生什么?
- 因果问题:若采取动作,相比不采取会改变什么?
- 决策问题:在约束和成本下应该做什么?
需要判断增量效果时,用随机实验、准实验或因果推断,不用单纯相关模型替代。
产品经理应能与技术团队讨论的 15 个问题
- 当前非 AI/人工基线是多少?
- 目标变量和标签由谁、按什么规则产生?
- 数据覆盖真实线上分布吗?哪些人群/场景缺失?
- 训练、验证、测试是否按用户或时间正确切分?
- 最重要的误报和漏报分别有什么代价?
- 哪些场景模型明确做不到?
- 结果如何校准、拒答、解释和被用户纠正?
- 模型变化会影响哪些下游流程?
- P50/P95 延迟和峰值吞吐是多少?
- 单任务全链路成本是多少?
- 数据、模型、代码、Prompt、索引如何版本化?
- 漂移如何检测,谁响应?
- 最坏攻击与误用是什么?
- 供应商不可用或质量下降如何降级?
- 什么证据足以扩大流量,什么触发回滚?
下一步:大模型与生成式 AI · 术语词典