典 · AI PM 永乐大典

行业知识 · v2.3.0 · 资料核对 2026-10-03

传统 AI、搜索、推荐与预测

AI 产品不等于 LLM 产品

当输出空间明确、标签稳定、延迟/成本严格或需要可校准概率时,传统机器学习、搜索、优化和规则经常比生成式模型更合适。

选择原则:用最简单能达到目标且可运营的方法。LLM 可作为理解/生成组件,与传统模型和确定性系统组合。

分类与评分

场景

欺诈/风险、流失、线索、意图、内容审核、质量检测、工单路由。

产品定义

阈值

模型给分不等于业务动作。根据容量和代价选择阈值:

阈值要按群体、时间和业务政策监控,不能上线后永远不变。

搜索系统

三段

  1. 召回:从大量候选快速找可能相关集合。
  2. 排序:用文本、行为、时效、质量等特征排序。
  3. 展示:去重、多样性、业务规则、权限和解释。

指标

点击不是完美相关标签:位置、展示和品牌都会影响点击,形成反馈偏差。

LLM 的位置

查询理解/改写、语义召回、结果摘要和对话式交互。核心检索、权限、实时数据和引用仍需确定系统负责。

推荐系统

常见方法

冷启动

新用户:显式偏好、情境、热门和快速反馈。新物品:内容特征、编辑推荐和探索配额。

指标陷阱

只优化点击/时长可能造成标题党、沉迷、回音室和供给者受损。指标树应含长期留存、满意、隐藏/举报、内容多样、创作者生态和群体体验。

反馈回路

系统展示什么决定收集到什么行为;未展示物品缺少标签。使用随机探索、反事实评估或受控实验,保留多样性和新供给机会。

时间序列与预测

场景

需求、库存、容量、现金流、故障和人力预测。

基线

先比较上期值、移动平均、季节性朴素和业务计划。复杂模型若不能稳定超过基线,不值得增加运营成本。

评测

预测准确不等于决策最优;需要把缺货、积压、服务水平等代价放入优化。

异常检测

异常是“偏离常态”,不自动等于欺诈或故障。定义:对象、时间窗口、基线、严重度、人工调查和反馈。

关键指标:每单位时间告警数、真实问题召回、告警精度、发现时间、调查负荷、重复/聚合和恢复。

告警太多会疲劳;用分级、聚合、抑制和根因关联提高可行动性。

因果、增量与决策

预测

谁可能购买/流失?

因果

发送优惠相比不发送,会改变谁的行为?

决策

在预算、容量和公平约束下,应该对谁采取什么动作?

高风险是把高预测分当作高增量效果。用 A/B、准实验、uplift 模型或因果方法验证干预,而非只建相关模型。

优化与运筹

排班、路径、定价、库存和资源分配往往需要约束优化。LLM 可把自然语言转成候选约束或解释结果,但求解和可行性由优化器/规则验证。

必须记录硬约束(绝不能违反)与软目标(可权衡),并给无可行解时的处理。

规则、传统 ML 与 LLM 组合

子任务合适方法
资格/权限/金额上限规则和授权系统
实时价格/库存/账户状态数据库/API
风险概率/排序传统 ML/排序模型
非结构化理解/生成LLM/多模态模型
最新私有知识搜索/RAG
路径和资源最优优化器
高影响最终决定明确政策 + 有效人工监督

生产产品通常是混合系统,不需要为“AI 原生”牺牲可控性。

数据泄漏和偏差

传统 ML 常见泄漏:

按时间、用户、机构正确切分;记录标签生成流程;对选择偏差和缺失结果做专门分析。

上线与监控

传统 AI 产品评审十问

  1. 预测时点和可用信息是否严格定义?
  2. 标签代表真正目标还是历史流程?
  3. 最简单基线是多少?
  4. 误报、漏报和不行动的代价是什么?
  5. 阈值如何与人工容量/预算连接?
  6. 总体分是否掩盖时间、地区或群体差异?
  7. 模型输出怎样改变环境并污染未来反馈?
  8. 是否需要因果而不只是预测?
  9. 漂移时谁决定调阈值、重训或停止?
  10. LLM 加入后是否真正提高端到端结果?