# 传统 AI、搜索、推荐与预测

## AI 产品不等于 LLM 产品

当输出空间明确、标签稳定、延迟/成本严格或需要可校准概率时，传统机器学习、搜索、优化和规则经常比生成式模型更合适。

选择原则：用最简单能达到目标且可运营的方法。LLM 可作为理解/生成组件，与传统模型和确定性系统组合。

## 分类与评分

### 场景

欺诈/风险、流失、线索、意图、内容审核、质量检测、工单路由。

### 产品定义

- 预测对象和时点：在什么信息可用时预测什么。
- 标签：谁定义、观察窗口多久、是否受历史政策影响。
- 动作：分数之后采取什么，谁受影响。
- 代价：误报和漏报分别造成什么。

### 阈值

模型给分不等于业务动作。根据容量和代价选择阈值：

- 高 Recall：尽量不漏，接受更多人工检查。
- 高 Precision：资源有限，只处理高把握样本。
- 多阈值：自动通过 / 人工复核 / 自动阻断。

阈值要按群体、时间和业务政策监控，不能上线后永远不变。

## 搜索系统

### 三段

1. 召回：从大量候选快速找可能相关集合。
2. 排序：用文本、行为、时效、质量等特征排序。
3. 展示：去重、多样性、业务规则、权限和解释。

### 指标

- 离线：Recall@K、MRR、NDCG、零结果率。
- 在线：搜索成功、改写率、点击后任务完成、放弃、时间。
- 生态：来源覆盖、长尾、公平、内容质量。

点击不是完美相关标签：位置、展示和品牌都会影响点击，形成反馈偏差。

### LLM 的位置

查询理解/改写、语义召回、结果摘要和对话式交互。核心检索、权限、实时数据和引用仍需确定系统负责。

## 推荐系统

### 常见方法

- 热门/规则基线。
- 协同过滤：利用相似用户/物品行为。
- 内容推荐：利用物品和用户特征。
- Learning-to-Rank：学习候选排序。
- Contextual Bandit：在探索与利用间选择。
- 多目标优化：相关性、质量、多样性、新颖、生态与安全。

### 冷启动

新用户：显式偏好、情境、热门和快速反馈。新物品：内容特征、编辑推荐和探索配额。

### 指标陷阱

只优化点击/时长可能造成标题党、沉迷、回音室和供给者受损。指标树应含长期留存、满意、隐藏/举报、内容多样、创作者生态和群体体验。

### 反馈回路

系统展示什么决定收集到什么行为；未展示物品缺少标签。使用随机探索、反事实评估或受控实验，保留多样性和新供给机会。

## 时间序列与预测

### 场景

需求、库存、容量、现金流、故障和人力预测。

### 基线

先比较上期值、移动平均、季节性朴素和业务计划。复杂模型若不能稳定超过基线，不值得增加运营成本。

### 评测

- 按时间滚动回测，不能随机打乱未来和过去。
- MAE 易解释；RMSE 更惩罚大误差；MAPE 在接近零时失真。
- 给预测区间，而非只有单点。
- 评估预测驱动的库存/排班决策成本。

预测准确不等于决策最优；需要把缺货、积压、服务水平等代价放入优化。

## 异常检测

异常是“偏离常态”，不自动等于欺诈或故障。定义：对象、时间窗口、基线、严重度、人工调查和反馈。

关键指标：每单位时间告警数、真实问题召回、告警精度、发现时间、调查负荷、重复/聚合和恢复。

告警太多会疲劳；用分级、聚合、抑制和根因关联提高可行动性。

## 因果、增量与决策

### 预测

谁可能购买/流失？

### 因果

发送优惠相比不发送，会改变谁的行为？

### 决策

在预算、容量和公平约束下，应该对谁采取什么动作？

高风险是把高预测分当作高增量效果。用 A/B、准实验、uplift 模型或因果方法验证干预，而非只建相关模型。

## 优化与运筹

排班、路径、定价、库存和资源分配往往需要约束优化。LLM 可把自然语言转成候选约束或解释结果，但求解和可行性由优化器/规则验证。

必须记录硬约束（绝不能违反）与软目标（可权衡），并给无可行解时的处理。

## 规则、传统 ML 与 LLM 组合

| 子任务 | 合适方法 |
|---|---|
| 资格/权限/金额上限 | 规则和授权系统 |
| 实时价格/库存/账户状态 | 数据库/API |
| 风险概率/排序 | 传统 ML/排序模型 |
| 非结构化理解/生成 | LLM/多模态模型 |
| 最新私有知识 | 搜索/RAG |
| 路径和资源最优 | 优化器 |
| 高影响最终决定 | 明确政策 + 有效人工监督 |

生产产品通常是混合系统，不需要为“AI 原生”牺牲可控性。

## 数据泄漏和偏差

传统 ML 常见泄漏：

- 使用预测时点之后才知道的信息。
- 同一用户/实体同时出现在训练和测试。
- 预处理在全量数据上先拟合。
- 历史政策决定标签，再用模型复制政策。

按时间、用户、机构正确切分；记录标签生成流程；对选择偏差和缺失结果做专门分析。

## 上线与监控

- 特征计算在线/离线一致。
- 模型、特征、阈值、规则和数据版本可追溯。
- 监控数据分布、缺失、分数、校准、业务结果和群体切片。
- 反馈有延迟时用代理指标，但最终回到真实结果。
- Shadow → Canary → 分阶段放量，保留规则/旧模型回滚。
- 重训不是默认自动发布，仍需回归和批准。

## 传统 AI 产品评审十问

1. 预测时点和可用信息是否严格定义？
2. 标签代表真正目标还是历史流程？
3. 最简单基线是多少？
4. 误报、漏报和不行动的代价是什么？
5. 阈值如何与人工容量/预算连接？
6. 总体分是否掩盖时间、地区或群体差异？
7. 模型输出怎样改变环境并污染未来反馈？
8. 是否需要因果而不只是预测？
9. 漂移时谁决定调阈值、重训或停止？
10. LLM 加入后是否真正提高端到端结果？
