行业知识 · v2.3.0 · 资料核对 2026-10-03
传统 AI、搜索、推荐与预测
AI 产品不等于 LLM 产品
当输出空间明确、标签稳定、延迟/成本严格或需要可校准概率时,传统机器学习、搜索、优化和规则经常比生成式模型更合适。
选择原则:用最简单能达到目标且可运营的方法。LLM 可作为理解/生成组件,与传统模型和确定性系统组合。
分类与评分
场景
欺诈/风险、流失、线索、意图、内容审核、质量检测、工单路由。
产品定义
- 预测对象和时点:在什么信息可用时预测什么。
- 标签:谁定义、观察窗口多久、是否受历史政策影响。
- 动作:分数之后采取什么,谁受影响。
- 代价:误报和漏报分别造成什么。
阈值
模型给分不等于业务动作。根据容量和代价选择阈值:
- 高 Recall:尽量不漏,接受更多人工检查。
- 高 Precision:资源有限,只处理高把握样本。
- 多阈值:自动通过 / 人工复核 / 自动阻断。
阈值要按群体、时间和业务政策监控,不能上线后永远不变。
搜索系统
三段
- 召回:从大量候选快速找可能相关集合。
- 排序:用文本、行为、时效、质量等特征排序。
- 展示:去重、多样性、业务规则、权限和解释。
指标
- 离线:Recall@K、MRR、NDCG、零结果率。
- 在线:搜索成功、改写率、点击后任务完成、放弃、时间。
- 生态:来源覆盖、长尾、公平、内容质量。
点击不是完美相关标签:位置、展示和品牌都会影响点击,形成反馈偏差。
LLM 的位置
查询理解/改写、语义召回、结果摘要和对话式交互。核心检索、权限、实时数据和引用仍需确定系统负责。
推荐系统
常见方法
- 热门/规则基线。
- 协同过滤:利用相似用户/物品行为。
- 内容推荐:利用物品和用户特征。
- Learning-to-Rank:学习候选排序。
- Contextual Bandit:在探索与利用间选择。
- 多目标优化:相关性、质量、多样性、新颖、生态与安全。
冷启动
新用户:显式偏好、情境、热门和快速反馈。新物品:内容特征、编辑推荐和探索配额。
指标陷阱
只优化点击/时长可能造成标题党、沉迷、回音室和供给者受损。指标树应含长期留存、满意、隐藏/举报、内容多样、创作者生态和群体体验。
反馈回路
系统展示什么决定收集到什么行为;未展示物品缺少标签。使用随机探索、反事实评估或受控实验,保留多样性和新供给机会。
时间序列与预测
场景
需求、库存、容量、现金流、故障和人力预测。
基线
先比较上期值、移动平均、季节性朴素和业务计划。复杂模型若不能稳定超过基线,不值得增加运营成本。
评测
- 按时间滚动回测,不能随机打乱未来和过去。
- MAE 易解释;RMSE 更惩罚大误差;MAPE 在接近零时失真。
- 给预测区间,而非只有单点。
- 评估预测驱动的库存/排班决策成本。
预测准确不等于决策最优;需要把缺货、积压、服务水平等代价放入优化。
异常检测
异常是“偏离常态”,不自动等于欺诈或故障。定义:对象、时间窗口、基线、严重度、人工调查和反馈。
关键指标:每单位时间告警数、真实问题召回、告警精度、发现时间、调查负荷、重复/聚合和恢复。
告警太多会疲劳;用分级、聚合、抑制和根因关联提高可行动性。
因果、增量与决策
预测
谁可能购买/流失?
因果
发送优惠相比不发送,会改变谁的行为?
决策
在预算、容量和公平约束下,应该对谁采取什么动作?
高风险是把高预测分当作高增量效果。用 A/B、准实验、uplift 模型或因果方法验证干预,而非只建相关模型。
优化与运筹
排班、路径、定价、库存和资源分配往往需要约束优化。LLM 可把自然语言转成候选约束或解释结果,但求解和可行性由优化器/规则验证。
必须记录硬约束(绝不能违反)与软目标(可权衡),并给无可行解时的处理。
规则、传统 ML 与 LLM 组合
| 子任务 | 合适方法 |
|---|---|
| 资格/权限/金额上限 | 规则和授权系统 |
| 实时价格/库存/账户状态 | 数据库/API |
| 风险概率/排序 | 传统 ML/排序模型 |
| 非结构化理解/生成 | LLM/多模态模型 |
| 最新私有知识 | 搜索/RAG |
| 路径和资源最优 | 优化器 |
| 高影响最终决定 | 明确政策 + 有效人工监督 |
生产产品通常是混合系统,不需要为“AI 原生”牺牲可控性。
数据泄漏和偏差
传统 ML 常见泄漏:
- 使用预测时点之后才知道的信息。
- 同一用户/实体同时出现在训练和测试。
- 预处理在全量数据上先拟合。
- 历史政策决定标签,再用模型复制政策。
按时间、用户、机构正确切分;记录标签生成流程;对选择偏差和缺失结果做专门分析。
上线与监控
- 特征计算在线/离线一致。
- 模型、特征、阈值、规则和数据版本可追溯。
- 监控数据分布、缺失、分数、校准、业务结果和群体切片。
- 反馈有延迟时用代理指标,但最终回到真实结果。
- Shadow → Canary → 分阶段放量,保留规则/旧模型回滚。
- 重训不是默认自动发布,仍需回归和批准。
传统 AI 产品评审十问
- 预测时点和可用信息是否严格定义?
- 标签代表真正目标还是历史流程?
- 最简单基线是多少?
- 误报、漏报和不行动的代价是什么?
- 阈值如何与人工容量/预算连接?
- 总体分是否掩盖时间、地区或群体差异?
- 模型输出怎样改变环境并污染未来反馈?
- 是否需要因果而不只是预测?
- 漂移时谁决定调阈值、重训或停止?
- LLM 加入后是否真正提高端到端结果?