典 · AI PM 永乐大典

行业知识 · v2.3.0 · 资料核对 2026-10-03

评测体系与实验

行业评测把风险/需求 ID 追踪到用例、环境、版本、结果和证据;评分器经过人工校准并单独版本化,高风险结论保留独立验证。样本数、置信区间、配对比较、多次 Agent 试验、污染和线上质量预算见 统计评测与质量门禁。

评测是 AI 产品的“需求规格 + 测试 + 运营传感器”

没有评测集,团队只能凭感觉争论;没有线上实验,离线进步无法证明业务价值;没有持续评测,模型、数据和用户变化会让上线时的结论失效。

评测金字塔

业务结果:收入、成本、风险、留存
用户任务:成功率、时间、采用、重大编辑
端到端 AI:正确、忠实、完整、拒答、安全
组件:检索、分类、工具、结构输出、策略
系统:延迟、吞吐、可用、成本、恢复

组件分用于定位,端到端和业务分决定产品是否有用。

第一步:定义“好”

为每个任务写 Rubric,维度可包括:

每维使用有锚点的等级。例如 0=错误且可能误导,1=有重大错误,2=基本正确需修改,3=正确完整可直接用。不要只写“1–5 分凭感觉”。

第二步:建立评测集

样本来源

分层

按任务、用户、语言、地区、长度、时间、难度、风险、工具、来源质量分层。总体平均分必须同时展示关键切片。

防污染

第三步:选择评分方式

确定性程序

Schema、格式、数值、引用存在、工具状态、关键词约束,尽量用代码和业务规则验证。

人工评测

高价值、主观或领域任务必须有人评:

LLM-as-a-Judge

适合扩规模和快速回归,但需:

Judging LLM-as-a-Judge 说明强模型评审有潜力,也暴露位置、冗长和自增强等偏差。

第四步:指标与不确定性

报告:样本量、分布、均值/比例、置信区间、分层、严重错误数和配对差异。

建议区分:

错误分类树

失败
├─ 输入:模糊、缺失、噪声、恶意、超长
├─ 知识:未入库、过期、权限错、检索漏、冲突
├─ 模型:指令、推理、事实、语言、格式、偏见
├─ 工具:选错、参数错、超时、部分执行、状态误报
├─ 体验:误解能力、无法纠错、过度信任、流程不适配
└─ 运营:版本漂移、供应商变化、监控缺失、反馈污染

每周看 Top 错误的频率 × 严重度 × 可修复性,不要被最有趣的个案带偏。

RAG 专项

RAGAS 提供参考自由的自动评测思路,但任何自动框架都需对本场景做人类校准。

Agent 专项

安全红队

覆盖:直接/间接提示注入、越狱、敏感泄漏、跨租户、工具越权、RAG 投毒、恶意文件、多轮诱导、编码混淆、资源耗尽、供应链和高风险误用。

红队不是一次活动:上线前、重大变更后、定期、事故后均要更新。记录攻击、前置条件、结果、严重度、控制和回归用例。

线上实验

影子模式

模型接收真实流量但结果不影响用户,用于质量、延迟和成本评估。仍要遵守数据授权和访问控制。

A/B 测试

先写:假设、主指标、护栏、样本/周期、分流单位、停止规则。避免同时看几十指标后挑显著结果。

AI A/B 注意:

因果陷阱

高采用者表现更好不代表产品导致表现更好;他们可能本来就更强。用随机分流、分阶段推出或合理准实验。

上线门禁示例

经典评测阅读:HELM 强调多维、透明和可复现;AI Agents That Matter 强调成本与 benchmark 可靠性。