# 评测体系与实验

行业评测把风险/需求 ID 追踪到用例、环境、版本、结果和证据；评分器经过人工校准并单独版本化，高风险结论保留独立验证。样本数、置信区间、配对比较、多次 Agent 试验、污染和线上质量预算见 [统计评测与质量门禁](../14_行业基线/01_统计评测与质量门禁.md)。

## 评测是 AI 产品的“需求规格 + 测试 + 运营传感器”

没有评测集，团队只能凭感觉争论；没有线上实验，离线进步无法证明业务价值；没有持续评测，模型、数据和用户变化会让上线时的结论失效。

## 评测金字塔

```text
业务结果：收入、成本、风险、留存
用户任务：成功率、时间、采用、重大编辑
端到端 AI：正确、忠实、完整、拒答、安全
组件：检索、分类、工具、结构输出、策略
系统：延迟、吞吐、可用、成本、恢复
```

组件分用于定位，端到端和业务分决定产品是否有用。

## 第一步：定义“好”

为每个任务写 Rubric，维度可包括：

- 正确性：结论是否对。
- 忠实性：是否被给定证据支持。
- 相关性：是否回答问题。
- 完整性：关键点是否遗漏。
- 可操作性：用户能否据此完成任务。
- 风格/格式：是否符合约束。
- 安全与公平：是否造成禁止风险或群体差异。
- 拒答质量：该答时答、该拒时拒、拒得有帮助。

每维使用有锚点的等级。例如 0=错误且可能误导，1=有重大错误，2=基本正确需修改，3=正确完整可直接用。不要只写“1–5 分凭感觉”。

## 第二步：建立评测集

### 样本来源

- 真实历史流量和工单。
- 用户研究与领域专家构造。
- 线上失败、投诉和事故。
- 对抗/红队和边界组合。
- 合成数据用于补长尾，但要人工验证并标注来源。

### 分层

按任务、用户、语言、地区、长度、时间、难度、风险、工具、来源质量分层。总体平均分必须同时展示关键切片。

### 防污染

- 训练/开发/测试按用户、实体或时间隔离。
- 冻结测试集，限制查看与反复调参。
- 保留一份真正未见的 holdout。
- 线上新样本滚动加入回归集，但记录版本，避免历史趋势失真。

## 第三步：选择评分方式

### 确定性程序

Schema、格式、数值、引用存在、工具状态、关键词约束，尽量用代码和业务规则验证。

### 人工评测

高价值、主观或领域任务必须有人评：

- 盲评候选，随机化顺序。
- 至少双评重要样本，记录分歧和仲裁。
- 评审者培训、校准题和一致性监控。
- 单独记录“不足以判断”，不要逼出假标签。

### LLM-as-a-Judge

适合扩规模和快速回归，但需：

- 用人工金标准校准准确性与偏差。
- 交换候选顺序，防位置偏差。
- 隐去模型品牌和无关风格。
- 要求基于 Rubric 输出结构化理由/证据。
- 定期抽查，模型或评审 Prompt 变化时重校准。

[Judging LLM-as-a-Judge](https://arxiv.org/abs/2306.05685) 说明强模型评审有潜力，也暴露位置、冗长和自增强等偏差。

## 第四步：指标与不确定性

报告：样本量、分布、均值/比例、置信区间、分层、严重错误数和配对差异。

- 一个 92% 与 90% 的差异，可能只是小样本波动。
- 重要的是可接受底线与业务意义，不只是统计显著。
- 方案 A 可提高平均分但增加致命错误，不能只看总分。

建议区分：

- Pass rate：达到可直接使用标准的比例。
- Critical failure rate：严重风险错误比例，常设硬门槛。
- Selective accuracy：只回答高把握样本时的质量与覆盖率。
- Cost per successful task：全链路成本除以成功任务。

## 错误分类树

```text
失败
├─ 输入：模糊、缺失、噪声、恶意、超长
├─ 知识：未入库、过期、权限错、检索漏、冲突
├─ 模型：指令、推理、事实、语言、格式、偏见
├─ 工具：选错、参数错、超时、部分执行、状态误报
├─ 体验：误解能力、无法纠错、过度信任、流程不适配
└─ 运营：版本漂移、供应商变化、监控缺失、反馈污染
```

每周看 Top 错误的频率 × 严重度 × 可修复性，不要被最有趣的个案带偏。

## RAG 专项

- 解析/入库覆盖率、ACL 正确率、知识新鲜度。
- Retrieval Recall@K：支持答案的文档是否被取回。
- Context Precision：取回内容有多少真正相关。
- Faithfulness：生成的主张是否由上下文支持。
- Answer Correctness/Relevance：最终是否正确解决任务。

[RAGAS](https://arxiv.org/abs/2309.15217) 提供参考自由的自动评测思路，但任何自动框架都需对本场景做人类校准。

## Agent 专项

- 端到端成功、部分成功、可恢复。
- 工具/参数正确率、权限违规、无效动作和循环。
- 步骤、Token、时间、成本与人工介入。
- 环境/工具错误、并发状态、恶意内容、目标冲突。
- 执行结果必须由环境状态核验，不能相信 Agent 自述“完成”。

## 安全红队

覆盖：直接/间接提示注入、越狱、敏感泄漏、跨租户、工具越权、RAG 投毒、恶意文件、多轮诱导、编码混淆、资源耗尽、供应链和高风险误用。

红队不是一次活动：上线前、重大变更后、定期、事故后均要更新。记录攻击、前置条件、结果、严重度、控制和回归用例。

## 线上实验

### 影子模式

模型接收真实流量但结果不影响用户，用于质量、延迟和成本评估。仍要遵守数据授权和访问控制。

### A/B 测试

先写：假设、主指标、护栏、样本/周期、分流单位、停止规则。避免同时看几十指标后挑显著结果。

AI A/B 注意：

- 按用户/团队分流，防体验串扰和学习效应。
- 记录模型、Prompt、索引和工具版本。
- 新奇效应与学习曲线可能需要更长观察。
- 业务主指标改善时检查投诉、重大错误、成本和群体差异。

### 因果陷阱

高采用者表现更好不代表产品导致表现更好；他们可能本来就更强。用随机分流、分阶段推出或合理准实验。

## 上线门禁示例

- 所有硬性高风险测试通过，未关闭 P0/P1 问题为 0。
- 核心黄金集达到阈值，关键切片不低于底线。
- 相比现状基线有业务意义的增益。
- P95 延迟、可用性、成本和容量通过。
- 评测、红队、UAT 结果与残余风险由指定责任人签字。
- 灰度、监控、告警、回滚、人工接管和事故演练就绪。

经典评测阅读：[HELM](https://arxiv.org/abs/2211.09110) 强调多维、透明和可复现；[AI Agents That Matter](https://arxiv.org/abs/2407.01502) 强调成本与 benchmark 可靠性。
