行业知识 · v2.3.0 · 资料核对 2026-10-03
评测体系与实验
行业评测把风险/需求 ID 追踪到用例、环境、版本、结果和证据;评分器经过人工校准并单独版本化,高风险结论保留独立验证。样本数、置信区间、配对比较、多次 Agent 试验、污染和线上质量预算见 统计评测与质量门禁。
评测是 AI 产品的“需求规格 + 测试 + 运营传感器”
没有评测集,团队只能凭感觉争论;没有线上实验,离线进步无法证明业务价值;没有持续评测,模型、数据和用户变化会让上线时的结论失效。
评测金字塔
业务结果:收入、成本、风险、留存
用户任务:成功率、时间、采用、重大编辑
端到端 AI:正确、忠实、完整、拒答、安全
组件:检索、分类、工具、结构输出、策略
系统:延迟、吞吐、可用、成本、恢复
组件分用于定位,端到端和业务分决定产品是否有用。
第一步:定义“好”
为每个任务写 Rubric,维度可包括:
- 正确性:结论是否对。
- 忠实性:是否被给定证据支持。
- 相关性:是否回答问题。
- 完整性:关键点是否遗漏。
- 可操作性:用户能否据此完成任务。
- 风格/格式:是否符合约束。
- 安全与公平:是否造成禁止风险或群体差异。
- 拒答质量:该答时答、该拒时拒、拒得有帮助。
每维使用有锚点的等级。例如 0=错误且可能误导,1=有重大错误,2=基本正确需修改,3=正确完整可直接用。不要只写“1–5 分凭感觉”。
第二步:建立评测集
样本来源
- 真实历史流量和工单。
- 用户研究与领域专家构造。
- 线上失败、投诉和事故。
- 对抗/红队和边界组合。
- 合成数据用于补长尾,但要人工验证并标注来源。
分层
按任务、用户、语言、地区、长度、时间、难度、风险、工具、来源质量分层。总体平均分必须同时展示关键切片。
防污染
- 训练/开发/测试按用户、实体或时间隔离。
- 冻结测试集,限制查看与反复调参。
- 保留一份真正未见的 holdout。
- 线上新样本滚动加入回归集,但记录版本,避免历史趋势失真。
第三步:选择评分方式
确定性程序
Schema、格式、数值、引用存在、工具状态、关键词约束,尽量用代码和业务规则验证。
人工评测
高价值、主观或领域任务必须有人评:
- 盲评候选,随机化顺序。
- 至少双评重要样本,记录分歧和仲裁。
- 评审者培训、校准题和一致性监控。
- 单独记录“不足以判断”,不要逼出假标签。
LLM-as-a-Judge
适合扩规模和快速回归,但需:
- 用人工金标准校准准确性与偏差。
- 交换候选顺序,防位置偏差。
- 隐去模型品牌和无关风格。
- 要求基于 Rubric 输出结构化理由/证据。
- 定期抽查,模型或评审 Prompt 变化时重校准。
Judging LLM-as-a-Judge 说明强模型评审有潜力,也暴露位置、冗长和自增强等偏差。
第四步:指标与不确定性
报告:样本量、分布、均值/比例、置信区间、分层、严重错误数和配对差异。
- 一个 92% 与 90% 的差异,可能只是小样本波动。
- 重要的是可接受底线与业务意义,不只是统计显著。
- 方案 A 可提高平均分但增加致命错误,不能只看总分。
建议区分:
- Pass rate:达到可直接使用标准的比例。
- Critical failure rate:严重风险错误比例,常设硬门槛。
- Selective accuracy:只回答高把握样本时的质量与覆盖率。
- Cost per successful task:全链路成本除以成功任务。
错误分类树
失败
├─ 输入:模糊、缺失、噪声、恶意、超长
├─ 知识:未入库、过期、权限错、检索漏、冲突
├─ 模型:指令、推理、事实、语言、格式、偏见
├─ 工具:选错、参数错、超时、部分执行、状态误报
├─ 体验:误解能力、无法纠错、过度信任、流程不适配
└─ 运营:版本漂移、供应商变化、监控缺失、反馈污染
每周看 Top 错误的频率 × 严重度 × 可修复性,不要被最有趣的个案带偏。
RAG 专项
- 解析/入库覆盖率、ACL 正确率、知识新鲜度。
- Retrieval Recall@K:支持答案的文档是否被取回。
- Context Precision:取回内容有多少真正相关。
- Faithfulness:生成的主张是否由上下文支持。
- Answer Correctness/Relevance:最终是否正确解决任务。
RAGAS 提供参考自由的自动评测思路,但任何自动框架都需对本场景做人类校准。
Agent 专项
- 端到端成功、部分成功、可恢复。
- 工具/参数正确率、权限违规、无效动作和循环。
- 步骤、Token、时间、成本与人工介入。
- 环境/工具错误、并发状态、恶意内容、目标冲突。
- 执行结果必须由环境状态核验,不能相信 Agent 自述“完成”。
安全红队
覆盖:直接/间接提示注入、越狱、敏感泄漏、跨租户、工具越权、RAG 投毒、恶意文件、多轮诱导、编码混淆、资源耗尽、供应链和高风险误用。
红队不是一次活动:上线前、重大变更后、定期、事故后均要更新。记录攻击、前置条件、结果、严重度、控制和回归用例。
线上实验
影子模式
模型接收真实流量但结果不影响用户,用于质量、延迟和成本评估。仍要遵守数据授权和访问控制。
A/B 测试
先写:假设、主指标、护栏、样本/周期、分流单位、停止规则。避免同时看几十指标后挑显著结果。
AI A/B 注意:
- 按用户/团队分流,防体验串扰和学习效应。
- 记录模型、Prompt、索引和工具版本。
- 新奇效应与学习曲线可能需要更长观察。
- 业务主指标改善时检查投诉、重大错误、成本和群体差异。
因果陷阱
高采用者表现更好不代表产品导致表现更好;他们可能本来就更强。用随机分流、分阶段推出或合理准实验。
上线门禁示例
- 所有硬性高风险测试通过,未关闭 P0/P1 问题为 0。
- 核心黄金集达到阈值,关键切片不低于底线。
- 相比现状基线有业务意义的增益。
- P95 延迟、可用性、成本和容量通过。
- 评测、红队、UAT 结果与残余风险由指定责任人签字。
- 灰度、监控、告警、回滚、人工接管和事故演练就绪。
经典评测阅读:HELM 强调多维、透明和可复现;AI Agents That Matter 强调成本与 benchmark 可靠性。