行业知识 · v2.3.0 · 资料核对 2026-10-03
统计评测与质量门禁
本章补充 评测体系与实验,用于模型更换、Prompt/RAG 变更、Agent 权限扩大和放量决策。目标是回答“变化是否足够好、在哪些任务上、证据有多稳”。
先签一份评测合同
合同由产品、领域专家、算法/工程和风险 Owner 共同确认:任务总体、抽样单位、成功标准、严重错误定义、关键切片、基线、试验次数、成本范围、置信水平、门禁和允许结论。冻结后再看候选结果,减少临时修改指标。
抽样单位通常是用户任务或独立会话。同一个用户的 100 次请求存在相关性;一段任务的 10 次模型调用也不能当成 10 个独立成功样本。按用户、租户或任务聚类统计,避免高估样本量。
把四种样本分开
| 集合 | 目的 | 更新方法 | 可以支持的结论 |
|---|---|---|---|
| 代表性集 | 估计现有用户分布的质量 | 概率抽样或明确分层权重 | 该分布中的质量水平 |
| 回归集 | 防历史错误复发 | 从失败和事故加入 | 已知错误是否复发 |
| 挑战/红队集 | 找到边界和攻击 | 对抗构造、专家审查 | 存在的脆弱性与控制效果 |
| 隐藏测试集 | 检查调参过拟合 | 限制接触、定期轮换 | 未见任务上的迁移表现 |
挑战集通常不是现实流量的概率样本,攻击成功率不能直接当作生产事故概率。总体质量也不能拿回归集平均分代替。每份报告写明集合用途与样本来源。
成功率需要区间
二元任务成功率为 成功任务数 / 有效任务数。同时报告样本数、缺失/无效数和置信区间。比例的 Wilson 区间与小样本二项区间方法可参考 NIST 统计手册。
演练:100 个独立任务中 90 个成功,点估计 90%,95% Wilson 区间约 82.6%–94.5%。不能据此宣布“真实成功率至少 90%”。若门禁是下界 ≥90%,应增加样本或提高质量,并在关键切片分别判断。
零次严重错误也有不确定性。独立二项试验中,n 次观察到 0 次事件,单侧 95% 上界为 1 - 0.05^(1/n)。100 次零事件的上界约 2.95%;要让上界低于 0.1%,约需 2995 次独立试验。这个计算只适用于相应抽样假设,不能证明对新型攻击、分布变化或系统事故的安全性。
样本量取决于基线、最小可检测差异、显著性水平、统计功效、设计和聚类;不是所有项目都用“100 条黄金集”。先写要支持什么决定,再用 NIST 样本量方法或统计人员计算。
比较两个方案
同一任务给基线和候选,保留配对结果:两者都成功、仅候选成功、仅基线成功、两者都失败。二元配对可用 McNemar 检验;连续评分、时间与成本可按任务做配对差值及 bootstrap 区间。重采样时保留用户/租户聚类结构。
同时呈现实际差异和区间。统计显著的小幅改善可能没有业务价值;结果不显著可能是样本不足,不能断言两者等效。非劣性比较应事先确定可接受退化边界,不能在结果出来后挑边界。
多候选、多指标和反复查看会增加误报。预先指定主指标、护栏和决策规则;探索结果标为探索,最终确认用未见数据。线上序贯试验应使用预先规定的序贯方法,避免每天看一次普通 p 值后“达到显著就停”。
Agent 评测的三个层次
结果:真实环境状态是否满足目标,如订单是否存在、文件是否正确、退款是否合规。轨迹:工具、权限、确认、循环、预算和异常处理是否符合动作契约。用户:任务时间、人工接管、结果信任与实际收益。自述“已完成”只能作为输出,不能作为成功凭据。
每个任务多次运行,记录初始状态、环境版本、模型、Prompt、工具、检索索引、随机参数、依赖故障和终态。pass@k 表示多次尝试中至少一次成功的机会,适用于可重试并可选择结果的情境;pass^k 关注连续多次成功,适合可靠性判断。必须写清估计方法、k 和试验预算,不能把最佳尝试当单次质量。τ-bench 原始实现提供可核对的任务和评测口径。
评分器先经过参考解验证,再测试错误解。代码检查验证确定性状态;模型评分器适用于难编码的质量维度;人工负责高影响判断与分歧仲裁。评分器、任务、执行环境和 Agent scaffold 共同构成被测系统。近期工程实践也强调结果与完整轨迹分别验证,见 Anthropic Agent 评测实践;其经验需用自己的任务验证。
Judge 校准记录
| 项目 | 必须记录 |
|---|---|
| 人工参考 | 领域专家、盲评、锚点、分歧及仲裁 |
| Judge 版本 | 模型、Prompt、温度、评分维度和日期 |
| 校准 | 按等级/切片的混淆矩阵、严重错误漏报 |
| 偏差 | 长度、位置、语种、风格、品牌与自偏好 |
| 不确定 | 不足以判断、需人工复核和抽检规则 |
Judge 一致不等于事实正确;多个相近模型也可能共享盲点。涉及引用,抽取具体主张与对应证据,分别核对引用存在、来源权威、时效与支持关系。
线上质量预算
技术可用性、内容质量、安全和成本分别建预算。示例:错误率阈值、每千任务严重错误、用户可纠正率、P95 完成时间、每成功任务成本。阈值由业务基线、损害与收益决定,示例数字不能直接作为行业标准。
放量条件应同时满足:关键切片质量达到约定;严重问题修复并复验;性能与成本满足约定;监控能发现漂移;回滚已演练;明确观察期与值班。用任务级质量告警解释用户影响,避免只看 API 200 和 Token 花费。
评测报告最小结构
决定与范围 → 样本/授权/版本 → 基线和候选 → 方法与评分器 → 总体和切片区间 → 严重错误 → 延迟/成本 → 无效样本与限制 → Go/No-Go 及负责人。每次修复把失败加入回归集,同时保留代表性集,以免改进趋势被集合变化掩盖。