# 公开数据与基准目录

核对日期：2026-10-03。本页登记一手公开入口和任务匹配，不复制数据全集，也不固定动态模型排名。下载前核验具体子集许可证、版本、个人信息、地域与再分发限制。

## 先定义项目数据，再参考公共基准

黄金集：来自授权真实任务，决定业务可用性。公共基准：帮助形成能力短名单和复现研究。红队数据：探索脆弱性。合成样本：补齐边界并经人工验证。四类的指标和结论分别报告。

| 一手入口 | 主要任务 | 适合的决定 | 不足与需补的项目数据 |
|---|---|---|---|
| [HELM](https://crfm.stanford.edu/helm/) | 多场景多指标语言模型评估 | 了解能力维度和评测透明度 | 自有任务、区域、成本与模型配置 |
| [MTEB](https://github.com/embeddings-benchmark/mteb) | 多语言/模态 Embedding 评测 | 检索模型短名单 | 自有文本长度、域、权限和噪声 |
| [BEIR](https://github.com/beir-cellar/beir) | 异质信息检索 | 检索泛化与基线 | 本业务知识、更新、表格与 ACL |
| [CMMLU](https://github.com/haonan-li/CMMLU) | 中文多学科理解 | 中文基础知识诊断 | 对话、检索、动作和领域任务 |
| [BFCL](https://gorilla.cs.berkeley.edu/leaderboard.html) | 函数调用与 Agentic 任务 | 工具调用候选评估 | 实际工具、权限、错误和副作用 |
| [τ-bench / τ²-bench](https://github.com/sierra-research/tau2-bench) | 工具、用户与策略交互 | 多轮端到端成功与稳定性 | 本业务政策、身份和异常流程 |
| [SWE-bench](https://www.swebench.com/) | 真实仓库问题修复 | 软件 Agent 的环境评测方法 | 自有语言、仓库、测试、审查和权限 |
| [WebArena](https://github.com/web-arena-x/webarena) | 网页任务环境 | 浏览器执行评测设计 | 真实站点、权限、变化和不可逆动作 |
| [OSWorld](https://github.com/xlang-ai/OSWorld) | 桌面多模态任务 | 计算机操作环境测试 | 实际 OS、应用、文件和授权边界 |
| [AgentDojo](https://github.com/ethz-spylab/agentdojo) | Agent 间接注入环境 | 同时观察正常效用与攻击脆弱性 | 新攻击、工具、任务和生产分布 |
| [Inspect AI](https://github.com/UKGovernmentBEIS/inspect_ai) | 评测执行框架 | 可复现 harness、评分与日志 | 它是框架，不能替代任务与参考标签 |

## 复现登记

记录仓库 commit、数据子集/版本、许可证、日期、任务数、语言、输入限制、模型/参数、工具/环境、预算、重试与评分器。报告里链接具体实验配置和结果，不只链接排行榜。

检查污染：训练接触、公开答案、提示重复、调参查看、测试泄漏和 benchmark 饱和。较高公开分数只说明在该版本和评测条件下的表现，不保证合同、医疗、金融等高影响任务的正确性。

## 收集真实项目样本

1. 定义目标总体与独立任务单位，列出切片与覆盖目标。
2. 获得采集、评测、保留和共享授权，清理敏感内容。
3. 保存输入、上下文版本、预期状态、参考、评分规则与风险。
4. 领域人员验证标签，记录分歧和无法判断。
5. 隔离开发与测试，隐藏关键测试样本。
6. 线上失败回灌回归集，并保留代表性集以观察真实趋势。

## 合成演练数据

[Agent 用例 CSV](assets/agent-test-cases.csv)提供 30 条输入条件、期望行为、环境断言与严重度，覆盖正常、攻击、超时、并发、撤权、预算和恢复。它尚未运行任何模型，`result` 留空。替换成实际系统参数和业务规则后才能使用，不能称为生产黄金集。

下一步：[数据治理](03_数据治理与知识工程.md) · [评测门禁](01_统计评测与质量门禁.md)
