行业知识 · v2.3.0 · 资料核对 2026-10-03
公开数据与基准目录
核对日期:2026-10-03。本页登记一手公开入口和任务匹配,不复制数据全集,也不固定动态模型排名。下载前核验具体子集许可证、版本、个人信息、地域与再分发限制。
先定义项目数据,再参考公共基准
黄金集:来自授权真实任务,决定业务可用性。公共基准:帮助形成能力短名单和复现研究。红队数据:探索脆弱性。合成样本:补齐边界并经人工验证。四类的指标和结论分别报告。
| 一手入口 | 主要任务 | 适合的决定 | 不足与需补的项目数据 |
|---|---|---|---|
| HELM | 多场景多指标语言模型评估 | 了解能力维度和评测透明度 | 自有任务、区域、成本与模型配置 |
| MTEB | 多语言/模态 Embedding 评测 | 检索模型短名单 | 自有文本长度、域、权限和噪声 |
| BEIR | 异质信息检索 | 检索泛化与基线 | 本业务知识、更新、表格与 ACL |
| CMMLU | 中文多学科理解 | 中文基础知识诊断 | 对话、检索、动作和领域任务 |
| BFCL | 函数调用与 Agentic 任务 | 工具调用候选评估 | 实际工具、权限、错误和副作用 |
| τ-bench / τ²-bench | 工具、用户与策略交互 | 多轮端到端成功与稳定性 | 本业务政策、身份和异常流程 |
| SWE-bench | 真实仓库问题修复 | 软件 Agent 的环境评测方法 | 自有语言、仓库、测试、审查和权限 |
| WebArena | 网页任务环境 | 浏览器执行评测设计 | 真实站点、权限、变化和不可逆动作 |
| OSWorld | 桌面多模态任务 | 计算机操作环境测试 | 实际 OS、应用、文件和授权边界 |
| AgentDojo | Agent 间接注入环境 | 同时观察正常效用与攻击脆弱性 | 新攻击、工具、任务和生产分布 |
| Inspect AI | 评测执行框架 | 可复现 harness、评分与日志 | 它是框架,不能替代任务与参考标签 |
复现登记
记录仓库 commit、数据子集/版本、许可证、日期、任务数、语言、输入限制、模型/参数、工具/环境、预算、重试与评分器。报告里链接具体实验配置和结果,不只链接排行榜。
检查污染:训练接触、公开答案、提示重复、调参查看、测试泄漏和 benchmark 饱和。较高公开分数只说明在该版本和评测条件下的表现,不保证合同、医疗、金融等高影响任务的正确性。
收集真实项目样本
- 定义目标总体与独立任务单位,列出切片与覆盖目标。
- 获得采集、评测、保留和共享授权,清理敏感内容。
- 保存输入、上下文版本、预期状态、参考、评分规则与风险。
- 领域人员验证标签,记录分歧和无法判断。
- 隔离开发与测试,隐藏关键测试样本。
- 线上失败回灌回归集,并保留代表性集以观察真实趋势。
合成演练数据
Agent 用例 CSV提供 30 条输入条件、期望行为、环境断言与严重度,覆盖正常、攻击、超时、并发、撤权、预算和恢复。它尚未运行任何模型,result 留空。替换成实际系统参数和业务规则后才能使用,不能称为生产黄金集。