典 · AI PM 永乐大典

行业知识 · v2.3.0 · 资料核对 2026-10-03

公开数据与基准目录

核对日期:2026-10-03。本页登记一手公开入口和任务匹配,不复制数据全集,也不固定动态模型排名。下载前核验具体子集许可证、版本、个人信息、地域与再分发限制。

先定义项目数据,再参考公共基准

黄金集:来自授权真实任务,决定业务可用性。公共基准:帮助形成能力短名单和复现研究。红队数据:探索脆弱性。合成样本:补齐边界并经人工验证。四类的指标和结论分别报告。

一手入口主要任务适合的决定不足与需补的项目数据
HELM多场景多指标语言模型评估了解能力维度和评测透明度自有任务、区域、成本与模型配置
MTEB多语言/模态 Embedding 评测检索模型短名单自有文本长度、域、权限和噪声
BEIR异质信息检索检索泛化与基线本业务知识、更新、表格与 ACL
CMMLU中文多学科理解中文基础知识诊断对话、检索、动作和领域任务
BFCL函数调用与 Agentic 任务工具调用候选评估实际工具、权限、错误和副作用
τ-bench / τ²-bench工具、用户与策略交互多轮端到端成功与稳定性本业务政策、身份和异常流程
SWE-bench真实仓库问题修复软件 Agent 的环境评测方法自有语言、仓库、测试、审查和权限
WebArena网页任务环境浏览器执行评测设计真实站点、权限、变化和不可逆动作
OSWorld桌面多模态任务计算机操作环境测试实际 OS、应用、文件和授权边界
AgentDojoAgent 间接注入环境同时观察正常效用与攻击脆弱性新攻击、工具、任务和生产分布
Inspect AI评测执行框架可复现 harness、评分与日志它是框架,不能替代任务与参考标签

复现登记

记录仓库 commit、数据子集/版本、许可证、日期、任务数、语言、输入限制、模型/参数、工具/环境、预算、重试与评分器。报告里链接具体实验配置和结果,不只链接排行榜。

检查污染:训练接触、公开答案、提示重复、调参查看、测试泄漏和 benchmark 饱和。较高公开分数只说明在该版本和评测条件下的表现,不保证合同、医疗、金融等高影响任务的正确性。

收集真实项目样本

  1. 定义目标总体与独立任务单位,列出切片与覆盖目标。
  2. 获得采集、评测、保留和共享授权,清理敏感内容。
  3. 保存输入、上下文版本、预期状态、参考、评分规则与风险。
  4. 领域人员验证标签,记录分歧和无法判断。
  5. 隔离开发与测试,隐藏关键测试样本。
  6. 线上失败回灌回归集,并保留代表性集以观察真实趋势。

合成演练数据

Agent 用例 CSV提供 30 条输入条件、期望行为、环境断言与严重度,覆盖正常、攻击、超时、并发、撤权、预算和恢复。它尚未运行任何模型,result 留空。替换成实际系统参数和业务规则后才能使用,不能称为生产黄金集。

下一步:数据治理 · 评测门禁