典 · AI PM 永乐大典

行业知识 · v2.3.0 · 资料核对 2026-10-03

AI Evaluation and Launch Plan

1. Decision

2. Task and risk taxonomy

SegmentFrequency/valueError impactDataset countCoverage gap

Include core, high-value, long-tail, refusal, adversarial, permission, and high-impact cases.

3. Dataset governance

4. Rubric and evaluators

DimensionDefinitionScale / passCritical failureEvaluator

5. Metrics and gates

CategoryMetricBaselineGateResultSegment / uncertainty
Task quality
Safety/privacy
Permission/tool
Latency/reliability
Cost
User/business

6. Error analysis

Error classCount/rateSeverityLayer/root causeFixRegression caseOwner

7. Security, privacy, and red-team checks

8. Operational readiness

9. Rollout stages

StageUsers/trafficDurationGatesHuman controlExpand/rollback decision

10. Decision