典 · AI PM 永乐大典

行业知识 · v2.3.0 · 资料核对 2026-10-03

模型选型与技术方案

候选比较采用质量、时延、风险和每成功任务成本的联合边界;记录模型/协议/SDK/工具版本、数据区域、弃用与变更通知、日志/证据导出和退出能力。公共基准用于短名单,实际选型使用自有冻结任务集。入口:公开基准 · 成本账本。

选型的对象不是“最好模型”,而是“最好系统方案”

同一模型在不同 Prompt、检索、工具、数据、延迟和产品流程下效果差异很大。选型单位应是:

模型 + 上下文/RAG + 工具 + 规则 + 安全 + 体验 + 运行方案

榜单只能用于形成短名单,不能代替场景评测。

第一步:写约束,而非先列厂商

第二步:先选系统模式

规则/搜索优先

答案确定、规则稳定、错误代价高且可枚举时,规则与传统检索通常更可靠便宜。

Prompt-only

通用知识、低风险、变化小、无需严格引用的生成任务;也是最快基线。

RAG

知识私有、更新快、需引用/权限/删除。先证明检索质量,再谈生成。

微调

需要稳定行为、专业输出、分类/抽取或降低长 Prompt 成本,且有足量高质量示例。不要用来承载经常更新的事实。

工具/工作流

实时查询、精确计算、交易和跨系统流程。让模型决定“何时用”,让确定程序负责“怎么算/怎么执行”。

Agent

路径不可预先枚举、多步动态任务且自主性价值明显;从白名单、低风险和人工确认开始。

第三步:建立短名单

按硬约束先淘汰:区域/合规、模态、上下文、SLA、许可、部署方式。再选 2–4 个候选,不必评测十几个相近模型。

候选应包含:

第四步:同条件评测

模型/方案评分卡

权重根据场景设置,不建议机械照抄:

维度参考权重证据
端到端任务质量25%黄金集、人评、关键切片
安全与高风险底线门槛项红队、泄漏、越权、拒答
延迟与可靠性15%P50/P95、压测、错误率、SLA
单位经济15%每成功任务成本、三年 TCO
数据/隐私/合规门槛项DPA、保留、区域、审计、许可
可控与可运营15%版本、日志、结构输出、回滚
集成与生态10%SDK、工具、速率、支持
供应商与退出风险10%财务/路线、迁移、可替代性
团队能力与交付周期10%人员、平台、PoC 到生产差距

门槛项未通过,不应靠其他分数抵消。

质量—延迟—成本 Pareto

不要强求单一总分。把候选画在质量、P95 延迟、每成功任务成本上,找不存在“所有维度都更差”的 Pareto 方案。

常见架构是模型路由:

路由器本身也要评测错误成本,避免省模型费却降低成功率。

Build / Buy / Partner 决策

Buy 优先的条件

通用能力、速度关键、差异化来自业务流程与数据、内部平台能力弱。

Build/自托管更合理的条件

能力是核心差异、规模足以摊薄固定成本、需要强数据控制/离线、团队有长期平台能力。

Partner

领域集成、合规认证或交付网络重要,但要防知识和能力被外包后无法接管。

三年 TCO 应含:试验、迁移、GPU/云、平台工程、值班、安全、评测、升级、停机、支持和退出,不只看 Token 单价。

供应商尽调问题

架构决策记录(ADR)

每个重大选择记录:背景、约束、候选、证据、决定、为什么不选其他、影响、风险、复核触发条件。

触发复核:流量跨档、法规变化、供应商变更、严重事故、质量/成本连续越线、关键能力商品化。

选型反模式

对应模板:模型/供应商评分卡 · ADR