# 模型选型与技术方案

候选比较采用质量、时延、风险和每成功任务成本的联合边界；记录模型/协议/SDK/工具版本、数据区域、弃用与变更通知、日志/证据导出和退出能力。公共基准用于短名单，实际选型使用自有冻结任务集。入口：[公开基准](../14_行业基线/07_公开数据与基准目录.md) · [成本账本](../14_行业基线/04_指标_FinOps与价值实现.md)。

## 选型的对象不是“最好模型”，而是“最好系统方案”

同一模型在不同 Prompt、检索、工具、数据、延迟和产品流程下效果差异很大。选型单位应是：

> 模型 + 上下文/RAG + 工具 + 规则 + 安全 + 体验 + 运行方案

榜单只能用于形成短名单，不能代替场景评测。

## 第一步：写约束，而非先列厂商

- 任务：分类、抽取、生成、视觉、语音、规划或执行。
- 模态、语言、领域、上下文长度和输出结构。
- 最低质量与高风险切片底线。
- P50/P95 延迟、吞吐、并发、可用性和区域。
- 单任务/每月成本上限。
- 数据是否可出域、可否被供应商保留/训练。
- 版本锁定、可解释、日志和审计需求。
- 上线周期、团队运维能力和退出期限。

## 第二步：先选系统模式

### 规则/搜索优先

答案确定、规则稳定、错误代价高且可枚举时，规则与传统检索通常更可靠便宜。

### Prompt-only

通用知识、低风险、变化小、无需严格引用的生成任务；也是最快基线。

### RAG

知识私有、更新快、需引用/权限/删除。先证明检索质量，再谈生成。

### 微调

需要稳定行为、专业输出、分类/抽取或降低长 Prompt 成本，且有足量高质量示例。不要用来承载经常更新的事实。

### 工具/工作流

实时查询、精确计算、交易和跨系统流程。让模型决定“何时用”，让确定程序负责“怎么算/怎么执行”。

### Agent

路径不可预先枚举、多步动态任务且自主性价值明显；从白名单、低风险和人工确认开始。

## 第三步：建立短名单

按硬约束先淘汰：区域/合规、模态、上下文、SLA、许可、部署方式。再选 2–4 个候选，不必评测十几个相近模型。

候选应包含：

- 当前生产/最强现实基线。
- 一个质量优先方案。
- 一个成本/延迟优先方案。
- 必要时一个可控/自托管方案。

## 第四步：同条件评测

- 使用同一冻结评测集和同一任务定义。
- 为每个模型做有限但公平的适配，记录 Prompt 与参数。
- 重复采样测方差，不只跑一次。
- 测正常、长尾、对抗、长上下文、多语言和峰值。
- 同时记录质量、延迟、成本、错误类型、拒答和安全。
- 盲评输出，减少品牌偏见。

## 模型/方案评分卡

权重根据场景设置，不建议机械照抄：

| 维度 | 参考权重 | 证据 |
|---|---:|---|
| 端到端任务质量 | 25% | 黄金集、人评、关键切片 |
| 安全与高风险底线 | 门槛项 | 红队、泄漏、越权、拒答 |
| 延迟与可靠性 | 15% | P50/P95、压测、错误率、SLA |
| 单位经济 | 15% | 每成功任务成本、三年 TCO |
| 数据/隐私/合规 | 门槛项 | DPA、保留、区域、审计、许可 |
| 可控与可运营 | 15% | 版本、日志、结构输出、回滚 |
| 集成与生态 | 10% | SDK、工具、速率、支持 |
| 供应商与退出风险 | 10% | 财务/路线、迁移、可替代性 |
| 团队能力与交付周期 | 10% | 人员、平台、PoC 到生产差距 |

门槛项未通过，不应靠其他分数抵消。

## 质量—延迟—成本 Pareto

不要强求单一总分。把候选画在质量、P95 延迟、每成功任务成本上，找不存在“所有维度都更差”的 Pareto 方案。

常见架构是模型路由：

- 小模型处理分类、改写、低风险常规任务。
- 大模型只处理复杂或高价值任务。
- 验证器或规则检查关键字段。
- 超预算/超时进入降级或人工。

路由器本身也要评测错误成本，避免省模型费却降低成功率。

## Build / Buy / Partner 决策

### Buy 优先的条件

通用能力、速度关键、差异化来自业务流程与数据、内部平台能力弱。

### Build/自托管更合理的条件

能力是核心差异、规模足以摊薄固定成本、需要强数据控制/离线、团队有长期平台能力。

### Partner

领域集成、合规认证或交付网络重要，但要防知识和能力被外包后无法接管。

三年 TCO 应含：试验、迁移、GPU/云、平台工程、值班、安全、评测、升级、停机、支持和退出，不只看 Token 单价。

## 供应商尽调问题

- 客户数据、输入输出、反馈是否用于训练？默认还是可选？
- 保留多久，备份何时删除，有哪些子处理者和区域？
- 版本是否锁定，弃用/价格/行为变更提前多久通知？
- SLA、速率、配额、峰值和灾备如何承诺？
- 安全认证、渗透测试、事件通知与审计权？
- 输出/微调模型/Embedding/日志的知识产权归属？
- 训练数据版权与模型许可有何保证和限制？
- 终止时如何导出、删除、验证删除并协助迁移？
- 能否提供系统卡、评测方法、已知限制和地区支持？

## 架构决策记录（ADR）

每个重大选择记录：背景、约束、候选、证据、决定、为什么不选其他、影响、风险、复核触发条件。

触发复核：流量跨档、法规变化、供应商变更、严重事故、质量/成本连续越线、关键能力商品化。

## 选型反模式

- 高管指定品牌后倒推证据。
- 只测平均准确率，不测最坏切片。
- 不把人工复核和重试计入成本。
- 用供应商准备的 Demo 数据。
- 把可支持最大上下文当有效上下文。
- 认为自托管天然安全、API 天然不安全；安全取决于完整控制。
- 没有退出方案与备用降级，却签长期独家。

对应模板：[模型/供应商评分卡](../06_模板工具箱/README.md#08-模型与供应商选型评分卡) · [ADR](../06_模板工具箱/README.md#09-架构决策记录-adr)
