# AI 平台化、组织与治理

## 平台化的目的

AI 平台不是把所有模型放进一个门户，而是降低多个产品团队交付可信 AI 的边际成本：更快接入、更低成本、更一致评测、更少重复风险。

只有当多个真实场景重复出现相同问题时平台化。过早建设会让平台成为没有客户的内部产品。

## 何时值得做平台

满足多数条件：

- 多个稳定场景/团队需要相似能力；数量是经验信号，不是固定门槛。
- 重复建设模型接入、RAG、评测、身份、观测或治理。
- 标准化能显著缩短上市或审计时间。
- 有专门平台团队和长期运营预算。
- 消费团队愿意迁移，平台能给出清晰 SLO。
- 共性稳定，差异可以扩展而非大量定制。

若只有一个探索项目，先做清晰模块，不急着成立平台。

## 平台能力地图

### 模型网关

统一模型目录、版本、路由、配额、重试、缓存、成本、区域和供应商切换。

### Prompt 与配置

模板、变量、评审、版本、实验、回滚、访问和秘密分离。

### 知识/RAG

解析、切块、Embedding、索引、ACL、来源、时效、重排和引用。

### 工具与 Agent

工具注册、Schema、身份委托、权限、沙箱、预算、确认、审计和补偿。

### 评测

数据集、Rubric、自动/人工评审、红队、回归、结果比较和门禁。

### 观测与运营

Trace、质量抽检、漂移、延迟、成本、政策命中、告警、事故和状态。

### 治理

AI 清单、风险分级、模型/系统/数据卡、审批、例外、证据和退役。

## 平台产品原则

- 把内部开发者当用户：研究任务、痛点、首次成功时间和支持负担。
- 提供“铺好路的安全默认”，允许受控扩展。
- 自助不等于无治理；常规低风险自动化，高风险进入明确评审。
- 抽象层不能隐藏关键模型差异和错误。
- 所有关键产物可导出，避免平台自身成为不可退出锁定。

## Golden Path

标准路径示例：

```text
登记场景/风险分级
 → 选择已批准模型/数据方式
 → 从模板创建应用和评测集
 → 本地/测试环境运行
 → 自动回归、安全和成本检查
 → 人工阶段门（需要时）
 → Canary/监控/回滚
 → 持续质量与治理复核
```

平台提供代码模板、SDK、示例和文档；每个门都说明证据和 Owner。

## 组织模式

### 中央团队

优点：标准、采购、平台和风险能力集中。缺点：离业务远、排队、成为瓶颈。

### 分散团队

优点：贴近用户、快速。缺点：重复、标准不一、供应商与风险失控。

### 联邦模式

中央提供平台、政策、专家和高风险评审；业务团队拥有场景、用户和结果。通常适合规模组织。

## 典型职责

| 团队 | 主要责任 |
|---|---|
| AI 产品/业务团队 | 场景、用户、价值、PRD、采用、业务风险 |
| AI 平台团队 | 共享能力、开发者体验、SLO、成本与演进 |
| 数据/知识团队 | 数据产品、质量、血缘、权限、更新 |
| 模型/应用科学 | 模型、实验、评测方法和能力边界 |
| 安全/隐私/法务 | 政策、专项控制、高风险意见和事故 |
| AI 治理委员会 | 风险偏好、例外、重大决定和组合监督 |
| SRE/运营 | 可靠性、容量、值班、恢复和运营移交 |

每项仍需一个最终 Accountable；“委员会负责”容易变成无人负责。

## AI Center of Excellence

CoE 的有效职能：

- 提供方法、模板、培训、专家咨询和社区。
- 运营模型/供应商目录和共享评测。
- 识别跨团队复用和风险趋势。
- 帮助业务团队建立能力，而非长期替他们交付。

失败模式：只发原则、不提供工具；所有项目必须排队审批；用演示数量代替业务价值；中央团队抢走场景 Owner。

## Intake 与分级服务

新的 AI 需求先提交：用户、任务、数据、动作、风险、规模、价值和 Owner。

按级别路由：

- 低风险常规：使用批准模板和自动门禁，自助上线。
- 中风险：平台/安全咨询和指定证据评审。
- 高风险：跨职能评估、独立测试、明确签字和持续监督。
- 禁止：拒绝或重新设计。

服务目录写清响应时间、所需材料和升级路径，防“治理黑箱”。

## 平台 API 与扩展

- 稳定契约、语义版本、弃用期和迁移指南。
- 租户、身份、权限和配额为一等概念。
- 可插拔模型/检索/评测，但保持统一 Trace 和证据。
- 扩展点有沙箱、审查和最小权限。
- 平台失败有降级，不成为所有 AI 产品单点故障。

## 成本与内部计费

展示（showback）比一开始强制分摊（chargeback）更容易建立行为：让团队看到按应用、客户、模型、成功任务的成本。

成熟后可分摊：

- 固定平台成本按组织/席位/基础配额。
- 变动成本按任务或资源。
- 公共治理/创新能力由中央投资。

不要让内部计费鼓励团队绕过平台或关闭必要日志；成本优化必须与质量和风险护栏绑定。

## 平台指标

### 开发者结果

首次成功时间、从申请到试点、发布频率、集成工时、支持请求、自助率。

### 复用

活跃消费者、共享组件复用、重复系统减少、模板/评测采用。

### 质量与风险

回归覆盖、高风险评审周期、事故/泄漏、回滚成功、证据完整。

### 经济

每成功任务成本、缓存/路由节省、供应商承诺利用率、平台总拥有成本。

平台调用数不是最终成功指标；如果下游产品没有用户价值，平台高用量只是更高账单。

## 能力成熟度

| 级别 | 特征 |
|---|---|
| 0 临时 | 个人账号、无清单、无复现 |
| 1 可见 | 统一清单、基础政策、少量试点 |
| 2 可重复 | 标准模板、评测、版本、灰度和 Owner |
| 3 平台化 | 自助 Golden Path、共享服务、成本与 SLO |
| 4 优化 | 组合管理、自动门禁、跨场景学习、持续治理 |

升级依据是真实问题与证据，不为“成熟度评级”堆流程。

## 平台路线图评审十问

1. 哪三个真实团队反复遇到这个问题？
2. 标准化节省多少时间/成本或降低什么风险？
3. 消费者为什么愿意迁移？
4. 平台默认是否安全又足够易用？
5. 差异如何扩展而不变成定制服务？
6. 平台 SLO、值班和故障降级是什么？
7. 成本如何可见并由谁承担？
8. 平台和业务团队的 Accountable 是否清楚？
9. 工具/模型/数据能否导出和替换？
10. 哪个使用或价值阈值不足时停止建设？
