典 · AI PM 永乐大典

行业知识 · v2.3.0 · 资料核对 2026-10-03

AI 平台化、组织与治理

平台化的目的

AI 平台不是把所有模型放进一个门户,而是降低多个产品团队交付可信 AI 的边际成本:更快接入、更低成本、更一致评测、更少重复风险。

只有当多个真实场景重复出现相同问题时平台化。过早建设会让平台成为没有客户的内部产品。

何时值得做平台

满足多数条件:

若只有一个探索项目,先做清晰模块,不急着成立平台。

平台能力地图

模型网关

统一模型目录、版本、路由、配额、重试、缓存、成本、区域和供应商切换。

Prompt 与配置

模板、变量、评审、版本、实验、回滚、访问和秘密分离。

知识/RAG

解析、切块、Embedding、索引、ACL、来源、时效、重排和引用。

工具与 Agent

工具注册、Schema、身份委托、权限、沙箱、预算、确认、审计和补偿。

评测

数据集、Rubric、自动/人工评审、红队、回归、结果比较和门禁。

观测与运营

Trace、质量抽检、漂移、延迟、成本、政策命中、告警、事故和状态。

治理

AI 清单、风险分级、模型/系统/数据卡、审批、例外、证据和退役。

平台产品原则

Golden Path

标准路径示例:

登记场景/风险分级
 → 选择已批准模型/数据方式
 → 从模板创建应用和评测集
 → 本地/测试环境运行
 → 自动回归、安全和成本检查
 → 人工阶段门(需要时)
 → Canary/监控/回滚
 → 持续质量与治理复核

平台提供代码模板、SDK、示例和文档;每个门都说明证据和 Owner。

组织模式

中央团队

优点:标准、采购、平台和风险能力集中。缺点:离业务远、排队、成为瓶颈。

分散团队

优点:贴近用户、快速。缺点:重复、标准不一、供应商与风险失控。

联邦模式

中央提供平台、政策、专家和高风险评审;业务团队拥有场景、用户和结果。通常适合规模组织。

典型职责

团队主要责任
AI 产品/业务团队场景、用户、价值、PRD、采用、业务风险
AI 平台团队共享能力、开发者体验、SLO、成本与演进
数据/知识团队数据产品、质量、血缘、权限、更新
模型/应用科学模型、实验、评测方法和能力边界
安全/隐私/法务政策、专项控制、高风险意见和事故
AI 治理委员会风险偏好、例外、重大决定和组合监督
SRE/运营可靠性、容量、值班、恢复和运营移交

每项仍需一个最终 Accountable;“委员会负责”容易变成无人负责。

AI Center of Excellence

CoE 的有效职能:

失败模式:只发原则、不提供工具;所有项目必须排队审批;用演示数量代替业务价值;中央团队抢走场景 Owner。

Intake 与分级服务

新的 AI 需求先提交:用户、任务、数据、动作、风险、规模、价值和 Owner。

按级别路由:

服务目录写清响应时间、所需材料和升级路径,防“治理黑箱”。

平台 API 与扩展

成本与内部计费

展示(showback)比一开始强制分摊(chargeback)更容易建立行为:让团队看到按应用、客户、模型、成功任务的成本。

成熟后可分摊:

不要让内部计费鼓励团队绕过平台或关闭必要日志;成本优化必须与质量和风险护栏绑定。

平台指标

开发者结果

首次成功时间、从申请到试点、发布频率、集成工时、支持请求、自助率。

复用

活跃消费者、共享组件复用、重复系统减少、模板/评测采用。

质量与风险

回归覆盖、高风险评审周期、事故/泄漏、回滚成功、证据完整。

经济

每成功任务成本、缓存/路由节省、供应商承诺利用率、平台总拥有成本。

平台调用数不是最终成功指标;如果下游产品没有用户价值,平台高用量只是更高账单。

能力成熟度

级别特征
0 临时个人账号、无清单、无复现
1 可见统一清单、基础政策、少量试点
2 可重复标准模板、评测、版本、灰度和 Owner
3 平台化自助 Golden Path、共享服务、成本与 SLO
4 优化组合管理、自动门禁、跨场景学习、持续治理

升级依据是真实问题与证据,不为“成熟度评级”堆流程。

平台路线图评审十问

  1. 哪三个真实团队反复遇到这个问题?
  2. 标准化节省多少时间/成本或降低什么风险?
  3. 消费者为什么愿意迁移?
  4. 平台默认是否安全又足够易用?
  5. 差异如何扩展而不变成定制服务?
  6. 平台 SLO、值班和故障降级是什么?
  7. 成本如何可见并由谁承担?
  8. 平台和业务团队的 Accountable 是否清楚?
  9. 工具/模型/数据能否导出和替换?
  10. 哪个使用或价值阈值不足时停止建设?