行业知识 · v2.3.0 · 资料核对 2026-10-03
工具与资源地图
基础工具地图保留原核对时点 2026-07-16;新增行业数据、规范和运营资料核对至 2026-10-03,见 公开数据与基准及 调研记录。具体软件版本与价格在采用前查官方文档。本页不构成商业推荐。
AI PM 的最小技术工作台
必会基础
- 表格/SQL:能抽样、分层、算基线、检查指标口径。
- Python + Notebook:能调 API、处理 JSONL、批量跑评测和成本。
- Git:版本化 Prompt、评测集、文档和配置。
- HTTP/JSON/OpenAPI:能读 API 契约、鉴权、错误和速率限制。
- 原型工具:能表现加载、流式、引用、纠错、确认、撤销和失败状态。
- 图表/白板:服务蓝图、数据流、信任边界、依赖和决策图。
目标不是成为全栈工程师,而是能独立验证假设、检查证据并与工程协作。
通用开发与分析
- Python:脚本、数据处理、API 原型。
- Jupyter:实验与可复现分析;不要把生产秘密写入 Notebook。
- pandas / Polars:表格数据处理。
- scikit-learn:传统 ML、指标、切分与基线。
- PyTorch:深度学习研究/训练生态。
- Git:版本控制。
- Postman 或
curl:API 探索。 - OpenAPI Specification:API 契约。
模型与开源生态
- Hugging Face:模型、数据集和应用生态;使用前核对模型卡、许可证和数据。
- 各云/模型厂商官方控制台与文档:用统一场景集评测,不按品牌选型。
- 本地推理引擎/服务框架:适合隐私、边缘或高利用率,但需承担容量、安全和运维。
选模型时统一记录:准确/忠实/拒答、切片、安全、P95、Token、成本、版本、区域、许可、数据条款和退出。
RAG 与搜索
类别而非必选清单:
- 文档解析/OCR:测试表格、扫描、版面、公式、代码和页码保真。
- 搜索:关键词(如 Elasticsearch/OpenSearch)与向量检索。
- 向量数据库:比较元数据过滤、租户隔离、备份、延迟、成本和迁移。
- 重排器:用自己的相关性集测 Recall@K/NDCG 与成本。
- 编排框架:LlamaIndex、LangChain 等可加速原型;生产前评估抽象复杂度、版本锁定和可观测。
先用最简单可解释基线:解析 + 合理切块 + BM25/向量混合 + ACL + 引用。复杂 Graph RAG 或多级 Agent 需由评测增益证明。
评测与可观测
- RAGAS:RAG 评测思路与工具。
- promptfoo:Prompt/模型对比与红队生态。
- DeepEval:LLM 应用评测框架。
- Arize Phoenix:追踪、评测和观测。
- Langfuse:开源 LLM 可观测与 Prompt/评测管理。
- MLflow:实验、模型与部署生命周期。
引入任何平台前问:数据是否离开环境、谁可看原始输入、评测逻辑能否导出、模型/Prompt/索引能否复现、锁定和费用如何。
Agent 与沙箱
- 编排框架用于定义状态、工具和流程;不要把框架自带 Demo 当安全架构。
- 工具描述采用 JSON Schema;身份、授权、额度和审计在模型外实现。
- 代码/浏览器/桌面 Agent 必须在隔离环境、测试账号和可重置状态中测试。
- 用模拟 API、虚拟机快照或事务沙箱做执行式评测。
安全参考:MITRE ATLAS、OWASP GenAI Security、NIST Adversarial ML。
产品、项目与知识管理
工具可替换,所需能力稳定:
- 需求/路线图:目标、证据、优先级、决策与版本。
- 项目:WBS、依赖、里程碑、资源、RAID、变更。
- 设计:流程、原型、组件、可用性反馈。
- 知识库:文档 Owner、生效/失效、权限、版本和搜索。
- 决策:ADR/Decision Log 可链接到代码、评测和发布。
- 事故:状态、时间线、沟通、行动闭环。
避免一项事实在五套工具分别维护;定义唯一来源和同步规则。
数据与治理资源
- NIST AI Resource Center:AI RMF 实施资源。
- ISO/IEC 42001:AI 管理体系。
- OECD.AI:原则、政策和工具目录。
- EU AI Act Service Desk:欧盟官方法规浏览、时间线与问答。
- 中国网信网:中国网信监管原文与公告。
- Model Cards / Data Cards:透明文档方法。
工具选型评分维度
| 维度 | 要问什么 |
|---|---|
| 场景适配 | 能否支持现有工作流、模态、语言和规模? |
| 数据控制 | 区域、保留、训练、删除、加密、权限、审计? |
| 质量 | 是否能在本方真实数据和版本上验证? |
| 可运营 | 日志、追踪、版本、SLO、告警、回滚、导出? |
| 集成 | API/SDK、身份、网络、配额、批处理、事件? |
| 安全合规 | 认证、子处理者、事件、许可证、行业要求? |
| 经济 | 三年 TCO、峰值、失败计费、人员与迁移? |
| 退出 | 标准格式导出、替代方案、终止删除和迁移时长? |
学习环境安全规则
- 不把公司/客户秘密粘贴进个人 AI 工具。
- 使用虚构、公开或已授权且脱敏的数据。
- API Key 放秘密管理/环境配置,不提交 Git 或截图。
- 给试验设预算和速率限制。
- 对 Agent 使用测试账号、最小权限和沙箱。
- 下载模型/数据检查来源、哈希、许可证和恶意代码风险。