# 工具与资源地图

> 基础工具地图保留原核对时点 2026-07-16；新增行业数据、规范和运营资料核对至 2026-10-03，见 [公开数据与基准](../14_行业基线/07_公开数据与基准目录.md)及 [调研记录](../research/2026-10-03-industry-update.md)。具体软件版本与价格在采用前查官方文档。本页不构成商业推荐。

## AI PM 的最小技术工作台

### 必会基础

- **表格/SQL**：能抽样、分层、算基线、检查指标口径。
- **Python + Notebook**：能调 API、处理 JSONL、批量跑评测和成本。
- **Git**：版本化 Prompt、评测集、文档和配置。
- **HTTP/JSON/OpenAPI**：能读 API 契约、鉴权、错误和速率限制。
- **原型工具**：能表现加载、流式、引用、纠错、确认、撤销和失败状态。
- **图表/白板**：服务蓝图、数据流、信任边界、依赖和决策图。

目标不是成为全栈工程师，而是能独立验证假设、检查证据并与工程协作。

## 通用开发与分析

- [Python](https://www.python.org/)：脚本、数据处理、API 原型。
- [Jupyter](https://jupyter.org/)：实验与可复现分析；不要把生产秘密写入 Notebook。
- [pandas](https://pandas.pydata.org/) / [Polars](https://pola.rs/)：表格数据处理。
- [scikit-learn](https://scikit-learn.org/)：传统 ML、指标、切分与基线。
- [PyTorch](https://pytorch.org/)：深度学习研究/训练生态。
- [Git](https://git-scm.com/)：版本控制。
- [Postman](https://www.postman.com/) 或 `curl`：API 探索。
- [OpenAPI Specification](https://spec.openapis.org/oas/latest.html)：API 契约。

## 模型与开源生态

- [Hugging Face](https://huggingface.co/)：模型、数据集和应用生态；使用前核对模型卡、许可证和数据。
- 各云/模型厂商官方控制台与文档：用统一场景集评测，不按品牌选型。
- 本地推理引擎/服务框架：适合隐私、边缘或高利用率，但需承担容量、安全和运维。

选模型时统一记录：准确/忠实/拒答、切片、安全、P95、Token、成本、版本、区域、许可、数据条款和退出。

## RAG 与搜索

类别而非必选清单：

- 文档解析/OCR：测试表格、扫描、版面、公式、代码和页码保真。
- 搜索：关键词（如 Elasticsearch/OpenSearch）与向量检索。
- 向量数据库：比较元数据过滤、租户隔离、备份、延迟、成本和迁移。
- 重排器：用自己的相关性集测 Recall@K/NDCG 与成本。
- 编排框架：[LlamaIndex](https://www.llamaindex.ai/)、[LangChain](https://www.langchain.com/) 等可加速原型；生产前评估抽象复杂度、版本锁定和可观测。

先用最简单可解释基线：解析 + 合理切块 + BM25/向量混合 + ACL + 引用。复杂 Graph RAG 或多级 Agent 需由评测增益证明。

## 评测与可观测

- [RAGAS](https://github.com/vibrantlabsai/ragas)：RAG 评测思路与工具。
- [promptfoo](https://www.promptfoo.dev/)：Prompt/模型对比与红队生态。
- [DeepEval](https://github.com/confident-ai/deepeval)：LLM 应用评测框架。
- [Arize Phoenix](https://arize.com/docs/phoenix/)：追踪、评测和观测。
- [Langfuse](https://langfuse.com/)：开源 LLM 可观测与 Prompt/评测管理。
- [MLflow](https://mlflow.org/)：实验、模型与部署生命周期。

引入任何平台前问：数据是否离开环境、谁可看原始输入、评测逻辑能否导出、模型/Prompt/索引能否复现、锁定和费用如何。

## Agent 与沙箱

- 编排框架用于定义状态、工具和流程；不要把框架自带 Demo 当安全架构。
- 工具描述采用 JSON Schema；身份、授权、额度和审计在模型外实现。
- 代码/浏览器/桌面 Agent 必须在隔离环境、测试账号和可重置状态中测试。
- 用模拟 API、虚拟机快照或事务沙箱做执行式评测。

安全参考：[MITRE ATLAS](https://atlas.mitre.org/)、[OWASP GenAI Security](https://genai.owasp.org/)、[NIST Adversarial ML](https://www.nist.gov/publications/adversarial-machine-learning-taxonomy-and-terminology-attacks-and-mitigations-0)。

## 产品、项目与知识管理

工具可替换，所需能力稳定：

- 需求/路线图：目标、证据、优先级、决策与版本。
- 项目：WBS、依赖、里程碑、资源、RAID、变更。
- 设计：流程、原型、组件、可用性反馈。
- 知识库：文档 Owner、生效/失效、权限、版本和搜索。
- 决策：ADR/Decision Log 可链接到代码、评测和发布。
- 事故：状态、时间线、沟通、行动闭环。

避免一项事实在五套工具分别维护；定义唯一来源和同步规则。

## 数据与治理资源

- [NIST AI Resource Center](https://airc.nist.gov/)：AI RMF 实施资源。
- [ISO/IEC 42001](https://www.iso.org/standard/42001)：AI 管理体系。
- [OECD.AI](https://oecd.ai/)：原则、政策和工具目录。
- [EU AI Act Service Desk](https://ai-act-service-desk.ec.europa.eu/)：欧盟官方法规浏览、时间线与问答。
- [中国网信网](https://www.cac.gov.cn/)：中国网信监管原文与公告。
- [Model Cards](https://research.google/pubs/model-cards-for-model-reporting/) / [Data Cards](https://research.google/pubs/data-cards-purposeful-and-transparent-dataset-documentation-for-responsible-ai/)：透明文档方法。

## 工具选型评分维度

| 维度 | 要问什么 |
|---|---|
| 场景适配 | 能否支持现有工作流、模态、语言和规模？ |
| 数据控制 | 区域、保留、训练、删除、加密、权限、审计？ |
| 质量 | 是否能在本方真实数据和版本上验证？ |
| 可运营 | 日志、追踪、版本、SLO、告警、回滚、导出？ |
| 集成 | API/SDK、身份、网络、配额、批处理、事件？ |
| 安全合规 | 认证、子处理者、事件、许可证、行业要求？ |
| 经济 | 三年 TCO、峰值、失败计费、人员与迁移？ |
| 退出 | 标准格式导出、替代方案、终止删除和迁移时长？ |

## 学习环境安全规则

- 不把公司/客户秘密粘贴进个人 AI 工具。
- 使用虚构、公开或已授权且脱敏的数据。
- API Key 放秘密管理/环境配置，不提交 Git 或截图。
- 给试验设预算和速率限制。
- 对 Agent 使用测试账号、最小权限和沙箱。
- 下载模型/数据检查来源、哈希、许可证和恶意代码风险。
