典 · AI PM 永乐大典

行业知识 · v2.3.0 · 资料核对 2026-10-03

论文、标准与延伸阅读

目标不是收藏最多,而是建立从“为什么”到“怎么做、怎么测、怎么管”的一手知识链。论文中的 benchmark 结果有数据、版本和实验边界,不能直接当作你的产品结论。

12 篇/份必读:最短核心路径

  1. Attention Is All You Need(2017)—— Transformer 与注意力机制起点。
  2. On the Opportunities and Risks of Foundation Models(2021)—— 基础模型能力、生态与社会风险全景。
  3. Training language models to follow instructions with human feedback(2022)—— InstructGPT,理解指令微调与 RLHF。
  4. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks(2020)—— RAG 原始范式。
  5. ReAct: Synergizing Reasoning and Acting in Language Models(2022)—— 推理与工具行动结合。
  6. Guidelines for Human-AI Interaction(CHI 2019)—— AI 体验的 18 条实证指南。
  7. Hidden Technical Debt in Machine Learning Systems(2015)—— 模型只是生产 ML 系统的一小部分。
  8. The ML Test Score(2017)—— 生产就绪的测试与监控量表。
  9. HELM: Holistic Evaluation of Language Models(2022)—— 多场景、多指标、透明评测。
  10. AI Agents That Matter(2024)—— Agent 评测同时看成本、可复现和过拟合。
  11. NIST AI Risk Management Framework 1.0(2023)及 GenAI Profile(2024)—— 治理、映射、测量、管理风险。
  12. Model Cards for Model Reporting(2019)—— 模型适用性、性能和限制的标准化记录。

阅读方法

每篇只需先回答:

读摘要、图 1、方法概览、结果表、限制,再决定是否精读。把论文加入项目方案时记录版本、适用条件和验证计划,不写“论文证明该方法一定更好”。

A. 机器学习与基础模型

产品问题:更大模型是否真提高你的每成功任务价值?平均能力能否覆盖关键切片?

B. 指令、对齐与高效适配

产品问题:你要改变的是知识、格式、风格、策略还是根本能力?偏好数据代表谁的价值?

C. Prompt 与推理方法

产品问题:额外推理带来的质量是否覆盖延迟/成本?外显推理是否泄露敏感信息或造成过度信任?

D. 检索增强生成 RAG

产品问题:资料是否进库、能否按权限取回、是否新鲜、答案是否真的受引用支持?

E. Agent、工具与真实环境

产品问题:为何不能用确定 Workflow?每个工具权限、确认、预算、幂等、停止和恢复是什么?

F. 评测与 benchmark

产品问题:公共 benchmark 与真实用户任务的重合有多大?指标是否会被风格、污染和反复调参操纵?

G. 安全、偏差、数据与责任

产品问题:谁被数据遗漏或伤害?人类监督是否真正有能力干预?安全是否依赖模型“听话”?

H. 工程化、组织与人机协作

I. 标准、法规与实务框架

2026-10-03 更新:正式法律/标准、动态工程规范与草案应分别记录。新增 ISO 42005 影响评估、42119-2 测试、5259 数据质量、12792 透明、20226 环境影响、OWASP 2026、MCP 2026-07-28、OpenTelemetry 与 FinOps 等入口及状态见 一手资料调研。NIST TEVV-Athlon 截止此日仍为初始草案,不能写成强制标准。公共能力数据见 基准目录。

书籍:方法论补全

产品与发现

AI 与商业

系统与交付

30 天论文学习计划

每周输出一页“结论—边界—产品影响—复现实验”,不要只写摘抄。

持续追踪而不被热点淹没