# 论文、标准与延伸阅读

> 目标不是收藏最多，而是建立从“为什么”到“怎么做、怎么测、怎么管”的一手知识链。论文中的 benchmark 结果有数据、版本和实验边界，不能直接当作你的产品结论。

## 12 篇/份必读：最短核心路径

1. [Attention Is All You Need](https://arxiv.org/abs/1706.03762)（2017）—— Transformer 与注意力机制起点。
2. [On the Opportunities and Risks of Foundation Models](https://arxiv.org/abs/2108.07258)（2021）—— 基础模型能力、生态与社会风险全景。
3. [Training language models to follow instructions with human feedback](https://arxiv.org/abs/2203.02155)（2022）—— InstructGPT，理解指令微调与 RLHF。
4. [Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks](https://arxiv.org/abs/2005.11401)（2020）—— RAG 原始范式。
5. [ReAct: Synergizing Reasoning and Acting in Language Models](https://arxiv.org/abs/2210.03629)（2022）—— 推理与工具行动结合。
6. [Guidelines for Human-AI Interaction](https://www.microsoft.com/en-us/research/publication/guidelines-for-human-ai-interaction/)（CHI 2019）—— AI 体验的 18 条实证指南。
7. [Hidden Technical Debt in Machine Learning Systems](https://research.google/pubs/hidden-technical-debt-in-machine-learning-systems/)（2015）—— 模型只是生产 ML 系统的一小部分。
8. [The ML Test Score](https://research.google/pubs/the-ml-test-score-a-rubric-for-ml-production-readiness-and-technical-debt-reduction/)（2017）—— 生产就绪的测试与监控量表。
9. [HELM: Holistic Evaluation of Language Models](https://arxiv.org/abs/2211.09110)（2022）—— 多场景、多指标、透明评测。
10. [AI Agents That Matter](https://arxiv.org/abs/2407.01502)（2024）—— Agent 评测同时看成本、可复现和过拟合。
11. [NIST AI Risk Management Framework 1.0](https://www.nist.gov/itl/ai-risk-management-framework)（2023）及 [GenAI Profile](https://www.nist.gov/publications/artificial-intelligence-risk-management-framework-generative-artificial-intelligence)（2024）—— 治理、映射、测量、管理风险。
12. [Model Cards for Model Reporting](https://research.google/pubs/model-cards-for-model-reporting/)（2019）—— 模型适用性、性能和限制的标准化记录。

## 阅读方法

每篇只需先回答：

- 它要解决什么问题，之前的基线是什么？
- 数据、任务、指标和实验设置是什么？
- 结论在哪些条件下成立，哪些没证明？
- 对产品的场景、架构、评测或风险决策有什么影响？
- 能否用自己的数据做一个最小复现/反证？

读摘要、图 1、方法概览、结果表、限制，再决定是否精读。把论文加入项目方案时记录版本、适用条件和验证计划，不写“论文证明该方法一定更好”。

## A. 机器学习与基础模型

- [Deep Learning](https://www.nature.com/articles/nature14539)（LeCun, Bengio, Hinton, 2015）—— 深度学习综述性奠基文章。
- [Attention Is All You Need](https://arxiv.org/abs/1706.03762)（Vaswani et al., 2017）—— Transformer。
- [BERT](https://arxiv.org/abs/1810.04805)（Devlin et al., 2018）—— 双向预训练语言表示。
- [Language Models are Few-Shot Learners](https://arxiv.org/abs/2005.14165)（Brown et al., 2020）—— 规模与上下文学习。
- [Scaling Laws for Neural Language Models](https://arxiv.org/abs/2001.08361)（Kaplan et al., 2020）—— 参数、数据与计算的经验规律。
- [Training Compute-Optimal Large Language Models](https://arxiv.org/abs/2203.15556)（Hoffmann et al., 2022）—— Chinchilla，强调数据与计算的配比。
- [On the Opportunities and Risks of Foundation Models](https://arxiv.org/abs/2108.07258)（Bommasani et al., 2021）—— 基础模型报告。
- [Emergent Abilities of Large Language Models](https://arxiv.org/abs/2206.07682)（Wei et al., 2022）—— 规模增长中的能力现象；阅读时同时保持对指标离散化的批判。
- [On Calibration of Modern Neural Networks](https://arxiv.org/abs/1706.04599)（Guo et al., 2017）—— 为什么预测概率需要校准。

产品问题：更大模型是否真提高你的每成功任务价值？平均能力能否覆盖关键切片？

## B. 指令、对齐与高效适配

- [Training language models to follow instructions with human feedback](https://arxiv.org/abs/2203.02155)（Ouyang et al., 2022）—— SFT、偏好数据与 RLHF。
- [Constitutional AI: Harmlessness from AI Feedback](https://arxiv.org/abs/2212.08073)（Bai et al., 2022）—— 用显式原则和 AI 反馈进行对齐。
- [Direct Preference Optimization](https://arxiv.org/abs/2305.18290)（Rafailov et al., 2023）—— 直接偏好优化。
- [LoRA: Low-Rank Adaptation of Large Language Models](https://arxiv.org/abs/2106.09685)（Hu et al., 2021）—— 参数高效微调。
- [QLoRA](https://arxiv.org/abs/2305.14314)（Dettmers et al., 2023）—— 量化与高效微调。
- [The Instruction Hierarchy](https://arxiv.org/abs/2404.13208)（Wallace et al., 2024）—— 训练模型区分高低权限指令，理解 Prompt Injection 防御的一层而非全部。

产品问题：你要改变的是知识、格式、风格、策略还是根本能力？偏好数据代表谁的价值？

## C. Prompt 与推理方法

- [Pre-train, Prompt, and Predict](https://arxiv.org/abs/2107.13586)（Liu et al., 2021）—— 提示方法综述。
- [Chain-of-Thought Prompting](https://arxiv.org/abs/2201.11903)（Wei et al., 2022）—— 中间推理步骤提示。
- [Self-Consistency Improves Chain of Thought Reasoning](https://arxiv.org/abs/2203.11171)（Wang et al., 2022）—— 多路径采样与一致答案。
- [Least-to-Most Prompting](https://arxiv.org/abs/2205.10625)（Zhou et al., 2022）—— 由简到繁分解问题。
- [Tree of Thoughts](https://arxiv.org/abs/2305.10601)（Yao et al., 2023）—— 搜索多个推理分支。
- [DSPy](https://arxiv.org/abs/2310.03714)（Khattab et al., 2023）—— 把 LM 调用声明化并优化 Prompt/模块。

产品问题：额外推理带来的质量是否覆盖延迟/成本？外显推理是否泄露敏感信息或造成过度信任？

## D. 检索增强生成 RAG

- [REALM](https://arxiv.org/abs/2002.08909)（Guu et al., 2020）—— 检索增强预训练。
- [Dense Passage Retrieval](https://arxiv.org/abs/2004.04906)（Karpukhin et al., 2020）—— 稠密段落检索。
- [Retrieval-Augmented Generation](https://arxiv.org/abs/2005.11401)（Lewis et al., 2020）—— RAG 起点。
- [RETRO](https://arxiv.org/abs/2112.04426)（Borgeaud et al., 2021）—— 从大规模语料检索增强语言模型。
- [Self-RAG](https://arxiv.org/abs/2310.11511)（Asai et al., 2023）—— 自适应检索与反思 Token。
- [Corrective Retrieval Augmented Generation](https://arxiv.org/abs/2401.15884)（Yan et al., 2024）—— 检索质量评估与纠正。
- [Retrieval-Augmented Generation for Large Language Models: A Survey](https://arxiv.org/abs/2312.10997)（Gao et al., 2023）—— Naive/Advanced/Modular RAG 全景。
- [RAGAS](https://arxiv.org/abs/2309.15217)（Es et al., 2023）—— RAG 自动评测维度。
- [ARES](https://arxiv.org/abs/2311.09476)（Saad-Falcon et al., 2023）—— 合成训练与少量人工校准的 RAG 评测。
- [Evaluation of RAG: A Survey](https://arxiv.org/abs/2405.07437)（Yu et al., 2024）—— 检索与生成评测梳理。

产品问题：资料是否进库、能否按权限取回、是否新鲜、答案是否真的受引用支持？

## E. Agent、工具与真实环境

- [ReAct](https://arxiv.org/abs/2210.03629)（Yao et al., 2022）—— 推理与行动交替。
- [Toolformer](https://arxiv.org/abs/2302.04761)（Schick et al., 2023）—— 自监督学习工具使用。
- [Reflexion](https://arxiv.org/abs/2303.11366)（Shinn et al., 2023）—— 用语言反馈改善后续尝试。
- [Generative Agents](https://arxiv.org/abs/2304.03442)（Park et al., 2023）—— 记忆、反思和计划的交互代理。
- [AutoGen](https://arxiv.org/abs/2308.08155)（Wu et al., 2023）—— 多 Agent 会话框架。
- [AgentBench](https://arxiv.org/abs/2308.03688)（Liu et al., 2023）—— 多环境 Agent benchmark。
- [WebArena](https://arxiv.org/abs/2307.13854)（Zhou et al., 2023）—— 真实感网页环境评测。
- [SWE-bench](https://arxiv.org/abs/2310.06770)（Jimenez et al., 2023）—— 用真实 GitHub 问题评软件工程 Agent。
- [OSWorld](https://arxiv.org/abs/2404.07972)（Xie et al., 2024）—— 真实计算机环境多模态 Agent。
- [AI Agents That Matter](https://arxiv.org/abs/2407.01502)（Kapoor et al., 2024）—— 成本、holdout、标准化和可复现。

产品问题：为何不能用确定 Workflow？每个工具权限、确认、预算、幂等、停止和恢复是什么？

## F. 评测与 benchmark

- [Measuring Massive Multitask Language Understanding / MMLU](https://arxiv.org/abs/2009.03300)（Hendrycks et al., 2020）—— 多学科知识 benchmark。
- [TruthfulQA](https://arxiv.org/abs/2109.07958)（Lin et al., 2021）—— 模型是否模仿常见错误观念。
- [BIG-bench](https://arxiv.org/abs/2206.04615)（Srivastava et al., 2022）—— 大规模多任务协作 benchmark。
- [HELM](https://arxiv.org/abs/2211.09110)（Liang et al., 2022）—— 全面、透明、多指标评估。
- [Judging LLM-as-a-Judge / MT-Bench](https://arxiv.org/abs/2306.05685)（Zheng et al., 2023）—— LLM 评审能力与偏差。
- [IFEval](https://arxiv.org/abs/2311.07911)（Zhou et al., 2023）—— 可验证指令遵循。
- [Chatbot Arena](https://arxiv.org/abs/2403.04132)（Chiang et al., 2024）—— 大规模人类成对偏好评测。
- [Large Language Models Often Know When They Are Being Evaluated](https://arxiv.org/abs/2505.23836)（Needham et al., 2025）—— 评测环境与真实部署差异的新风险。

产品问题：公共 benchmark 与真实用户任务的重合有多大？指标是否会被风格、污染和反复调参操纵？

## G. 安全、偏差、数据与责任

- [Datasheets for Datasets](https://arxiv.org/abs/1803.09010)（Gebru et al., 2018）—— 数据集标准化文档。
- [Model Cards for Model Reporting](https://arxiv.org/abs/1810.03993)（Mitchell et al., 2018）—— 模型报告框架。
- [Stochastic Parrots](https://dl.acm.org/doi/10.1145/3442188.3445922)（Bender et al., 2021）—— 大模型规模、数据、环境与社会风险批判。
- [Data Cascades in High-Stakes AI](https://research.google/pubs/everyone-wants-to-do-the-model-work-not-the-data-work-data-cascades-in-high-stakes-ai/)（Sambasivan et al., 2021）—— 数据问题如何累积成下游伤害。
- [Red Teaming Language Models with Language Models](https://arxiv.org/abs/2202.03286)（Perez et al., 2022）—— 自动生成红队测试。
- [Indirect Prompt Injection](https://arxiv.org/abs/2302.12173)（Greshake et al., 2023）—— 外部内容劫持 LLM 应用。
- [Universal and Transferable Adversarial Attacks on Aligned Language Models](https://arxiv.org/abs/2307.15043)（Zou et al., 2023）—— 自动后缀越狱攻击。
- [Algorithm Aversion](https://doi.org/10.1037/xge0000033)（Dietvorst et al., 2015）—— 人在看到算法犯错后可能过度排斥。
- [Guidelines for Human-AI Interaction](https://doi.org/10.1145/3290605.3300233)（Amershi et al., 2019）—— 能力告知、交互、纠错与长期适应。

产品问题：谁被数据遗漏或伤害？人类监督是否真正有能力干预？安全是否依赖模型“听话”？

## H. 工程化、组织与人机协作

- [Hidden Technical Debt in Machine Learning Systems](https://research.google/pubs/hidden-technical-debt-in-machine-learning-systems/)（Sculley et al., 2015）—— 数据依赖、反馈回路、配置与系统债务。
- [The ML Test Score](https://research.google/pubs/the-ml-test-score-a-rubric-for-ml-production-readiness-and-technical-debt-reduction/)（Breck et al., 2017）—— 28 类生产测试/监控需求。
- [Rules of Machine Learning](https://developers.google.com/machine-learning/guides/rules-of-ml)（Google）—— 从启发式到生产 ML 的工程经验。
- [People + AI Guidebook](https://pair.withgoogle.com/guidebook-v2/)（Google PAIR）—— 用户需求、数据、心智模型、解释、控制和失败。
- [A Comparative Analysis of Industry Human-AI Interaction Guidelines](https://arxiv.org/abs/2010.11761)（2020）—— 对 Microsoft、Google、Apple 的行业指南进行归纳比较。

## I. 标准、法规与实务框架

2026-10-03 更新：正式法律/标准、动态工程规范与草案应分别记录。新增 ISO 42005 影响评估、42119-2 测试、5259 数据质量、12792 透明、20226 环境影响、OWASP 2026、MCP 2026-07-28、OpenTelemetry 与 FinOps 等入口及状态见 [一手资料调研](../research/2026-10-03-industry-update.md)。NIST TEVV-Athlon 截止此日仍为初始草案，不能写成强制标准。公共能力数据见 [基准目录](../14_行业基线/07_公开数据与基准目录.md)。

- [NIST AI RMF](https://www.nist.gov/itl/ai-risk-management-framework) 与 [Playbook](https://www.nist.gov/itl/ai-risk-management-framework/nist-ai-rmf-playbook)。
- [NIST GenAI Profile](https://doi.org/10.6028/NIST.AI.600-1)。
- [NIST Adversarial ML Taxonomy 2025](https://doi.org/10.6028/NIST.AI.100-2e2025)。
- [ISO/IEC 42001:2023](https://www.iso.org/standard/42001)—— AI 管理体系。
- [OECD AI Principles](https://oecd.ai/en/ai-principles)—— 人权、公平、透明、安全、问责等国际原则。
- [MITRE ATLAS](https://atlas.mitre.org/)—— AI 攻击技战术知识库。
- [OWASP GenAI Security](https://genai.owasp.org/)—— LLM/GenAI 应用安全实践。
- [EU AI Act 原文](https://eur-lex.europa.eu/eli/reg/2024/1689/oj/eng) 与 [官方实施页](https://digital-strategy.ec.europa.eu/en/policies/regulatory-framework-ai)。
- 中国监管入口见本库 [安全合规伦理](../05_安全合规伦理/README.md#中国大陆重点监管地图)。
- [PMI AI 项目组合、项目集与项目管理标准](https://www.pmi.org/standards/artificial-intelligence)、[PMI PMBOK](https://www.pmi.org/standards/pmbok) 与 [Scrum Guide](https://scrumguides.org/scrum-guide.html)——AI 项目治理、项目原则与敏捷框架。

## 书籍：方法论补全

### 产品与发现

- Marty Cagan, *Inspired* —— 产品团队、发现与交付。
- Melissa Perri, *Escaping the Build Trap* —— 从产出转向结果。
- Teresa Torres, *Continuous Discovery Habits* —— 持续发现和机会树。
- Eric Ries, *The Lean Startup* —— 假设、实验、经验证学习。
- Alberto Savoia, *The Right It* —— 先验证“该不该做”。

### AI 与商业

- Ajay Agrawal et al., *Prediction Machines* / *Power and Prediction* —— 从预测成本下降看业务重构。
- Marco Iansiti & Karim Lakhani, *Competing in the Age of AI* —— AI 驱动运营模式。
- Ethan Mollick, *Co-Intelligence* —— 个体与组织的人机协作实践；作为观点书阅读并用场景评测验证。

### 系统与交付

- Donella Meadows, *Thinking in Systems* —— 反馈、延迟和系统杠杆。
- Nicole Forsgren et al., *Accelerate* —— 软件交付绩效与组织实践。
- Matthew Skelton & Manuel Pais, *Team Topologies* —— 团队认知负荷和协作边界。
- Gene Kim et al., *The DevOps Handbook* —— 流动、反馈和持续学习。

## 30 天论文学习计划

- 第 1 周：Attention、Foundation Models、InstructGPT、LoRA；画出训练—适配—推理图。
- 第 2 周：RAG、DPR、RAG survey、RAGAS；实现并评测一个小知识库。
- 第 3 周：ReAct、Toolformer、SWE-bench、AI Agents That Matter；设计有权限的 Agent 沙箱。
- 第 4 周：HAI Guidelines、Hidden Debt、HELM、NIST GenAI Profile；完成 AI PRD、评测和风险包。

每周输出一页“结论—边界—产品影响—复现实验”，不要只写摘抄。

## 持续追踪而不被热点淹没

- 订阅 arXiv 分类：`cs.AI`、`cs.CL`、`cs.LG`、`cs.HC`、`cs.CR`。
- 跟踪 NeurIPS、ICML、ICLR、ACL/EMNLP、CHI、FAccT、USENIX Security 的论文与最佳论文。
- 优先看有代码、数据、完整评测、负面结果和限制的工作。
- 对“刷新 SOTA”先问：数据污染？挑 benchmark？成本？方差？真实部署？
- 每季度只把改变实际决策的内容纳入本大典，避免成为新闻收藏夹。
