典 · AI PM 永乐大典

行业知识 · v2.3.0 · 资料核对 2026-10-03

RAG、Agent 与多模态系统

RAG:把生成连接到可管理知识

Retrieval-Augmented Generation(检索增强生成)在回答前从外部知识源取回相关内容,把内容提供给生成模型。典型链路:

文档接入 → 解析/OCR → 清洗/切块 → 元数据/权限 → Embedding → 索引
用户问题 → 查询理解/改写 → 检索 → 重排 → 上下文组装 → 生成 → 引用/验证

RAG 适合

RAG 不等于

切块与元数据

切块要保留语义单元、标题层级、来源、时间、文档版本、页码和 ACL。块太小丢上下文,太大引入噪声并增加成本。表格、代码、扫描 PDF、图片和跨页结构需要专门解析与评测。

检索方式

RAG 评测拆开做

层关键问题示例指标
语料正确资料是否入库且可访问?解析成功、时效、权限正确率
检索支持答案的块是否在 Top-K?Recall@K、MRR、NDCG
上下文是否相关、充分、无冲突?Context precision/coverage
生成是否由证据支持并回答任务?忠实性、正确性、完整性
端到端用户是否完成任务?成功率、节省时间、升级人工率

排错顺序:先确认语料和权限 → 看检索 → 看上下文 → 看生成。不要每次都归罪于模型。

Agent:让模型在环境中采取动作

Agent 通常由模型、工具、状态/记忆、策略/计划、循环控制和护栏组成。它不只是“能调用一个函数”,而是在多步中感知状态、选择动作、观察结果并继续。

目标 → 计划/下一动作 → 权限检查 → 工具调用 → 观察结果
          ↑                                  ↓
          └──── 状态更新、验证、重试/停止 ────┘

先用 Workflow,再考虑开放式 Agent

当流程稳定、合规严格、错误代价高时,优先 Workflow。只有任务路径确实无法预先枚举,且动态规划带来显著价值时才提高自主性。

自主性阶梯

级别能力典型控制
L0 建议只输出建议用户自行执行
L1 草稿生成可编辑动作用户确认提交
L2 有限执行在白名单工具和额度内执行高风险动作二次确认
L3 监督自治多步执行,异常时升级预算、策略、审计、停止按钮
L4 高自治长期目标和复杂环境只适用于极低损害、成熟验证场景

自主性不是越高越先进。应根据可逆性、损害、可观测性、频率和责任确定。

Agent 必备控制

生产控制面还应记录 Agent/用户/任务身份、委托链、凭证受众、租户、动作契约、状态版本和撤权传播。多 Agent 的消息不自动构成审批;工具成功回执仍需环境回读。MCP 2026-07-28 正式规范、协议迁移和威胁测试见 Agent 安全、身份与协议。

Agent 评测

不仅测最终成功:

论文 AI Agents That Matter 提醒评测不能只看准确率,还应同时考虑成本、可复现性和 benchmark 过拟合。

Memory:记忆不是越多越好

长期记忆涉及同意、纠错、保留、删除、隔离和投毒风险。用户应能知道“记住了什么”、修改或删除;敏感事实默认少记,推断性人格标签尤其谨慎。

多 Agent

多个 Agent 分工可提高模块化和并行度,也会增加通信错误、成本、死锁和责任模糊。先问:单一编排器 + 专用工具能否解决?

若使用多 Agent:

多模态

多模态系统处理文本、图片、音频、视频、传感器等。常见链路:

特有风险

产品设计

下一步:数据、工程与 LLMOps · 评测与实验