行业知识 · v2.3.0 · 资料核对 2026-10-03
RAG、Agent 与多模态系统
RAG:把生成连接到可管理知识
Retrieval-Augmented Generation(检索增强生成)在回答前从外部知识源取回相关内容,把内容提供给生成模型。典型链路:
文档接入 → 解析/OCR → 清洗/切块 → 元数据/权限 → Embedding → 索引
用户问题 → 查询理解/改写 → 检索 → 重排 → 上下文组装 → 生成 → 引用/验证
RAG 适合
- 私有知识、频繁更新的知识、需要引用与可删除知识。
- 文档问答、客服辅助、研究检索、企业搜索、合规核对。
RAG 不等于
- 不保证检索到正确资料。
- 不保证模型忠实使用资料。
- 不自动解决多步推理、权限或结构化实时数据。
- 不是把整库文档都塞进上下文。
切块与元数据
切块要保留语义单元、标题层级、来源、时间、文档版本、页码和 ACL。块太小丢上下文,太大引入噪声并增加成本。表格、代码、扫描 PDF、图片和跨页结构需要专门解析与评测。
检索方式
- 关键词/BM25:专有名词、编号、精确匹配强。
- 向量检索:语义改写和同义表达强。
- 混合检索:结合两者,企业场景常是好基线。
- 重排器:对初筛候选做更精细相关性排序。
- 查询分解:复杂问题拆成多个子查询。
- Graph RAG:显式利用实体关系,适合跨文档关系问题;建设成本更高。
RAG 评测拆开做
| 层 | 关键问题 | 示例指标 |
|---|---|---|
| 语料 | 正确资料是否入库且可访问? | 解析成功、时效、权限正确率 |
| 检索 | 支持答案的块是否在 Top-K? | Recall@K、MRR、NDCG |
| 上下文 | 是否相关、充分、无冲突? | Context precision/coverage |
| 生成 | 是否由证据支持并回答任务? | 忠实性、正确性、完整性 |
| 端到端 | 用户是否完成任务? | 成功率、节省时间、升级人工率 |
排错顺序:先确认语料和权限 → 看检索 → 看上下文 → 看生成。不要每次都归罪于模型。
Agent:让模型在环境中采取动作
Agent 通常由模型、工具、状态/记忆、策略/计划、循环控制和护栏组成。它不只是“能调用一个函数”,而是在多步中感知状态、选择动作、观察结果并继续。
目标 → 计划/下一动作 → 权限检查 → 工具调用 → 观察结果
↑ ↓
└──── 状态更新、验证、重试/停止 ────┘
先用 Workflow,再考虑开放式 Agent
- Workflow:步骤和分支由人定义,模型只处理局部不确定任务。可控、可测、可审计。
- Agent:模型动态选择步骤和工具,灵活但路径空间、成本和风险更大。
当流程稳定、合规严格、错误代价高时,优先 Workflow。只有任务路径确实无法预先枚举,且动态规划带来显著价值时才提高自主性。
自主性阶梯
| 级别 | 能力 | 典型控制 |
|---|---|---|
| L0 建议 | 只输出建议 | 用户自行执行 |
| L1 草稿 | 生成可编辑动作 | 用户确认提交 |
| L2 有限执行 | 在白名单工具和额度内执行 | 高风险动作二次确认 |
| L3 监督自治 | 多步执行,异常时升级 | 预算、策略、审计、停止按钮 |
| L4 高自治 | 长期目标和复杂环境 | 只适用于极低损害、成熟验证场景 |
自主性不是越高越先进。应根据可逆性、损害、可观测性、频率和责任确定。
Agent 必备控制
生产控制面还应记录 Agent/用户/任务身份、委托链、凭证受众、租户、动作契约、状态版本和撤权传播。多 Agent 的消息不自动构成审批;工具成功回执仍需环境回读。MCP 2026-07-28 正式规范、协议迁移和威胁测试见 Agent 安全、身份与协议。
- 最小权限、短期凭证、工具白名单、参数 Schema。
- 把读取与写入、草稿与提交、低风险与高风险工具分离。
- 预算:Token、步骤、时间、金额、调用频率。
- 幂等、超时、重试上限、循环检测和补偿事务。
- 执行前预览,关键动作人工批准,执行后可核验结果。
- 外部网页、邮件、文档均视为不可信数据,防间接提示注入。
- 完整记录目标、计划、工具、参数、结果、批准人与版本。
Agent 评测
不仅测最终成功:
- 成功率、部分完成率、路径长度、无效动作率。
- 工具选择/参数正确率、权限违规率、重复/死循环率。
- 单任务成本、时长、人工介入率和可恢复率。
- 对环境变化、工具错误、恶意内容和缺失信息的鲁棒性。
论文 AI Agents That Matter 提醒评测不能只看准确率,还应同时考虑成本、可复现性和 benchmark 过拟合。
Memory:记忆不是越多越好
- 短期状态:当前任务步骤与工具结果。
- 会话记忆:一段对话内的偏好与承诺。
- 长期记忆:跨会话的用户事实或经验。
- 组织知识:经治理的共享知识库。
长期记忆涉及同意、纠错、保留、删除、隔离和投毒风险。用户应能知道“记住了什么”、修改或删除;敏感事实默认少记,推断性人格标签尤其谨慎。
多 Agent
多个 Agent 分工可提高模块化和并行度,也会增加通信错误、成本、死锁和责任模糊。先问:单一编排器 + 专用工具能否解决?
若使用多 Agent:
- 每个角色有清晰输入、输出、权限和停止条件。
- 共享状态使用结构化 Schema,不靠自然语言无限转述。
- 设置唯一协调者和最终验证器。
- 分别评测个体能力、通信损失和系统端到端结果。
多模态
多模态系统处理文本、图片、音频、视频、传感器等。常见链路:
- 图片理解/OCR → 结构化抽取 → 检索/推理。
- 语音识别(ASR)→ LLM → 语音合成(TTS)。
- 视频抽帧/音频/时间轴 → 片段理解 → 摘要/检索。
- 文生图/视频 → 安全、版权、标识和人工审核。
特有风险
- OCR/ASR 上游错误被语言模型“合理化”。
- 图像中的文字可成为提示注入载体。
- 人脸、声音、位置和生物特征属于高敏感数据。
- 深度伪造、肖像/声音权、训练版权和内容标识。
- 多模态评测成本高,必须按模态质量和端到端任务分别测。
产品设计
- 向用户展示系统实际读取到的文字/区域,支持纠正。
- 对关键数字、姓名、单位和时间做确定性校验。
- 明确合成内容标识和来源。
- 高风险识别结果不作为唯一自动决策依据。
下一步:数据、工程与 LLMOps · 评测与实验