同 一套 卷子 才算 回归: 华 为 云 把 RAG 优 化 收成 闭 环
华为云 AgentArts 把 RAG 优化收成评估、分析、改文档或配置、再回归。每个场景至少 30 到 50 条。没有 context,幻觉和引用相关性评估器不能工作。回归必须用同一评测集和同一评估器。页面没有给出优化前后的分数。

本文目录
同一套卷子才算回归:华为云把 RAG 优化收成闭环
华为云智果(AgentArts,华为云的智能体开发平台)最佳实践《通过智能体评估持续优化》页面标注的更新时间是 2026-08-05 GMT+08:00。页面没有另给首次发布时间。文档认为,只靠主观判断很难看全文档和配置问题,也很难说明优化到底有没有效。AgentArts 的智能体评估是把「凭经验改」收成「用数据改」,形成可以重复做的闭环。相关案例另见《企业知识问答助手(RAG)智能体评估》。那一篇讲上线前怎么建智能体和评测集,本篇只讲评估之后怎么改、怎么再测。
构建 RAG 评测集
评测集的质量决定这次评估能不能把问题暴露出来。RAG(检索增强生成,先从知识库取出片段再回答)场景要有三列:
- input:用户提问。要覆盖常规正向题、意图模糊的边界题,以及知识库里明确没有的内容,用来看智能体会不会拒答。
- reference_output:标准参考答案,由业务专家审核,要求准确且完整。
- context:这道题对应的知识库检索切片原文。它是幻觉现象评估器和引用相关性评估器的输入依据。评测集里没有 context,这两类评估器无法工作。
不同目的对应不同的列,文档用表 1 对齐:
| 评估目的 | 必须字段 | 说明 |
|---|---|---|
| 常规问答正确性(正确性评估器) | input、reference_output | 对比实际输出和标准答案 |
| RAG 防幻觉(幻觉评估器) | input、reference_output、context | context 是切片原文,是幻觉判断的核心依据 |
| 引用准确性(引用相关性评估器) | input、context、actual_output | 验证引用能否在原文中溯源 |
| 格式规范(格式检查评估器) | input | 只校验输出格式,不需要参考答案 |
每个业务场景至少准备 30 到 50 条,覆盖常规必答题、陷阱题和边界题。智能体上线后,要把线上真实提问里的 BadCase 从观测里抽出来,补进评测集。文档没有规定这 30 到 50 条里三类题各占多少。
评估 RAG 智能体
文档把评估比成模拟考试:评测集是考卷,决定考到哪些知识边界;评估器是阅卷标准;评估任务是每次改完之后的模考。RAG 场景下,分数直接反映知识库文档和配置:
- 正确性评估器看回答和标准答案是否一致。分低通常是召回切片语义匹配不够,或切片内容不完整。
- 幻觉现象评估器看智能体有没有脱离检索到的切片自行编造。分低直接指向定义缺失、指代歧义或内容矛盾。
- 引用相关性评估器看引用能不能在原始切片里找到出处。分低通常对应术语混用,或步骤编号错乱。
分析 BadCase
评估任务完成后按三步看:
- 先看总体得分和各维度,判断知识库最突出的问题。文档给的例子是:正确性较高、幻觉现象偏低,说明召回内容的相关性还行,但文档里有定义缺失或指代歧义,模型在没有依据时会自己编。
- 在评估详情里重点看得分是 0.0 的数据,逐条读评估器写出的评分理由。
- 人工标注。AgentArts 允许给每个 BadCase 打自定义标签,也允许人工改分,用来校准评估数据。
表 2 是文档建议的标签和对应改法:
| 标签 | 含义 | 优化方向 |
|---|---|---|
| 知识库缺失 | 知识库里没有回答该问题所需的文档 | 补对应主题文档,或拆开大文档以提高切片命中率 |
| 术语歧义 | 术语没有定义,或前后不一致 | 补术语定义,并统一用词 |
| 切片不完整 | 召回的切片被截断,缺关键信息 | 调整分段,或改文档结构,让切片边界更合理 |
| 内容矛盾 | 同一问题有互相矛盾的文档版本 | 清掉过时文档,统一表述 |
| 表述模糊 | 代词指代不明,或多义词没有上下文 | 消歧,把代词换成具体名词 |
| 配置问题 | 阈值不合理,相关切片被滤掉,或无关切片被召回 | 调整相关度阈值或 topk 召回数量 |
文档接着按失败原因给了三条改法,不另起一套分类:
- 幻觉或知识编造:先查知识库里有没有对应文档。有文档但召回内容和问题不符,再查指代歧义或术语不一致。提示词里要加硬约束,原文是:「当检索不到相关信息时,请明确回复当前知识库中暂无该信息,不得自行编造答案」。
- 工具调用参数错误:检查工作流里知识检索节点的参数引用,确认上游节点把用户的核心问题提取出来并传下去。
- 切片召回不准:先用命中测试看这道题实际召回了什么,再按命中分值调相关度阈值。如果切片本身质量差,回到文档写作,而不是先改阈值。
回归测试
文档或配置改完后,把修订文档重新上传到知识库,等解析完成,再建一次评估任务。必须使用和优化前相同的评测集、相同的评估器。前后两份报告的得分用来判断方案是否有效:
- 幻觉现象评分上升,并且「知识库缺失」类 BadCase 减少,说明文档优化方向是对的。
- 效果不明显,就回到 BadCase 的评分理由,再区分是文档、配置还是提示词。
文档把这个循环写成:评估,分析,优化(文档或配置),回归验证。
这篇文档没有给出的东西
页面没有任何优化前、优化后的分数,也没有样本量、评测集版本或评估器版本。30 到 50 条是每个业务场景的准备建议,不是某次实验的题量。0.0 是阅读评分理由时要优先看的分数,文档没有写它是不是唯一的失败线,也没有写其他分数怎么分档。人工改分被当作校准手段,但没有写标注人数、是否抽检一致。命中测试和相关度阈值、topk 都只给了动作顺序,没有给推荐数值。父主题是《优化 RAG 应用实践》,上一篇是《优化知识库配置》,本篇不包含那篇的配置参数。
出处:华为云,华为云,通过智能体评估持续优化,2026-08-05,https://support.huaweicloud.com/bestpractice-agentarts/agentarts_06_0123.html
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。