CodexQA

行业与实践研究与基准测试

同一套卷子才算回归:华为云把 RAG 优化收成闭环

CodexQA 团队阅读约 5 分钟

华为云 AgentArts 把 RAG 优化收成评估、分析、改文档或配置、再回归。每个场景至少 30 到 50 条。没有 context,幻觉和引用相关性评估器不能工作。回归必须用同一评测集和同一评估器。页面没有给出优化前后的分数。

本文目录

同一套卷子才算回归:华为云把 RAG 优化收成闭环

华为云智果(AgentArts,华为云的智能体开发平台)最佳实践《通过智能体评估持续优化》页面标注的更新时间是 2026-08-05 GMT+08:00。页面没有另给首次发布时间。文档认为,只靠主观判断很难看全文档和配置问题,也很难说明优化到底有没有效。AgentArts 的智能体评估是把「凭经验改」收成「用数据改」,形成可以重复做的闭环。相关案例另见《企业知识问答助手(RAG)智能体评估》。那一篇讲上线前怎么建智能体和评测集,本篇只讲评估之后怎么改、怎么再测。

构建 RAG 评测集

评测集的质量决定这次评估能不能把问题暴露出来。RAG(检索增强生成,先从知识库取出片段再回答)场景要有三列:

  • input:用户提问。要覆盖常规正向题、意图模糊的边界题,以及知识库里明确没有的内容,用来看智能体会不会拒答。
  • reference_output:标准参考答案,由业务专家审核,要求准确且完整。
  • context:这道题对应的知识库检索切片原文。它是幻觉现象评估器和引用相关性评估器的输入依据。评测集里没有 context,这两类评估器无法工作。

不同目的对应不同的列,文档用表 1 对齐:

评估目的必须字段说明
常规问答正确性(正确性评估器)input、reference_output对比实际输出和标准答案
RAG 防幻觉(幻觉评估器)input、reference_output、contextcontext 是切片原文,是幻觉判断的核心依据
引用准确性(引用相关性评估器)input、context、actual_output验证引用能否在原文中溯源
格式规范(格式检查评估器)input只校验输出格式,不需要参考答案

每个业务场景至少准备 30 到 50 条,覆盖常规必答题、陷阱题和边界题。智能体上线后,要把线上真实提问里的 BadCase 从观测里抽出来,补进评测集。文档没有规定这 30 到 50 条里三类题各占多少。

评估 RAG 智能体

文档把评估比成模拟考试:评测集是考卷,决定考到哪些知识边界;评估器是阅卷标准;评估任务是每次改完之后的模考。RAG 场景下,分数直接反映知识库文档和配置:

  • 正确性评估器看回答和标准答案是否一致。分低通常是召回切片语义匹配不够,或切片内容不完整。
  • 幻觉现象评估器看智能体有没有脱离检索到的切片自行编造。分低直接指向定义缺失、指代歧义或内容矛盾。
  • 引用相关性评估器看引用能不能在原始切片里找到出处。分低通常对应术语混用,或步骤编号错乱。

分析 BadCase

评估任务完成后按三步看:

  1. 先看总体得分和各维度,判断知识库最突出的问题。文档给的例子是:正确性较高、幻觉现象偏低,说明召回内容的相关性还行,但文档里有定义缺失或指代歧义,模型在没有依据时会自己编。
  2. 在评估详情里重点看得分是 0.0 的数据,逐条读评估器写出的评分理由。
  3. 人工标注。AgentArts 允许给每个 BadCase 打自定义标签,也允许人工改分,用来校准评估数据。

表 2 是文档建议的标签和对应改法:

标签含义优化方向
知识库缺失知识库里没有回答该问题所需的文档补对应主题文档,或拆开大文档以提高切片命中率
术语歧义术语没有定义,或前后不一致补术语定义,并统一用词
切片不完整召回的切片被截断,缺关键信息调整分段,或改文档结构,让切片边界更合理
内容矛盾同一问题有互相矛盾的文档版本清掉过时文档,统一表述
表述模糊代词指代不明,或多义词没有上下文消歧,把代词换成具体名词
配置问题阈值不合理,相关切片被滤掉,或无关切片被召回调整相关度阈值或 topk 召回数量

文档接着按失败原因给了三条改法,不另起一套分类:

  • 幻觉或知识编造:先查知识库里有没有对应文档。有文档但召回内容和问题不符,再查指代歧义或术语不一致。提示词里要加硬约束,原文是:「当检索不到相关信息时,请明确回复当前知识库中暂无该信息,不得自行编造答案」。
  • 工具调用参数错误:检查工作流里知识检索节点的参数引用,确认上游节点把用户的核心问题提取出来并传下去。
  • 切片召回不准:先用命中测试看这道题实际召回了什么,再按命中分值调相关度阈值。如果切片本身质量差,回到文档写作,而不是先改阈值。

回归测试

文档或配置改完后,把修订文档重新上传到知识库,等解析完成,再建一次评估任务。必须使用和优化前相同的评测集、相同的评估器。前后两份报告的得分用来判断方案是否有效:

  • 幻觉现象评分上升,并且「知识库缺失」类 BadCase 减少,说明文档优化方向是对的。
  • 效果不明显,就回到 BadCase 的评分理由,再区分是文档、配置还是提示词。

文档把这个循环写成:评估,分析,优化(文档或配置),回归验证。

这篇文档没有给出的东西

页面没有任何优化前、优化后的分数,也没有样本量、评测集版本或评估器版本。30 到 50 条是每个业务场景的准备建议,不是某次实验的题量。0.0 是阅读评分理由时要优先看的分数,文档没有写它是不是唯一的失败线,也没有写其他分数怎么分档。人工改分被当作校准手段,但没有写标注人数、是否抽检一致。命中测试和相关度阈值、topk 都只给了动作顺序,没有给推荐数值。父主题是《优化 RAG 应用实践》,上一篇是《优化知识库配置》,本篇不包含那篇的配置参数。

出处:华为云,华为云,通过智能体评估持续优化,2026-08-05,https://support.huaweicloud.com/bestpractice-agentarts/agentarts_06_0123.html

觉得有用,转给同事

微信扫码

用微信扫一扫,在手机上打开后即可转发。

用 RSS 订阅

提交勘误