CodexQA

行业与实践研究与基准测试

只看正确性会放过过程错误:华为云把评估器分成三类

CodexQA 团队阅读约 3 分钟

华为云 AgentArts 预置 50 多个评估器。只拿正确性满分不能上线:订票答对却没调 API、事实对但风格不合、回答正确却带偏见,都要靠结果、调用链和体验三类评估器互相制约。

只看正确性会放过过程错误:华为云把评估器分成三类

华为云智果(AgentArts)文档《评估器最优组合实践》的更新时间是 2026-09-15 GMT+08:00,没有另给首次发布时间。平台预置 50 多个不同维度的评估器。文档批评一种省事做法:评估任务里只选最基础的「正确性」,看到满分就认为可以上线。投产之后,正确仍然盖不住三类失败。

回答风格不符:事实没错,但生硬、排版乱。答案对、过程错:订票智能体返回了航班,却是用大模型常识猜的,没有调用订票 API。合规风险:面对恶意挑衅,它「正确」地回答了问题,同时带上偏见或违规言论。所以单一维度量不出生产级能力。文档要求的是互相制约、互相补充的评估器组合。

裁判不是关键词匹配

评估器把评测集、智能体回答和该评估器专属的裁判 prompt 一起发给评测大模型。裁判在内部推演,给出得分和判分理由。文档按输入输出和打分标准分成三类,并说明完整名单要去看《预置评估器》,本页没有把 50 多个逐一列出。

结果导向型盯标准答案。它必须依赖评测集里的 reference_output(标准参考答案)或 context(参考资料)。例子是正确性、参考答案遵从度。判分只看核心事实是否对齐,数值错误或关键点遗漏直接 0 分。文中的最小例子是问「1+1 等于多少」,参考答案是 2:输出 2 得 1.0,输出 3 得 0.0。这是刻度说明,不是业务基准。

工具调用链类型不看最终生成的内容,只看调用轨迹和工具信息。例子是工具选择质量、工具参数正确性。工具选择质量对比 tools_called,也就是运行中实际调用的工具,查有没有捏造不存在的工具或选错功能。工具参数正确性查参数是否漏填、类型和格式是否正确。天气查询的例子:选了「查新闻」是低分链;识别意图、调用天气工具、再生成回复,得 1.0,文档称其逻辑严密、无冗余。这里没有给出中间分,例如多调用一次该得多少。

体验感知型看输出是否自然、安全。例子是 AI 味检查、不敏感性。它们看的是 actual_output。文档用一段电影推荐说明 AI 味:堆「首先、其次、此外、综上所述、希望这些建议对您有所帮助」。这段没有配具体分数。

三个场景怎么组合

企业知识问答的目标是严格基于文档、不瞎编、并且准确。防幻觉用「幻觉现象」,把输出和评测集里的 context,也就是知识库原始片段,做比对,避免虚构事实、错误数据或无法验证的回答。保准确用「知识问答-真实准确」和「正确性」,配 reference_output,查有没有漏掉核心事实或答非所问。守边界用「拒答检测」:超出知识库时要能说不知道,而不是强行编。

工具调用的目标是选对工具、填对参数。选对用「工具选择质量」,看第一步有没有选对 API,避免张冠李戴。填对用「轨迹-工具参数填充正确性」,文档称这是最严的检查,看参数缺失和格式,例如日期格式、JSON 结构,避免下游报错。顺畅用「轨迹质量」,看整条链是否连贯,有没有死循环或无效冗余调用。

内容创作的目标是新颖、有吸引力、排版符合要求、拒绝套话。去 AI 味用「AI 味检查」,点名要查「综上所述」「首先其次」。求新用「创意性」,查是不是陈词滥调,鼓励认知反差或新颖视角。细节用「细节丰富度」加「格式检查」,内容不能空,还要守住用户的排版约束。能不能直接用,用「文本可用性」,标准是无需大量人工修改。

这篇没有测量的部分

50 多个、0 分、1.0 和 0.0,都是产品说明里的规模和示意分,不是一份公开测试集的成绩,也没有客户样本量。三类评估器如何加权、冲突时以谁为准,本页没有写。工具链例子只有「低分」和 1.0,没有阈值。体验类例子没有分数。下一篇被指向《企业知识问答助手(RAG)智能体评估》,不在本页。

出处:华为云,华为云,评估器最优组合实践,2026-09-15,https://support.huaweicloud.com/bestpractice-agentarts/agentarts_06_0091.html

觉得有用,转给同事

微信扫码

用微信扫一扫,在手机上打开后即可转发。

用 RSS 订阅

提交勘误