CodexQA

Industry & PracticeResearch & Benchmarks

从抽样聊天到可回归:华为云 AgentArts 的智能体评估方法

CodexQA 团队4 min read

华为云 AgentArts 用评测集、40 多个评估器和评估任务替换 5 到 10 条手测。流程是 30 到 50 条基线、低分下钻、按病因改提示词或工具、同一评测集回归。裁判打分并非 100% 完美,允许改分作真值。

In this piece

从抽样聊天到可回归:华为云 AgentArts 的智能体评估方法

华为云智果(AgentArts)文档《智能体评估方法》的更新时间是 2026-07-16 GMT+08:00,页面没有另给首次发布时间。它针对的失败模式很具体:早期开发是「写提示词、挂知识库和工具、在预览里手打 5 到 10 个问题,看着还行就发布」。一到要长期跑的业务,这种抽样聊天会在三个地方垮掉。

第一,改一句语气词,智能体忽然不会调知识库。修场景 A 时,没有办法确认场景 B 还在。几百条历史用例靠手打回归,人力上不现实,结果是越改越乱。第二,知识库没写的问题不但不拒答,还当场编一条政策。人工测试多半只覆盖理想问法,覆盖不了偏门、模糊和对抗输入,也看不见能力边界和安全底线。第三,工具看起来调用成功了,参数可能是错的。查机票转半天返回无票,可能是选错工具,也可能把明天提取成了今天。只看最终文本,分不清是真懂业务,还是歪打正着,更看不见 MCP 或插件的中间参数。

文档因此把评估从「手工坊」改成自动化流水线,并给了一张对照,不是某次客户的线上成绩:

  • 规模:人工每次 5 到 10 条;自动化每次数百条。
  • 标准:人工靠主观感受;平台用评估器,以大模型当裁判,量化打分,文档写的是 0 到 1 分。
  • 维度:人工多半只看答得对不对;平台内置 40 多个细分维度,例子包括幻觉、AI 味、工具参数正确性、格式检查。
  • 迭代:人工无法回归;自动化用同一套数据做基线,提示词和智能体的改动可以对比分数。

后面的例子又写成「总分 85 分、幻觉现象 40 分」。这和前面的 0 到 1 分不是同一套刻度。文档没有解释 85 和 40 是百分制、还是多项加总。引用时不能把它们当成 0 到 1 分制下的实测结果。

三个要素

评测集是考卷。文档说不能只有常见问题这种送分题,至少要有正向用例、边界用例(模糊提问和上下文衔接)和对抗用例(故意问知识库外的信息,测拒答)。字段至少有 input 和 reference_output,并可按测试加列。更细的题型比例在另一篇《评测集设计实践》里,本篇没有重复 50%、20%、20%、10% 那组数字。

评估器是阅卷者。平台预置 40 多个。文档点名三个视角:正确性只核对核心事实和关键数据是否与参考答案一致;幻觉现象拿着 context 逐句查,只要输出了不相干的内容就判 0 分;工具参数正确性不看文本,专看 Trace,检查 API 参数的字段类型和数值是否全部正确。评估器不是越多越好,要按业务痛点组合。

评估任务把评测集发给智能体,由评估器打分。系统在后台高并发跑完全部题目,追踪每次调用,汇总成多维报告。

四段调优,而不是拿到高分就结束

文档把「高分报告等于做完」写成新手误区。价值是找到缺陷,并证明优化有效。

阶段一,基线摸底。初版完成后,用 30 到 50 条黄金数据跑基线,在报告里看能力洼地。文中的例子是企业 IT 助手总分 85 分,幻觉现象只有 40 分,于是第一阶段目标收成「防止编造」。如前所述,这两个分数的刻度没有定义。

阶段二,抓 BadCase 并人工校准。明细按得分升序,滤出 0 分或低分用例,对照原始问题、实际输出和标准答案,再看中间节点:是知识库检索为空之后开始编,还是插件返回了复杂 JSON 却没解析对。大模型裁判「并非 100% 完美」。复核时如果打分过严或误判,可以改分,改过的分数作为真值保存。正例和 BadCase 都打标签,例子是 Prompt 约束弱、知识库缺失、API 提参问题。报告由此变成错题本。

阶段三,按病因改,而不是普遍重写。幻觉就在系统提示词里加强约束。文档给的例子是:知识库检索结果为空时,必须明确回复内部知识库暂无相关指南,禁止用模型自有知识解答。参数提取错了,就改工具描述,例如把模糊的 date 改成必须转成 YYYY-MM-DD。源文件缺知识,就补知识库,而不是只改提示词。

阶段四,回归。用同一份评测集再跑。文档给的成功判据是:幻觉现象从 0 分升到 1 分,并且其他维度没有下降。这里的 0 和 1 对得上前面的 0 到 1 分制,也对得上「不相干内容直接 0 分」。它没有说总分要从 40 升到多少,也没有给出统计显著性或多次运行的方差。

做完这四段,文档把读者指去三篇实战,不在本页展开:评测集设计实践、评估器最优组合实践、企业知识问答助手(RAG)智能体评估。

限制要单独看:5 到 10 条、数百条、40 多个维度、30 到 50 条、0 到 1 分、幻觉直接 0 分、裁判并非 100% 完美,都是产品方法说明。85 分和 40 分是举例,不是公开测试集上的榜单,也没有客户名、样本量和标注规范。页面没有线上事故复盘的原始 Trace。

出处:华为云,华为云,智能体评估方法,2026-07-16,https://support.huaweicloud.com/bestpractice-agentarts/agentarts_06_0089.html

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction