CodexQA

行业与实践研究与基准测试

华为云 AgentArts 智能体评估:把“能回答”变成可回归的工程系统

CodexQA 团队阅读约 3 分钟

华为云 AgentArts 的官方评估实践把智能体测试从“开发者手动聊几轮”推进到可重复、可量化、可定位的评测流程。对企业来说,重点不是一次跑出一个分数,而是建立基线、识别能力洼地,并在每次 Prompt、知识库或工具改动后验证是否回归。

华为云 AgentArts 智能体评估:把“能回答”变成可回归的工程系统

华为云 AgentArts 的官方评估实践把智能体测试从“开发者手动聊几轮”推进到可重复、可量化、可定位的评测流程。对企业来说,重点不是一次跑出一个分数,而是建立基线、识别能力洼地,并在每次 Prompt、知识库或工具改动后验证是否回归。

一、为什么抽样聊天不够

只在预览窗口输入 5~10 个典型问题,容易遗漏三类风险:知识库没有答案时是否拒答、工具参数是否正确、修改一个场景后是否破坏另一个场景。Agent 的最终回复也可能看起来正确,但中间已经发生了错误检索、错误调用或不安全操作。

官方文档将这种模式概括为从“手工坊”走向“工业化流水线”:用评测集固定问题,用评估器统一标准,用报告比较版本差异。

二、评测闭环怎么搭

1. 先准备 30~50 条黄金数据

智能体初版完成后,先用 30~50 条黄金数据跑一次基线测试。数据不应只包含理想问题,还要有边界题、对抗题和时效题。对于知识库问答,建议每条数据同时保存 input、reference_output 和 context:问题、人工标准答案、真实检索片段三者缺一不可。

2. 用评估器拆出能力画像

AgentArts 的评估器覆盖幻觉、回答相关性、指令遵循、工具调用、格式检查等维度。一个总分 85 分的助手,可能在“幻觉现象”上只有 40 分;此时优化目标应是防编造,而不是继续打磨语气。

3. 修改后用同一份数据回归

完成 Prompt、知识库或工具调整后,再跑同一份评测集。理想结果是目标维度提升,其他维度不下降。重复使用同一套数据,才能把“感觉变好了”变成可比较的版本证据。

三、评测集设计的四类样本

  • 正向用例:覆盖高频、结构化、已有标准答案的问题;
  • 边界用例:测试模糊表达、缺少关键信息时是否追问;
  • 对抗用例:测试敏感请求、越权请求和知识库外问题是否拒答;
  • 时效用例:测试政策、制度或业务规则更新后的准确性。

对知识库场景,官方最佳实践特别强调 context 字段:它不是可有可无的备注,而是判断回答是否基于真实证据、防止模型凭空补全的关键输入。

四、从分数回到工程动作

评测报告的价值在于定位下一步动作。例如:幻觉分低,优先补充拒答样本、调整检索约束;工具参数错误,检查工具 schema、字段映射与调用前确认;格式分低,增加结构化输出约束;版本升级后历史题下降,则应阻断发布并回看变更。

这套方法也提醒团队不要把评测器当成绝对真理。模型裁判需要用人工样本校准,开放式内容仍要保留人工复核;评分变化还要结合样本覆盖、随机性和业务风险解释。

五、适合企业落地的最小流程

  1. 为每个核心场景建立 30~50 条黄金数据;
  2. 每类风险至少加入一组边界题和拒答题;
  3. 保存标准答案与证据片段,不只保存问题;
  4. 建立版本基线,固定评估器和模型配置;
  5. 每次改 Prompt、知识库、工具或模型后自动回归;
  6. 发布门禁关注能力洼地和回归项,而不是只看总分。

AgentArts 的启示是:智能体质量不是“聊起来不错”,而是能够被测量、被复现、被解释,并在持续迭代中不引入新的风险。

出处:华为云,《智能体评估方法》《评测集设计实践》,2026 年 7 月至 9 月版本动态,https://support.huaweicloud.com/bestpractice-agentarts/agentarts_06_0089.html;https://support.huaweicloud.com/bestpractice-agentarts/agentarts_06_0090.html

出处:华为云,华为云,《智能体评估方法》《评测集设计实践》,2026-08-28,https://support.huaweicloud.com/wtsnew-agentarts/index.html。

觉得有用,转给同事

微信扫码

用微信扫一扫,在手机上打开后即可转发。

用 RSS 订阅

提交勘误