研究与基准测试/2026-09-18/8 分钟评测集不是聊天记录:华为云 AgentArts 要求先对齐评估器华为云 AgentArts 把评测集当成考卷:至少 30 到 50 条,正向、边界、对抗、安全大约按 50%、20%、20%、10% 配置。防幻觉必须单列 context,actual_output 不能提前写进试卷。
研究与基准测试/2026-09-16/8 分钟RAG 上线前要单独防幻觉:华为云把 context 和标准答案拆开华为云 AgentArts 的 RAG 评估要求先发布智能体,评测集初始 30 到 50 条,并用 context 判断是不是瞎编、用 reference_output 判断对不对。字段映射错了,整次评估作废。
研究与基准测试/2026-09-15/6 分钟只看正确性会放过过程错误:华为云把评估器分成三类华为云 AgentArts 预置 50 多个评估器。只拿正确性满分不能上线:订票答对却没调 API、事实对但风格不合、回答正确却带偏见,都要靠结果、调用链和体验三类评估器互相制约。
研究与基准测试/2026-07-16/7 分钟从抽样聊天到可回归:华为云 AgentArts 的智能体评估方法华为云 AgentArts 用评测集、40 多个评估器和评估任务替换 5 到 10 条手测。流程是 30 到 50 条基线、低分下钻、按病因改提示词或工具、同一评测集回归。裁判打分并非 100% 完美,允许改分作真值。