研究与基准测试/2026-09-18/8 分钟评测集不是聊天记录:华为云 AgentArts 要求先对齐评估器华为云 AgentArts 把评测集当成考卷:至少 30 到 50 条,正向、边界、对抗、安全大约按 50%、20%、20%、10% 配置。防幻觉必须单列 context,actual_output 不能提前写进试卷。
研究与基准测试/2026-09-16/8 分钟RAG 上线前要单独防幻觉:华为云把 context 和标准答案拆开华为云 AgentArts 的 RAG 评估要求先发布智能体,评测集初始 30 到 50 条,并用 context 判断是不是瞎编、用 reference_output 判断对不对。字段映射错了,整次评估作废。