Not translated yet — showing the Chinese originals.
Industry & Practice · Tagged “华为云”
Research & Benchmarks//8 min
华为云 AgentArts 把评测集当成考卷:至少 30 到 50 条,正向、边界、对抗、安全大约按 50%、20%、20%、10% 配置。防幻觉必须单列 context,actual_output 不能提前写进试卷。
Research & Benchmarks//8 min
华为云 AgentArts 的 RAG 评估要求先发布智能体,评测集初始 30 到 50 条,并用 context 判断是不是瞎编、用 reference_output 判断对不对。字段映射错了,整次评估作废。
Research & Benchmarks//6 min
华为云 AgentArts 预置 50 多个评估器。只拿正确性满分不能上线:订票答对却没调 API、事实对但风格不合、回答正确却带偏见,都要靠结果、调用链和体验三类评估器互相制约。
Research & Benchmarks//7 min
华为云 AgentArts 用评测集、40 多个评估器和评估任务替换 5 到 10 条手测。流程是 30 到 50 条基线、低分下钻、按病因改提示词或工具、同一评测集回归。裁判打分并非 100% 完美,允许改分作真值。