研究与基准测试/2026-09-18/8 分钟评测集不是聊天记录:华为云 AgentArts 要求先对齐评估器华为云 AgentArts 把评测集当成考卷:至少 30 到 50 条,正向、边界、对抗、安全大约按 50%、20%、20%、10% 配置。防幻觉必须单列 context,actual_output 不能提前写进试卷。
研究与基准测试/2026-09-15/6 分钟只看正确性会放过过程错误:华为云把评估器分成三类华为云 AgentArts 预置 50 多个评估器。只拿正确性满分不能上线:订票答对却没调 API、事实对但风格不合、回答正确却带偏见,都要靠结果、调用链和体验三类评估器互相制约。
研究与基准测试/2026-08-12/11 分钟描述不可信:阿里云用三天把 UGC 游戏 Agent 收成可回归阿里云 AgentLoop 在 UGC 游戏 Agent 上用 3 天走完观测、分层评估、根因和回归。事实层按正确项除以正确加错误项打分,一条样本 16 项里 9 项错。回写后的新分数没有公布。