自动 评 测 能 找回 多少 失败: 100 条 真实 对话 的 盲 测 结果
智测团队 · OpenQA(openqa.cn)阅读约 3 分钟
最好的系统召回 87%,每个系统都找到过人漏掉的问题,但「看起来对、体验不好」的一类全都抓不到。
自动评测能找回多少失败:100 条真实对话的盲测结果
Braintrust、Arize、LangSmith 现在都上了「读你的生产轨迹、自己报告哪里在失败」的 agent。编程 agent 也能干同样的活。那这些系统到底能自己找出多少问题,漏掉什么?
Hamel Husain 和 Antaripa Saha 在 2026 年 7 月 11 日做了一次盲测,结果发在 Do Automated Evals Work?。这篇是中文读后笔记,不是翻译,数字均出自原文。
实验怎么做的
数据来自一个真实的公寓租赁客服 AI,不是合成基准。租客发信息或打电话问房源,agent 回答并约看房,某些对话按规定要转人工。
- 领域专家按错误分析流程人工标注 100 条轨迹,标出 39 处失败,形成一份失败分类。
- 把人工标注全部遮掉,让每个系统盲看这 100 条,自己找问题。
- 给每个系统的提示词是同一份,故意写得很轻:说明这是什么产品、要求分组归纳、举出轨迹编号、不要假设每条都失败。原文特别说,这就是多数人拿到这类产品后开箱即用的用法。
- 按三个口径打分:召回(39 处人工失败找到了几处)、精确(它报的问题里几处是真的,人漏掉的真问题也算数)、新发现(人工没标出来的真问题)。
参与者不只三家的评测 agent,还有 Codex、Factory Droid、Claude Code 三个编程 agent 直接读日志文件干同样的活。
结果
| 系统 | 召回 | 精确 | 新发现 |
|---|---|---|---|
| Braintrust Loop | 87.2% | 79.1% | 9 |
| Codex(GPT-5.5 High) | 84.6% | 82.8% | 11 |
| Factory Droid(GPT-5.5 High) | 84.6% | 83.3% | 10 |
| LangSmith 聊天 agent | 79.5% | 77.5% | 9 |
| Claude Code(Opus 4.8) | 79.5% | 77.4% | 14 |
| Arize AX Alyx | 74.4% | 91.0% | 3 |
原文自己先泼了冷水:一个数据集、39 处标注,系统之间的差距只隔着几条轨迹,这个实验不构成厂商排名,目的也不是排名。
真正一致的发现有三条:
- 失败在轨迹里「看得出来」时,所有系统都能抓到——比如没有依据就承诺档期、用户已经确认过还反复追问确认。
- 每个系统都找到过人漏掉的问题。自动化的价值不是复刻人工,是互补。
- 全自动方案全都漏掉同一类:轨迹看起来完全正确,但体验不好的对话。回复没错、工具没调错,就是让人不舒服。这类失败没有客观信号,只有领域判断。误报也不少,噪声要人过滤。
还有一个细节:团队本来期待这些工具在开跑前会反问需求、澄清标准。基本都没有。
这对你的评测流程意味着什么
- 自动评测当初筛用,不当终审用。让它把 100 条里「看得出错」的挑出来,省你的时间。
- 体验类失败留给人。定期抽样人工过轨迹这件事,自动化替代不了,只能改变抽样的优先级。
- 人工标注仍然要存在,哪怕量小。没有人工标过的失败集,你连「自动系统召回多少」都没法算。
- 精确率比召回率更容易骗人。报得多的系统看着勤快,误报会把评审人的时间吃光。两个数一起看。
- 编程 agent 直接读日志,成绩不输专门的评测产品。工具不是门槛,有标注、有口径才是。
材料边界
全部数字与实验设计出自 Hamel Husain、Antaripa Saha 2026-07-11 的 Do Automated Evals Work?,单一数据集、39 处人工标注,结论不外推到厂商排名。本文为中文笔记,非翻译,未复制原文段落与配图。
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。