CodexQA

Industry & PracticeResearch & Benchmarks

榜首模型不一定该上线:公开基准之外怎么评测整套系统

CodexQA 团队2 min read

deepsense.ai 认为 2026 年的公开基准更接近真实工作,但仍然只够做能力筛选。上线要评模型、支架、工具、成本和业务结果,而不是只看榜单。

来源:Mateusz Wosiński、Alan Konarski、Rafał Łabędzki、Maciej Domagała,deepsense.ai,2026 年 9 月 3 日。阅读时间原文约 18 到 27 分钟。

作者的立场可以收成一句:AI 负责人还应该看模型榜单,但主要用来决定下一轮该测什么,不能默认榜首就是这个业务的最佳选择。

公开基准在靠近真实工作,缺口还在

2026 年的一批公开评测已经离开窄的学术题,改测端到端的职业流程。它们不只看输出对不对,也看会不会用工具、能不能做完复杂任务、重复多次是否还稳。

文中点到的例子包括:SWE-Lancer 覆盖 1400 多条自由职业软件任务,对应一百万美元量级的真实报酬;GDPval 评 44 个职业的交付物;τ-bench 检查使用工具的 Agent 能否在模拟业务系统里到达正确状态,并且多次重复仍然成功。作者自己的 EDA 基准则用来看 Agent 能否在多个领域里准确、可重复地解结构化分析题。

这是进步,但没有填上基准和生产之间的缺口。GDPval 的第一版仍是一次作答,没有覆盖「收集上下文、用多个工具、改稿、回应反馈」这种迭代流程。2026 年 7 月,OpenAI 估计 SWE-Bench Pro 大约 30% 的任务是坏的,主要因为测试过严,或提示写得不够明确。Harness-Bench 则发现,任务环境相同,换模型与支架的搭配,成绩可以差很多。

作者由此把公开基准定义成能力筛选:用来做短名单,在共同条件下比较模型。标准化评测的价值在这里,不在于直接拍板上线。

要评的是整套系统

短名单之后,评测对象应是整套系统,而不只是模型权重:模型、支架(harness)、工具、记忆、执行路径、可靠性、成本,以及业务结果。条件要接近生产,而不是排行榜默认的那一种支架。

Anthropic 把轨迹和最终环境结果分开看,OpenAI 建议用轨迹打分去检查工具调用、路由、交接和防护。这些行为可以在多个粒度上测:某个必要动作是否在长轨迹里出现过,期望动作序列和实际序列是否一致,轨迹和参考有多接近。

文中的实用框架是三步:用公开基准把候选收到能比较的短名单;在接近生产的条件下比较整套系统并定位失败模式;再决定哪一套真正可以发货。榜首如果在你们的工具、时延和失败代价下更贵、更不稳,就不是生产选择。

原文:https://deepsense.ai/blog/the-top-scoring-model-is-not-always-the-best-production-choice-how-to-evaluate-ai-systems-beyond-public-benchmarks

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction