CodexQA

行业与实践研究与基准测试

PawBench:Agent 的成绩,不只属于模型

CodexQA 团队阅读约 2 分钟

通义实验室公开的 PawBench 用 4,050 个测试单元回答一个常被忽略的问题:Agent 失败时,究竟是模型能力不足,还是 Harness 没有把能力稳定地转化为执行结果?

PawBench:Agent 的成绩,不只属于模型

通义实验室公开的 PawBench 用 4,050 个测试单元回答一个常被忽略的问题:Agent 失败时,究竟是模型能力不足,还是 Harness 没有把能力稳定地转化为执行结果?

一、把模型和 Harness 放进同一张考卷

现实中的 Agent 从来不是裸模型。模型决定“可能会什么”,Harness 决定工具如何暴露、上下文如何维护、文件是否验证、失败后能否恢复。因此 PawBench 用一个简单表达式概括系统表现:Agent Performance = f(Model, Harness)。

PawBench v1.0 包含 150 个真实任务、9 个基础模型和 3 个生产级 Harness:Hermes、OpenClaw、QwenPaw。9×3×150 形成 4,050 个测试单元。任务来自多个 Agent 基准,覆盖场景、原子能力、复杂度、输入模态和运行环境。

二、结果显示 Harness 会改变排名

所有任务在 Docker 沙箱中运行,并保留可追踪执行轨迹。最终分数同时使用自动规则检查和 LLM 评审,既验证文件、数值和格式,也评价开放式交付物的语义质量。

结果显示,强模型在不同 Harness 上相对稳定,而较弱模型对 Harness 更敏感。文本任务中,QwenPaw、OpenClaw 与 Hermes 之间出现明显分差;某些情况下,更合适的 Harness 能让中等模型超过更强模型在另一 Harness 上的表现。

这意味着榜单上的“模型差距”可能混入了工具数量、工作目录注入、搜索默认可用性、产物校验和错误恢复机制的差异。

三、三类典型交互效应

1. 小模型更依赖执行结构

较大的模型能自行补足部分上下文、过滤工具并检查产物。小模型更容易丢失当前目录、误判文件是否写入成功,或在工具过多时选错第一步。因此 Harness 需要显式告诉 Agent 当前状态、可用资源和交付位置。

2. Skill 成功需要发现与执行同时成立

如果 Harness 不扫描工作区,模型可能根本看不到任务所需 Skill;即使 Skill 被注入,模型也可能在复杂推理中没有正确调用。稳定的 Skill 流程需要同时解决“发现、展示、调用和验证”。

3. 搜索能力取决于默认可用性

需要外部 key 的搜索工具、默认可用的无 key 搜索、浏览器工具,都会造成不同的起点。强模型可能用 curl 或替代路径绕开缺失工具,较弱模型则容易停滞。因此评测必须记录环境能力,而不能把配置差异误算为模型能力。

四、四条协同设计原则

  • 把当前位置、资源、输出路径和约束明确注入上下文;
  • 工具足够但不过载,关键工具应开箱可用;
  • 不相信 Agent 自报完成,验证文件、测试和最终产物;
  • 给失败提供具体反馈和有边界的重试机会。

PawBench 最值得借鉴的不是谁拿到第一,而是评测对象从模型扩展成了“模型 × Harness”组合。企业选型时,应使用自己的任务切片、工具链和运行环境复测,而不是直接照搬单一模型榜单。

出处:通义实验室,《What We Learned from Evaluating 4,050 Agent Runs》,2026 年,https://www.alibabacloud.com/blog/what-we-learned-from-evaluating-4050-agent-runs_603332

出处:阿里云,通义实验室,《What We Learned from Evaluating 4,050 Agent Runs》,2026-08-28,https://www.alibabacloud.com/blog/what-we-learned-from-evaluating-4050-agent-runs_603332。

觉得有用,转给同事

微信扫码

用微信扫一扫,在手机上打开后即可转发。

用 RSS 订阅

提交勘误