CodexQA

Industry & PracticeResearch & Benchmarks

三次都改对才算稳:腾讯 E-Bench 用数据库差异评多步工具

CodexQA 团队7 min read

323 道合成任务,三次尝试,没有部分分。Kimi-K3 的 Avg@3 是 73.79%,但三次都成功只有 58.82%。加上代码执行后 Opus-4.8 升到第一,最好的三次全过仍是 68.66%。

In this piece

三次都改对才算稳:腾讯 E-Bench 用数据库差异评多步工具

腾讯混元团队联合清华大学智能产业研究院、东南大学计算机科学与工程学院的预印本 E-Bench: Benchmarking Multi-Step Tool-Use Agents in Real-World Product Scenarios,arXiv 公开戳记是 2026 年 7 月 26 日(2607.23722)。PDF 页眉写的是 2026-7-28。通讯作者是 Maxm Pan(maxmpan@tencent.com)。E-Bench 是一套全合成的多步工具使用评测:Agent 不能直接查库,只能用产品工具把隐藏信息找齐,再改环境状态;对不对只看数据库差异,不看它说得像不像。

改没改对,不看轨迹像不像

现有工具评测多半停在单次 API 选对没有、调用格式对不对,或者很短的轨迹。接到真实或在线服务上的环境又难重置、难扩、受隐私约束,服务一变就复现不了。任务若靠公开事实或熟悉界面,高分也可能是见过,不是当场把隐藏状态查出来。

E-Bench 做成完全合成,不取真实用户,也不接在线服务。323 道会改状态的任务,三个按真实产品建模的域:王者荣耀(Honor of Kings)、QQ 音乐(QQ Music)、腾讯会议(Tencent Meeting)。建造拆成两段,互不绑死。

第一段是环境。每个域先有一套关系表,按外键做成表依赖图,空库打开外键检查,再按拓扑顺序填表。根表先填,下游表只能引用已经存在的记录。填的时候用强模型,但只能通过插入工具写库,标识不能现编。填完再用脚本修时间顺序、汇总数和状态字段。这样得到的是没有孤儿记录的产品世界,不是只够一道题用的局部夹具。

第二段是任务。有特权的生成器可以 query_sql 和 exec_code,走「看数据、定目标、改状态、写意图」。写库前后各打一份快照,差就是标准答案。评测时这些内部工具拿掉。基础设定里求解器只有业务级 MCP 工具,没有代码执行。这就是生成器–求解器不对称:信息差加工具差。求解器必须自己把隐藏目标集找全,再把多次、常常还是并行的工具调用排好,才能改出同样的状态。

意图改写会留住用户明确说的值,例如歌单名、日期范围,但把从库里算出来的值换成规则。题面写「把我收藏里下架的歌加进去」,不列歌曲 ID,也不给数量。过早按不完整证据提交,就会和标准差异对不上。

没有状态变化、意图解析不了、工具用得过多的候选丢掉。留下来的再交给三个全信息校验器:GPT-5.5、Claude Opus 4.7、GLM-5.1,工具和生成器一样,是 query_sql 和 exec_code。校验看的是记录下来的状态变化能不能复现,不是隐藏信息检索。至少两个校验器与标准差异一致才收。然后再丢掉弱基线很容易做完的题,并按能力类型分层。论文没有给出「很容易」的数值门槛。

判分是确定性的数据库差异,没有 LLM 裁判,也没有部分分。一次尝试要么最终状态和标准差异完全一致,要么记失败。

三个库、323 题、六种能力

表 2:

  • 王者荣耀:16 表、168 列、29 条外键、18,646 行、170 个用户、110 题。求解器工具 33 个;加上代码执行是 34 个。每题差异 3 到 25 行,均值 9.5,中位数 9。插入 / 更新 / 删除占 37.7% / 46.1% / 16.2%。
  • QQ 音乐:12 表、72 列、16 条外键、28,321 行、54 个用户、104 题。工具 27 / 28。每题差异 5 到 80 行,均值 16.5,中位数 13。插入 98.8%,删除 1.2%,更新按环境设计就是 0。
  • 腾讯会议:13 表、105 列、24 条外键、29,350 行、995 名员工、109 题。工具 25 / 26。每题差异 7 到 221 行,均值 48.5,中位数 35。插入 98.6%,更新 0.3%,删除 1.1%。

合计 41 表、345 列、69 条外键、76,317 行、1,219 个主体、323 题,数据单元格超过 60 万。全基准平均每题 24.9 行级改动。

王者荣耀覆盖好友、黑名单、房间、队伍和英雄购买。QQ 音乐覆盖搜歌、歌单、收藏和关注艺人。腾讯会议覆盖组织、群聊、会议、会议室和日程。工具是产品语义的增删改查,底下仍是同一套库。

六种能力分两组。信息差为主:全量获取、多条件过滤、聚合计算。决策为主:跨步依赖、精确边界判断、跨实体级联。一道题可以带多种能力。

E-Bench-Code 只多给求解器一个 exec_code。Agent 写 Python,把域工具当内部函数来分页、聚合和做集合运算。它缩小工具差,不取消信息差。

11 个模型:平均做对和三次都做对不是一回事

每个开发方在实验时点各取一个代表模型,用各自最高思考强度,共用一套 harness。每题 3 次独立尝试,每次从该域数据库的干净副本开始。

  • Avg@3:三次尝试的成功率,按题和尝试平均,看典型一次做得怎么样。
  • Pass@3:三次里至少一次成功,这题算解出。
  • Pass^3:三次全部成功,看稳不稳。

正文表 3 是 11 个模型。Muse-Spark-1.1 因内容审核只出现在附录,不进这张主表。列是 E-Bench 的 Avg@3 / Pass@3 / Pass^3,再接 E-Bench-Code 的同样三列。

  • Kimi-K3:73.79 / 87.62 / 58.82;77.61 / 88.70 / 65.80
  • GPT-5.5:72.03 / 82.97 / 57.59;77.19 / 87.32 / 66.90
  • Opus-4.8:68.78 / 84.33 / 50.81;81.11 / 92.61 / 68.66
  • Grok-4.5:66.10 / 80.50 / 52.32;69.24 / 82.66 / 55.75
  • GLM-5.2:52.32 / 71.52 / 30.96;60.99 / 81.69 / 42.25
  • Qwen-3.7-Max:50.88 / 70.59 / 30.34;61.92 / 80.99 / 44.01
  • Hy3:50.15 / 74.30 / 26.63;64.40 / 85.56 / 44.01
  • Seed-2.1-Pro:47.94 / 65.33 / 28.79;53.04 / 75.35 / 30.99
  • Gemini-3.5-Flash:42.62 / 64.71 / 21.98;62.54 / 82.39 / 40.49
  • MiniMax-M3:41.07 / 62.85 / 20.12;46.85 / 74.65 / 21.13
  • DeepSeek-V4-Pro:34.47 / 53.56 / 17.34;47.68 / 72.89 / 25.35

基础设定里,Kimi-K3 的 Avg@3 最高,73.79%。超过 66% 的还有 GPT-5.5、Opus-4.8、Grok-4.5。其余没有一个超过 53%。11 个模型的 Avg@3 平均 54.56%,也就是典型一次尝试大约一半失败。

稳的缺口更大。Kimi-K3 从 Pass@3 的 87.62% 掉到 Pass^3 的 58.82%,GPT-5.5 从 82.97% 掉到 57.59%。基础设定里没有任何模型的 Pass^3 到 60%。因为没有部分分,偶尔改对不能当成可以去改线上产品状态。

给了代码,分都涨,名次换了,稳仍然不到 70%

exec_code 让 11 个模型的 Avg@3 全部上升。Opus-4.8 从 68.78% 到 81.11%,超过 Kimi-K3 和 GPT-5.5,从第三变成第一。Gemini-3.5-Flash 从 42.62% 到 62.54%,相对提高 46.7%,名次从第 9 到第 6。DeepSeek-V4-Pro 相对提高 38.32%。最好的 Pass^3 是 Opus-4.8 的 68.66%,仍低于 70%;最差是 MiniMax-M3 的 21.13%。

涨得多的模型把大量交互折进代码。Gemini-3.5-Flash 有 95% 的交互走代码,Opus-4.8 是 93%。它们在 exec_code 里调用域函数,而不是逐个打 MCP 工具。11 个模型、三个域平均,每题 MCP 工具调用从 60.42 降到 15.86,少 73.8%;回合从 14.87 降到 9.87,少 33.6%。调用变少不等于工作变少,是多次调用被折进一次代码。

按能力、对 11 个模型平均,代码带来的 Avg@3 绝对增益从大到小:多条件过滤 51.94% 到 62.55%(+10.61,相对 +20.43%),全量获取 53.55% 到 63.65%(+10.11,+18.88%),聚合计算 52.85% 到 62.30%(+9.45,+17.88%),跨实体级联 60.08% 到 68.88%(+8.80,+14.66%),跨步依赖 54.11% 到 62.79%(+8.68,+16.05%),精确边界判断 57.39% 到 64.94%(+7.55,+13.16%)。论文的结论是:代码主要卸掉检索、过滤和聚合,不替代选实体、选阈值和决定下一步。

三个域也不一样难。基础设定的平均 Avg@3:王者荣耀 43.64%,腾讯会议 58.87%,QQ 音乐 61.39%。加上代码后是 52.36%、67.78%、71.94%。QQ 音乐平均多 10.55 分,王者荣耀 8.72,腾讯会议 8.91。Grok-4.5 在基础设定的 QQ 音乐上是该域最好,在王者荣耀上只是中游。前沿一层是 Kimi-K3、GPT-5.5、Opus-4.8,Grok-4.5 是强的第二层。单域排名不能代替这套基准。

这些数不能被读成什么

环境是按产品建模的合成库,不是王者荣耀、QQ 音乐或腾讯会议的线上数据,也不能外推到跨产品流程。未来工作才打算接到真实命令行和在线后端。生成器比求解器多 SQL 和代码,所以基础分低,有一部分是工具被拿走,不是单纯「不会聊天」。校验器里有 GPT-5.5,但它用的是全信息工具,和被测设定不是同一次考试。弱基线过滤没有公开阈值。QQ 音乐没有更新类差异,是设计,不是模型不会更新。Pass@3 会把碰对一次算成解出,看稳不稳要用 Pass^3。图里的分域柱状没有逐模型数字写进正文的,不能从柱高反推。附录里的 Muse-Spark-1.1 不在主表。API 美元成本在附录,正文这张主表没有把它当成排名。预印本许可证是 arXiv.org perpetual non-exclusive license,这篇只复述评测做法和表内数字。

出处:腾讯混元团队,Weihuang Zheng、Tianyuan Zou、Eileen Ye 等,E-Bench: Benchmarking Multi-Step Tool-Use Agents in Real-World Product Scenarios,2026-07-26,https://arxiv.org/abs/2607.23722

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction