CodexQA

行业与实践研究与基准测试

E-Commerce Bench:把「经营一家网店一整年」变成 Agent 评测

CodexQA 团队阅读约 9 分钟

阿里 Qwen 团队联合淘宝天猫发布 E-Commerce Bench,用 10 万元本金、365 天连续经营和确定性谈判内核,评估 18 个模型作为商家的长程经营、防欺诈与长程学习能力。

本文目录

E-Commerce Bench:把「经营一家网店一整年」变成 Agent 评测

阿里巴巴 Qwen 团队联合淘宝天猫集团(Taobao & Tmall Group)在 2026 年 9 月 2 日发布了 E-Commerce Bench(一个评估大模型 Agent 长程自主经营能力的基准,配套论文见 arXiv:2608.30730,代码开源在 GitHub 的 QwenLM/E-CommerceBench)。它想回答的问题不是「模型能不能在有限轮次内完成一个目标」,而是「模型能不能像商家一样,在一个不断变化的市场里持续经营一整年并活下去」。这篇文章按原文顺序整理它的评测设计、关键数据和明确的边界。

为什么长程经营没有「自然停止点」

原文指出,过去几年的 Agent 基准大多遵循同一个模式:给模型一个目标,让它在有限轮次内达成,无论是走迷宫找宝藏、写一份报告还是修一段代码,然后用交付物质量或任务完成度打分。这类评测通常有一个明确定义的自然停止点。

但现实世界里大多数长程任务没有这样的停止点。天气预报、股票交易、经营一家企业都是如此。一家网店不会在某个早上「经营完毕」:上个月积压的库存、前天谈下的进货价、昨天做的促销,都会影响今天的销量,Agent 必须在一个不断变化的市场里持续调整策略,去达成一个长周期的利润目标。E-Commerce Bench 就是为测量这种长程经营能力而设计的,评估模型作为商家在真实市场环境中经营网店的表现。

十万元本金,连续经营 365 天

评测设定是:Agent 从 10 万元人民币本金起步,可以同时经营多家店铺,在一个完整的模拟年度里做真实卖家每天做的事——研究品类、和供应商砍价、给商品定价上架、盯促销日历、管理库存和现金流。环境从不透露需求上限在哪里、真实成本底线是多少,这些都要 Agent 自己去发现。一年结束时,从利润、现金流管理、供应商谈判、防欺诈、运营效率、执行力和长程学习等多个维度打分。

为了还原真实电商平台,基准内置了五类机制:

  1. 真实市场数据:6886 件商品分布在 60 个品类,背后是 576 家供应商和 12 种可开店铺类型,全年日历上固定了 10 个市场事件和 8 场促销。品类销量、退货率和节假日日历都直接来自脱敏后的淘宝天猫平台数据。
  2. 时间预算:一天从早上 8 点到下午 6 点,只有 600 分钟,每次工具调用都要消耗其中一部分。查一次余额花 10 分钟,开一家店 60 分钟,给一个供应商发一条消息 30 分钟。调研和行动共用同一个预算,所以「先想清楚」和「边做边摸索」的代价是不同的。
  3. 三账户结算:每一笔成本在发生当下就离开银行账户,而收入要等订单发货、扣除佣金、进入平台担保、再等 9 天才到平台钱包,还要经过一次手动提现才变回可花的现金。
  4. 仓储与物流:库存按每天每件收取仓储费,关店也不能停止计费,除非愿意亏本清仓。物流分三档速度,快速档运费翻倍,慢速档减半,任何订单两天内不发货就直接取消。
  5. 退货与信誉:退货率由四个因素驱动——品类自身的基线、供应商发来的次品、Agent 定价高出参考价多少、以及选了哪档物流。后两项在模型控制之内。信誉直接乘算需求,一次退货扣 0.6、一次取消扣 1.0,被钉在信誉刻度底部的店铺只能拿到正常流量的 15%。

确定性谈判内核与需求模型

如果市场需求和供应商行为都是随机的,模型之间的差距就会被噪声淹没,基准既没有区分度也不可复现。因此客户侧完全不做采样:某件商品某天卖多少,是由一组命名因子算出来的——品类基础需求、价格响应、周末、促销、季节性、当天事件、店铺信誉,以及市场需求上限。

供应商侧则用一个确定性内核(deterministic kernel)产生报价和让步策略,再由一个模型把它们渲染成自然对话。原文解释了为什么不让 LLM 直接扮演供应商:第一,同样的谈判策略会得到不一致的报价,导致同一个 Agent 两次运行遇到不同价格;第二,LLM 可能被攻破,一个不诚实的 Agent 可以靠话术或越狱把价格压到成本底线以下,让基准退化成一场越狱比赛。所以每个供应商被拆成两层:

  • 确定性谈判内核:供应商给出的每一次报价、让步、接受和离场都来自内核。保留价和开价是商品的内在属性,而不是从分布里抽样得到的。
  • NPC 渲染层:LLM 只负责把内核已经确定的决策转成人类语言,让 Agent 感觉像在和一个真人讨价还价。

这样多轮砍价的质感保留了下来,采样噪声却被排除在外。

年末总资产只是冰山一角:七条能力轴

原文对 18 个模型各跑了 5 个完整回合(共 90 个 episode)。同样从 10 万元起步,结果相差几个数量级:GPT-5.6 Sol 收于 143 万元,是本金的 14.31 倍;Qwen3.5-Plus 平均只剩 1100 元。最强的开源权重模型是 Qwen3.8-Max-Preview,达到本金的 4.16 倍,但总资产前四名全部是闭源模型。强模型也不保证赢:90 个回合里有 10 个以破产告终,其中两个 GPT-5.5 的回合在 1 月就断了现金流,因为囤货太重,而那时还没有一分钱销售收入完成结算。

365 天的资产曲线大致分三种形态:领先者从 1 月起稳步爬升;破产的回合一路下跌再也没回来,最早的 1 月就触底;中下游模型全年贴着 10 万元线,一整年忙完又回到原点。通往破产的路几乎总是同一条:1 月把仓库堆满,然后再也没能把它卖出去。

原文强调,赚得多不等于经营得好,所以在年末总资产之外还独立打了六个维度:谈判质量、防欺诈、现金流与偿付能力、运营效率、运营执行、长程学习。把七个轴画成雷达图后形状明显凹凸不平——每个厂商家族各取一个模型,七家里有六家至少在某一条轴上低于 18 个模型的中位数。逐轴看,有几个发现比资产总额本身更有意思。

谈判质量:没有一个模型能把价格压到供应商的成本底线。谈判得分范围 0 到 1,0.5 意味着从不还价、供应商开多少就接受多少。Claude Opus 4.7 达到 0.811,确实砍下来不少;Kimi K2.6 只有 0.596,勉强比直接接受开价好一点。还有一个值得注意的结果:同一个模型在面对它能遇到的六种供应商行为风格时谈判表现差异很小,而模型之间的差距是它的四倍。

防欺诈:这是各家分化最大的地方。落到欺诈供应商手里的采购支出占比,两个极端相差超过 160 倍——Claude Opus 4.7 是 0.12%,Qwen3.5-Plus 是 20.11%。作为参照,名单上 576 家供应商里有 152 家是欺诈性的,占 26.4%,所以一个不做任何筛查、把采购预算盲目摊到所有供应商身上的买家,会正好落在 26.4% 这条线附近。全部 18 个模型都低于这条线,意味着每一个都至少筛掉了一些欺诈者。赚得最多的 GPT-5.6 Sol 在这一项只排第 16,但它那一年照样活了下来。真正的分界线不在于模型选择跟谁谈——每个模型接触的对象里欺诈供应商都大致占同样的 26.4%——而在于一场对话会不会变成一笔订单。在 Claude Opus 4.7 接触过的欺诈供应商里,只有 4.0% 最终拿到了订单,而 GPT-5.6 Sol 是 31.7%。

运营效率:用一整年的利润除以产生它的工具调用次数,Fable5 每次调用回报 479 元,高于总资产领先者 GPT-5.6 Sol 的 363 元,而且用的调用次数还少 59.9%。发货、跳到下一天、提现、上架库存这四类动作占了全部调用的 71.8%,而真正能改变采购成本的供应商对话只占 6.0%,改价只占 0.66%。大部分预算被花在了对成本结构毫无影响的动作上。

一整年下来,几乎没有模型买得更便宜

长程学习很难测,主要因为很难说清「进步」应该长什么样。这个环境恰好自带一把现成的尺子:卖家内核永远不会以低于自己保留价的价格成交,所以 Agent 已经拿到的最好价格,就是那个供应商成本底线的一个上界,而且这个上界只会越收越紧。对同一个供应商、同一件商品,下一次采购的成交价是高于还是低于已经拿到的最好价格,不需要任何额外标注就能判断。

原文把每一次复购价格表示成它在砍价区间里的位置,再和一个「把 Agent 已经拿到的价格重新洗牌」的零假设对比,得到 AnchorRatio(锚定比)指标,1.0 意味着模型对自己历史价格的排序和随机排序无法区分。在 8647 次复购里,18 个模型只有 2 个低于 1.0,中位数是 1.369,有 15 个模型在「更贵」的方向上偏离零假设超过两个标准差。供应商选择也朝错误方向漂移:17 个模型在下半年成交中给欺诈供应商的份额比上半年更大。一整年下来,模型并没有变得更会买货。Qwen3.8-Max-Preview 是 18 个里唯一表现出清晰长程学习迹象的,AnchorRatio 为 0.834,也就是说它确实随着一年推进把复购价格谈得更低了。

结语与边界

原文复盘了三个结论。其一,构建 E-Commerce Bench 时反复纠结的一个问题是「要不要让 LLM 直接扮演供应商」,最终答案是否定的:一旦对手方也是概率模型,Agent 与供应商之间的博弈就变成两个采样过程叠加,同样的 Agent 策略两次运行会得到完全不同的结果,评测就失去了可比性。团队的做法是把每一个经济决策冻结进确定性内核,只留一层 LLM 渲染把数字变成人话——多轮砍价的手感保住了,随机噪声被挡在分数之外。原文认为这个思路可以推广到电商谈判之外:用伪随机的确定性内核守住可复现性,看起来是长程基准的一个通用配方。

其二,单一指标会掩盖模型的真实样子。18 个模型没有一个在七条轴上都站得住;前三名每一个都有一项弱到前十开外,而垫底的模型未必在每一维都最差。只看年末总资产,你会以为 GPT-5.6 Sol 全面领先,但它在防欺诈上排第 16。长程任务的失败模式太分散,不把它们拆开就无从知道模型到底弱在哪。

其三,E-Commerce Bench 远未饱和。无论在谈判、防欺诈还是长程学习上,每个维度最好的模型都离满分还有明显距离;七个维度的最好成绩分散在六个不同模型手里,前沿模型仍有大量提升空间,基准也留有足够的余量来衡量经营能力。

需要说明的限制:所有成绩来自 Qwen 团队与淘宝天猫集团的官方实验,回合数为每模型 5 次,样本量有限,破产与学习类结论应理解为其实验窗口内的观察而非普适保证;模型名与得分为原文引用,实际能力随版本更新会变化;需求与供应商行为虽然是确定性内核,但底层品类销量、退货率等来自脱敏平台数据,评测环境是模拟市场而非真实交易。

出处:阿里,Qwen Team(Wei Fan、Xinjie Shen、Xudong Guo、Jianhong Tu、Yang Su、Yinger Zhang、Lianghao Deng、Fengyu Wang、Baohua Dong、Yangqiu Song、Dayiheng Liu,联合淘宝天猫集团),《E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation》,2026-09-02,https://qwen.ai/blog?id=e-commerce-bench

觉得有用,转给同事

微信扫码

用微信扫一扫,在手机上打开后即可转发。

用 RSS 订阅

提交勘误