Industry & PracticeResearch & Benchmarks
最好的 配置 只有 人类 净 资产 的 27.3 %: 阿里 MerchantBench 用 365 天 订单 评 长 程 一致
48 次运行,每次 365 个模拟日。Hermes 上 Qwen3.7-Max 的终局净资产 59.46 千元,人类是 217.61。这格的变异系数 55.1%。SWR 最高的模型行并不是净资产最高的行。

In this piece
最好的配置只有人类净资产的 27.3%:阿里 MerchantBench 用 365 天订单评长程一致
阿里巴巴集团参与的预印本 MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations。arXiv 最早提交戳记是 2026 年 7 月 31 日,当前 HTML 是 2026 年 8 月 4 日的 v2(2607.28956)。作者包括 Qiming Shi、Yulong Tao、Linbo Jin、Chengyu Wang、Chengfu Huo 等,第一单位是 Alibaba Group,合作单位有浙江大学、北京大学、复旦大学。数据来自 1688。MerchantBench 评的不是一道题做没做完,而是同一个网店在 365 个模拟日里能不能把净资产目标维持住。
环境按小时走,Agent 每 12 步才决策一次
任务写成有限视界的部分可观察决策过程。模拟器按小时推进,控制视界 365 天,共 8760 步。需求、供应商状态和订单生命周期每一步都在变。Agent 每 12 步才拿到一个决策窗口,其余步是空动作。到第 8760 步停止新需求和激活,未完结订单继续走到终局结算。中间奖励是 0。终局净资产是现金余额、保证金、在途资金和应收款四项之和。一次运行的分数就是这一笔终局净资产,策略的目标是它在随机轨迹上的期望。
初始状态:现金 2000 元,保证金 1000 元,在架上限 50 个。现金付采购和已实现亏损,未付罚款从保证金扣,保证金耗尽就停业。
目录来自 1688 的真实记录,时间从 2025 年 6 月 1 日到 2026 年 5 月 31 日,另有 365 份按日对齐的市场报告。先去掉缺标识、类目对不上、价格非正、需求史不完整的记录,剩下 98843 个商品、36576 个供应商、10 个一级类目。Agent 通过工具只能看见公开的商品和供应商字段。需求曲线、风险率、尚未发生的订单结果和未来事件时间保持隐藏。
供给端每步按商品级概率抽三种上游事件:改价、下架、发货延迟。概率用平台履约信号校准。订单是单件一件代发,商家不先囤货。下单就按当时供货价采购,扣现金、减库存。正常单在抽样延迟后结算,应收进现金。异常结果有六种:取消、缺货、晚发、仅退款、退货退款、差评。取消退回采购成本;缺货则采购不发生。晚发继续走完履约。两种退款都去掉应收,只有退货退款退回采购成本,差评保留销售收入。缺货、晚发、退货退款和差评会产生平台罚款,除取消以外的异常还会按各自的经验分和权重拉低店铺评分。
工具 26 个,分四组:选品、上下架和改价、现金流、供应商与订单监测。每个决策窗口先给模拟时间、店铺状态、最近的供应和订单变化,Agent 做到自己结束窗口或时间用尽。ReAct 和 Hermes 用同一套环境动态、同一份任务提示、同样这 26 个工具。
48 次运行,每格是 3 次的平均
八个模型,两套框架,每对跑 3 次,共 48 次,每次 365 个模拟日。模型是 GPT-5.6 Sol、Claude Opus 4.8、Qwen3.7-Max、Qwen3.7-Plus、GLM-5.2、DeepSeek-V4-Pro、DeepSeek-V4-Flash、Kimi K2.6。ReAct 是包在 26 个工具上的最小控制器。Hermes 用默认配置,在这 26 个工具之外还有代码执行、规划、记忆和技能管理。两套框架都会压缩长历史,摘要模型就是被测模型自己。
另外有规则基线,以及 3 名没有电商经营经验的人类。规则基线每天检查,拿掉不活跃或受供应商事件影响的商品,再用当日市场报告填满空位。
表 1 的数是 3 次运行的平均。净资产和 GMV 的单位是千元,罚款是元,比率是百分数。SWR 是持续窗口率:在所有滚动 30 天里,预定决策窗口中至少调用一次环境工具的比例,取这些窗口里的最小值。每个框架内最好的一格加粗。
| 配置 | 净资产 | GMV | 利润率 | 订单 | 罚款 | 评分 | 异常率 | 在架 | SWR | 工具调用 |
|---|---|---|---|---|---|---|---|---|---|---|
| ReAct GPT-5.6 Sol | 40.89 | 74.19 | 51.3 | 996 | 499 | 4.04 | 10.7 | 50.0 | 99.4 | 7257 |
| ReAct Claude Opus 4.8 | 31.89 | 69.10 | 44.4 | 1214 | 796 | 4.05 | 12.1 | 24.0 | 45.0 | 1139 |
| ReAct Qwen3.7-Max | 20.66 | 39.73 | 44.5 | 925 | 672 | 3.90 | 16.1 | 39.6 | 11.1 | 815 |
| ReAct Qwen3.7-Plus | 20.74 | 40.85 | 45.6 | 1056 | 705 | 3.99 | 13.1 | 49.9 | 52.2 | 1221 |
| ReAct GLM-5.2 | 25.73 | 60.90 | 37.3 | 2158 | 1422 | 3.93 | 14.9 | 26.0 | 53.3 | 2045 |
| ReAct DeepSeek-V4-Pro | 6.56 | 8.40 | 41.9 | 450 | 245 | 4.01 | 14.4 | 23.5 | 30.6 | 660 |
| ReAct DeepSeek-V4-Flash | 14.47 | 28.78 | 39.6 | 985 | 517 | 4.04 | 14.1 | 19.3 | 40.6 | 960 |
| ReAct Kimi K2.6 | 24.99 | 63.69 | 32.9 | 2230 | 1474 | 3.89 | 15.3 | 47.3 | 10.6 | 1228 |
| Hermes GPT-5.6 Sol | 52.93 | 133.07 | 40.2 | 3251 | 1096 | 4.09 | 9.2 | 50.0 | 66.1 | 4831 |
| Hermes Claude Opus 4.8 | 35.56 | 83.23 | 39.9 | 1808 | 1089 | 4.02 | 11.8 | 22.1 | 31.7 | 1138 |
| Hermes Qwen3.7-Max | 59.46 | 116.76 | 46.9 | 1929 | 1295 | 3.90 | 15.7 | 49.6 | 22.2 | 1366 |
| Hermes Qwen3.7-Plus | 29.42 | 53.69 | 48.9 | 981 | 642 | 3.95 | 13.8 | 49.9 | 19.4 | 820 |
| Hermes GLM-5.2 | 42.32 | 103.06 | 36.9 | 2731 | 1454 | 4.05 | 11.3 | 49.6 | 62.8 | 1792 |
| Hermes DeepSeek-V4-Pro | 16.71 | 31.95 | 43.4 | 1062 | 665 | 3.98 | 14.5 | 33.0 | 33.3 | 942 |
| Hermes DeepSeek-V4-Flash | 24.69 | 64.52 | 37.6 | 1989 | 1774 | 3.93 | 16.0 | 48.8 | 62.2 | 1259 |
| Hermes Kimi K2.6 | 23.96 | 75.06 | 26.8 | 3398 | 2671 | 3.73 | 19.1 | 48.3 | 17.8 | 969 |
| 人类 | 217.61 | 608.06 | 35.3 | 9442 | 5622 | 3.98 | 12.5 | 49.1 | 100.0 | 8311 |
| 规则基线 | 24.48 | 53.37 | 40.3 | 1605 | 1374 | 3.76 | 18.0 | 50.0 | 100.0 | 3236 |
16 个模型配置里,净资产最高的是 Hermes 上的 Qwen3.7-Max,59.46 千元。ReAct 里最高的是 GPT-5.6 Sol,40.89。按模型把两套框架平均,GPT-5.6 Sol 的平均净资产最高。人类是 217.61 千元。59.46 除以 217.61 是 27.3%,和摘要里「最好的 LLM 配置只达到人类平均终局净资产的 27.3%」对得上。规则基线 24.48,已经高于 ReAct 里的 Qwen3.7-Max、Qwen3.7-Plus、DeepSeek 两档和 Kimi 并不明显占优的好几行;DeepSeek-V4-Pro 的 ReAct 只有 6.56。
利润率不能拿来排名。人类利润率 35.3,低于 ReAct GPT-5.6 Sol 的 51.3,但订单是 9442 对 996,GMV 是 608.06 对 74.19。高利润率对应的是更小的盘子。
八个模型平均下来,Hermes 的终局净资产比 ReAct 高 53.3%,GMV 高 71.5%,订单多 71.2%。七个模型在 Hermes 上净资产更高,升幅从 Claude Opus 4.8 的 11.5% 到 Qwen3.7-Max 的 187.8%。Kimi K2.6 是例外,Hermes 比 ReAct 低 4.1%。这里的百分数是相对变化,不是表里的百分点。
图 4 是三次重复的净资产分布。同一框架里变异系数最低的是 ReAct 的 GPT-5.6 Sol,3.3%,以及 Hermes 的 Claude Opus 4.8,10.0%。净资产均值最高的 Hermes Qwen3.7-Max,变异系数是 55.1%。3 次平均撑不起「稳定第一」。
SWR 和净资产不是一回事
人类 SWR 是 100%。模型在 ReAct 上从 10.6% 到 99.4%,在 Hermes 上从 17.8% 到 66.1%。ReAct 的 GPT-5.6 Sol 达到 99.4%,净资产仍只有 40.89,不到人类的五分之一。Hermes Qwen3.7-Max 的 SWR 只有 22.2%,净资产却是模型里最高。持续调用工具,不等于目标还在净资产上。
论文把失败分成两类。操作一致性:越做越少,不再跟进先前决定或延迟结果。策略一致性:还在动,但离开了终局净资产,或者证据攒起来了也不改无效策略。
Qwen3.7-Max 的季度有效窗口率,Hermes 从 62% 掉到 37%,ReAct 从 68% 掉到 23%,环境工具调用也明显减少。ReAct Qwen3.7-Max 的 SWR 是 11.1%,供应链检查占剩余工具调用的比例从 14% 升到 34%。Hermes 的 Kimi K2.6 有一次在第 104 天判定店铺没法恢复,之后 523 个决策窗口里有 355 个不再做环境动作。这两处是轨迹例子,不是 48 次的平均。
证据怎么用,论文只给了代表性轨迹。GPT-5.6 Sol 和 Kimi K2.6 会把不良结果归到具体在架商品并换掉。Qwen3.7-Plus 留着继续观察。DeepSeek-V4-Pro 退款后没有改受影响的在架商品。人类的说法是下架,再用相近关键词找替代,把需求留下。GPT-5.6 Sol 有一条轨迹对没有不良结果的已验证商品降价,用来增加正常结算、把评分拉回阈值。Qwen3.7-Max 在一次早期差评把店打到三星后,改了 40 个在架商品的价格。
采购价带也是对照,不是模型表。人类在架商品的平均采购价,前三个月在 43.4 元到 53.1 元,后三个月在 58.7 元到 90.8 元。GLM-5.2、DeepSeek-V4-Flash、Kimi K2.6 的价格轨迹相对平。图 6 的选品对齐分是在架商品当月、按在架小时加权的目录需求分位。人类从 6 月的 56.1 升到 12 月和 1 月的 80 以上。规则基线停在目录中位附近。Claude Opus 4.8 后几个月对齐变强,但货架从 37.3 个收到 12.0 个,利润没有跟着上去。
记忆错误也是个例。Hermes Claude Opus 4.8 有一次把「拿掉弱商品会把流量集中到剩下的」当成真的,在架数从第 54 天的 47 个收到第 322 天的 3 个,而每件商品的需求本来是独立的。Hermes Qwen3.7-Max 有一次在第 282 天把终点记成第 285 天,还剩 83 天就不再补空位,模拟时间走过那个假终点才改回来。
这些数不能被读成什么
终局净资产是 3 次的均值。Hermes Qwen3.7-Max 的变异系数 55.1%,第一名不稳定。人类只有 3 人,而且没有电商经营经验,217.61 不是职业商家的上限。规则基线 SWR 也是 100%,净资产只有 24.48,所以 SWR 不能代替经营结果。Hermes 比 ReAct 多出来的代码、记忆和技能没有拆开做消融,53.3% 不能记成某一个开关的效果。Kimi 在 Hermes 上更差,框架收益看模型。隐藏的需求、风险率和未来事件意味着这是部分可观察仿真,不是 1688 上的真实开店。小时步、每 12 步一次决策、保证金耗尽即停业,都换掉就会换结果。预印本许可证是 arXiv.org perpetual non-exclusive license。这篇只复述评测协议和表内数字,也不是 2026-09-02 那篇 E-Commerce Bench。
出处:阿里巴巴集团,Qiming Shi、Yulong Tao、Linbo Jin、Chengyu Wang、Chengfu Huo 等,MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations,2026-07-31,https://arxiv.org/abs/2607.28956
Found it useful? Pass it on
Scan with WeChat to open it on your phone and forward it.