CodexQA

Industry & PracticeResearch & Benchmarks

最好的配置只有人类净资产的 27.3%:阿里 MerchantBench 用 365 天订单评长程一致

CodexQA 团队7 min read

48 次运行,每次 365 个模拟日。Hermes 上 Qwen3.7-Max 的终局净资产 59.46 千元,人类是 217.61。这格的变异系数 55.1%。SWR 最高的模型行并不是净资产最高的行。

In this piece

最好的配置只有人类净资产的 27.3%:阿里 MerchantBench 用 365 天订单评长程一致

阿里巴巴集团参与的预印本 MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations。arXiv 最早提交戳记是 2026 年 7 月 31 日,当前 HTML 是 2026 年 8 月 4 日的 v2(2607.28956)。作者包括 Qiming Shi、Yulong Tao、Linbo Jin、Chengyu Wang、Chengfu Huo 等,第一单位是 Alibaba Group,合作单位有浙江大学、北京大学、复旦大学。数据来自 1688。MerchantBench 评的不是一道题做没做完,而是同一个网店在 365 个模拟日里能不能把净资产目标维持住。

环境按小时走,Agent 每 12 步才决策一次

任务写成有限视界的部分可观察决策过程。模拟器按小时推进,控制视界 365 天,共 8760 步。需求、供应商状态和订单生命周期每一步都在变。Agent 每 12 步才拿到一个决策窗口,其余步是空动作。到第 8760 步停止新需求和激活,未完结订单继续走到终局结算。中间奖励是 0。终局净资产是现金余额、保证金、在途资金和应收款四项之和。一次运行的分数就是这一笔终局净资产,策略的目标是它在随机轨迹上的期望。

初始状态:现金 2000 元,保证金 1000 元,在架上限 50 个。现金付采购和已实现亏损,未付罚款从保证金扣,保证金耗尽就停业。

目录来自 1688 的真实记录,时间从 2025 年 6 月 1 日到 2026 年 5 月 31 日,另有 365 份按日对齐的市场报告。先去掉缺标识、类目对不上、价格非正、需求史不完整的记录,剩下 98843 个商品、36576 个供应商、10 个一级类目。Agent 通过工具只能看见公开的商品和供应商字段。需求曲线、风险率、尚未发生的订单结果和未来事件时间保持隐藏。

供给端每步按商品级概率抽三种上游事件:改价、下架、发货延迟。概率用平台履约信号校准。订单是单件一件代发,商家不先囤货。下单就按当时供货价采购,扣现金、减库存。正常单在抽样延迟后结算,应收进现金。异常结果有六种:取消、缺货、晚发、仅退款、退货退款、差评。取消退回采购成本;缺货则采购不发生。晚发继续走完履约。两种退款都去掉应收,只有退货退款退回采购成本,差评保留销售收入。缺货、晚发、退货退款和差评会产生平台罚款,除取消以外的异常还会按各自的经验分和权重拉低店铺评分。

工具 26 个,分四组:选品、上下架和改价、现金流、供应商与订单监测。每个决策窗口先给模拟时间、店铺状态、最近的供应和订单变化,Agent 做到自己结束窗口或时间用尽。ReAct 和 Hermes 用同一套环境动态、同一份任务提示、同样这 26 个工具。

48 次运行,每格是 3 次的平均

八个模型,两套框架,每对跑 3 次,共 48 次,每次 365 个模拟日。模型是 GPT-5.6 Sol、Claude Opus 4.8、Qwen3.7-Max、Qwen3.7-Plus、GLM-5.2、DeepSeek-V4-Pro、DeepSeek-V4-Flash、Kimi K2.6。ReAct 是包在 26 个工具上的最小控制器。Hermes 用默认配置,在这 26 个工具之外还有代码执行、规划、记忆和技能管理。两套框架都会压缩长历史,摘要模型就是被测模型自己。

另外有规则基线,以及 3 名没有电商经营经验的人类。规则基线每天检查,拿掉不活跃或受供应商事件影响的商品,再用当日市场报告填满空位。

表 1 的数是 3 次运行的平均。净资产和 GMV 的单位是千元,罚款是元,比率是百分数。SWR 是持续窗口率:在所有滚动 30 天里,预定决策窗口中至少调用一次环境工具的比例,取这些窗口里的最小值。每个框架内最好的一格加粗。

配置净资产GMV利润率订单罚款评分异常率在架SWR工具调用
ReAct GPT-5.6 Sol40.8974.1951.39964994.0410.750.099.47257
ReAct Claude Opus 4.831.8969.1044.412147964.0512.124.045.01139
ReAct Qwen3.7-Max20.6639.7344.59256723.9016.139.611.1815
ReAct Qwen3.7-Plus20.7440.8545.610567053.9913.149.952.21221
ReAct GLM-5.225.7360.9037.3215814223.9314.926.053.32045
ReAct DeepSeek-V4-Pro6.568.4041.94502454.0114.423.530.6660
ReAct DeepSeek-V4-Flash14.4728.7839.69855174.0414.119.340.6960
ReAct Kimi K2.624.9963.6932.9223014743.8915.347.310.61228
Hermes GPT-5.6 Sol52.93133.0740.2325110964.099.250.066.14831
Hermes Claude Opus 4.835.5683.2339.9180810894.0211.822.131.71138
Hermes Qwen3.7-Max59.46116.7646.9192912953.9015.749.622.21366
Hermes Qwen3.7-Plus29.4253.6948.99816423.9513.849.919.4820
Hermes GLM-5.242.32103.0636.9273114544.0511.349.662.81792
Hermes DeepSeek-V4-Pro16.7131.9543.410626653.9814.533.033.3942
Hermes DeepSeek-V4-Flash24.6964.5237.6198917743.9316.048.862.21259
Hermes Kimi K2.623.9675.0626.8339826713.7319.148.317.8969
人类217.61608.0635.3944256223.9812.549.1100.08311
规则基线24.4853.3740.3160513743.7618.050.0100.03236

16 个模型配置里,净资产最高的是 Hermes 上的 Qwen3.7-Max,59.46 千元。ReAct 里最高的是 GPT-5.6 Sol,40.89。按模型把两套框架平均,GPT-5.6 Sol 的平均净资产最高。人类是 217.61 千元。59.46 除以 217.61 是 27.3%,和摘要里「最好的 LLM 配置只达到人类平均终局净资产的 27.3%」对得上。规则基线 24.48,已经高于 ReAct 里的 Qwen3.7-Max、Qwen3.7-Plus、DeepSeek 两档和 Kimi 并不明显占优的好几行;DeepSeek-V4-Pro 的 ReAct 只有 6.56。

利润率不能拿来排名。人类利润率 35.3,低于 ReAct GPT-5.6 Sol 的 51.3,但订单是 9442 对 996,GMV 是 608.06 对 74.19。高利润率对应的是更小的盘子。

八个模型平均下来,Hermes 的终局净资产比 ReAct 高 53.3%,GMV 高 71.5%,订单多 71.2%。七个模型在 Hermes 上净资产更高,升幅从 Claude Opus 4.8 的 11.5% 到 Qwen3.7-Max 的 187.8%。Kimi K2.6 是例外,Hermes 比 ReAct 低 4.1%。这里的百分数是相对变化,不是表里的百分点。

图 4 是三次重复的净资产分布。同一框架里变异系数最低的是 ReAct 的 GPT-5.6 Sol,3.3%,以及 Hermes 的 Claude Opus 4.8,10.0%。净资产均值最高的 Hermes Qwen3.7-Max,变异系数是 55.1%。3 次平均撑不起「稳定第一」。

SWR 和净资产不是一回事

人类 SWR 是 100%。模型在 ReAct 上从 10.6% 到 99.4%,在 Hermes 上从 17.8% 到 66.1%。ReAct 的 GPT-5.6 Sol 达到 99.4%,净资产仍只有 40.89,不到人类的五分之一。Hermes Qwen3.7-Max 的 SWR 只有 22.2%,净资产却是模型里最高。持续调用工具,不等于目标还在净资产上。

论文把失败分成两类。操作一致性:越做越少,不再跟进先前决定或延迟结果。策略一致性:还在动,但离开了终局净资产,或者证据攒起来了也不改无效策略。

Qwen3.7-Max 的季度有效窗口率,Hermes 从 62% 掉到 37%,ReAct 从 68% 掉到 23%,环境工具调用也明显减少。ReAct Qwen3.7-Max 的 SWR 是 11.1%,供应链检查占剩余工具调用的比例从 14% 升到 34%。Hermes 的 Kimi K2.6 有一次在第 104 天判定店铺没法恢复,之后 523 个决策窗口里有 355 个不再做环境动作。这两处是轨迹例子,不是 48 次的平均。

证据怎么用,论文只给了代表性轨迹。GPT-5.6 Sol 和 Kimi K2.6 会把不良结果归到具体在架商品并换掉。Qwen3.7-Plus 留着继续观察。DeepSeek-V4-Pro 退款后没有改受影响的在架商品。人类的说法是下架,再用相近关键词找替代,把需求留下。GPT-5.6 Sol 有一条轨迹对没有不良结果的已验证商品降价,用来增加正常结算、把评分拉回阈值。Qwen3.7-Max 在一次早期差评把店打到三星后,改了 40 个在架商品的价格。

采购价带也是对照,不是模型表。人类在架商品的平均采购价,前三个月在 43.4 元到 53.1 元,后三个月在 58.7 元到 90.8 元。GLM-5.2、DeepSeek-V4-Flash、Kimi K2.6 的价格轨迹相对平。图 6 的选品对齐分是在架商品当月、按在架小时加权的目录需求分位。人类从 6 月的 56.1 升到 12 月和 1 月的 80 以上。规则基线停在目录中位附近。Claude Opus 4.8 后几个月对齐变强,但货架从 37.3 个收到 12.0 个,利润没有跟着上去。

记忆错误也是个例。Hermes Claude Opus 4.8 有一次把「拿掉弱商品会把流量集中到剩下的」当成真的,在架数从第 54 天的 47 个收到第 322 天的 3 个,而每件商品的需求本来是独立的。Hermes Qwen3.7-Max 有一次在第 282 天把终点记成第 285 天,还剩 83 天就不再补空位,模拟时间走过那个假终点才改回来。

这些数不能被读成什么

终局净资产是 3 次的均值。Hermes Qwen3.7-Max 的变异系数 55.1%,第一名不稳定。人类只有 3 人,而且没有电商经营经验,217.61 不是职业商家的上限。规则基线 SWR 也是 100%,净资产只有 24.48,所以 SWR 不能代替经营结果。Hermes 比 ReAct 多出来的代码、记忆和技能没有拆开做消融,53.3% 不能记成某一个开关的效果。Kimi 在 Hermes 上更差,框架收益看模型。隐藏的需求、风险率和未来事件意味着这是部分可观察仿真,不是 1688 上的真实开店。小时步、每 12 步一次决策、保证金耗尽即停业,都换掉就会换结果。预印本许可证是 arXiv.org perpetual non-exclusive license。这篇只复述评测协议和表内数字,也不是 2026-09-02 那篇 E-Commerce Bench。

出处:阿里巴巴集团,Qiming Shi、Yulong Tao、Linbo Jin、Chengyu Wang、Chengfu Huo 等,MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations,2026-07-31,https://arxiv.org/abs/2607.28956

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction