CodexQA

Industry & PracticeResearch & Benchmarks

测试集宏平均 F1 为 0.615:阿里参与的基准用淘宝行为核验消费价值

CodexQA 团队8 min read

5440 段淘宝购买过程,测试集 544 段由专家从零标注。B2V-Verifier 宏平均 F1 0.615,基线最高是 GPT-5 的 0.417。引言写的大约 34% 没有落到表上的某一格。

In this piece

测试集宏平均 F1 为 0.615:阿里参与的基准用淘宝行为核验消费价值

北京大学与阿里巴巴集团的预印本 Behavior2Value: Benchmarking and Empowering LLMs for Consumer Value Measurement from E-commerce Behaviors。arXiv 为 2609.18203v1。HTML 水印和 abs 页提交日都是 2026 年 9 月 16 日。许可证是 arXiv.org perpetual non-exclusive license,不是 CC BY。作者是 Peixuan Hou、Bin Chen、Li He、Jian Xu、Bo Zheng、Xiuli Ma、Guojie Song。单位块写了北京大学智能学院,以及 Alibaba Group。通讯作者标记在 Guojie Song,邮箱 gjsong@pku.edu.cn。HTML 没有给每位作者单独的上标,所以不能从页面上把名单拆成“哪几位只属于阿里”。数据写明来自匿名化的淘宝行为日志。

Behavior-to-Value(下称 B2V,从一次购买决策过程里的行为,判断这单体现了哪些消费价值)不是推荐下一个商品。标签空间是 E-commerce Consumption Value Taxonomy(下称 ECVT,把电商消费价值收成 30 个细项的分类)。基准叫 B2V-Bench。模型侧的方法叫 B2V-Verifier,底座是 Qwen3-8B。

5440 段购买过程,测试集由专家从零标

每条样本是一笔已完成订单,加上用户在前一天、同一品类里的互动。行为类型 25 种,包括搜索、点击、加购、看优惠券、核对规格、看评价、看问答、找客服。一段里平均 341 个动作。样本还带行为摘要、价值标签和理由。全集 5440 段,来自 2025 年 3 月到 2026 年 3 月的 13 个月度切片。训练 4352,验证 544,测试 544。4352 加 544 加 544 等于 5440。

训练和验证的标签先由自动流程生成,再由人按规程改。测试集从 1000 条心理学专家从零标注的池子里抽出 544 条,用来避开模型自己产的标签。另外 456 条专家样本有没有进入训练,正文没有写。

ECVT 有 30 个细项,按消费价值理论的五个维度来组织。细项从 Amazon Reviews 2023 的评论语句里先用模型归并,再对照已有量表,由心理学专家删掉重复和噪声。正式标签只用其中 28 个,另加一个 none,表示这段行为不够支撑任何价值,避免硬贴标签。决策复杂度和探索兴趣在专家讨论后被移出默认标签,因为单看一段行为认不准。75.2% 的样本至少还有一个次要价值。摘要长度大多在 500 到 1000 字。图 4 说各月的量级和五个维度的构成比较稳,不像只吃到某一个季节。

自动标注先和 1000 条专家共识对过

原始日志太长,先压成摘要。作者用盲评选摘要模型,GPT-5.4 最好,于是全量摘要用它生成。评测里的大模型读的是这份摘要,不是那平均 341 步的原始序列。传统序列模型读的是结构化动作序列。两边的输入不一样。

标注规程叫 VCOP。每个价值写清含义、什么样的行为算证据、什么样的行为算反证,以及和邻近价值怎么分开。AutoPVQ 把肖像价值观问卷的做法搬过来:先给每条行为肖像打 0 到 3 分,再按诊断权重做成该价值的原始分,然后减去这一段里所有候选价值的平均分。最高的一项超过 \(\tau_1\) 才当主标签,其他项超过 \(\tau_2\) 且另有独立证据才当次标签。两个阈值的数值正文没有给。证据不够的候选会被打回去重打分。

1000 段由三名心理学专家一起从零标,分歧讨论到共识。同一套多智能体协议下换三个模型,和这份共识比。表 2:

指标GPT-5.4Claude-SonnetQwen-3.5
主标签一致率86.7%82.9%79.6%
标签集合 Jaccard0.8120.7740.741
完全匹配72.4%67.1%63.5%
Cohen's \(\kappa\)0.7810.7350.692

GPT-5.4 被选来跑全量。之后仍有人按规程改标签、证据和过度推断。这里的 \(\kappa\) 是模型对专家共识,不是三位专家两两之间的一致率。专家之间的一致率正文没有给。

核验模型只把“证据够”的价值留下

B2V-Verifier 不用一次吐出一整组标签。每个价值单独做一次三分类:supported、unsupported、insufficient。supported 是轨迹里有清楚证据。unsupported 是无关、矛盾或不一致。insufficient 是看上去像,但证据不够。训练样本三类都造:标注留下的是 supported;被校验打回的是 insufficient;再抽不相关的价值当 unsupported。推理时,判成 supported 的价值合成多标签结果。

微调用 LLaMA-Factory,在四张 NVIDIA A40 上监督微调 Qwen3-8B。它的输入格式对应提示词档位 P3,所以主表里它只出现在 P3,不和 P4 的少样本提示并排训练。

大模型基线 10 个,提示从 P1 到 P4 加信息:只有标签名,加上定义,加上行为层面的价值描述,再加上少样本。序列模型 GRU4Rec、BERT4Rec、DIN 把预测头换成价值分类。正文说它们明显更差,数字放在附录,主表没有。

指标三组。多标签:宏平均 F1、微平均 F1、加权 F1、宏精确率、宏召回率、汉明损失(越低越好)。排序:NDCG@1、@2、@3。主标签:Primary Accuracy、Top-2 Accuracy,以及二者平均。

主表:0.615 对上最好的基线宏平均 F1 0.417

引言写 B2V-Verifier 相对多个大模型,多标签分类大约提高 34%,标签排序大约 7.4%,主标签识别大约 5.5%。这句没有指明对照的是哪一个模型、哪一列 F1、是相对增幅还是绝对差。表 3 给的是绝对值。下面按原文列出。星号、剑号、双剑号是原文用来标前三的记号,不是显著性检验。

模型提示宏 F1微 F1加权 F1精确率召回率汉明损失N@1N@2N@3主标签Top-2平均
Claude-Haiku-4.5P10.2560.5100.5590.3130.4070.0830.6710.6100.6330.5480.6770.613
Claude-Haiku-4.5P20.2860.5760.6000.3150.3930.0680.7140.6720.6720.5740.7430.659
Claude-Haiku-4.5P30.3130.5960.6120.3670.3980.0600.7300.6920.6660.5930.7700.682
Claude-Haiku-4.5P40.2750.6240.6220.3010.3550.0530.7570.7270.6790.6040.7770.691
DeepSeek-V3.2P10.2660.5680.6050.3000.4330.0730.7170.6760.6880.5690.7320.651
DeepSeek-V3.2P20.2890.5970.6110.2670.4560.0650.7210.6970.6920.5610.7570.659
DeepSeek-V3.2P30.3170.6190.6450.3180.4420.0590.7570.7110.7010.5950.7570.676
DeepSeek-V3.2P40.3500.6550.6590.3800.4220.0500.7730.7490.7110.6130.7810.697
Gemini-2.5P10.2760.5820.5700.3500.3530.0670.7730.6910.6910.5630.6950.629
Gemini-2.5P20.2480.5830.5490.3690.3390.0640.7750.7030.6750.5780.7170.648
Gemini-2.5P30.2630.5960.5680.3500.3550.0600.7810.7130.6740.6120.7340.673
Gemini-2.5P40.2420.6040.5720.3050.3010.0540.7750.7260.6570.6150.7510.683
GLM-5P10.3080.5850.6120.2970.4330.0660.7080.6790.6760.5690.7040.637
GLM-5P20.3350.6090.6280.3540.4150.0580.7040.6730.6590.5780.7140.646
GLM-5P30.3390.6250.6370.3790.3890.0530.6730.6660.6470.5560.7170.637
GLM-5P40.3580.6080.6220.4170.4050.0550.6650.6470.6300.5580.7030.631
GPT-4o-miniP10.2480.5140.5250.2970.3160.0830.7100.6420.6410.5170.6380.578
GPT-4o-miniP20.2530.5040.5210.3030.2980.0840.7210.6420.6350.5260.6450.586
GPT-4o-miniP30.2480.5030.5190.3500.2980.0850.7170.6440.6350.5430.6580.601
GPT-4o-miniP40.2200.5690.5770.3050.2730.0690.6910.6570.6590.5320.7040.618
GPT-5P10.3140.5560.6130.2840.4470.0750.5990.6230.6510.4760.7010.589
GPT-5P20.4000.5970.6540.3620.5310.0670.6860.6870.7050.5480.7490.649
GPT-5P30.3600.6290.6730.3420.4670.0620.6900.6970.7250.5480.7750.662
GPT-5P40.4170.6280.6660.4000.5240.0600.7030.7040.7190.5580.7700.664
Kimi-K2.6P10.2750.5780.6130.2730.3910.0720.7620.7260.7170.6210.7600.691
Kimi-K2.6P20.3250.5850.5980.3600.4320.0700.7790.7290.7230.6320.7580.695
Kimi-K2.6P30.3070.5930.6200.3740.3980.0690.7570.7240.7260.6040.7640.684
Kimi-K2.6P40.3040.5910.6150.3380.3810.0660.7160.7040.6950.5680.7370.653
Qwen3-235BP10.2530.5590.5770.2330.4040.0750.7570.6910.6960.5990.7270.663
Qwen3-235BP20.2710.5650.5820.2800.3860.0740.7300.7000.6980.5740.7420.658
Qwen3-235BP30.2900.5810.6020.3000.4100.0710.7470.7150.7130.5950.7380.667
Qwen3-235BP40.2880.6050.6220.3100.3990.0660.7570.7310.7320.5930.7640.679
B2V-VerifierP30.6150.8150.8120.6590.5910.0280.8240.8070.7980.6520.8420.747

基线里,宏平均 F1 最高的是 GPT-5 的 P4,0.417。微平均 F1 最高的是 DeepSeek-V3.2 的 P4,0.655。主标签准确率最高的是 Kimi-K2.6 的 P2,0.632。B2V-Verifier 这些列都更高:宏平均 F1 0.615,微平均 0.815,汉明损失 0.028,NDCG@1 0.824,主标签 0.652,Top-2 0.842。0.615 相对 0.417 的差是 0.198。这不是引言里的“大约 34%”的直接算式,正文没有把 34% 还原到某一格。

提示加长并不单调变好。GPT-5 的宏平均 F1 从 P1 的 0.314 到 P2 的 0.400,P3 又落到 0.360,P4 到 0.417。Kimi-K2.6 的主标签在 P2 是 0.632,P4 掉到 0.568。论文的解释是:少样本会把预测带向常见标签组合,主标签可能变好,次要价值的召回变差。

拿掉核验形式,宏平均 F1 掉到 0.548

表 4 在同一套训练和评测上做消融。

变体宏 F1微 F1加权 F1NDCG@1NDCG@3主标签Top-2
完整核验0.6150.8150.8120.8240.7980.6520.842
去掉核验形式0.5480.7660.7590.7730.7420.5890.796
去掉价值描述0.5740.7890.7840.7940.7640.6150.813
去掉不足证据0.5630.7810.7760.7850.7550.6030.807
去掉不支持0.5820.7950.7890.8020.7720.6240.819

掉得最多的是改回直接预测标签。论文据此说,收益主要来自“逐个价值核验证据”,不是只换了一个 8B 模型的名字。表里没有再报一次未微调的 Qwen3-8B。Qwen3-235B 是基线,不是这个 8B 的对照。

这些数不能被读成什么

0.615 是 544 条专家从零标注的测试集上的宏平均 F1,不是线上点击率,也不是 5440 条全量上的成绩。训练标签经过 AutoPVQ,测试标签没有。大模型看的是 GPT-5.4 写的摘要,序列模型看的是原始动作。摘要模型本身没有出现在表 3 的被测名单里。

引言的 34%、7.4%、5.5% 写的是大约,没有对照格。表 3 才是可以逐格核对的数。星号不是统计检验。\(\tau_1\)、\(\tau_2\) 和各项诊断权重没有数值。专家之间的一致率没有给。1000 条专家池里没进测试集的 456 条,去向没有写。

分类从 30 项收成 28 项加 none。决策复杂度和探索兴趣是因为单段行为认不出才删的,不是因为模型做得好。数据是淘宝匿名日志的 13 个月,不能直接说成其他电商站点的价值分布。数据集和代码写的是录用后公开,这篇预印本还没给出可用地址。

页面能确认的机构是北京大学和 Alibaba Group,通讯邮箱在北大。作者没有逐人单位。许可证不是知识共享署名,而是 arXiv 的非独占许可。这篇只复述评测协议和文中数字。

出处:阿里巴巴集团、北京大学,Peixuan Hou、Guojie Song 等,Behavior2Value: Benchmarking and Empowering LLMs for Consumer Value Measurement from E-commerce Behaviors,2026-09-16,https://arxiv.org/abs/2609.18203

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction