Industry & PracticeResearch & Benchmarks
测试 集 宏 平均 F1 为 0.615: 阿里 参与 的 基准 用 淘 宝 行为 核验 消费 价值
5440 段淘宝购买过程,测试集 544 段由专家从零标注。B2V-Verifier 宏平均 F1 0.615,基线最高是 GPT-5 的 0.417。引言写的大约 34% 没有落到表上的某一格。

In this piece
测试集宏平均 F1 为 0.615:阿里参与的基准用淘宝行为核验消费价值
北京大学与阿里巴巴集团的预印本 Behavior2Value: Benchmarking and Empowering LLMs for Consumer Value Measurement from E-commerce Behaviors。arXiv 为 2609.18203v1。HTML 水印和 abs 页提交日都是 2026 年 9 月 16 日。许可证是 arXiv.org perpetual non-exclusive license,不是 CC BY。作者是 Peixuan Hou、Bin Chen、Li He、Jian Xu、Bo Zheng、Xiuli Ma、Guojie Song。单位块写了北京大学智能学院,以及 Alibaba Group。通讯作者标记在 Guojie Song,邮箱 gjsong@pku.edu.cn。HTML 没有给每位作者单独的上标,所以不能从页面上把名单拆成“哪几位只属于阿里”。数据写明来自匿名化的淘宝行为日志。
Behavior-to-Value(下称 B2V,从一次购买决策过程里的行为,判断这单体现了哪些消费价值)不是推荐下一个商品。标签空间是 E-commerce Consumption Value Taxonomy(下称 ECVT,把电商消费价值收成 30 个细项的分类)。基准叫 B2V-Bench。模型侧的方法叫 B2V-Verifier,底座是 Qwen3-8B。
5440 段购买过程,测试集由专家从零标
每条样本是一笔已完成订单,加上用户在前一天、同一品类里的互动。行为类型 25 种,包括搜索、点击、加购、看优惠券、核对规格、看评价、看问答、找客服。一段里平均 341 个动作。样本还带行为摘要、价值标签和理由。全集 5440 段,来自 2025 年 3 月到 2026 年 3 月的 13 个月度切片。训练 4352,验证 544,测试 544。4352 加 544 加 544 等于 5440。
训练和验证的标签先由自动流程生成,再由人按规程改。测试集从 1000 条心理学专家从零标注的池子里抽出 544 条,用来避开模型自己产的标签。另外 456 条专家样本有没有进入训练,正文没有写。
ECVT 有 30 个细项,按消费价值理论的五个维度来组织。细项从 Amazon Reviews 2023 的评论语句里先用模型归并,再对照已有量表,由心理学专家删掉重复和噪声。正式标签只用其中 28 个,另加一个 none,表示这段行为不够支撑任何价值,避免硬贴标签。决策复杂度和探索兴趣在专家讨论后被移出默认标签,因为单看一段行为认不准。75.2% 的样本至少还有一个次要价值。摘要长度大多在 500 到 1000 字。图 4 说各月的量级和五个维度的构成比较稳,不像只吃到某一个季节。
自动标注先和 1000 条专家共识对过
原始日志太长,先压成摘要。作者用盲评选摘要模型,GPT-5.4 最好,于是全量摘要用它生成。评测里的大模型读的是这份摘要,不是那平均 341 步的原始序列。传统序列模型读的是结构化动作序列。两边的输入不一样。
标注规程叫 VCOP。每个价值写清含义、什么样的行为算证据、什么样的行为算反证,以及和邻近价值怎么分开。AutoPVQ 把肖像价值观问卷的做法搬过来:先给每条行为肖像打 0 到 3 分,再按诊断权重做成该价值的原始分,然后减去这一段里所有候选价值的平均分。最高的一项超过 \(\tau_1\) 才当主标签,其他项超过 \(\tau_2\) 且另有独立证据才当次标签。两个阈值的数值正文没有给。证据不够的候选会被打回去重打分。
1000 段由三名心理学专家一起从零标,分歧讨论到共识。同一套多智能体协议下换三个模型,和这份共识比。表 2:
| 指标 | GPT-5.4 | Claude-Sonnet | Qwen-3.5 |
|---|---|---|---|
| 主标签一致率 | 86.7% | 82.9% | 79.6% |
| 标签集合 Jaccard | 0.812 | 0.774 | 0.741 |
| 完全匹配 | 72.4% | 67.1% | 63.5% |
| Cohen's \(\kappa\) | 0.781 | 0.735 | 0.692 |
GPT-5.4 被选来跑全量。之后仍有人按规程改标签、证据和过度推断。这里的 \(\kappa\) 是模型对专家共识,不是三位专家两两之间的一致率。专家之间的一致率正文没有给。
核验模型只把“证据够”的价值留下
B2V-Verifier 不用一次吐出一整组标签。每个价值单独做一次三分类:supported、unsupported、insufficient。supported 是轨迹里有清楚证据。unsupported 是无关、矛盾或不一致。insufficient 是看上去像,但证据不够。训练样本三类都造:标注留下的是 supported;被校验打回的是 insufficient;再抽不相关的价值当 unsupported。推理时,判成 supported 的价值合成多标签结果。
微调用 LLaMA-Factory,在四张 NVIDIA A40 上监督微调 Qwen3-8B。它的输入格式对应提示词档位 P3,所以主表里它只出现在 P3,不和 P4 的少样本提示并排训练。
大模型基线 10 个,提示从 P1 到 P4 加信息:只有标签名,加上定义,加上行为层面的价值描述,再加上少样本。序列模型 GRU4Rec、BERT4Rec、DIN 把预测头换成价值分类。正文说它们明显更差,数字放在附录,主表没有。
指标三组。多标签:宏平均 F1、微平均 F1、加权 F1、宏精确率、宏召回率、汉明损失(越低越好)。排序:NDCG@1、@2、@3。主标签:Primary Accuracy、Top-2 Accuracy,以及二者平均。
主表:0.615 对上最好的基线宏平均 F1 0.417
引言写 B2V-Verifier 相对多个大模型,多标签分类大约提高 34%,标签排序大约 7.4%,主标签识别大约 5.5%。这句没有指明对照的是哪一个模型、哪一列 F1、是相对增幅还是绝对差。表 3 给的是绝对值。下面按原文列出。星号、剑号、双剑号是原文用来标前三的记号,不是显著性检验。
| 模型 | 提示 | 宏 F1 | 微 F1 | 加权 F1 | 精确率 | 召回率 | 汉明损失 | N@1 | N@2 | N@3 | 主标签 | Top-2 | 平均 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Claude-Haiku-4.5 | P1 | 0.256 | 0.510 | 0.559 | 0.313 | 0.407 | 0.083 | 0.671 | 0.610 | 0.633 | 0.548 | 0.677 | 0.613 |
| Claude-Haiku-4.5 | P2 | 0.286 | 0.576 | 0.600 | 0.315 | 0.393 | 0.068 | 0.714 | 0.672 | 0.672 | 0.574 | 0.743 | 0.659 |
| Claude-Haiku-4.5 | P3 | 0.313 | 0.596 | 0.612 | 0.367 | 0.398 | 0.060 | 0.730 | 0.692 | 0.666 | 0.593 | 0.770 | 0.682 |
| Claude-Haiku-4.5 | P4 | 0.275 | 0.624 | 0.622 | 0.301 | 0.355 | 0.053 | 0.757 | 0.727 | 0.679 | 0.604 | 0.777 | 0.691 |
| DeepSeek-V3.2 | P1 | 0.266 | 0.568 | 0.605 | 0.300 | 0.433 | 0.073 | 0.717 | 0.676 | 0.688 | 0.569 | 0.732 | 0.651 |
| DeepSeek-V3.2 | P2 | 0.289 | 0.597 | 0.611 | 0.267 | 0.456 | 0.065 | 0.721 | 0.697 | 0.692 | 0.561 | 0.757 | 0.659 |
| DeepSeek-V3.2 | P3 | 0.317 | 0.619 | 0.645 | 0.318 | 0.442 | 0.059 | 0.757 | 0.711 | 0.701 | 0.595 | 0.757 | 0.676 |
| DeepSeek-V3.2 | P4 | 0.350 | 0.655 | 0.659 | 0.380 | 0.422 | 0.050 | 0.773 | 0.749 | 0.711 | 0.613 | 0.781 | 0.697 |
| Gemini-2.5 | P1 | 0.276 | 0.582 | 0.570 | 0.350 | 0.353 | 0.067 | 0.773 | 0.691 | 0.691 | 0.563 | 0.695 | 0.629 |
| Gemini-2.5 | P2 | 0.248 | 0.583 | 0.549 | 0.369 | 0.339 | 0.064 | 0.775 | 0.703 | 0.675 | 0.578 | 0.717 | 0.648 |
| Gemini-2.5 | P3 | 0.263 | 0.596 | 0.568 | 0.350 | 0.355 | 0.060 | 0.781 | 0.713 | 0.674 | 0.612 | 0.734 | 0.673 |
| Gemini-2.5 | P4 | 0.242 | 0.604 | 0.572 | 0.305 | 0.301 | 0.054 | 0.775 | 0.726 | 0.657 | 0.615 | 0.751 | 0.683 |
| GLM-5 | P1 | 0.308 | 0.585 | 0.612 | 0.297 | 0.433 | 0.066 | 0.708 | 0.679 | 0.676 | 0.569 | 0.704 | 0.637 |
| GLM-5 | P2 | 0.335 | 0.609 | 0.628 | 0.354 | 0.415 | 0.058 | 0.704 | 0.673 | 0.659 | 0.578 | 0.714 | 0.646 |
| GLM-5 | P3 | 0.339 | 0.625 | 0.637 | 0.379 | 0.389 | 0.053 | 0.673 | 0.666 | 0.647 | 0.556 | 0.717 | 0.637 |
| GLM-5 | P4 | 0.358 | 0.608 | 0.622 | 0.417 | 0.405 | 0.055 | 0.665 | 0.647 | 0.630 | 0.558 | 0.703 | 0.631 |
| GPT-4o-mini | P1 | 0.248 | 0.514 | 0.525 | 0.297 | 0.316 | 0.083 | 0.710 | 0.642 | 0.641 | 0.517 | 0.638 | 0.578 |
| GPT-4o-mini | P2 | 0.253 | 0.504 | 0.521 | 0.303 | 0.298 | 0.084 | 0.721 | 0.642 | 0.635 | 0.526 | 0.645 | 0.586 |
| GPT-4o-mini | P3 | 0.248 | 0.503 | 0.519 | 0.350 | 0.298 | 0.085 | 0.717 | 0.644 | 0.635 | 0.543 | 0.658 | 0.601 |
| GPT-4o-mini | P4 | 0.220 | 0.569 | 0.577 | 0.305 | 0.273 | 0.069 | 0.691 | 0.657 | 0.659 | 0.532 | 0.704 | 0.618 |
| GPT-5 | P1 | 0.314 | 0.556 | 0.613 | 0.284 | 0.447 | 0.075 | 0.599 | 0.623 | 0.651 | 0.476 | 0.701 | 0.589 |
| GPT-5 | P2 | 0.400 | 0.597 | 0.654 | 0.362 | 0.531 | 0.067 | 0.686 | 0.687 | 0.705 | 0.548 | 0.749 | 0.649 |
| GPT-5 | P3 | 0.360 | 0.629 | 0.673 | 0.342 | 0.467 | 0.062 | 0.690 | 0.697 | 0.725 | 0.548 | 0.775 | 0.662 |
| GPT-5 | P4 | 0.417 | 0.628 | 0.666 | 0.400 | 0.524 | 0.060 | 0.703 | 0.704 | 0.719 | 0.558 | 0.770 | 0.664 |
| Kimi-K2.6 | P1 | 0.275 | 0.578 | 0.613 | 0.273 | 0.391 | 0.072 | 0.762 | 0.726 | 0.717 | 0.621 | 0.760 | 0.691 |
| Kimi-K2.6 | P2 | 0.325 | 0.585 | 0.598 | 0.360 | 0.432 | 0.070 | 0.779 | 0.729 | 0.723 | 0.632 | 0.758 | 0.695 |
| Kimi-K2.6 | P3 | 0.307 | 0.593 | 0.620 | 0.374 | 0.398 | 0.069 | 0.757 | 0.724 | 0.726 | 0.604 | 0.764 | 0.684 |
| Kimi-K2.6 | P4 | 0.304 | 0.591 | 0.615 | 0.338 | 0.381 | 0.066 | 0.716 | 0.704 | 0.695 | 0.568 | 0.737 | 0.653 |
| Qwen3-235B | P1 | 0.253 | 0.559 | 0.577 | 0.233 | 0.404 | 0.075 | 0.757 | 0.691 | 0.696 | 0.599 | 0.727 | 0.663 |
| Qwen3-235B | P2 | 0.271 | 0.565 | 0.582 | 0.280 | 0.386 | 0.074 | 0.730 | 0.700 | 0.698 | 0.574 | 0.742 | 0.658 |
| Qwen3-235B | P3 | 0.290 | 0.581 | 0.602 | 0.300 | 0.410 | 0.071 | 0.747 | 0.715 | 0.713 | 0.595 | 0.738 | 0.667 |
| Qwen3-235B | P4 | 0.288 | 0.605 | 0.622 | 0.310 | 0.399 | 0.066 | 0.757 | 0.731 | 0.732 | 0.593 | 0.764 | 0.679 |
| B2V-Verifier | P3 | 0.615 | 0.815 | 0.812 | 0.659 | 0.591 | 0.028 | 0.824 | 0.807 | 0.798 | 0.652 | 0.842 | 0.747 |
基线里,宏平均 F1 最高的是 GPT-5 的 P4,0.417。微平均 F1 最高的是 DeepSeek-V3.2 的 P4,0.655。主标签准确率最高的是 Kimi-K2.6 的 P2,0.632。B2V-Verifier 这些列都更高:宏平均 F1 0.615,微平均 0.815,汉明损失 0.028,NDCG@1 0.824,主标签 0.652,Top-2 0.842。0.615 相对 0.417 的差是 0.198。这不是引言里的“大约 34%”的直接算式,正文没有把 34% 还原到某一格。
提示加长并不单调变好。GPT-5 的宏平均 F1 从 P1 的 0.314 到 P2 的 0.400,P3 又落到 0.360,P4 到 0.417。Kimi-K2.6 的主标签在 P2 是 0.632,P4 掉到 0.568。论文的解释是:少样本会把预测带向常见标签组合,主标签可能变好,次要价值的召回变差。
拿掉核验形式,宏平均 F1 掉到 0.548
表 4 在同一套训练和评测上做消融。
| 变体 | 宏 F1 | 微 F1 | 加权 F1 | NDCG@1 | NDCG@3 | 主标签 | Top-2 |
|---|---|---|---|---|---|---|---|
| 完整核验 | 0.615 | 0.815 | 0.812 | 0.824 | 0.798 | 0.652 | 0.842 |
| 去掉核验形式 | 0.548 | 0.766 | 0.759 | 0.773 | 0.742 | 0.589 | 0.796 |
| 去掉价值描述 | 0.574 | 0.789 | 0.784 | 0.794 | 0.764 | 0.615 | 0.813 |
| 去掉不足证据 | 0.563 | 0.781 | 0.776 | 0.785 | 0.755 | 0.603 | 0.807 |
| 去掉不支持 | 0.582 | 0.795 | 0.789 | 0.802 | 0.772 | 0.624 | 0.819 |
掉得最多的是改回直接预测标签。论文据此说,收益主要来自“逐个价值核验证据”,不是只换了一个 8B 模型的名字。表里没有再报一次未微调的 Qwen3-8B。Qwen3-235B 是基线,不是这个 8B 的对照。
这些数不能被读成什么
0.615 是 544 条专家从零标注的测试集上的宏平均 F1,不是线上点击率,也不是 5440 条全量上的成绩。训练标签经过 AutoPVQ,测试标签没有。大模型看的是 GPT-5.4 写的摘要,序列模型看的是原始动作。摘要模型本身没有出现在表 3 的被测名单里。
引言的 34%、7.4%、5.5% 写的是大约,没有对照格。表 3 才是可以逐格核对的数。星号不是统计检验。\(\tau_1\)、\(\tau_2\) 和各项诊断权重没有数值。专家之间的一致率没有给。1000 条专家池里没进测试集的 456 条,去向没有写。
分类从 30 项收成 28 项加 none。决策复杂度和探索兴趣是因为单段行为认不出才删的,不是因为模型做得好。数据是淘宝匿名日志的 13 个月,不能直接说成其他电商站点的价值分布。数据集和代码写的是录用后公开,这篇预印本还没给出可用地址。
页面能确认的机构是北京大学和 Alibaba Group,通讯邮箱在北大。作者没有逐人单位。许可证不是知识共享署名,而是 arXiv 的非独占许可。这篇只复述评测协议和文中数字。
出处:阿里巴巴集团、北京大学,Peixuan Hou、Guojie Song 等,Behavior2Value: Benchmarking and Empowering LLMs for Consumer Value Measurement from E-commerce Behaviors,2026-09-16,https://arxiv.org/abs/2609.18203
Found it useful? Pass it on
Scan with WeChat to open it on your phone and forward it.