HR @ 1000 从 0.7735 到 0.8651, 线上 GMV 涨 1.64 %: 淘 宝 搜索 怎么 测 生成 式 检索
相对 FORGE,HR@1000 从 0.7735 到 0.8651,差 9.16 个百分点。强化学习那一行 HR@5000 更高,但没有上线。线上 1% 流量、38 天,GMV +1.64%,没有绝对值。

本文目录
HR@1000 从 0.7735 到 0.8651,线上 GMV 涨 1.64%:淘宝搜索怎么测生成式检索
阿里淘宝的论文 TSGR: Taobao Search Generative Retrieval。页面版本是 arXiv 2607.18796v1,水印日期 2026 年 7 月 21 日。许可证是 arXiv.org 的永久非独占许可。通讯作者单位是 Taobao & Tmall Group of Alibaba。第一作者写的是在阿里巴巴集团实习期间完成。
TSGR 用一个自回归模型直接生成商品的语义编号,再在同一模型里做价值排序。语义编号在这里指把商品压成三级离散 token,不是商品原始 ID。评测分三问:编号和训练阶段怎么改命中率、价值排序模块换不换得过单独的预排序、线上交易指标有没有相对增益。
两亿条交互,主指标是 HR@1000
第 4.1 节:训练集是淘宝搜索两周里超过 2 亿条真实交互,测试集抽自下一天。骨干是 Qwen2.5-0.5B。三级码本大小是 32768×8192×8192。束搜索宽度是 400、400、10000。每个商品有 44 条并行的第三级排序。监督微调用 AdamW,学习率 1×10⁻⁴,批大小 256。生成损失和排序损失的系数 λ 是 1。价值权重是浏览 1、点击 2、成交 3。
命中率 HR@K 是相关商品出现在前 K 个候选里的比例。论文把 HR@1000 当主指标,因为检索要保证相关商品进下游排序的候选池。对照有两个:FORGE,最后一级 token 随机初始化,每个编号最多对应 5 个商品;以及检索之后再接的常规预排序模型。
表里最高的一格不总在最终方案上
表 2 五列依次是 HR@20、100、500、1000、5000。FORGE 是 0.4328、0.5863、0.7207、0.7735、0.8604。QP-SID 是 0.4635、0.6235、0.7669、0.8177、0.8961。Pre-SFT 是 0.4694、0.6340、0.7740、0.8222、0.8987。常规预排序是 0.4248、0.6264、0.8112、0.8552、0.8771。强化学习是 0.4659、0.6420、0.7857、0.8277、0.9027。最终采用的价值排序模块 VRM 是 0.4586、0.6677、0.8250、0.8651、0.8953。表注说同一类里的方法互斥,带剑号的才是 TSGR 采用的配置:QP-SID、Pre-SFT 和 VRM。强化学习没有进部署。
摘要写 HR@1000 提升 9.16%。0.8651 减 0.7735 等于 0.0916,是相对 FORGE 的 9.16 个百分点,不是相对涨幅 9.16%。正文写 QP-SID 的 HR@1000 高 4.42%,对应 0.8177 减 0.7735。预排序相对 Pre-SFT 的 HR@1000 高 3.30%,对应 0.8552 减 0.8222。强化学习相对 Pre-SFT 高 0.55%,对应 0.8277 减 0.8222。这三处百分号和表内差的小数一致,读成百分点才对得上。
正文还写 VRM 的 HR@1000 提升和预排序可比,是 +3.73% 对 +3.30%。印刷表里 VRM 相对 Pre-SFT 的差是 0.0429,不是 0.0373。0.0373 对不上表 2 任何一列。这里只保留能从格子减出来的数。
VRM 不是五列都最高。HR@20 的 0.4586 低于 Pre-SFT 的 0.4694,也低于 QP-SID 的 0.4635。HR@5000 的 0.8953 低于强化学习的 0.9027,也低于 Pre-SFT 的 0.8987。预排序的 HR@20 是 0.4248,低于 FORGE 的 0.4328。它换来的是 HR@500 和 HR@1000。
有一版路径会塌,最终输出没有塌成那样
表 3 是前 100 个输出的分级命中,单位是百分数。QP-SID:簇命中 78.71,第三级 72.83,整体 57.32。多路径标签:77.20、71.90、55.50。论文写这套多路径训练里,99.8% 的模型输出塌到默认路径,所以没有采用。这是失败配置,不是上线模型。
表 4 是最终 QP-SID 的类别分布,单位是百分数。默认未命中:训练序列 55.37,标签 23.20,评测序列 61.42,模型输出 32.05。词排名第 1:25.46、54.54、22.99、44.91。第 2:11.63、15.00、9.71、14.53。第 3:7.54、7.26、5.88、8.51。标签里查询相关的三类加起来是 76.8%。模型输出的默认路径是 32.05%,不是 99.8%。
表 5 是抽样子集上的监督微调对照,不能和表 2 的 0.86 比。点对点:HR@20 到 HR@5000 是 0.3851、0.5653、0.7188、0.7714、0.8577。按会话加权的多正样本:0.4042、0.5890、0.7405、0.7922、0.8718。图 3 到图 6 的大部分读数没有写进正文。联合 Pre-SFT 写了 +5.76%,没有给出每一项任务自己的格子。第 4.3 节写一部分消融用的是抽样子集。
线上 1% 流量、38 天,延迟只给了预算
第 4.4 节:TSGR 作为额外召回通道上线,输出直接进排序,绕过常规预排序。服务用 NVIDIA H20,延迟预算 80 毫秒。正文没有给实测的 P99 或平均延迟。前两级解码用前缀树裁掉非法 token,第三级普通束搜索。生成过程中 VRM 打价值分,再重排。
生产 A/B 覆盖淘宝搜索 1% 的在线流量,连续 38 天。实验组用 TSGR 替换常规检索和预排序,把排好的前 1500 个候选交给排序。相对生产基线,IPV +0.43%,成交笔数 +1.12%,GMV +1.64%。论文写统计显著,没有写 p 值,也没有写这三项的绝对值。同一节前面说它是现有召回之外的一条通道,后面又说实验组用它替换常规检索和预排序。两句都在,不能收成「已经替换全部召回」。
这些数不能被读成什么
0.8651 是淘宝搜索测试集上的 HR@1000,分母是下一天的抽样,不是全站点击率。9.16 是和 FORGE 的百分点差。相对涨幅要另算,不能把摘要里的百分号直接当成相对提升。
0.9027 的 HR@5000 在强化学习那一行,那一行没有上线。上线配置的 HR@20 不是表里最高。
+1.64% 的 GMV 来自 1% 流量、38 天的相对增益。没有绝对成交额,也不能写成全量。80 毫秒是预算。99.8% 是被放弃的那一版路径塌缩,表 4 的上线分布不是这个数。图上的消融读数没有进正文。
出处:阿里,Taobao & Tmall Group of Alibaba,TSGR: Taobao Search Generative Retrieval,2026-07-21,https://arxiv.org/abs/2607.18796v1
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。