CodexQA

Industry & PracticeResearch & Benchmarks

1% 流量 GMV 高 1.06%:淘宝把成交排序写进生成式 DocID

CodexQA 团队5 min read

3 亿商品上,CRID 站内转化 HR@20 比最强对照高 3.72 个百分点,HR@1000 高 9.10 个百分点。1% 流量、30 天:IPV +0.18%,订单 +0.54%,GMV +1.06%。站内深位 HR@1000 相对最强向量检索低 3.02%。

In this piece

1% 流量 GMV 高 1.06%:淘宝把成交排序写进生成式 DocID

淘宝天猫、阿里巴巴的 CRID(Cluster-Ranked Identifier,簇内排序标识:前几级是语义簇,最后一级是簇内按业务价值排的名次),arXiv 提交日 2026 年 7 月 13 日,当前页为 8 月 28 日修订的 v2(2607.11392)。作者 Gui Ling、Zhihong Chen、Yu Li、Tong Xiong、Kunhai Lin、Kaixuan Zhang、Yuliang Yan、Dan Ou、Haihong Tang、Bo Zheng,邮箱在 taobao.com。许可证是 CC BY 4.0。

生成式检索把找商品写成逐 token 生成文档标识 DocID。只按语义量化时,同一簇里成交差很多的商品会拿到相邻甚至相同的标识,也和搜索要优化的转化对不上。候选池是数亿商品,生成模型又不能为了时延无限加大。CRID 把标识拆成语义簇前缀和簇内业务价值名次:前半段选语义,后半段在簇内排序。这样标识和商品一一对应,新品进来只在受影响的簇里重排,不必重训码本。

三层码本,最后一层是 30 天成交名次

实验池是淘宝搜索超过 3 亿商品,骨干是 Qwen2.5-0.5B。表征用查询—商品对做对比学习,得到 256 维向量:约 1 亿对,128 张 GPU,每卡批大小 256,再经相关性模型过滤。语义簇用 RQ-KMeans,抽样 1 亿条、批大小 400 万、3 个 epoch。离线主实验的前两级是 8192×8192,第三级换成按 30 天成交次数排的名次。评的是商品级 Hitrate@K:正确商品是否出现在前 K 个预测里。站内转化和站外转化分开。站外指同一级类目、但不是这次搜索场景里的转化。相对比较用 4000 万训练子集,作者写这一规模已基本收敛,继续加长训练没有看到方法排名对调。

生成概率拆成两段:先生成语义前缀,再在该簇里生成名次。推理用受约束的 beam search。训练分两段:先记住 DocID,再做监督微调。全量上线时监督微调超过 1.5 亿样本;DPO 抽 100 万查询,平均每条 10 对偏好,离线站内转化 HR@1000 大约再高 0.5 个百分点。

表 1。同一套前两级,只改第三级。无碰撞表示标识和商品一一对应。数字是 Hitrate。

第三级无碰撞站内 HR20HR100HR500HR1000站外 HR20HR100HR500HR1000
8192³ 语义否16.68%33.73%55.01%63.83%13.18%26.51%43.16%49.99%
OPQ否20.86%39.02%59.86%67.54%16.32%30.51%47.10%53.55%
Sinkhorn-Knopp否24.45%44.00%63.16%69.90%19.32%34.26%49.79%55.46%
Tiger是37.48%51.83%66.44%73.15%30.00%39.96%52.66%57.99%
FORGE否37.28%51.60%66.29%72.50%29.66%39.99%51.99%57.40%
CRID是41.20%59.02%76.22%82.25%32.43%45.71%59.79%65.50%

和表里最强对照比,站内 HR@20 高 3.72 个百分点,HR@1000 高 9.10 个百分点。Tiger 只保证无碰撞、标识按递增编号;FORGE 允许一个标识最多五个商品。CRID 两项都更高。

事后重排补不回联合建模

对照是两级 8192² 语义模型:先取出前 1000 个语义簇,展开商品,按解码分截一个池,再用同一个全局业务价值重排。站内 Hitrate:池子 1 万时 HR@20 14.77%、HR@1000 70.97%;池子 5000 时 17.54%、69.18%;池子 1000 时 20.99%、48.62%。CRID 是 41.20% 和 82.25%。论文写联合建模在每个截断上都高于事后重排,HR@20 大约差 20 个百分点,HR@1000 大约差 11 个百分点。池子变小只能抬高头部、牺牲深位。和查询无关的重排会把热门但不相关的商品顶到前面。

图 2 没有逐点表。文字结论:把成交名次换成簇内随机顺序,深位 Hitrate 掉得多;每四个商品共用一个标识、制造轻度碰撞,头部掉得更明显。业务价值主要补深位,无碰撞主要保头部。

表 3 把粗价值档保持无碰撞,只在窗口 W 内打乱。W=1 就是 CRID。站内 HR@1000:W=1 为 82.25%,W=4 为 81.39%(−0.86),W=16 为 81.67%(−0.58),W=128 为 79.09%(−3.16),W=512 为 76.29%(−5.96),整簇随机为 73.15%(−9.10)。这些设置的名次 token 频率相同,所以优势不是「小名次更常见」,而是名次和业务价值对齐。小窗口内打乱不到 0.9 个百分点,跨价值档打乱才明显变差。

换统计量也稳。30 天成交名次:HR@20 41.20%、HR@100 59.02%、HR@500 76.22%、HR@1000 82.25%。30 天点击名次:40.80%、58.30%、75.73%、81.81%。内部质量分:41.15%、59.34%、76.21%、81.82%。簇内 Spearman ρ:成交对点击 0.708,成交对质量分 0.666,点击对质量分 0.617。排序相关性只有中等,Hitrate 差不大。

十天后的增量,以及和向量检索比

训练截止 10 天后的增量见下表。不更新:池覆盖 65.08%,平均每个 CRID 1.00 个商品,HR@20 到 HR@1000 为 37.86%、54.40%、71.60%、77.52%。只插入:新商品进最近的语义簇,并占业务价值最接近的已有名次。覆盖 99.15%,但平均 6.31 个商品挤在一个标识上,四项降到 29.13%、46.00%、63.83%、70.44%。全量重排:新旧商品按当日业务价值一起重排。覆盖 99.37%,仍是 1.00,四项 39.12%、56.74%、74.04%、80.05%,高于不更新。不更新的标识会随着商品退出池子失效。

全量链路的码本改成 32768×8192 语义加名次空间 8192,实际簇平均大小 8.75,由第 4 节的簇大小分析选定。相对最强的个性化向量检索,站内是 HR@20 +13.26%、HR@100 +10.05%、HR@500 −0.63%、HR@1000 −3.02%。站外是 +8.00%、+7.01%、+3.75%、+2.66%。头部站内更高,深位站内略低;站外四个截断都更高。

线上把它当作已有向量检索旁边的又一路,同时做召回和粗排。三级解码的动态 beam 是 100、400、1500,按累积概率截断,目标是 Hitrate 近乎无损。送进精排大约 1300 个商品,时延要求和原有通路相同。1% 流量、30 天的 A/B:整体 IPV(商品页浏览)+0.18%,订单数 +0.54%,GMV(成交金额)+1.06%。之后全量。摘要把这句写成全量流量上的 A/B;实验节写的是 1% 再全量,这里以实验节为准。

增益从哪来,以及限制

前两级语义和 FORGE 的 1-gram、2-gram Hitrate 几乎重合。差距在第三级:K=1000 时全路径 Hitrate 约 82% 对 72%。作者把检索增益拆成个性化偏好(目标商品的标识前缀是否出现在用户历史里)和统计先验(语料级业务价值)。拟合用 log K 上的 logistic CDF,多数组 R²>0.99。图 5 的文字结论:簇变大时,各名次组自己的 HR@1000 上升,但头部名次(0–10)占比从 78% 降到 34%,加权后的 HR@1000 反而下降。生产配置按 HR@1000 来选,不是按最大的簇。

限制写了两条。实验只在淘宝搜索。推荐里查询语义没这么强,是否还成立没有验证。线上时延限制下模型是 0.5B,更大的模型会改变「容量对语料」的平衡,没有做。表 6 的站内深位低于最强向量检索,不能把头部 Hitrate 或 1.06% 的 GMV 读成所有截断都更好。语料和日志是内部的,没有公开数据集。

阿里巴巴淘宝天猫,Gui Ling、Zhihong Chen、Yu Li、Tong Xiong、Kunhai Lin、Kaixuan Zhang、Yuliang Yan、Dan Ou、Haihong Tang、Bo Zheng,Beyond Semantic IDs: Encoding Business-Value Ranking into Document Identifiers for Generative Retrieval,2026-07-13,https://arxiv.org/abs/2607.11392

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction