CodexQA

行业与实践研究与基准测试

一周线上观看时长涨 0.96%,公开集只有 7583 个物品:百度怎么测统一检索排序

CodexQA 团队阅读约 5 分钟

KuaiRand-Pure 上 HR@10 从 0.0511 到 0.0575。手机百度一周全量对照里,总观看时长 +0.96%,总分发量 +1.08%。线上只给相对涨幅,没有绝对基线。

本文目录

一周线上观看时长涨 0.96%,公开集只有 7583 个物品:百度怎么测统一检索排序

百度的论文 UNIQUE: A Unified Retrieval and Ranking System for Large-Scale Feed Recommendation。页面版本是 arXiv 2609.23718v1,水印日期 2026 年 9 月 20 日。许可证是 CC BY 4.0。通讯作者单位是 Baidu Inc.。第一作者写的是在百度实习期间完成,学校单位是北航。

UNIQUE 把生成式检索和目标感知排序放进同一个早期融合模型。检索在这里指先用语义码从大库里取出候选,排序指再给这些候选打点击、时长等分。评测分三问:公开视频集上检索和点击预估是否同时变好、去掉哪一块会掉、手机百度线上有没有相对增益。

公开集对全库排序,工业流量只报相对涨幅

第 4.1 节的公开集是 KuaiRand-Pure。表 1:27285 个用户,7583 个物品,1186059 次交互,平均序列长度 43.47。交互按时间排,少于 3 次的用户被滤掉。留一法:最后一次做测试,倒数第二次做验证,更早的做训练。检索不抽样,对整个物品库排序,报 HR@K 和 NDCG@K。HR@K 是正确物品出现在前 K 名里的比例。排序只报点击率预测的 AUC,因为对照模型大多只做点击率。论文写 UNIQUE 里的相关性、观看时长等目标只当辅助监督,不进这张公开表。

公开集上码本大小是 1024,码向量 64 维。论文写这是因为物品只有 7583 个,公开集主要用来检查检索和排序能不能一起做,不是大规模码本分配的证据。工业物品库用的是单层 16384 个码。序列最长 501:1 个静态用户 token,短期 100,中期 200,长期 200。优化器用 Adam,学习率 1×10⁻³,批大小 2048。

离线五列都最高,涨幅最大的是 HR@10

表 2。序列检索对照里,SASRec 的 HR@10 是 0.0304,HR@50 是 0.0847,NDCG@10 是 0.0189,NDCG@50 是 0.0310,没有 CTR-AUC。TIGER 是 0.0380、0.0902、0.0205、0.0378。排序对照里,DIN 的 CTR-AUC 是 0.6812,DCN 是 0.7037,这两列没有检索分。生成式对照 HSTU 是 0.0453、0.1418、0.0273、0.0412、0.7150。UniGRF-HSTU 是 0.0511、0.1453、0.0298、0.0430、0.7168。

UNIQUE 是 0.0575、0.1510、0.0310、0.0473、0.7252。相对最强检索对照 UniGRF-HSTU,论文写 HR@10 高 12.52%,HR@50 高 3.92%,NDCG@10 高 4.03%,NDCG@50 高 10.00%。CTR-AUC 绝对高 0.0084,相对 HSTU 绝对高 0.0102。HR@50 的相对涨幅小于 HR@10,不是每一列都涨一成。

去掉生成目标,HR@50 掉得最多

表 3 在同一套损失和优化设置上拆四块。完整模型 HR@50 0.1510,CTR-AUC 0.7252。去掉早期融合:0.1398,低 7.42%;AUC 0.7164,低 1.21%。把单层平铺码本换成层次码本:0.1421,低 5.89%;AUC 0.7190,低 0.85%。去掉目标注意力拆分:0.1456,低 3.58%;AUC 0.7207,低 0.62%。去掉生成式码预测:0.1374,低 9.01%;AUC 0.7115,低 1.89%。检索掉得最多的是生成目标,排序掉得也是它,但 AUC 的相对跌幅小于 HR@50。

工业码本把 128×128 的层次码本换成容量同为 16384 的单层码本。资源计数方差从 1510.85 降到 389.57。平均 top-1 类目份额从 65.43% 升到 78.08%。方差下降是码之间更匀,类目份额上升是单个码内部更集中,两件事方向相反。图 2 没有给出每一档头部码的累计占比。

一周全量对照只有相对数,候选池里它占 22.5%

第 4.1.2 节写,2026 年 1 月起 UNIQUE 部署在手机百度首页信息流、发现页和短视频的检索阶段,并服务这三处的全部在线请求。三处共用同一套结构,特征和训练数据按场景分开。第 4.4 节的线上对照是相对此前的生产检索链路,做了一周全量 A/B。论文写增益通过内部显著性检验,p < 0.05。没有写样本量,也没有写绝对基线。

表 4:总观看时长 +0.96%,总分发量 +1.08%,用户留存率 +0.70%。表 5 按周活跃天数拆。高活是大于 5 天,观看时长 +1.11%,分发量 +1.29%。中活是 2 到 5 天,+0.63% 和 +0.65%。低活是少于 2 天,+0.29% 和 +0.15%。新用户定义为注册 14 天内,+1.44% 和 +1.24%。低活的分发量涨幅只有 0.15 个百分点,不是各人群一样。

同一节写 UNIQUE 占检索候选池的 22.5%。服务全部请求,不等于最终候选都由它产生。长尾物品定义为历史点击排在可分发物品底部 20% 的那一段,覆盖 182 万个物品。正文写 UNIQUE 的长尾曝光份额达到 1.04%。这是份额,不是相对涨幅。图 3 还报了类目覆盖、人均香农熵和头部 1000 个候选里的长尾占比,正文没有列出这三项的相对数字。

时延写了,召回损失没有写数字

峰值大约 10000 QPS,平均延迟 37 ms。表 6:P80 延迟 35 ms,P99 89 ms,在线推理 MFU 44.23%。午间缓存窗口 15 秒,命中率 37%;晚间 30 秒,命中率 60%。推荐服务大约 400 张 NVIDIA L20,每实例一张卡,TensorRT FP16。推理成本大约每 1000 次请求 0.0013 美元。检索生成 N=100 个语义码,每个码再出 M=30 个物品。论文写把 N 提到 200,多样性增益很小,成本大约两倍;把 M 降到 10 会明显伤召回,没有给出召回掉多少。新物品在首次曝光后 5 分钟内进入训练流,1 小时内完成量化。物品向量按小时预计算。

这些数不能被读成什么

0.0575 的 HR@10 是 7583 个物品的全库留一法,不是手机百度的点击率。0.7252 的 AUC 只覆盖点击率这一列。公开集码本 1024,和生产用的 16384 不是同一套容量。

12.52% 是相对 UniGRF-HSTU 的 HR@10。HR@50 只高 3.92%。不能把五列都说成大约涨一成。

线上的 +0.96% 和 +1.08% 是一周全量对照的相对增益,没有绝对观看时长,也没有分母。p < 0.05 是内部检验。22.5% 说明它只贡献候选池的一部分。1.04% 是长尾曝光份额,不能写成长尾提升了 1.04 个百分点。

89 ms 是 P99,平均是 37 ms。M 降到 10 会伤召回这句话没有配数字。图 2 和图 3 的曲线读数没有写进正文。

出处:百度,Baidu Inc.,UNIQUE: A Unified Retrieval and Ranking System for Large-Scale Feed Recommendation,2026-09-20,https://arxiv.org/abs/2609.23718v1

觉得有用,转给同事

微信扫码

用微信扫一扫,在手机上打开后即可转发。

用 RSS 订阅

提交勘误