CodexQA

Industry & PracticeResearch & Benchmarks

用户过 0.03 亿就饱和:蚂蚁在支付宝数据上测表征缩放

CodexQA 团队3 min read

支付宝数据上,用户数超过约 3000 万或时间窗超过 60 天,下游探测变平。模型从 0.2B 加到 0.4B,训练损失还降,准确率几乎不动。ALGN 的 AUC 76.43%,容量 63.47%。

用户过 0.03 亿就饱和:蚂蚁在支付宝数据上测表征缩放

蚂蚁集团 DeepFind 团队与浙江大学的 User Behavioral Densing Law(用户行为致密化规律:数据规模和「最少够用的 tokenization 容量」之间的定量关系),arXiv 提交日 2026 年 8 月 24 日(2608.23392,v1)。作者 Bin Dou、Junru Zhang、Zhaoyi Yuan、Wuliang Huang、Letian Gong、Baokun Wang、Huan Li、Yu Cheng、Weiqiang Wang。邮箱 yike.wbk@antgroup.com、lihuan.cs@zju.edu.cn。许可证是 CC BY 4.0。

工业里把用户表征做大,通常是加人、加长行为序列、加大模型。这篇要测的是:原始行为文本加到十亿级以后,下游会不会停;tokenization 能不能把信息变密,从而推迟饱和。他们在支付宝账单等数据上做线性探测,不把训练损失当成表征质量。

三套下游,阈值 0.5

分类用冻结的用户表征加一层线性分类器,判定阈值常用 0.5。三个指标:AUC 看排序,KS 看正负样本累积分布拉开的最大距离,准确率看这个阈值下判对的比例。文本检索用查询向量和用户向量的余弦相似度,超过阈值才投放。用户到用户检索从一小撮种子用户找相似用户。分类 50 个数据集、文本检索 22 个、用户到用户检索 22 个,每个数据集 50 万用户。数据源包括 PayBill(支付账单)、SPM(Super Position Model 记录)和小程序描述。

原始行为的缩放在三个轴上都变平。用户数大约超过 0.03B(3000 万),或时间窗大约超过 60 天,AUC、KS、准确率都明显变平。把编码器从 0.2B 参数加到 0.4B,训练损失还能降,下游准确率几乎不动:更大的模型在拟合重复行为,不是多抽出任务相关信号。结论把这三件事写成饱和阈值:用户人口、时间窗、模型容量。数据可以到数亿用户,有用信号不跟数据量一起涨。

tokenization 在相同 token 和计算预算下能越过这道墙。图上的逐点没有全部写进正文。把账单数据上选出的压缩配置直接迁到 SPM 和小程序,AUC 大约保留源内设置的 95.0% 和 97.5%,KS 保留 83.2% 和 88.5%。配置不是只能用在一种日志上,但 KS 掉得比 AUC 多。

ALGN 按条分配码本深度

ALGN 是按这条规律做的变长语义 ID。长度先验是 γ=0.3 的几何分布。对照有固定长度的 RQ-VAE、VQ-VAE、RQ-Kmeans、SARQ,以及只看先验、只看残差、只看不确定度的变体。容量是 SID 用了多少,越低越省。

方法容量 %AUC %KS %准确率 %
RQ-VAE100.0074.5639.0282.44
VQ-VAE316.2373.4537.9582.47
RQ-Kmeans100.0073.7738.3482.85
SARQ76.2475.3641.2883.16
ALGN63.4776.4343.3183.52

相对表里最好的 SARQ,AUC、KS、准确率高 1.07、2.03、0.36。论文把容量节省写成 13.23%。表内两项是 76.24 和 63.47,相差 12.77,这里两套数字都留着,不把它们算成同一个量。

消融:

方法容量 %AUC %KS %准确率 %
启发式变长86.9174.4338.1082.39
去掉不确定度77.8375.1140.2182.77
去掉残差76.2475.3641.2883.16
去掉正则73.4276.0142.2183.35
直接按 SID 长度正则63.1676.2242.9983.47
随机分布正则70.1576.1642.8883.45
ALGN63.4776.4343.3183.52

相对启发式变长,容量从 86.91% 到 63.47%,AUC、KS、准确率高 2.00、5.21、1.14。去掉不确定度后,相对 ALGN 低 1.32、3.10、0.75。直接按长度正则的容量 63.16%,略低于 ALGN,但三项指标低 0.21、0.32、0.05。图 11 写 ALGN 把致密化规律的缩放斜率降到大约 0.59,没有逐点坐标。

限制

实验是文本行为这一种模态。视频消费等别的行为还没测。公开基准上的稳健性,作者写仍在评,这篇没有那张表。饱和阈值来自支付宝生产数据上的探测曲线,不是推荐或投放的线上 A/B。容量百分比和正文里的 13.23% 节省不要混用。线性探测看的是表征能不能被简单分类器读出来,不是端到端排序模型的全部效果。

蚂蚁集团 DeepFind、浙江大学,Bin Dou、Junru Zhang、Zhaoyi Yuan、Wuliang Huang、Letian Gong、Baokun Wang、Huan Li、Yu Cheng、Weiqiang Wang,Towards a Densing Law for User Representation Learning at Billion-Scale Capacity,2026-08-24,https://arxiv.org/abs/2608.23392

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction