用户 过 0.03 亿 就 饱和: 蚂蚁 在 支付 宝 数据 上 测 表征 缩 放
支付宝数据上,用户数超过约 3000 万或时间窗超过 60 天,下游探测变平。模型从 0.2B 加到 0.4B,训练损失还降,准确率几乎不动。ALGN 的 AUC 76.43%,容量 63.47%。

用户过 0.03 亿就饱和:蚂蚁在支付宝数据上测表征缩放
蚂蚁集团 DeepFind 团队与浙江大学的 User Behavioral Densing Law(用户行为致密化规律:数据规模和「最少够用的 tokenization 容量」之间的定量关系),arXiv 提交日 2026 年 8 月 24 日(2608.23392,v1)。作者 Bin Dou、Junru Zhang、Zhaoyi Yuan、Wuliang Huang、Letian Gong、Baokun Wang、Huan Li、Yu Cheng、Weiqiang Wang。邮箱 yike.wbk@antgroup.com、lihuan.cs@zju.edu.cn。许可证是 CC BY 4.0。
工业里把用户表征做大,通常是加人、加长行为序列、加大模型。这篇要测的是:原始行为文本加到十亿级以后,下游会不会停;tokenization 能不能把信息变密,从而推迟饱和。他们在支付宝账单等数据上做线性探测,不把训练损失当成表征质量。
三套下游,阈值 0.5
分类用冻结的用户表征加一层线性分类器,判定阈值常用 0.5。三个指标:AUC 看排序,KS 看正负样本累积分布拉开的最大距离,准确率看这个阈值下判对的比例。文本检索用查询向量和用户向量的余弦相似度,超过阈值才投放。用户到用户检索从一小撮种子用户找相似用户。分类 50 个数据集、文本检索 22 个、用户到用户检索 22 个,每个数据集 50 万用户。数据源包括 PayBill(支付账单)、SPM(Super Position Model 记录)和小程序描述。
原始行为的缩放在三个轴上都变平。用户数大约超过 0.03B(3000 万),或时间窗大约超过 60 天,AUC、KS、准确率都明显变平。把编码器从 0.2B 参数加到 0.4B,训练损失还能降,下游准确率几乎不动:更大的模型在拟合重复行为,不是多抽出任务相关信号。结论把这三件事写成饱和阈值:用户人口、时间窗、模型容量。数据可以到数亿用户,有用信号不跟数据量一起涨。
tokenization 在相同 token 和计算预算下能越过这道墙。图上的逐点没有全部写进正文。把账单数据上选出的压缩配置直接迁到 SPM 和小程序,AUC 大约保留源内设置的 95.0% 和 97.5%,KS 保留 83.2% 和 88.5%。配置不是只能用在一种日志上,但 KS 掉得比 AUC 多。
ALGN 按条分配码本深度
ALGN 是按这条规律做的变长语义 ID。长度先验是 γ=0.3 的几何分布。对照有固定长度的 RQ-VAE、VQ-VAE、RQ-Kmeans、SARQ,以及只看先验、只看残差、只看不确定度的变体。容量是 SID 用了多少,越低越省。
| 方法 | 容量 % | AUC % | KS % | 准确率 % |
|---|---|---|---|---|
| RQ-VAE | 100.00 | 74.56 | 39.02 | 82.44 |
| VQ-VAE | 316.23 | 73.45 | 37.95 | 82.47 |
| RQ-Kmeans | 100.00 | 73.77 | 38.34 | 82.85 |
| SARQ | 76.24 | 75.36 | 41.28 | 83.16 |
| ALGN | 63.47 | 76.43 | 43.31 | 83.52 |
相对表里最好的 SARQ,AUC、KS、准确率高 1.07、2.03、0.36。论文把容量节省写成 13.23%。表内两项是 76.24 和 63.47,相差 12.77,这里两套数字都留着,不把它们算成同一个量。
消融:
| 方法 | 容量 % | AUC % | KS % | 准确率 % |
|---|---|---|---|---|
| 启发式变长 | 86.91 | 74.43 | 38.10 | 82.39 |
| 去掉不确定度 | 77.83 | 75.11 | 40.21 | 82.77 |
| 去掉残差 | 76.24 | 75.36 | 41.28 | 83.16 |
| 去掉正则 | 73.42 | 76.01 | 42.21 | 83.35 |
| 直接按 SID 长度正则 | 63.16 | 76.22 | 42.99 | 83.47 |
| 随机分布正则 | 70.15 | 76.16 | 42.88 | 83.45 |
| ALGN | 63.47 | 76.43 | 43.31 | 83.52 |
相对启发式变长,容量从 86.91% 到 63.47%,AUC、KS、准确率高 2.00、5.21、1.14。去掉不确定度后,相对 ALGN 低 1.32、3.10、0.75。直接按长度正则的容量 63.16%,略低于 ALGN,但三项指标低 0.21、0.32、0.05。图 11 写 ALGN 把致密化规律的缩放斜率降到大约 0.59,没有逐点坐标。
限制
实验是文本行为这一种模态。视频消费等别的行为还没测。公开基准上的稳健性,作者写仍在评,这篇没有那张表。饱和阈值来自支付宝生产数据上的探测曲线,不是推荐或投放的线上 A/B。容量百分比和正文里的 13.23% 节省不要混用。线性探测看的是表征能不能被简单分类器读出来,不是端到端排序模型的全部效果。
蚂蚁集团 DeepFind、浙江大学,Bin Dou、Junru Zhang、Zhaoyi Yuan、Wuliang Huang、Letian Gong、Baokun Wang、Huan Li、Yu Cheng、Weiqiang Wang,Towards a Densing Law for User Representation Learning at Billion-Scale Capacity,2026-08-24,https://arxiv.org/abs/2608.23392
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。