CodexQA

Industry & PracticeResearch & Benchmarks

影子评测精度从 92.0% 到 97.5%,把行为写成文本反而掉到 83.0%:微信支付怎么测序列模型

CodexQA 团队6 min read

三个月影子评测里 SeqLLM 周平均精度 97.5%,只文本的对照是 92.0%。把行为直接串成文本掉到 83.0%,这一版没有上线。欺诈检测只给了百分点,没有绝对值。

In this piece

影子评测精度从 92.0% 到 97.5%,把行为写成文本反而掉到 83.0%:微信支付怎么测序列模型

腾讯微信支付的论文 SeqLLM: Augmenting LLMs with Behavioral-Sequence Modeling for High-Stakes Decisions at WeChat Pay。页面版本是 arXiv 2608.03063v1,水印日期 2026 年 8 月 4 日。许可证是 CC BY 4.0。作者单位写的是 WeChat Pay, Tencent。

SeqLLM 把商户的行为序列接进预训练语言模型。行为序列在这里指按时间排好的交易事件,不是把原始流水贴进提示词。默认骨干是 Qwen3-8B。评测分四问:学会序列之后语言能力还在不在、文本和行为是不是互补、线上筛查和欺诈检测有没有增益、换到公开推荐集还站不站得住。

标签要再等 30 天,指标是头部精度不是 AUC

第 4.1 节的微信支付数据:每个商户有资料、投诉文本和交易序列。先用大约 2000 万条序列做注入,这些序列里不含风险正样本商户。再在 406 万标注商户上做风险监督微调,标注来自前面多个月。评测窗是其后 30 天,每天大约 99 万商户,特征在打分时刻截断。打完分再等 30 天,用这 30 天里出现的风险证据定最终标签。历史最长 1000 个事件,输入最长 10000 个 token。

商户风险不报 AUC。报的是分数最高的 r% 里面,风险商户占多少。r 取 1、0.1、0.01。下一事件预测用 HR@10:真的下一个事件出现在前 10 名里的比例。语言能力用 C-Eval、MMLU、AGIEval。

持续预训练把序列学会了,语言分掉到三成以下

表 1 把前缀引导的监督微调和持续预训练放在同一骨干、同一语料、同一优化器上比。持续预训练额外还有原文和对话格式的语言回放,语言监督只多不少。

零样本 Qwen3-8B 的 HR@10 只有 0.312,C-Eval 0.779,MMLU 0.769,AGIEval 0.636。只做序列的 PANTHER,HR@10 是 0.680,没有语言分。样本对齐的持续预训练,HR@10 到 0.802,C-Eval 掉到 0.271,MMLU 0.264,AGIEval 0.324。加上对齐栈之后,HR@10 0.804,C-Eval 仍是 0.293。

SeqLLM 的 HR@10 是 0.806,和 0.804 几乎一样。C-Eval 0.789,MMLU 0.765,AGIEval 0.643。相对零样本骨干,C-Eval 高 0.010,MMLU 低 0.004,AGIEval 高 0.007。梯度对齐的持续预训练把损失 token 的数量对齐了,语言分仍然塌,所以不是「监督少了」能解释的。

离线头部精度:只加行为不够,只加文本也不够

第 4.3 节把架构、数据和监督固定,只换输入。打分不是看生成出来的那句话,而是第一个回答位置上,正标签 token 的归一化概率。

表 2:只行为,P@Top-1% 是 9.0%,Top-0.1% 是 20.1%,Top-0.01% 是 70.0%。只文本是 23.0%、70.1%、88.0%。文本加行为是 32.6%、79.2%、97.0%。Top-0.01% 的 97.0% 是极小头部上的精度,分母不是全部商户。

线上先影子三个月,串成文本的那一版没有发

第 4.4 节第一套部署是 0.6B 到 8B 的级联。0.6B 每天给大约 5000 万活跃商户打分,取出固定候选,再由 8B 排序。整套服务用 128 张 GPU。对照是 DeepSeek 上做了监督微调和强化学习的模型,只用商户资料和投诉,没有行为序列。

上线前做了三个月配对的前瞻影子评测。三套系统每天对同一批中性候选排序,候选来自一套与这三个打分器都无关的上游预筛,返回的条数相同。影子输出不进审核、不执行、不写标签。正样本的定义是:30 天内被现有生产风险系统确认,或者之后被确认的用户伤害报告。现有系统是一套专家策略的集成,论文写它独立于这三个被评打分器,包括那个 DeepSeek 基线。

表 3 是周平均。DeepSeek 只文本的风险精度 92.0%。SeqLLM 97.5%,高 5.5 个百分点。每一周都更高,配对符号检验 p < 10⁻³。把行为序列直接串成文本、仍用 DeepSeek 的那一版,精度掉到 83.0%。这一版没有上线。论文的解释是:没有序列能力时,最多 1000 个事件变成几万个稀疏 token,会冲掉原来的文本推理。

上线后两套并行。同一并发窗口里,SeqLLM 的申诉率约 2%,基线 12%;申诉后的洗白率 0% 对 8%,洗白这边观察到的是零。0.6B 在筛查比例 0.4% 时,六天监测窗口保住 91.24% 已确认的风险商户。8B 的精度增益是加在这个漏斗上面,不是用漏掉商户换来的。申诉率写的是约 2%,不是精确到小数。

第二套是欺诈检测器。原来的行为嵌入从头用欺诈标签学。实验只换初始化,用 SeqLLM 预训练的行为 token 嵌入,其余特征、结构和服务不变。三个月 A/B,用户随机分到相等的两臂,每天数十亿笔交易,标签成熟要 14 天。Precision@Top-0.01% 和 Top-0.1% 增加 26.8 和 7.6 个百分点。Recall@Top-0.1% 和 Top-1% 增加 12.9 和 33.1 个百分点。图 3 写明绝对值因业务保密没有给出。不能从百分点反推基线精度。

公开集上,完整管线的 P@1 没有超过对照

表 4 按 User-LLM 的协议,在 MovieLens-20M 和 Amazon Reviews 上测。下一物品 Recall@5:MovieLens 上 User-LLM 0.154,SeqLLM 0.174,相对高 13.0%。Amazon 上 0.047 对 0.062,相对高 31.9%。喜欢的类型准确率,MovieLens 0.787 对 0.973。语言分是作者自己复现的:SeqLLM 的 MMLU 0.738、C-Eval 0.786、AGIEval 0.657;User-LLM 是 0.297、0.276、0.307。拿掉语义初始化后,MovieLens Recall@5 从 0.174 降到 0.169。拿掉投影层后,喜欢的类目准确率从 0.987 降到 0.925。

表 5 在 RecIF 上和 OpenOneRec 的 OneRec-8B 比。RecIF 有 9600 万次交互、16 万用户。序列阶段对齐了 15.6 万条行为序列和 1300 万条描述。SeqLLM 只用 10 万条一般指令,OneRec 大约 2860 万条一般域和一般监督微调样本。序列阶段:OneRec 预训练的 P@1 是 0.0204,SeqLLM 是 0.0411。P@32 是 0.1521 对 0.2398。GPU 天 460 对 105。

走完各自后面的步骤后,OneRec 完整管线 P@1 是 0.0542,SeqLLM 加强化学习是 0.0540,低 0.4%。P@32 是 0.2101 对 0.2399,高 14.2%。C-Eval 0.7489 对 0.7485。GPU 天大约 994 对 206。OneRec 后面还有监督微调、蒸馏和强化学习;SeqLLM 这列只加了强化学习。两边的后训练步骤不一样。

表 6 是作者建的 RecProbe。视频–主题匹配准确率,OneRec-8B 0.4653,SeqLLM 0.7450。受众定向 0.4733 对 0.6160。视频兴趣排序的 NDCG@3,0.1121 对 0.8961。兴趣–类目一致 0.4973 对 0.7420。论文把排序这项的大差距部分归因于 OneRec 没有按指令输出,不完全是语义分。

这些数不能被读成什么

0.806 的 HR@10 是下一事件猜进前 10,不是风险精度。风险离线表的 97.0% 是 Top-0.01% 的精度。影子实验的 97.5% 是周平均的 30 天风险精度,对照是 92.0%。三套数的分母不一样。

83.0% 说明把行为明文串进 DeepSeek 会更差,而且这版没有上线。不能把 97.5% 理解成「只要把流水贴进提示词」。

影子实验的正样本来自现有生产风险系统或用户报告。论文写这套系统独立于三个被评打分器,但标签仍然来自生产体系,不是一份事先锁死的外部金标。申诉率的约 2% 和洗白率的 0% 是上线后的运营指标,洗白样本在观察窗口里是零,不是统计上的精确零风险。

欺诈检测的 +26.8 个百分点没有基线绝对值。三个月、两臂相等、14 天成熟写了,绝对精度没有写。

公开集上,SeqLLM+RL 的 P@1 比完整 OneRec 低 0.4%。GPU 天少,不等于推荐精度每一列都高。RecProbe 是自建探针。

出处:腾讯,WeChat Pay,SeqLLM: Augmenting LLMs with Behavioral-Sequence Modeling for High-Stakes Decisions at WeChat Pay,2026-08-04,https://arxiv.org/abs/2608.03063v1

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction