Industry & PracticeResearch & Benchmarks
8B 动态 规则 高于 235B 静态 规则: 微 信用 它 替换 搜索 回答
DR-Generator-8B 六项准确率都高于 Qwen3-32B 零样本动态规则。用它监督的 8B 策略,开放题四项高于 70B 奖励模型和 235B 静态规则。微信搜索已全量替换,绝对指标未公开。

In this piece
8B 动态规则高于 235B 静态规则:微信用它替换搜索回答
腾讯微信与清华大学的 DynamicRubric(动态规则,按当前这一组候选回答现场写出带权二元规则,再合成每条回答的分数),arXiv 提交日 2026 年 7 月 22 日,当前页为 7 月 23 日修订的 v2(2607.20083)。作者 Beining Wang、Weihang Su、Hongtao Tian、Hao Kong、Tao Yang、Ting Yao、Qingyi Pan、Yueyue Wu、Qingyao Ai、Min Zhang、Yiqun Liu。单位是清华大学计算机系和 WeChat, Tencent。通讯作者 Qingyao Ai。许可证是 CC BY 4.0。
策略变强以后,同一次采样里的回答会挤在一起。评估器如果拉不开相对分差,策略更新就没有方向。论文把这件事写成概率分配:在给定问题和这一组回答时,把概率从一条回答挪到另一条,方向性收益正好等于两条的评估分差。所以相对分差就是策略更新要用的信号。只看问题、事先写好的宽规则,帮不了已经都很「有帮助、很清楚」的候选。
生成器写规则,验证器只打勾
对每个问题,DR-Policy 先采样一组候选。DR-Generator 看着这组回答,写出带权二元规则,条数和权重都不预先固定。冻结的 DR-Verifier 对每条规则、每条回答打是或否,再按权重加成回答级分数。生成器和策略分开优化,交替进行:先让生成器适应上一轮策略采出来的回答,再用新分数去更新策略。
两边都从独立的 Qwen3-8B 初始化,用 GRPO(组内相对优势的策略优化)训练。策略侧把评估分变成同一组里的相对优势。生成器侧把可区分奖励和锚点奖励在优势层面相加,因此 λ 设为 1。锚数据是 Nectar,开放域数据,每个问题有七条已排序回答。过滤后,生成器训练样本 2.4 万条:至少七条回答,问题和最高排序回答都超过 50 个字符,并丢掉重复、退化、套话过多的集合。策略训练保留 3.6 万条问题。只给排序过的锚数据时,生成器、验证器和策略可以是同一骨干的三份拷贝,不必另接外部奖励模型。
表 1 里,动态规则方法的验证器固定为 Qwen3-30B-A3B,避免和 Qwen3-8B、Qwen3-32B 生成器同模耦合。评估器评测用四个成对基准加两个列表基准,报告 AVG@5。成对基准是 JudgeBench、Personalized-RewardBench、RM-Bench、UltraFeedback。列表基准是 AEOLLM 和 LMSYS-Chat-1M。准确率是去掉平局后的严格准确率,列表另报 nDCG。
8B 生成器对上更大的评估器
DR-Generator-8B 的严格准确率:JudgeBench 57.4%,Personalized-RewardBench 73.3%,RM-Bench 69.8%,UltraFeedback 68.7%,AEOLLM 51.2%,LMSYS-Chat-1M 28.0%。同设定的 Qwen3-32B 零样本动态规则是 46.4%、67.6%、64.7%、64.6%、29.7%、15.1%。六项准确率都更高。AEOLLM 的 nDCG 是 0.898,零样本 32B 是 0.902,这一列没有更高。LMSYS 的 nDCG 是 0.779,对 0.763。
标量奖励模型只是对照,不是同一套规则生成器。Skywork-Reward-Gemma2-27B 及其「能看到整组回答」的变体,在表 1 列出的每一项上都低于 DR-Generator-8B。能看到候选集本身不够:Skywork 加上回答集后,JudgeBench 从 52.1% 到 56.1%,RM-Bench 却从 67.7% 降到 65.8%。Nemotron-70B-Reward-Multilingual 在 RM-Bench 85.2%、UltraFeedback 72.8%、AEOLLM 57.5%,高于 8B 动态规则。论文把和 70B 的比较写成有竞争力,不是全面超过。
用这套分数监督策略
开放生成用四个基准。AlpacaEval2 和 ArenaHardv2.0 报胜率,WildBench 和 WritingBench 报各自原量表上的分数,都是越高越好。裁判是 DeepSeek-V4-Flash。附录 F.2 用 GPT-4.1 再评,增益仍在。
下表是原文表 2。监督方法一列里,Native 是未再训练的骨干。RaR 是 Rubric-as-Reward:只用问题、不用候选回答,由 Qwen3-235B-A22B-Instruct-2507 写静态规则。
| 监督 | 监督规模 | 骨干 | AlpacaEval2 | ArenaHardv2.0 | WildBench | WritingBench |
|---|---|---|---|---|---|---|
| Native | — | Qwen3-8B | 38.5 | 9.0 | 16.4 | 57.8 |
| Native | — | Qwen3-32B | 50.2 | 20.8 | 29.7 | 62.0 |
| Skywork-27B | 27B | Qwen3-8B | 50.6 | 15.3 | 22.3 | 60.2 |
| Skywork-27B,可见回答集 | 27B | Qwen3-8B | 48.2 | 12.3 | 20.5 | 58.6 |
| Nemotron-70B | 70B | Qwen3-8B | 35.2 | 10.3 | 17.5 | 56.2 |
| Nemotron-70B,可见回答集 | 70B | Qwen3-8B | 41.9 | 9.2 | 18.9 | 58.2 |
| RaR 静态规则 | 235B | Qwen3-8B | 58.5 | 15.7 | 25.2 | 61.6 |
| DR-Generator-8B | 8B | Qwen3-8B | 67.1 | 21.0 | 30.7 | 64.3 |
8B 动态规则监督的策略,四项都高于 70B 奖励模型、235B 静态规则,也高于未训练的 Qwen3-32B。可见回答集的标量模型并不稳定更好:Skywork 加上回答集后四项都低于不加的 Skywork。
协同进化,以及线上替换
G0 和 P0 都从 Qwen3-8B 分开初始化。先用 P0 的回答训练出 G1,再用 G1 监督出 P1。下一轮比较两件事:生成器继续在过期的 P0 分布上训练,还是改到当前的 P1;策略继续用过期的 G1,还是改用刚适应过的 G2。图 2 没有在正文给出逐点数字。文字结论是:跟着当前策略分布训练生成器更强,停在 P0 上可能变差;G2 监督 P1 时四个开放生成基准都更好,过期的 G1 增益更小,因为按 P0 校准的规则在 P1 的样本上会饱和或给出噪声分差。
可验证任务看的是开放生成优化会不会伤推理。基准是 MATH-500(竞赛风格数学,用 Math-Verify 判)、MMLU-Pro(科学问答,精确匹配)和 CodeScope(编码,精确匹配),报告 AVG@5。图 3 同样没有逐点数字。正文只写:相对初始策略,两轮 DynamicRubric 优化后的策略在这三项上都更高。附录 F.3 用 Llama-3.1-8B-Instruct 重跑整条流水线,用来看骨干是否换得动,正文没有另给一张对照表。
线上是微信搜索的 AI 回答,每天数千万次请求。基线是原先的生产模型。两边都是 WeLM-V4-80B-A3B,微信自己的模型。因商业保密,原文不给绝对数,只写相对提升在总搜索量、用户时长、绝对正向行为上统计显著。随后全量替换旧模型,承接全部线上流量。线上还会用刷新后的锚数据继续校正评估方向,让后面的策略迭代跟着目标变。
两个目标都要留
消融在同一生成器、同一策略采样、同样的步数上,只改目标。表 3 是准确率。去掉锚点目标,宏平均 56.9:JudgeBench 56.1,Personalized-RewardBench 72.4,RM-Bench 69.8,UltraFeedback 67.9,AEOLLM 47.3,LMSYS-Chat-1M 27.7。去掉可区分目标,宏平均 52.7:50.0、73.8、66.3、66.8、38.8、20.7。两个都留,宏平均 58.1:57.4、73.3、69.8、68.7、51.2、28.0。可区分负责在当前回答集上拉开差异,锚点负责这些差异跟已有排序一致。只留其中一个,都会在部分基准上更高,但宏平均都低于完整目标。
限制
训练时策略优化要串行调用生成器和验证器,墙钟时延会增加。附录 E 称在他们的设置里,这项开销仍低于用更大奖励模型或更大规则生成器做监督,但生成器、验证器或回答集再变大,成本会更明显。验证器在训练中保持冻结。附录 F.1 换过不同规模、不同家族的验证器,但训练没用 GPT-4.1 这类更强的黑盒验证器。图 2 和图 3 的逐点分数没有写进正文。线上绝对指标没有公开,不能把「统计显著的相对提升」读成具体百分比。结果对应文中的 Qwen3-8B 主实验、表 1 至表 3 的基准,以及微信搜索这一条生产链路。
腾讯微信、清华大学,Beining Wang、Weihang Su、Hongtao Tian、Hao Kong、Tao Yang、Ting Yao、Qingyi Pan、Yueyue Wu、Qingyao Ai、Min Zhang、Yiqun Liu,Co-Evolving LLM Evaluators and Policies via DynamicRubric,2026-07-22,https://arxiv.org/abs/2607.20083
Found it useful? Pass it on
Scan with WeChat to open it on your phone and forward it.