4 步 视频 VBench 84.33: 混 元 把 前 向 强化 学习 接到 MeanFlow
腾讯混元在 SD3.5-M 上用 4 步采样,少步 8 项里 6 项最好。Aesthetic 5.9275 低于 RTDMD 的 6.1290。Wan2.1 上 4 步 VBench 84.33,高于 50 步 LongCat-Video RL 的 82.57。Semantic 77.68 低于 SC-DMD 的 77.77。

本文目录
4 步视频 VBench 84.33:混元把前向强化学习接到 MeanFlow
腾讯混元与香港科技大学的 MeanFlowNFT(把前向过程强化学习接到平均速度生成器上),arXiv 提交日 2026 年 7 月 16 日(2607.15273)。当前 HTML 是 v2,标注日期 2026 年 7 月 21 日。作者 Yushi Huang、Xiangxin Zhou(同等贡献,通讯)、Jun Zhang、Liefeng Bo、Tianyu Pang(通讯)。单位是 Tencent Hunyuan 与 The Hong Kong University of Science and Technology。许可证是 CC BY 4.0。
MeanFlow 预测一段时间内的平均速度,所以一两步或几步就能采样,不用像普通扩散或流模型那样把瞬时速度积很多次。DiffusionNFT 是一种前向过程强化学习:不走反向轨迹,也不估似然,直接优化瞬时速度。两边对不上。这篇造一个由平均速度诱导出来的瞬时速度预测器,只在这个预测器上做 DiffusionNFT;真正采样仍用平均速度,步数保持少。作者证明,在理想设定下,它继承 DiffusionNFT 的严格策略改进。实验只比较图像和视频上的自动指标,不把训练损失当成质量。
训练设置
图像底座是 SD3.5-M,分辨率 1024×1024。少步模型用 4 步,多步对照用 40 步。视频底座是 Wan2.1 1.3B,少步 4 步,多步对照 50 步。每次更新的系数是 min(0.001×i, 0.5),i 是第几次更新。KL 正则权重 10 的负 4 次方。优化器 AdamW,学习率固定 3×10⁻⁶。采样 rollout 用 4 步生成器。SD3.5-M 每组 24 条,每次更新 48 组,8 张 NVIDIA H20。Wan2.1 每组 16 条,每个 epoch 8 组,32 张 NVIDIA H20。
图像指标:ImageReward、CLIPScore、Aesthetic Score、PickScore、HPSv2、HPSv3、GenEval2、OCR。HPSv3 和 OCR 按所引论文的设定,GenEval2 用官方设定,其余指标在 DrawBench 上算。视频报 VBench 的 Total、Quality、Semantic,另加留出的 256 条 prompt(不进训练集)上的 HPSv3-G、HPSv3-P、VideoAlign 的运动质量 MQ 和文本对齐 TA。
图像:少步 8 项里 6 项最好
少步模型里,加粗是最好,下划线是次好。多步行只作对照,不参加这 6/8 的计数。
| 方法 | 步数 | ImageReward | CLIPScore | Aesthetic | PickScore | HPSv2 | HPSv3 | GenEval2 | OCR |
|---|---|---|---|---|---|---|---|---|---|
| SD3.5-M,无 CFG | 40 | -0.4770 | 0.2391 | 5.1514 | 20.6587 | 0.2109 | 3.4601 | 0.1171 | 0.1439 |
| + DiffusionNFT | 40 | 1.4066 | 0.2889 | 5.9647 | 23.6440 | 0.3236 | 13.5959 | 0.2613 | 0.9098 |
| SD3.5-M,有 CFG | 40 | 0.9253 | 0.2880 | 5.3811 | 22.4638 | 0.2822 | 11.2489 | 0.2038 | 0.5449 |
| + Flow-GRPO | 40 | 1.0193 | 0.2912 | 5.2843 | 22.4783 | 0.2657 | 9.8059 | 0.2638 | 0.6282 |
| DMD | 4 | 0.9241 | 0.2841 | 5.5055 | 22.2807 | 0.2874 | 11.7156 | 0.2042 | 0.3996 |
| CDM | 4 | 1.0307 | 0.2819 | 5.5721 | 22.4160 | 0.2976 | 12.5190 | 0.2020 | 0.3225 |
| AnyFlow | 4 | 1.1125 | 0.2886 | 5.4203 | 22.4789 | 0.2969 | 12.0691 | 0.1896 | 0.4520 |
| RTDMD | 4 | 1.2315 | 0.2775 | 6.1290 | 23.2825 | 0.3265 | 13.9253 | 0.2042 | 0.2965 |
| R_dm | 4 | 0.7236 | 0.2720 | 5.7537 | 22.0748 | 0.2759 | 11.2115 | 0.1619 | 0.3759 |
| DMD + DiffusionNFT | 4 | 0.7158 | 0.2843 | 5.3784 | 21.9571 | 0.2708 | 9.6985 | 0.2249 | 0.4865 |
| CDM + DiffusionNFT | 4 | 0.1455 | 0.2745 | 4.8335 | 21.3849 | 0.2143 | -3.2834 | 0.2103 | 0.3303 |
| AnyFlow + DiffusionNFT | 4 | 1.2394 | 0.2915 | 5.9489 | 23.0876 | 0.2919 | 12.1378 | 0.2335 | 0.5948 |
| MeanFlowNFT | 4 | 1.4504 | 0.2967 | 5.9275 | 23.5019 | 0.3269 | 13.8826 | 0.2375 | 0.6534 |
少步里 MeanFlowNFT 最好的 6 项是 ImageReward、CLIPScore、PickScore、HPSv2、GenEval2、OCR。不是最好的两项:Aesthetic 5.9275,低于 RTDMD 的 6.1290,也低于 AnyFlow + DiffusionNFT 的 5.9489;HPSv3 13.8826,低于 RTDMD 的 13.9253。正文把 OCR 说成 0.65 对 RTDMD 的 0.30,表内是 0.6534 对 0.2965。
相对 40 步 DiffusionNFT,4 步 MeanFlowNFT 在 ImageReward(1.4504 对 1.4066)、CLIPScore(0.2967 对 0.2889)、HPSv2(0.3269 对 0.3236)、HPSv3(13.8826 对 13.5959)上更高。正文用约数写成 ImageReward 1.45 对 1.41、CLIPScore 0.297 对 0.289。同一张表里,40 步 DiffusionNFT 的 Aesthetic 5.9647、PickScore 23.6440、GenEval2 0.2613、OCR 0.9098 更高;40 步 Flow-GRPO 的 GenEval2 0.2638 也更高。所以「4 步超过 40 步强化学习」只成立在文中点名的若干奖励指标上,不是 8 项全超过。
把 DiffusionNFT 直接接到不预测瞬时速度后验均值的少步模型上,改进保证推不出来。CDM + DiffusionNFT 在大约 400 step 内发散,表上 ImageReward 掉到 0.1455,HPSv3 掉到 -3.2834。图 4 是训练奖励曲线,正文没有逐点坐标。图 13 到 15 的观感比较(过饱和、物体尺度不合理)也没有打分。
视频:4 步对 50 步
少步视频没有开源的强化学习基线,对照是蒸馏:rCM、DMD、SC-DMD、AnyFlow。SC-DMD 用的是该论文报告的数,四项留出指标是空的。50 步对照是带 CFG 的 Wan2.1 1.3B,以及 LongCat-Video RL。
| 方法 | 步数 | VBench Total | Quality | Semantic | HPSv3-G | HPSv3-P | MQ | TA |
|---|---|---|---|---|---|---|---|---|
| Wan2.1 1.3B,有 CFG | 50 | 82.94 | 84.69 | 75.97 | 3.9099 | 8.2868 | 0.8684 | 1.2255 |
| + LongCat-Video RL | 50 | 82.57 | 84.44 | 75.10 | 4.7099 | 9.2730 | 0.5493 | 1.6321 |
| rCM | 4 | 82.43 | 84.58 | 73.82 | 3.9660 | 8.7198 | 0.2740 | 1.6290 |
| DMD | 4 | 82.64 | 84.65 | 74.57 | 3.8598 | 8.7955 | 0.1810 | 1.6845 |
| SC-DMD | 4 | 83.36 | 84.76 | 77.77 | – | – | – | – |
| AnyFlow | 4 | 83.71 | 85.36 | 77.11 | 6.0536 | 10.450 | 0.7504 | 1.7356 |
| MeanFlowNFT | 4 | 84.33 | 85.99 | 77.68 | 6.5959 | 10.793 | 0.9535 | 1.7235 |
少步 7 项里 MeanFlowNFT 最好的是 5 项:Total 84.33、Quality 85.99、HPSv3-G 6.5959、HPSv3-P 10.793、MQ 0.9535。Semantic 77.68,低于 SC-DMD 的 77.77。TA 1.7235,低于 AnyFlow 的 1.7356。摘要里的例子是 4 步 VBench 84.33,高于 50 步 LongCat-Video RL 的 82.57。同一张表里,它也高于 50 步 Wan2.1 CFG 的 Total 82.94,并且 Quality、Semantic 和四项留出指标都高于这两行 50 步结果。
测试时步数可以取 2、4、8、16、32。正文写大多数指标随步数上升,而且比 AnyFlow 更不随步数改布局和内容。图 5、图 6、图 7 没有逐点数字,这里不补。
限制
只做了 DiffusionNFT 这一类前向过程强化学习,没有做 RAM、AWM。只做了 MeanFlow,没有做 shortcut、consistency trajectory 等其他 flow-map。诱导预测器的构造作者认为可以外推到这些方法,但没有做实验。SC-DMD 的四项留出指标缺失,不能把它和 MeanFlowNFT 在 HPSv3、MQ、TA 上比。图像上的「超过 40 步」不能推广到 GenEval2 和 OCR。没有线上 A/B,也没有人工评测表。
腾讯混元、香港科技大学,Yushi Huang、Xiangxin Zhou、Jun Zhang、Liefeng Bo、Tianyu Pang,MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators,2026-07-16,https://arxiv.org/abs/2607.15273
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。