CodexQA

行业与实践研究与基准测试

4 步视频 VBench 84.33:混元把前向强化学习接到 MeanFlow

CodexQA 团队阅读约 4 分钟

腾讯混元在 SD3.5-M 上用 4 步采样,少步 8 项里 6 项最好。Aesthetic 5.9275 低于 RTDMD 的 6.1290。Wan2.1 上 4 步 VBench 84.33,高于 50 步 LongCat-Video RL 的 82.57。Semantic 77.68 低于 SC-DMD 的 77.77。

本文目录

4 步视频 VBench 84.33:混元把前向强化学习接到 MeanFlow

腾讯混元与香港科技大学的 MeanFlowNFT(把前向过程强化学习接到平均速度生成器上),arXiv 提交日 2026 年 7 月 16 日(2607.15273)。当前 HTML 是 v2,标注日期 2026 年 7 月 21 日。作者 Yushi Huang、Xiangxin Zhou(同等贡献,通讯)、Jun Zhang、Liefeng Bo、Tianyu Pang(通讯)。单位是 Tencent Hunyuan 与 The Hong Kong University of Science and Technology。许可证是 CC BY 4.0。

MeanFlow 预测一段时间内的平均速度,所以一两步或几步就能采样,不用像普通扩散或流模型那样把瞬时速度积很多次。DiffusionNFT 是一种前向过程强化学习:不走反向轨迹,也不估似然,直接优化瞬时速度。两边对不上。这篇造一个由平均速度诱导出来的瞬时速度预测器,只在这个预测器上做 DiffusionNFT;真正采样仍用平均速度,步数保持少。作者证明,在理想设定下,它继承 DiffusionNFT 的严格策略改进。实验只比较图像和视频上的自动指标,不把训练损失当成质量。

训练设置

图像底座是 SD3.5-M,分辨率 1024×1024。少步模型用 4 步,多步对照用 40 步。视频底座是 Wan2.1 1.3B,少步 4 步,多步对照 50 步。每次更新的系数是 min(0.001×i, 0.5),i 是第几次更新。KL 正则权重 10 的负 4 次方。优化器 AdamW,学习率固定 3×10⁻⁶。采样 rollout 用 4 步生成器。SD3.5-M 每组 24 条,每次更新 48 组,8 张 NVIDIA H20。Wan2.1 每组 16 条,每个 epoch 8 组,32 张 NVIDIA H20。

图像指标:ImageReward、CLIPScore、Aesthetic Score、PickScore、HPSv2、HPSv3、GenEval2、OCR。HPSv3 和 OCR 按所引论文的设定,GenEval2 用官方设定,其余指标在 DrawBench 上算。视频报 VBench 的 Total、Quality、Semantic,另加留出的 256 条 prompt(不进训练集)上的 HPSv3-G、HPSv3-P、VideoAlign 的运动质量 MQ 和文本对齐 TA。

图像:少步 8 项里 6 项最好

少步模型里,加粗是最好,下划线是次好。多步行只作对照,不参加这 6/8 的计数。

方法步数ImageRewardCLIPScoreAestheticPickScoreHPSv2HPSv3GenEval2OCR
SD3.5-M,无 CFG40-0.47700.23915.151420.65870.21093.46010.11710.1439
+ DiffusionNFT401.40660.28895.964723.64400.323613.59590.26130.9098
SD3.5-M,有 CFG400.92530.28805.381122.46380.282211.24890.20380.5449
+ Flow-GRPO401.01930.29125.284322.47830.26579.80590.26380.6282
DMD40.92410.28415.505522.28070.287411.71560.20420.3996
CDM41.03070.28195.572122.41600.297612.51900.20200.3225
AnyFlow41.11250.28865.420322.47890.296912.06910.18960.4520
RTDMD41.23150.27756.129023.28250.326513.92530.20420.2965
R_dm40.72360.27205.753722.07480.275911.21150.16190.3759
DMD + DiffusionNFT40.71580.28435.378421.95710.27089.69850.22490.4865
CDM + DiffusionNFT40.14550.27454.833521.38490.2143-3.28340.21030.3303
AnyFlow + DiffusionNFT41.23940.29155.948923.08760.291912.13780.23350.5948
MeanFlowNFT41.45040.29675.927523.50190.326913.88260.23750.6534

少步里 MeanFlowNFT 最好的 6 项是 ImageReward、CLIPScore、PickScore、HPSv2、GenEval2、OCR。不是最好的两项:Aesthetic 5.9275,低于 RTDMD 的 6.1290,也低于 AnyFlow + DiffusionNFT 的 5.9489;HPSv3 13.8826,低于 RTDMD 的 13.9253。正文把 OCR 说成 0.65 对 RTDMD 的 0.30,表内是 0.6534 对 0.2965。

相对 40 步 DiffusionNFT,4 步 MeanFlowNFT 在 ImageReward(1.4504 对 1.4066)、CLIPScore(0.2967 对 0.2889)、HPSv2(0.3269 对 0.3236)、HPSv3(13.8826 对 13.5959)上更高。正文用约数写成 ImageReward 1.45 对 1.41、CLIPScore 0.297 对 0.289。同一张表里,40 步 DiffusionNFT 的 Aesthetic 5.9647、PickScore 23.6440、GenEval2 0.2613、OCR 0.9098 更高;40 步 Flow-GRPO 的 GenEval2 0.2638 也更高。所以「4 步超过 40 步强化学习」只成立在文中点名的若干奖励指标上,不是 8 项全超过。

把 DiffusionNFT 直接接到不预测瞬时速度后验均值的少步模型上,改进保证推不出来。CDM + DiffusionNFT 在大约 400 step 内发散,表上 ImageReward 掉到 0.1455,HPSv3 掉到 -3.2834。图 4 是训练奖励曲线,正文没有逐点坐标。图 13 到 15 的观感比较(过饱和、物体尺度不合理)也没有打分。

视频:4 步对 50 步

少步视频没有开源的强化学习基线,对照是蒸馏:rCM、DMD、SC-DMD、AnyFlow。SC-DMD 用的是该论文报告的数,四项留出指标是空的。50 步对照是带 CFG 的 Wan2.1 1.3B,以及 LongCat-Video RL。

方法步数VBench TotalQualitySemanticHPSv3-GHPSv3-PMQTA
Wan2.1 1.3B,有 CFG5082.9484.6975.973.90998.28680.86841.2255
+ LongCat-Video RL5082.5784.4475.104.70999.27300.54931.6321
rCM482.4384.5873.823.96608.71980.27401.6290
DMD482.6484.6574.573.85988.79550.18101.6845
SC-DMD483.3684.7677.77––––
AnyFlow483.7185.3677.116.053610.4500.75041.7356
MeanFlowNFT484.3385.9977.686.595910.7930.95351.7235

少步 7 项里 MeanFlowNFT 最好的是 5 项:Total 84.33、Quality 85.99、HPSv3-G 6.5959、HPSv3-P 10.793、MQ 0.9535。Semantic 77.68,低于 SC-DMD 的 77.77。TA 1.7235,低于 AnyFlow 的 1.7356。摘要里的例子是 4 步 VBench 84.33,高于 50 步 LongCat-Video RL 的 82.57。同一张表里,它也高于 50 步 Wan2.1 CFG 的 Total 82.94,并且 Quality、Semantic 和四项留出指标都高于这两行 50 步结果。

测试时步数可以取 2、4、8、16、32。正文写大多数指标随步数上升,而且比 AnyFlow 更不随步数改布局和内容。图 5、图 6、图 7 没有逐点数字,这里不补。

限制

只做了 DiffusionNFT 这一类前向过程强化学习,没有做 RAM、AWM。只做了 MeanFlow,没有做 shortcut、consistency trajectory 等其他 flow-map。诱导预测器的构造作者认为可以外推到这些方法,但没有做实验。SC-DMD 的四项留出指标缺失,不能把它和 MeanFlowNFT 在 HPSv3、MQ、TA 上比。图像上的「超过 40 步」不能推广到 GenEval2 和 OCR。没有线上 A/B,也没有人工评测表。

腾讯混元、香港科技大学,Yushi Huang、Xiangxin Zhou、Jun Zhang、Liefeng Bo、Tianyu Pang,MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators,2026-07-16,https://arxiv.org/abs/2607.15273

觉得有用,转给同事

微信扫码

用微信扫一扫,在手机上打开后即可转发。

用 RSS 订阅

提交勘误