CodexQA

行业与实践研究与基准测试

WBench 平均 81.7:京东用 3000 个镜头评长视频

CodexQA 团队阅读约 5 分钟

京东 JoyAI-Echo-1.5 在 100 个故事、3000 个镜头上 7 项里 6 项最高,Aesthetic 0.5705 低于 LTX-2.5 的 0.6019。WBench Navigation 158 条平均 81.7。对 HappyOyster 的世界模型人工评测里,语义只有 13.63% 对 29.44%。

本文目录

WBench 平均 81.7:京东用 3000 个镜头评长视频

京东 Joy Future Academy 的 JoyAI-Echo-1.5(长程音视频生成系统,分长视频和世界模型两个变体),arXiv 提交日 2026 年 8 月 24 日(2608.23383)。当前 HTML 是 v2,标注日期 2026 年 8 月 25 日。署名作者 Nan Duan、Haoyang Huang、Weiyang Jin、Haoran Li、Yaowei Li、Yuming Li、Yijun Liu、Xin Lu、Xiaoxiao Ma、Yanwen Ma、Yaofeng Su、Yilang Sun、Haoyu Wang、Zeyue Xue、Songchun Zhang、Junhao Zhuang。单位写成 Joy Future Academy, JD。许可证是 CC BY 4.0。项目页和代码分别在 echo-team-joy-future-academy-jd.github.io 与 github.com/jd-opensource/JoyAI-Echo。

长视频变体用跨镜头记忆保住人物外观和说话人。世界模型变体把导航输入收成标定过的 6 自由度相机轨迹。两边都把双向音视频骨干收成因果、少步的生成器:先做 teacher forcing,再在自己滚出来的轨迹上做短程和长程 Self-Gradient Forcing。评测分自建长视频集、公开世界模型基准和人工并排,不把训练损失当成质量。

100 个故事、3000 个镜头

长视频评测沿用 JoyAI-Echo-1.0 的协议:100 个故事、3000 个镜头。除非另写,结果都开着 Director Agent,由它做镜头规划和记忆选择。四组指标:跨镜头用 ViCLIP、Self-CIDS(GroundingDINO、Torchreid、FaceNet)和 3DSpeaker 的 Voice;画质按 VBench-Long,把镜头接成一条长视频再切成 2 秒算 Aesthetic 和 Imaging;文本对齐用脚本和画面的 CLIP;语音用 Whisper 转写后对参考台词算词级 Recall。这一版不用 1.0 的 accuracy,所有方法都按 Recall 重跑。

对照分三类。联合生成:JavisDiT++、LTX-2.3、LTX-2.5,每镜大约 10 秒再拼接;LTX 开提示增强,第一镜之后用上一镜末帧做条件。级联:ShotStream 或 StoryMem 先出无声画面,MMAudio 再配音。原生长视频:HappyOyster 的 Directing 模式。另有自己的 1.0。

方法ViCLIPSelf-CIDSVoiceAestheticImagingCLIPRecall
JavisDiT++0.69550.56210.79330.50190.60840.25220.0951
LTX-2.30.70470.61350.68470.54360.47510.25590.9304
LTX-2.50.77750.66400.76030.60190.58040.26830.9545
ShotStream+MMAudio0.79880.73080.79450.52550.60440.19980.0297
StoryMem+MMAudio0.78970.74910.76430.52650.63200.23680.0301
HappyOyster Directing0.75350.69400.77050.56060.67010.25440.1085
JoyAI-Echo-1.00.80260.77930.81290.56790.70580.26580.9489
JoyAI-Echo-1.50.82640.79370.85240.57050.74670.28680.9674

7 项里 6 项最高。不是最高的是 Aesthetic 0.5705,低于 LTX-2.5 的 0.6019,在这张表里排第二。相对 1.0,ViCLIP、Self-CIDS、Voice 高 0.0238、0.0144、0.0395。

和 HappyOyster Directing 的人工并排用 Good–Similar–Bad。百分比因四舍五入可以不刚好加到 100。标注人数正文没有写。

方面Echo-1.5差不多HappyOyster
故事指令38.6%43.8%17.7%
对白和背景声39.2%37.3%23.5%
记忆和身份24.8%59.5%15.7%
音视频同步48.4%31.4%20.3%
音质44.4%22.2%33.3%

五维都是 Echo 更高。同步差最大,48.4% 对 20.3%。身份一维有 59.5% 判成差不多。图 6 的 10 分钟案例、图 7 和 1.0 的观感比较没有逐项打分。

世界模型:158 条导航

WBench 用 Navigation 这 158 条。Quality 是观感和时间质量,Setting 是场景和主体是否贴题,Interaction 是导航轨迹跟不跟,Consistency 是空间、几何、光度、透视、主体和片段一致性,Physical 是物理和因果是否说得通。JoyAI-Echo-1.5 是未蒸馏的双向多步模型,Causal 是蒸成 4 步的因果模型。

方法平均QualitySettingInteractionConsistencyPhysical
JoyAI-Echo-1.581.781.579.487.289.870.6
JoyAI-Echo-1.5-Causal81.081.188.387.977.570.1
HiDream-O1-World80.781.981.979.588.072.1

平均分 81.7 最高,4 步因果 81.0 第二,HiDream 80.7 第三。分项不是全第一。Quality 上 Seedance 1.5 是 82.1,HiDream 是 81.9,都高于 81.5。Setting 上 Cosmos3-Super 91.6、Wan 2.7 91.4、Kling 3.0 91.0,Echo 只有 79.4,因果版 88.3 也不是最高。Interaction 上因果版 87.9 高于未蒸馏的 87.2。Consistency 上 LingBot-World(base-camera)89.9,略高于 89.8。Physical 上 HiDream 72.1、Wan 2.7 71.8,高于 70.6。4 步和多步的平均分只差 0.7,正文据此说蒸馏大体保住了交互能力。图 8、图 9 没有逐点分数。

SANA-WM-Bench:241 帧和 961 帧

每个划分 80 个场景。短程用每条轨迹前 241 帧。R、T、CMC 越低越好,分别是旋转、平移和综合轨迹误差。

划分方法VBenchRTCMC
简单SANA-WM81.750.4890.1940.195
简单JoyAI-Echo-1.583.910.5230.1600.162
困难SANA-WM81.791.2480.1990.206
困难JoyAI-Echo-1.583.961.6970.2560.266

简单划分上 VBench、平移和 CMC 最好,旋转 0.523 高于 SANA-WM 的 0.489(越高越差)。困难划分上 VBench 最高,但三项轨迹误差都比 SANA-WM 大。

长程是官方 961 帧,60 秒、16 FPS,报的是未蒸馏多步模型。重访一致性不看真值帧,只比回到相近机位的帧。ΔIQ 是第一段和最后一段各 10 秒窗口的 VBench Imaging Quality 之差,越低越好。

简单划分:VBench 81.36,低于 LingBot-World 的 81.82;旋转 3.22、平移 0.918、CMC 0.927,这三项轨迹误差低于表内对照;重访 PSNR 15.10(正文写成 15.10 dB),SSIM 0.335 低于 LingBot 的 0.366,LPIPS 0.451 高于 LingBot 的 0.394(LPIPS 越低越好);ΔIQ 0.02,低于 LingBot 的 0.04。困难划分:VBench 81.72,低于 LingBot 的 81.89;旋转 12.05,高于 SANA-WM 的 10.02;平移 1.265、CMC 1.358 是该划分最低;PSNR 14.58、SSIM 0.333 最高;LPIPS 0.482 高于 LingBot 的 0.436;ΔIQ 0.93,高于 Matrix-Game 3 的 0.32 和 LingBot 的 0.58。正文把困难长程上旋转漂到 12.05° 写成还没解决的问题。

4 步因果模型在同一 961 帧设定上,简单划分 VBench 80.13,略高于 Evoke 的 80.11;旋转 5.009、平移 1.592、CMC 1.611 最低;PSNR 14.41 与 SANA-WM + Causal Refiner 持平;SSIM 0.2998、LPIPS 0.4802 最好;ΔIQ 2.09,差于 Refiner 的 -0.75 和 Evoke 的 -0.49。困难划分 VBench 81.06,轨迹三项和 PSNR 14.04、SSIM 0.2910、LPIPS 0.4893 都是该组最好;ΔIQ 1.30,差于 Evoke 的 0.30 和 Refiner 的 -0.24。图 11 只写平均和最低成像质量高于 Evoke 和带 Refiner 的 SANA-WM,没有把图上的格子写进正文。

200 条自建世界模型人工评测

WMB 有 200 条:游戏、人形机器人、户外、室内、驾驶;第三人称 132,第一人称 68。和 LingBot-World-v2、HappyOyster 做匿名并排。标注人数没有写。

对 HappyOyster:总体 63.13% 对 27.06%,差不多 9.82%。时空一致 57.69% 对 10.44%,观感 52.88% 对 23.81%,初始世界 39.50% 对 15.44%。语义跟随是 13.63% 对 29.44%,动作是 18.94% 对 24.56%,这两项 HappyOyster 更高。

对 LingBot-World-v2:总体 46.50% 对 21.57%,差不多 31.92%。五维里明确偏好都是 Echo 更高。差最大的是语义 34.00% 对 15.14%,以及时空 32.64% 对 14.71%。

限制

没有单独的限制节。长视频主表默认开着 Director Agent,不能当成关掉规划之后的生成器分数。语音从 accuracy 改成 Recall,和 1.0 论文的旧表不能直接比。WBench 平均第一,Setting、Quality、Physical 不是第一。SANA 困难短程和困难长程的部分轨迹误差更大,长程困难旋转到 12.05°。对 HappyOyster 的世界模型人工评测在语义和动作上落败。WMB 和 100 故事集是自建的,不是线上 A/B。4 步因果模型的 ΔIQ 差于若干对照,少步不是每一项都更稳。

京东 Joy Future Academy,Nan Duan、Haoyang Huang、Weiyang Jin、Haoran Li、Yaowei Li、Yuming Li、Yijun Liu、Xin Lu、Xiaoxiao Ma、Yanwen Ma、Yaofeng Su、Yilang Sun、Haoyu Wang、Zeyue Xue、Songchun Zhang、Junhao Zhuang,Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds,2026-08-24,https://arxiv.org/abs/2608.23383

觉得有用,转给同事

微信扫码

用微信扫一扫,在手机上打开后即可转发。

用 RSS 订阅

提交勘误