WBench 平均 81.7: 京 东 用 3000 个 镜头 评 长 视频
京东 JoyAI-Echo-1.5 在 100 个故事、3000 个镜头上 7 项里 6 项最高,Aesthetic 0.5705 低于 LTX-2.5 的 0.6019。WBench Navigation 158 条平均 81.7。对 HappyOyster 的世界模型人工评测里,语义只有 13.63% 对 29.44%。

本文目录
WBench 平均 81.7:京东用 3000 个镜头评长视频
京东 Joy Future Academy 的 JoyAI-Echo-1.5(长程音视频生成系统,分长视频和世界模型两个变体),arXiv 提交日 2026 年 8 月 24 日(2608.23383)。当前 HTML 是 v2,标注日期 2026 年 8 月 25 日。署名作者 Nan Duan、Haoyang Huang、Weiyang Jin、Haoran Li、Yaowei Li、Yuming Li、Yijun Liu、Xin Lu、Xiaoxiao Ma、Yanwen Ma、Yaofeng Su、Yilang Sun、Haoyu Wang、Zeyue Xue、Songchun Zhang、Junhao Zhuang。单位写成 Joy Future Academy, JD。许可证是 CC BY 4.0。项目页和代码分别在 echo-team-joy-future-academy-jd.github.io 与 github.com/jd-opensource/JoyAI-Echo。
长视频变体用跨镜头记忆保住人物外观和说话人。世界模型变体把导航输入收成标定过的 6 自由度相机轨迹。两边都把双向音视频骨干收成因果、少步的生成器:先做 teacher forcing,再在自己滚出来的轨迹上做短程和长程 Self-Gradient Forcing。评测分自建长视频集、公开世界模型基准和人工并排,不把训练损失当成质量。
100 个故事、3000 个镜头
长视频评测沿用 JoyAI-Echo-1.0 的协议:100 个故事、3000 个镜头。除非另写,结果都开着 Director Agent,由它做镜头规划和记忆选择。四组指标:跨镜头用 ViCLIP、Self-CIDS(GroundingDINO、Torchreid、FaceNet)和 3DSpeaker 的 Voice;画质按 VBench-Long,把镜头接成一条长视频再切成 2 秒算 Aesthetic 和 Imaging;文本对齐用脚本和画面的 CLIP;语音用 Whisper 转写后对参考台词算词级 Recall。这一版不用 1.0 的 accuracy,所有方法都按 Recall 重跑。
对照分三类。联合生成:JavisDiT++、LTX-2.3、LTX-2.5,每镜大约 10 秒再拼接;LTX 开提示增强,第一镜之后用上一镜末帧做条件。级联:ShotStream 或 StoryMem 先出无声画面,MMAudio 再配音。原生长视频:HappyOyster 的 Directing 模式。另有自己的 1.0。
| 方法 | ViCLIP | Self-CIDS | Voice | Aesthetic | Imaging | CLIP | Recall |
|---|---|---|---|---|---|---|---|
| JavisDiT++ | 0.6955 | 0.5621 | 0.7933 | 0.5019 | 0.6084 | 0.2522 | 0.0951 |
| LTX-2.3 | 0.7047 | 0.6135 | 0.6847 | 0.5436 | 0.4751 | 0.2559 | 0.9304 |
| LTX-2.5 | 0.7775 | 0.6640 | 0.7603 | 0.6019 | 0.5804 | 0.2683 | 0.9545 |
| ShotStream+MMAudio | 0.7988 | 0.7308 | 0.7945 | 0.5255 | 0.6044 | 0.1998 | 0.0297 |
| StoryMem+MMAudio | 0.7897 | 0.7491 | 0.7643 | 0.5265 | 0.6320 | 0.2368 | 0.0301 |
| HappyOyster Directing | 0.7535 | 0.6940 | 0.7705 | 0.5606 | 0.6701 | 0.2544 | 0.1085 |
| JoyAI-Echo-1.0 | 0.8026 | 0.7793 | 0.8129 | 0.5679 | 0.7058 | 0.2658 | 0.9489 |
| JoyAI-Echo-1.5 | 0.8264 | 0.7937 | 0.8524 | 0.5705 | 0.7467 | 0.2868 | 0.9674 |
7 项里 6 项最高。不是最高的是 Aesthetic 0.5705,低于 LTX-2.5 的 0.6019,在这张表里排第二。相对 1.0,ViCLIP、Self-CIDS、Voice 高 0.0238、0.0144、0.0395。
和 HappyOyster Directing 的人工并排用 Good–Similar–Bad。百分比因四舍五入可以不刚好加到 100。标注人数正文没有写。
| 方面 | Echo-1.5 | 差不多 | HappyOyster |
|---|---|---|---|
| 故事指令 | 38.6% | 43.8% | 17.7% |
| 对白和背景声 | 39.2% | 37.3% | 23.5% |
| 记忆和身份 | 24.8% | 59.5% | 15.7% |
| 音视频同步 | 48.4% | 31.4% | 20.3% |
| 音质 | 44.4% | 22.2% | 33.3% |
五维都是 Echo 更高。同步差最大,48.4% 对 20.3%。身份一维有 59.5% 判成差不多。图 6 的 10 分钟案例、图 7 和 1.0 的观感比较没有逐项打分。
世界模型:158 条导航
WBench 用 Navigation 这 158 条。Quality 是观感和时间质量,Setting 是场景和主体是否贴题,Interaction 是导航轨迹跟不跟,Consistency 是空间、几何、光度、透视、主体和片段一致性,Physical 是物理和因果是否说得通。JoyAI-Echo-1.5 是未蒸馏的双向多步模型,Causal 是蒸成 4 步的因果模型。
| 方法 | 平均 | Quality | Setting | Interaction | Consistency | Physical |
|---|---|---|---|---|---|---|
| JoyAI-Echo-1.5 | 81.7 | 81.5 | 79.4 | 87.2 | 89.8 | 70.6 |
| JoyAI-Echo-1.5-Causal | 81.0 | 81.1 | 88.3 | 87.9 | 77.5 | 70.1 |
| HiDream-O1-World | 80.7 | 81.9 | 81.9 | 79.5 | 88.0 | 72.1 |
平均分 81.7 最高,4 步因果 81.0 第二,HiDream 80.7 第三。分项不是全第一。Quality 上 Seedance 1.5 是 82.1,HiDream 是 81.9,都高于 81.5。Setting 上 Cosmos3-Super 91.6、Wan 2.7 91.4、Kling 3.0 91.0,Echo 只有 79.4,因果版 88.3 也不是最高。Interaction 上因果版 87.9 高于未蒸馏的 87.2。Consistency 上 LingBot-World(base-camera)89.9,略高于 89.8。Physical 上 HiDream 72.1、Wan 2.7 71.8,高于 70.6。4 步和多步的平均分只差 0.7,正文据此说蒸馏大体保住了交互能力。图 8、图 9 没有逐点分数。
SANA-WM-Bench:241 帧和 961 帧
每个划分 80 个场景。短程用每条轨迹前 241 帧。R、T、CMC 越低越好,分别是旋转、平移和综合轨迹误差。
| 划分 | 方法 | VBench | R | T | CMC |
|---|---|---|---|---|---|
| 简单 | SANA-WM | 81.75 | 0.489 | 0.194 | 0.195 |
| 简单 | JoyAI-Echo-1.5 | 83.91 | 0.523 | 0.160 | 0.162 |
| 困难 | SANA-WM | 81.79 | 1.248 | 0.199 | 0.206 |
| 困难 | JoyAI-Echo-1.5 | 83.96 | 1.697 | 0.256 | 0.266 |
简单划分上 VBench、平移和 CMC 最好,旋转 0.523 高于 SANA-WM 的 0.489(越高越差)。困难划分上 VBench 最高,但三项轨迹误差都比 SANA-WM 大。
长程是官方 961 帧,60 秒、16 FPS,报的是未蒸馏多步模型。重访一致性不看真值帧,只比回到相近机位的帧。ΔIQ 是第一段和最后一段各 10 秒窗口的 VBench Imaging Quality 之差,越低越好。
简单划分:VBench 81.36,低于 LingBot-World 的 81.82;旋转 3.22、平移 0.918、CMC 0.927,这三项轨迹误差低于表内对照;重访 PSNR 15.10(正文写成 15.10 dB),SSIM 0.335 低于 LingBot 的 0.366,LPIPS 0.451 高于 LingBot 的 0.394(LPIPS 越低越好);ΔIQ 0.02,低于 LingBot 的 0.04。困难划分:VBench 81.72,低于 LingBot 的 81.89;旋转 12.05,高于 SANA-WM 的 10.02;平移 1.265、CMC 1.358 是该划分最低;PSNR 14.58、SSIM 0.333 最高;LPIPS 0.482 高于 LingBot 的 0.436;ΔIQ 0.93,高于 Matrix-Game 3 的 0.32 和 LingBot 的 0.58。正文把困难长程上旋转漂到 12.05° 写成还没解决的问题。
4 步因果模型在同一 961 帧设定上,简单划分 VBench 80.13,略高于 Evoke 的 80.11;旋转 5.009、平移 1.592、CMC 1.611 最低;PSNR 14.41 与 SANA-WM + Causal Refiner 持平;SSIM 0.2998、LPIPS 0.4802 最好;ΔIQ 2.09,差于 Refiner 的 -0.75 和 Evoke 的 -0.49。困难划分 VBench 81.06,轨迹三项和 PSNR 14.04、SSIM 0.2910、LPIPS 0.4893 都是该组最好;ΔIQ 1.30,差于 Evoke 的 0.30 和 Refiner 的 -0.24。图 11 只写平均和最低成像质量高于 Evoke 和带 Refiner 的 SANA-WM,没有把图上的格子写进正文。
200 条自建世界模型人工评测
WMB 有 200 条:游戏、人形机器人、户外、室内、驾驶;第三人称 132,第一人称 68。和 LingBot-World-v2、HappyOyster 做匿名并排。标注人数没有写。
对 HappyOyster:总体 63.13% 对 27.06%,差不多 9.82%。时空一致 57.69% 对 10.44%,观感 52.88% 对 23.81%,初始世界 39.50% 对 15.44%。语义跟随是 13.63% 对 29.44%,动作是 18.94% 对 24.56%,这两项 HappyOyster 更高。
对 LingBot-World-v2:总体 46.50% 对 21.57%,差不多 31.92%。五维里明确偏好都是 Echo 更高。差最大的是语义 34.00% 对 15.14%,以及时空 32.64% 对 14.71%。
限制
没有单独的限制节。长视频主表默认开着 Director Agent,不能当成关掉规划之后的生成器分数。语音从 accuracy 改成 Recall,和 1.0 论文的旧表不能直接比。WBench 平均第一,Setting、Quality、Physical 不是第一。SANA 困难短程和困难长程的部分轨迹误差更大,长程困难旋转到 12.05°。对 HappyOyster 的世界模型人工评测在语义和动作上落败。WMB 和 100 故事集是自建的,不是线上 A/B。4 步因果模型的 ΔIQ 差于若干对照,少步不是每一项都更稳。
京东 Joy Future Academy,Nan Duan、Haoyang Huang、Weiyang Jin、Haoran Li、Yaowei Li、Yuming Li、Yijun Liu、Xin Lu、Xiaoxiao Ma、Yanwen Ma、Yaofeng Su、Yilang Sun、Haoyu Wang、Zeyue Xue、Songchun Zhang、Junhao Zhuang,Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds,2026-08-24,https://arxiv.org/abs/2608.23383
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。