CodexQA

Industry & PracticeResearch & Benchmarks

56 条能核对的尺子:通义用 Qwen-Image-Bench 评复杂文生图

CodexQA 团队6 min read

通义实验室的 Qwen-Image-Bench 用 56 条可核验规则、五根能力柱和 1000 条中英提示词评文生图。Q-Judger 基于 Qwen3.6-27B,和专家判断的 Spearman 相关是 0.92,但没有给出专家人数。

In this piece

56 条能核对的尺子:通义用 Qwen-Image-Bench 评复杂文生图

阿里云社区在 2026 年 7 月 6 日发布了通义实验室的 Qwen-Image-Bench。这是一套面向创作者的文生图评测集,用来看模型在复杂、真实创作场景里的表现,并配套开源评判模型 Q-Judger。文生图已经进了专业创作流程,但领先模型在常规基准上接近饱和之后,分数和真实效果之间的缺口还在。

常规基准只看对齐和画质,创作现场还要别的

已有文生图评测大多看语义对齐和图像质量。视觉叙事、品牌、游戏美术和漫画还要求视觉审美、逻辑推理,以及在严格约束下把文字画准。Qwen-Image-Bench 和专业艺术家一起设计,落在真实创作场景上。它有 56 条细粒度、可核验的评分规则,并带统一评判模型 Q-Judger。

资源在四处:论文 http://arxiv.org/abs/2605.28091 ,Hugging Face 数据集 https://huggingface.co/datasets/Qwen/Qwen-Image-Bench ,ModelScope https://www.modelscope.cn/datasets/Qwen/Qwen-Image-Bench ,GitHub https://github.com/QwenLM/Qwen-Image-Bench 。

五根能力柱,不是几个大分数

它不拿少数几个宽指标去量模型,而是把 56 条可核验能力收成五根柱子:创意生成、审美、真实世界保真、质量和一致性。

三个设计点是:

  1. 场景覆盖真实应用需要的能力,包括世界知识、创意推理、文字渲染、视觉叙事、游戏设计和艺术审美。
  2. 放入世界各地的文化母题和历史元素,用来测跨文化的多样性和对齐,而不是只测一种语境。
  3. 评测可以复现:1000 条分层的中英提示词,覆盖 17 个应用领域。每条提示词至少对应 4 个三级维度。再配上开源的 Q-Judger,用来加快整条评测流程。

Q-Judger:一次给出 56 维,不是只给一个总分

评测集只有在过程稳定、能规模化时才有用。Q-Judger 基于 Qwen3.6-27B,对每张生成图输出全部 56 个维度的分数,用来做能力诊断,而不是只留一个总分。细粒度训练之后,它和人类专家判断的 Spearman 相关是 0.92。原文没有给出专家人数、样本量和标注协议。

中英总排名高度一致,前五是同一批

中文提示词和英文提示词各评了一遍,总排名高度一致。两种语言的前五都是:GPT Image 2、Nano Banana 2.0、GPT Image 1.5、Nano Banana Pro、Qwen Image 2.0 Pro。GPT Image 2 在两种语言里都大约领先 5 分。前五的成员相同,唯一变化是英文提示词下 GPT Image 1.5 和 Nano Banana 2.0 的第 2、第 3 名对调。这和 GPT Image 1.5 在英文输入上文字渲染、遵循提示更强是一致的。

GPT Image 2 在两种语言下都排第一,五根一级柱子全部第 1。最明显的优势在创意生成,两种语言里都大约高出下一名 8 分。

第 2 到第 4 名是 Nano Banana 2.0、GPT Image 1.5 和 Nano Banana Pro,总分差距不到 1 分。差别在具体能力:Nano Banana 2.0 强在审美和创意生成;GPT Image 1.5 强在审美和真实世界保真,英文提示词下升到第 2;Nano Banana Pro 强在质量和真实世界保真,三者里轮廓最均衡。

Qwen Image 2.0 Pro 在两种语言里都是第 5,总分几乎一样。创意生成可以和第 4 名这一档相比。在文字准确、分镜、漫画、信息可视化和跨语言生成这些吃语言理解的创作者维度上,它达到或超过上一档。和领先组的差距集中在吃视觉执行的维度:解剖保真、游戏设计、物体。原文把这写成后续改进方向是更强的视觉精度,不是已经补上。

拉开差距的是七类,全行业一起塌的是五类

中英两套评测里,模型之间差距最大的都是这七类:信息可视化、文字准确、跨语言生成、分镜、漫画、平面设计、游戏设计。它们合在一起考的是创意想象、逻辑推理和执行精度。

Q-Judger 把 56 个维度画成心形雷达。最弱的维度放在心形缺口,也就是 12 点方向。

几个图案是原文写明的:

  • GPT Image 2 在两种语言下都是最外圈。顶点来自五个高分维度:文字排版、分镜、平面设计、游戏设计、信息可视化。其中平面设计和游戏设计在中文和英文里都超过 90。更重要的是,它几乎所有维度都保持强,不是只有孤立长板。
  • 分开档位的是文字准确、跨语言生成和信息可视化。只有少数领先模型能到 60 分以上,靠后的模型掉得很快。
  • 心形缺口对应五个维度,两种语言下所有模型一起塌:物理逻辑、解剖保真、物体、动物、接触交互。它们跨了四根不同的柱子,说明天花板不在单一轴上,而是全行业在细粒度物理、生物结构和因果逻辑上的共同盲区。
  • 中段模型会不对称变形。以 Qwen Image 2.0 Pro 为例,视觉风格维度还能跟上,创意精度维度明显向内塌。创意生成内部,两种语言里它最强的那些维度平均比最弱的高出 20 分以上。

1000 条提示词要同时打到至少四个三级维度

提示词若不能稳定拉开模型,评测集就没用。他们和专业艺术家一起做了中英各一套、合计 1000 条提示词。每条都要同时测多项能力,至少映射到四个不同的三级维度,并且对模型表现差异敏感。

文中的例子按维度和提示词成对出现,对比图只说明谁和谁放在一起,没有逐图打分:

  • 时装造型、接触交互、艺术设计、镜头风格、构图、物理逻辑。提示词是中央圣马丁白秀后台的抓拍:化妆镜灯亮着,造型师给模特收紧胸衣、用别针固定斗篷。要求手和物理交互准确、别针和布料的张力真实、镜面反射合理,并用镜中倒影做成第二画面。对照是 GPT Image 2.0 和 Nano Banana 2.0。
  • 色彩和谐、情绪、构图、自然度、风格控制、真实场景。提示词是印象派下午咖啡馆,松散笔触、并置色彩、颤动光影,人物和建筑按莫奈的方式处理。对照是 GPT Image 2.0 和 FLUX.2 Max。
  • 产品设计、文化元素、色彩和谐、自然度、色彩。提示词是「敦煌飞天」文具系列,笔记本、书签、和纸胶带,母题来自古典壁画,颜色复刻古代矿物颜料。对照是 GPT Image 2.0 和 Qwen-Image 2.0 Pro。
  • 游戏设计、艺术设计、文字准确、二维空间、构图关系、分辨率、风格控制。提示词是二维像素 RPG 小镇截图,要有喷泉、武器店、旅店和三个 NPC,像素风格一致且可读,左上角简单界面写明 HP 100/100、Gold 250,文字必须清楚。对照是 GPT Image 2.0 和 Seedream 4.0。
  • 情绪、色彩和谐、风格控制、自然度、色彩。提示词是毕加索蓝色时期的街头艺人,冷色、瘦削忧郁的人物、沉重笔触,情绪和形体统一。对照是 GPT Image 2.0 和 Kling Image 2.1。

能画对、能画美只是起点

原文把下一阶段定义成:理解意图、用世界知识、在复杂约束里推理,再把抽象想法变成专业质量的画面。图像合成能力继续靠拢之后,这些更高的创作和推理能力会变成模型之间的主要差别。Qwen-Image-Bench 和 Q-Judger 都开源,用来把这些能力测出来。

读的时候只保留原文给得出的边界:Spearman 0.92 没有专家人数和样本量;大约 5 分、大约 8 分、不到 1 分、超过 90、高于 60、高出 20 分以上,都是正文里的幅度,不是从雷达图上另读出来的精确表;1000 条是中英提示词的合计规模,不是 1000 个模型;五类共同塌陷说明的是行业盲区,不是某一家单独的失败。

出处:阿里云,Tongyi Lab,Qwen-Image-Bench: Beyond Basic Generation — Evaluating T2I Models in Complex Scenarios,2026-07-06,https://www.alibabacloud.com/blog/qwen-image-bench-beyond-basic-generation-%E2%80%94-evaluating-t2i-models-in-complex-scenarios_603335

Found it useful? Pass it on

WeChat

Scan with WeChat to open it on your phone and forward it.

Subscribe via RSS

Submit a correction