
评测背景当 AI 从“会生图”进化到能替代专业摄影、甚至深度参与艺术创作时我们该如何评测一个模型的“真实创作能力”目前业界的文生图T2I评测大多仍局限于基础语义遵循、图像质量或审美打分。但在真实的影像叙事、品牌设计、游戏美术、漫画创作等工作流中模型需要的不仅是“能理解提示词”更要创作出具备视听语言美学知识、有逻辑推理能力能精准控制文字渲染的优秀作品。“能够生成图片”并不等同于“具备用户需要的创作能力”。Qwen-Image-Bench 正是一个面向真实用户创作需求的文生图创作级评测基准由专业影像视觉与美学设计团队主导设计并由 Qwen Image 团队官方开源。该基准已被 EMNLP 2026 主会接收。论文[2605.28091] Qwen-Image-Bench: From Generation to Creation in Text-to-Image Evaluationhuggingfacehttps://huggingface.co/datasets/Qwen/Qwen-Image-BenchQ-Judger 开源地址https://huggingface.co/Qwen/Qwen-Image-Bench魔搭社区Qwen-Image-Bench榜单概览Qwen-Image-Bench 当前榜单纳入 19 款主流文生图模型并按照综合得分进行排名。完整结果如下Qwen-Image-Bench 文生图模型总榜点击访问晓天衡宇评测社区查看完整评测集详情及详细得分榜单。核心结论结论 1GPT Image 2 总榜居首Qwen Image 3 Pro 位列第二且五项能力表现均衡GPT Image 2 以 64.69 分位列总榜第一Qwen Image 3 Pro 以 62.35 分排名第二Nano Banana 2.0 以 59.82 分排名第三。Qwen Image 3 Pro 与榜首相差 2.34 分较第三名高 2.53 分进入本次榜单头部梯队。从一级维度看Qwen Image 3 Pro 在「图像质量」、「图像美学」、「图文一致性」、「现实世界还原」和「创作推理」五项能力中均排名第二对应得分分别为 57.41 分、63.78 分、63.54 分、56.05 分和 72.45 分。这表明Qwen Image 3 Pro 在本次评测中呈现出较为均衡的能力结构综合表现未明显依赖单一维度。结论 2「创作推理」维度方差最高「细分任务」反映模型能力特点五项一级维度中「创作推理」的模型间方差为 94.10位列各维度首位。该维度中GPT Image 2 以 75.23 分排名第一Qwen Image 3 Pro 以 72.45 分排名第二在三级维度中「文字准确性」、「信息可视化」、「跨语言生成」、「分镜创作」、「平面设计」、「漫画创作」和「游戏设计」等考点位居模型间方差排名前列。这表明在本次评测框架下不同模型在创作推理相关任务中的表现有所不同「文字编辑」、「知识表达」、「视觉叙事」和「设计应用」等细分能力是拉开各家模型差距的重要维度。结论 3「现实世界还原」仍有提升空间「物理与交互能力」是重点观察方向本次评测中「现实世界还原」维度各模型得分分布在 43.16 分至 57.38 分之间。其中GPT Image 2 以 57.38 分位列第一Qwen Image 3 Pro 以 56.05 分位列第二。进一步观察三级维度「物理逻辑」、「人像保真度」、「动物」、「物体」和「接触交互」五个考点的最高得分均低于 44 分。这表明在本次评测框架下参评模型在「物理规律」、「主体形态」及「对象交互关系」的呈现上仍有完善空间相关三级考点可为后续模型优化提升提供更细致的参考。评测集设计Qwen-Image-Bench 采用 L1→L2→L3 三级评测框架将文生图模型的综合能力拆解为 5 项一级能力、23 项二级维度和 56 项三级考点。五项一级能力包括「图像质量」、「图像美学」、「图文一致性」、「现实世界还原」和「创作推理」形成从“基础生成表现”到“复杂创作能力”的完整评测结构。其中「图像质量」、「图像美学」和「图文一致性」主要考察画面清晰度与细节、视觉审美以及对prompt要求的响应情况「现实世界还原」进一步关注「物理规律」、「主体形态」和「世界知识」的准确呈现「创作推理」则覆盖「文字编辑」、「影像叙事」、「设计应用」和「创意表达」「逻辑推理」等任务。上述能力进一步细化为可独立评分的具体考点覆盖「分镜创作」、「游戏设计」、「漫画创作」、「时尚造型」、「字体美学」和「世界知识」等细分方向。这一设计使评测结果不仅能够形成综合排名也可以进一步定位模型在具体创作环节中的能力表现为专项分析和模型后续迭代提供依据。Qwen-Image-Bench 三级维度框架总览评测集构造Qwen-Image-Bench 贯彻“真实创作场景驱动”的构造思路。艺术家及专业影像视觉与美学设计团队从“实际创作流程”中提取典型场景和创作需求再将其映射至相应的二级维度与三级考点。使评测内容与真实视觉创作中的能力要求形成对应关系。在此基础上评测集经过多轮专家驱动的 Prompt 设计与校验最终形成 1,000 条中英双语分 Prompt。每条 Prompt 至少覆盖 4 项三级考点并与对应的维度检查清单建立关联使同一生成结果可以在多个细粒度能力维度上接受评估。Prompt 同时兼顾不同创作类型与文化元素以提升评测场景的覆盖范围和多样性。本次评测组织 19 款主流文生图模型完成全部 Prompt 的图像生成共形成 19,000 个评测样本生成结果随后进入自动评分环节。评测集构建流程专家驱动 Prompt 工程 → 多模型生图 → AI 自动评分评测方法Qwen-Image-Bench 采用配套的自动评估模型 Q-Judger 进行评分。Q-Judger 以 Qwen3.6-27B 为底座通过超过 130,000 组中英双语专家标注对进行训练。其输入包括评测 Prompt、模型生成图片、评分标准Rubric以及 L2/L3 维度检查清单可在单次推理中输出 56 项三级考点的结构化评分。每项三级考点采用四档评分标准Fail 映射为 0 分Pass 映射为 60 分Excel 映射为 100 分不适用于当前图片或 Prompt 的考点标记为 N/A不参与后续聚合。评分完成后系统按照 L3→L2→L1 逐层取均值每项二级维度在对应一级能力中等权计算五项一级能力再以各占 1/5 的权重形成样本综合得分。每款模型的最终得分取其全部 1,000 个样本综合得分的平均值并据此形成总榜排名。Q-Judger 的训练数据由 80 位具有全球艺术院校背景的专业标注专家参与完成初始标注后由至少 3 名专家进行独立交叉复核。在独立测试中Q-Judger 与资深人类艺术专家标注的 Spearman 系数达到 0.92在降低大规模人工评审成本的同时保留了细粒度、可追溯的评测结果。Q-Judger 评分映射与逐层聚合机制案例展示为进一步呈现 Qwen-Image-Bench 在真实创作任务中的评测方式以下选取 4组案例覆盖「现实世界还原」、「产品设计」、「文化元素」、「文字编辑」、「游戏设计」、「艺术风格」等方向。每组 Prompt 均对应多项三级考点通过并列展示不同模型的生成结果可以直观观察模型对具体创作要求的响应情况。以下案例主要用于展示 Prompt 与细粒度考点的对应关系不作为单一样本下模型优劣的判断依据。案例 1秀场后台「接触互动」与「物理逻辑」维度考点时尚造型、接触互动、艺术设计、摄影机/镜头风格、构图、物理逻辑。Prompt 示例模拟拍摄一张中央圣马丁艺术与设计学院 White Show 秀场后台抓拍图后台化妆间镜前灯泡发光造型师正在为面容姣好的模特系紧束腰并使用别针固定披风。要求手部与接触互动准确、别针与织物拉力真实、镜面反射合理构图以镜中倒影形成二次画面。GPT Image 2Nano Banana 2.0案例 2敦煌文创「产品设计」与「文化元素」维度考点产品设计、文化元素、色彩、想象力。Prompt 示例文创文具系列“敦煌飞天”包括笔记本、书签与胶带图案提取壁画经典纹样配色复刻矿物颜料古韵兼具文化性与实用性。GPT Image 2Qwen Image 2.0 Pro案例 3像素风RPG「游戏设计」与「文字呈现」维度考点游戏设计、艺术设计、文字准确性、二维空间、清晰度/分辨率、风格控制。Prompt 示例2D 像素风 RPG 的城镇场景截图包含喷泉、武器店、旅馆和三名 NPC要求像素风格统一、可读性强画面左上角设置简洁 UI显示“HP 100/100” 和 “Gold 250”文字需清晰。GPT Image 2Seedream 4.0案例 4艺术设计「艺术风格」与「情绪表达」维度考点艺术设计、情绪表达、色彩、风格控制。Prompt 示例毕加索蓝色时期风格的流浪艺人冷色调主导人物瘦削忧郁笔触沉郁全图情绪与形式统一。GPT Image 2Kling Image 2.1综合判断综合来看本次榜单形成了由 GPT Image 2、Qwen Image 3 Pro 和 Nano Banana 2.0 组成的前三名格局。其中Qwen Image 3 Pro 位列总榜第二并在五项一级能力中均保持第二名。从整体结果看头部模型的综合表现已不只取决于基础画质或语义对齐对现实世界的呈现、创作意图的理解以及专业场景的执行同样是影响综合排名的重要方面。同时综合得分相近的模型也可能具有不同的能力结构和适用场景。因此总榜可以作为判断模型整体能力的基础参考具体选择时仍需结合一级维度和三级考点考察模型与实际创作需求的适配程度。注本文结论基于本次参评的 19 款模型、1,000 条 Prompt 及 Q-Judger 评分框架仅反映模型在Qwen-Image-Bench 下的相对表现不代表其在所有视觉创作任务中的绝对能力。写在最后最新官方自建评测集已同步上线至晓天衡宇评测社区官网欢迎访问查看更详细的评测数据关注晓天衡宇•评测社区官方账号获取更多大模型相关知识~