通义千问发布 Qwen-Image-3.0 图像生成模型,核心关键词为"实"

Qwen:Blog Retrieval(API)·2026-07-21 14:00·45天前·QwenTeam
AI 导读

通义千问发布第三代图像生成基座模型 Qwen-Image-3.0,核心关键词为“实”。该模型支持最长 4.5k token 指令输入,可单次生成包含 9 个复杂信息图的 3×3 网格布局;文本渲染精度达 10px,并支持 12 种语言原生渲染,旨在将图像转化为可部署的生产力工具。

Qwen:Blog Retrieval(API)
精选
77AI 编辑部评分,满分 100

通义千问发布 Qwen-Image-3.0 图像生成模型,核心关键词为"实"

2026-07-21 14:00· 45天前· QwenTeam
AI 导读

通义千问发布第三代图像生成基座模型 Qwen-Image-3.0,核心关键词为“实”。该模型支持最长 4.5k token 指令输入,可单次生成包含 9 个复杂信息图的 3×3 网格布局;文本渲染精度达 10px,并支持 12 种语言原生渲染,旨在将图像转化为可部署的生产力工具。

推荐理由

我觉得 Qwen-Image-3.0 不只是画得好看,而是真正追求“有用”,4.5k token 输入、12 种语言渲染、10px 精细文字,对做设计、内容生产的人是生产力级突破。

正文 · AI 翻译

Image 2QWEN CHAT 我们正式发布通义千问图像生成系列第三代基础模型——Qwen-Image-3.0。如果说 Qwen-Image-1.0 的关键词是"精准",Qwen-Image-2.0 的关键词是"精准、多样、完整、美观、真实",那么 Qwen-Image-3.0 的核心可以归结为一个字——"实"。

这个"实"体现在三个维度:

  • 内容丰富:支持高达 4.5k 模型 token 输入,轻松生成报纸、分镜脚本、试卷等复杂版式。
  • 细节真实:支持精确渲染小至 10px 的文字,生动再现毛孔、发丝等细节,呈现逼真的微观级刻画。
  • 知识深厚:原生支持 12 种语言渲染,模拟网页、游戏、直播等主流界面,并依托丰富的世界知识进行创作。

总之,Qwen-Image-3.0 追求的不仅是"好看",更是"好用",让图像生成成为真正可落地的生产力工具。

内容丰富#

先来看下面这张由 Qwen-Image-3.0 生成的图片:

Image 3可以看到,Qwen-Image-3.0 能够准确渲染一张数学幻灯片,包括空间关系、数学符号、定理描述等丰富的视觉内容。这些内容布局合理,相对位置恰当,信息量十足。

然而,这并非 Qwen-Image-3.0 的真正实力。实际上,这仅仅是其真实能力的"九分之一",因为这张图只是 Qwen-Image-3.0 生成的复杂 3×3 网格中的一个单元格。我们来看原始图片:

Image 4没错——上面整张图片是由 Qwen-Image-3.0 一次性生成的,而非多张图片拼接而成。这张图片的难点在于,每个单元格都是一张复杂的信息图;要精确描述整个 3×3 网格,需要整整 3.7k 模型 token。

这 3.7k 个模型 token 必须完整描绘一幅隧道安全漫画、一堂空间几何课、一篇《出师表》的风格分析、物理抛体运动、生物学寄生虫学讲解、一张右侧胸痛的医学示意图、群论的西罗定理、银行内控管理信息图,以及细胞 DNA 结构对比——每个单元格都包含精确的中英文文本、公式、图表、卡通角色等内容。

然而这对 Qwen-Image-3.0 来说依然毫不费力——因为 Qwen-Image-3.0 将可接受的指令长度提升到了 4.5k 个模型 token,这意味着模型能够理解并渲染极其复杂、信息密集的视觉布局。

这就是我们所说的“丰富内容”的一个重要特征:内容可以横向扩展。横向扩展体现了模型在语义并列与空间控制方面的能力——即在一张图片中有序地排布多个概念,并使它们互不干扰地呈现出来。

除了横向扩展,深度是“丰富内容”的另一个重要特征。

横向扩展考验的是“一张画布上能放置多少个并行元素”,而深度则考验模型的语义解构与逻辑嵌套能力——能否在一张图片中逐层渲染多个嵌套界面。下面的示例通过一条指令,从外到内依次展示了:一个 VSCode 编程界面 → 一个 Qwen Chat 界面 → 一个微信界面 → 一张手冲咖啡海报。每一层都保留了各自界面的真实风格与细节,形成了“画中画中画”的视觉深度。

Image 5以上两个示例分别从横向和纵向两个维度说明了“丰富内容”的含义。

真实细节#

如果说“丰富内容”解决的是“画多少”的问题,那么“真实细节”解决的则是“画多细”的问题。Qwen-Image-3.0 在微观细节的渲染精度上达到了新高度:10 像素的小字清晰可辨,毛孔和发丝得到精细呈现,皮肤质感接近照片级真实感。我们先从精细小字的渲染说起。

下图是一张关于鲸鲨的知识信息图,包含大量文字和插图。Qwen-Image-3.0 能够准确渲染每一个区域。

Image 6学术论文是对小字渲染的终极考验——密集的 LaTeX 公式、上下标、希腊字母和定理编号,任何一个符号都不能出错。

Image 7该模型渲染了一整页代数几何领域的学术论文,包含多行复杂的公式推导。上标、下标、花括号、分数线以及多行对齐等 LaTeX 排版元素均被准确呈现,即使在小字号下也保持了极佳的可读性。

Qwen-Image-3.0 还能在逼真的纸张上生成精细文字。下例是一份由 Qwen-Image-3.0 生成的报纸,模型不仅准确生成了密集的文字,还模拟了报纸的真实外观。

Image 8在编辑任务中,我们同样可以生成精细文字。例如在下述案例中,模型生成了具有真实风格的批注。

Image 9: Before editingImage 10: After editing

模型在书页上叠加了逼真的红色手写批注——下划线、波浪线、圆圈、箭头和简短评语——笔迹自然流畅,完美模拟了高中生课堂笔记的风格。

除了文字和版面的精细还原,“真实细节”在纹理刻画方面同样表现突出。以下是两幅人像摄影示例,模型捕捉到了极为细腻的质感。

Image 11Image 12除了人像,模型还能描绘其他物体的细腻纹理。

Image 13Image 14Image 15Image 16在编辑任务中,我们同样可以生成细节丰富的图像。

Image 17: image1Image 18: image2Image 19: image3Image 20: After editing

对于受损或不完整的传统绘画,该模型能够修复缺失部分,同时忠实保留原作的艺术风格与笔触。

Image 21: Before editingImage 22: After editing

该模型完成了这幅鹰战图的修复,笔触与原作保持一致,保留了水墨渐变、羽毛纹理和构图平衡,同时去除了霉斑和破损痕迹。

深度知识#

“丰富内容”回答的是“能画得多复杂”,“真实细节”回答的是“能画得多逼真”,而“深度知识”回答的是“能画得多广泛”。Qwen-Image-3.0 具备覆盖 12 种语言、多种字体、100 多种艺术风格以及各类 UI 界面的渲染能力——这一切都依托于模型对世界知识的深度理解。

在以下三个示例中,模型分别准确渲染了日语、韩语和西班牙语。Image 23

Image 24Image 25除了能准确渲染多种语言,该模型还拥有丰富的世界知识。特别是,模型可以生成各种逼真的 UI 界面。Image 26

Image 27我们还可以利用模型强大的世界知识来创建信息图。在下面的示例中,我们基于一张真实图片生成了一个复杂的信息图。

Image 28: Before editingImage 29: After editing

在保留原始昆虫照片主要主体的同时,模型添加了分类信息、形态学标注、放大细节图和比例尺等专业元素,生成了一张可直接用于学术发表的研究用图。

除了模型自身已具备的世界知识,它还可以连接互联网检索最新的世界知识。例如,我们可以要求模型生成一张杭州 7 月 21 日的天气预报图。

Image 30: After editing模型还能找到特定的 IP 形象并据此进行创作。例如,我们可以生成一张齐白石和梵高在直播间介绍 Qwen-Image-3.0 的图片。

Image 31: After editing

结论#

从 Qwen-Image-1.0 的“精准”,到 Qwen-Image-2.0 的“精准、多样、完整、美观、真实”,再到如今 Qwen-Image-3.0 的“真实”——我们始终追求的目标,是让图像生成从“可用”走向“实用”,从“好看”走向“好用”。

在“内容丰富、细节真实、知识深入”这三大核心能力的支撑下,Qwen-Image-3.0 在报纸 PDF、短剧分镜、复杂 UI 界面等高价值生产力场景中取得了重大突破。我们相信,随着图像生成模型能力的持续提升,它们将在设计、内容创作、教育和电商等更多领域释放真正的生产力价值。

以上就是本次更新的主要亮点。希望您能喜欢使用 Qwen-Image-3.0!

来源:Qwen:Blog Retrieval(API)· qwen.ai