QWEN CHAT 我们正式发布通义万相-图像生成3.0(Qwen-Image-3.0),这是通义万相系列第三代基础图像生成模型。如果说通义万相-图像生成1.0的关键词是"精准",通义万相-图像生成2.0的关键词是"精准、多样、完整、美观、真实",那么通义万相-图像生成3.0的核心可以归结为一个字——"实"。
这个"实"体现在三个维度:
- 内容丰富:支持高达4.5k模型token输入,轻松生成报纸、分镜脚本、试卷等复杂版式。
- 细节真实:支持精确渲染小至10像素的文字,生动再现毛孔、发丝等细节,呈现栩栩如生的微观级刻画。
- 知识深厚:原生支持12种语言渲染,模拟网页、游戏、直播等主流界面,并调用丰富的世界知识。
总之,通义万相-图像生成3.0追求的不仅是"好看",更是"好用",让图像生成成为真正可落地的生产力工具。
内容丰富#
先看下面这张由通义万相-图像生成3.0生成的图片:
可以看到,通义万相-图像生成3.0能够准确渲染一张数学幻灯片,包括空间关系、数学符号、定理描述等丰富的视觉内容。这些内容布局合理、相对位置恰当,信息量十足。
然而,这并非通义万相-图像生成3.0的真正实力。事实上,这只是其真实能力的"九分之一",因为这张图片实际上只是通义万相-图像生成3.0生成的一个复杂3×3网格中的一格。我们来看原始图片:
没错——整张上图是由通义万相-图像生成3.0一次性生成的,而非多张图片拼接而成。这张图片的难点在于,每个格子都是一张复杂的信息图;要精确描述整个3×3网格,需要整整3.7k模型token。
这 3.7k 个模型 token 必须完整描绘一幅隧道安全漫画、一堂空间几何课、一篇《出师表》的风格分析、物理抛体运动、生物学寄生虫学讲解、一张右侧胸痛的医学示意图、群论的西罗定理、银行内控管理信息图,以及细胞 DNA 结构对比——每个单元格都包含精确的中英文文本、公式、图表、卡通角色等内容。
然而,这对 Qwen-Image-3.0 来说依然毫不费力——因为 Qwen-Image-3.0 将可接受的指令长度提升到了 4.5k 个模型 token,这意味着该模型能够理解并渲染极其复杂、信息密集的视觉布局。
这是我们提到的“丰富内容”的一个重要特征:内容可以横向扩展。横向扩展体现了模型在语义并置和空间控制方面的能力——即在单张图像中有序地排布多个概念,并使其互不干扰地呈现出来。
除了横向扩展,深度是“丰富内容”的另一个重要特征。
横向扩展考验的是“单张画布上能放置多少个并行元素”,而深度则考验模型的语义解构与逻辑嵌套能力——即能否在单张图像中逐层渲染多个嵌套界面。下面的示例通过一条指令,从外到内依次展示了:VSCode 编程界面 → Qwen Chat 界面 → 微信界面 → 一张手冲咖啡海报。每一层都保留了各自界面的真实风格与细节,形成了“画中画中画”的视觉深度。
以上两个示例分别从横向和纵向维度说明了“丰富内容”的含义。
真实细节#
如果说“丰富内容”解决的是“画多少”的问题,那么“真实细节”解决的则是“画多细”的问题。Qwen-Image-3.0 在微观细节的渲染精度上达到了新高度:10 像素的小字清晰可辨,毛孔和发丝被精细呈现,皮肤质感接近照片级真实感。我们先从精确渲染小字说起。
下图是一张关于鲸鲨的知识信息图,包含大量文字和插图。Qwen-Image-3.0 能够精确渲染每一个区域。
学术论文是对小字渲染的终极考验——密集的 LaTeX 公式、上下标、希腊字母和定理编号,任何一个符号都不能出错。
该模型渲染了一整页代数几何领域的学术论文,包含多行复杂公式推导。上标、下标、花括号、分数线以及多行对齐等 LaTeX 排版元素均被准确呈现,即使在小字号下也保持了极佳的可读性。
Qwen-Image-3.0 还能在逼真的纸张上生成精细文字。下例是 Qwen-Image-3.0 生成的一份报纸,模型不仅准确生成了密集的文字,还模拟了报纸的真实外观。
在编辑任务中,我们同样可以生成精细文字。例如,在下述案例中,模型生成了具有真实风格的批注。
模型在书页上叠加了逼真的红色手写批注——下划线、波浪线、圆圈、箭头和简短评语——笔迹自然流畅,完美模拟了高中课堂笔记的风格。
除了文字和版面的精细还原,“真实细节”在纹理描绘方面同样表现出色。以下是两幅人像摄影示例,模型捕捉到了极为细腻的质感。
除了人像,模型还能描绘其他物体的细腻纹理。
在编辑任务中,我们同样可以生成细节丰富的图像。
面对受损或不完整的传统绘画,该模型能够修复缺失部分,同时忠实保留原有的艺术风格与笔触。
模型完成了这幅鹰战图的修复,笔触与原作保持一致,保留了水墨渐变、羽毛纹理和构图平衡,同时去除了霉斑和破损痕迹。
深度知识#
“丰富内容”回答的是“能画得多复杂”,“真实细节”回答的是“能画得多逼真”,而“深度知识”回答的是“能画得多广泛”。Qwen-Image-3.0 具备覆盖 12 种语言、多种字体、100 多种艺术风格以及各类 UI 界面的渲染能力——这一切都依托于模型对世界知识的深度理解。
在以下三个示例中,模型分别准确渲染了日语、韩语和西班牙语。
除了能准确渲染多种语言,该模型还拥有丰富的世界知识。特别是,模型可以生成各种逼真的 UI 界面。
我们还可以利用模型强大的世界知识来制作信息图。在下面的示例中,我们基于一张真实图片生成了复杂的信息图。
在保留原始昆虫照片主体的同时,模型添加了分类信息、形态标注、放大细节图和比例尺等专业元素,生成了一张可直接用于学术发表的科研图片。
除了模型自身已具备的世界知识,它还能连接互联网检索最新的世界知识。例如,我们可以让模型生成一张 7 月 21 日杭州的天气预报图。
模型还能找到特定的 IP 形象并据此进行创作。例如,我们可以生成一张齐白石和梵高在直播间介绍 Qwen-Image-3.0 的图片。
结论#
从通义千问图像生成 1.0 的“精准”,到通义千问图像生成 2.0 的“精准、多样、完整、美观、真实”,再到如今通义千问图像生成 3.0 的“真实”——我们始终追求的目标,就是让图像生成从“可用”走向“实用”,从“好看”走向“好用”。
在“丰富内容、真实细节、深度知识”三大核心能力的支撑下,通义千问图像生成 3.0 在报纸 PDF、短剧分镜、复杂 UI 界面等高价值生产力场景中实现了重大突破。我们相信,随着图像生成模型能力的持续提升,它们将在设计、内容创作、教育和电商等更多领域释放真正的生产力价值。
以上就是本次更新的主要亮点。希望您能喜欢使用通义千问图像生成 3.0!