# MRT：用于大规模分层图像生成与编辑的掩码区域Transformer

- 来源：HuggingFace Daily Papers（社区热门论文）
- 发布时间：2026-05-26 08:00
- AIHOT 分数：70
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmpnhwild0xr0sl01guxfodgi
- 原文链接：https://arxiv.org/abs/2605.27235

## 精选理由

首次把分层图像生成统一到 20B 遮罩扩散框架，溢出画布层的设计挺巧，让图层可以超出边界编辑，蒸馏后能实时跑，做设计工具的团队该仔细读读。

## AI 摘要

MRT是一个20B参数的掩码区域扩散模型，专为多层透明图像生成与编辑设计。它在超过1000万个多语言设计样本上训练，统一了文本到图层、图像到图层和图层到图层三项任务。模型通过选择性token掩码实现灵活的图层生成与编辑，并引入溢出感知画布图层以处理边界不一致问题，支持半透明背景合成。此外，应用扩散蒸馏实现了8步实时生成。实验表明，MRT在所有任务上显著优于先前先进方法与商业系统。用户研究显示，其图像到图层质量优于同期Qwen-Image-Layered模型，推理速度快10-100倍，GPU内存消耗降低50-90%。

## 正文

表示同等第一作者贡献。通讯作者：

ryanyuan@canva.com

摘要

分层图像生成与编辑是一项基础能力，它能够实现对生成视觉内容的逐层复用、编辑与合成，类似于自然语言中的单词级编辑。尽管其重要性显著，但在大规模应用层面，这仍是一个探索不足的领域。为填补这一空白，我们提出了 MRT，一个拥有 200 亿参数的掩码区域扩散模型，专为多层透明图像生成与编辑而设计，并在超过 1000 万个涵盖多种宽高比和文本提示的多语言设计样本上进行了训练。为充分利用这一规模，我们做出了两项关键技术贡献。首先，我们将三种互补的任务——文本到图层、图像到图层以及图层到图层——统一在一个共享的掩码区域扩散框架内，通过选择性 token 掩码实现灵活的逐层生成与编辑。其次，为了实现溢出图层生成，我们引入了一个溢出感知画布图层，用于处理边界不一致性并支持半透明背景合成，从而能够生成超出可见画布边界的完整可编辑图层。此外，我们应用扩散蒸馏技术，实现了 8 步、实时的多层生成，且质量下降极小。大量实验表明，我们的框架在所有三项任务上均大幅超越了包括多种商业系统在内的先前最先进方法，为多层透明图像生成树立了新的标杆。值得注意的是，根据用户研究结果，我们的模型在图像到图层的质量上显著优于同期发布的 Qwen-Image-Layered 模型，同时在图像到图层推理过程中实现了更快的推理速度并节省了激活 GPU 内存消耗。

1 引言

近年来，文本到图像生成技术通过多种技术进步取得了显著的质量提升，包括大规模扩散Transformer架构[37, 9, 36]、基于数十亿高质量图文对数据的分布式训练[55, 14, 13, 43]、通过直线路径将简单先验分布转化为复杂数据分布的整流流匹配[9, 30]、用于加速推理的分布匹配知识蒸馏[61, 60, 41, 66, 67, 12, 34, 33, 65]，以及先进的文本编码器架构[14, 31, 32]。相比之下，面向分层图像生成的生成模型[62, 48, 28, 17, 64, 21, 22, 38, 5]仍显著发展不足。这一差距主要源于两个因素：缺乏可与LAION-5B[42]相媲美的大规模高质量数据集，以及对最先进开源文本到图像模型中先验知识的利用有限。这些制约因素阻碍了分层图像合成领域关键研究方向的系统性探索。

我们通过一项全面的研究来填补这一基础性研究空白，该研究基于一个高质量、大规模的多层数据集，包含超过百万个样本——其规模比近期工作[38]大一个数量级。我们的数据集涵盖多种分辨率和宽高比，包含超过百万个独立图层和超过百万个超大视觉元素，以支持溢出图层生成。我们采用GPT-5 mini为所有图形设计生成全局描述。对于视觉文本图层，我们利用真实排版属性，确保全面且高质量的标注。为了在大规模上充分利用该数据集，我们通过在Qwen-Image[55]（最大的开源文本到图像扩散模型，参数量约为B）上实现掩码区域Transformer架构，构建了我们的多层生成模型。

为了提升分层图像生成与编辑在训练和推理过程中的效率，我们引入了以下关键技术贡献：首先，我们提出了一种统一的掩码区域 Transformer 框架，可处理三种互补任务：文本到图层、图像到图层以及图层到图层的生成与编辑。其核心创新在于我们的自适应掩码机制，该机制根据具体任务需求，决定是从干净潜变量还是从噪声中初始化每个图层。其次，我们的掩码区域 Transformer 直接在完整画布上运行，将背景视为一种特殊的透明前景图层，并封装了部分延伸至背景区域之外的溢出图层。这种架构确保所有前景图层保持完全可复用性，并且可以在画布上任意重新定位，这一点在图 2 和实验部分中得到了说明。第三，我们进一步提出利用分布匹配蒸馏方案，开发一个质量退化极小的少步数多层生成器。

我们进行了全面的消融实验，以研究不同组件的影响。我们通过实验证明，扩大模型和数据集规模可将性能提升至新水平，而联合多任务训练在提升性能的同时，也改善了用户体验。我们展示了我们的图像到图层任务对各种领域外的设计图像和自然图像具有出色的泛化能力。我们的图层到图层任务则能轻松支持多图像融合，将任意给定的用户图像无缝集成到现有设计中。我们希望我们的掩码区域 Transformer 能够以前所未有的规模，推动对这一基础性挑战任务的理解。

2 相关工作

分层图像生成与编辑任务遵循两种范式：同步生成（Text2Layer [64]、LayerDiff [17]、ART [38]、PrismLayer [5]、Qwen-Image-Layered [59]）和顺序生成（LayerDiffuse [62]、COLE [22]、OpenCOLE [21]、LayerD [45]）。相关的布局生成与控制方法分为两类：（1）从视觉元素生成布局 [7, 44, 25, 10, 56, 19, 3, 18, 27, 6, 46, 24, 23, 54, 53, 15, 58, 20, 4, 11, 2]，以及（2）通过空间条件控制生成 [29, 52, 51, 1, 57, 26, 47, 40, 63, 10, 4]。与最相关的工作 ART [38] 和 Qwen-Image-Layered [59] 相比，我们的掩码区域 Transformer 统一了三个任务：文本到图层、图像到图层以及图层到图层的生成。我们进一步原生支持溢出图层，并通过知识蒸馏实现了少步数多层生成。

3 方法

3.1 扩展分层数据与扩散模型

扩展的分层数据集。大规模、高质量多层透明图像的稀缺，是推进多层生成建模面临的根本性挑战。我们没有依赖嘈杂且未经整理的互联网来源，而是构建了一个经过筛选的内部数据集，其中包含来自全球最大图形设计平台之一的超过 1000 万份多层图形设计。所有设计均由专业设计师创作，并完全授权用于生成模型训练。图 1 展示了关键的数据集统计信息，表明我们的数据集涵盖了多样的宽高比和分辨率，同时支持多语言视觉文本渲染和双语文本提示词。

图 1：数据集统计信息展示。图 (a) 和 (b) 显示了每个设计中独立图层数量的分布。图 (c) 和 (d) 分别显示了视觉文本中不同语言的分布以及不同图层类型的分布。图 (e) 和 (f) 显示了在支持溢出图层前后，所有透明图层总视觉 token 数量的分布。图 (g) 显示了宽度与高度宽高比的分布。

图 2：溢出层的示意说明。第一行展示了画布层，其背景完全透明，从而在主背景区域之外也暴露了像素。第 2-3 行对比了不支持溢出生成的多层生成（基线方法）与支持溢出生成的多层生成（本文方法）。全尺寸溢出层生成对于保持完整的可编辑性和可复用性至关重要，可防止图层内容在背景边界处被截断。

缩放区域 Transformer。为了融入溢出层的生成，我们遵循 ART [38] 以区域方式执行去噪扩散过程，具体如下：首先，我们将多层透明图像表示为 {, , }，其中 是全尺寸画布上的合成图像， 是半透明 RGBA 背景层， 和 是 RGBA 前景层。其次，我们在合并图像上执行扩散过程，该合并图像将完全透明的画布作为基础层，并根据预定义布局叠加 和所有层。第三，我们使用 WAN-2.1-VAE [50] 编码器提取所有前景层的区域裁剪表示、背景层的表示以及合成完整设计的表示。最后，我们实现了一个匿名区域扩散 Transformer [38]，其参数量为 B，遵循 Qwen-Image [55] 架构，对这些区域前景层 token、背景层 token 和合成完整设计图像 token 共同执行全注意力机制。

溢出层支持。此前的研究工作[38, 5]仅在可见画布区域内生成前景层，导致超出背景边界的元素不完整。这限制了层的可复用性，如图2第二行所示。然而，我们发现训练集中超过一定比例的样本包含溢出层，这使得该问题成为关键的实际考量。为解决此问题，我们引入了一个额外的全尺寸画布层，用于支持生成完整的半透明背景和溢出元素。这一方案之所以可行，是因为我们能够获取数据集中所有样本的真实完整层数据。该设计对于实际编辑工作流至关重要：若无此设计，超出画布的层将被裁剪并呈现为不可编辑状态，严重限制其在后续合成任务中的可用性。图2展示了我们数据集中具有代表性的溢出层示例（第一行），并对比了有无溢出层支持的分层样本（第二行和第三行）。

3.2 掩码区域Transformer

我们在图3中展示了掩码区域扩散Transformer框架如何以统一方式解决三个具有挑战性的多层生成任务——文本到层、图像到层以及层到层。其核心思路是在区域扩散Transformer中，对全局图像token或参考token与现有层token的组合进行条件性掩码处理。掩码潜变量表示编码了预设条件的干净token，噪声注入和扩散监督仅应用于非掩码token。我们在掩码干净token与噪声token之间应用完全注意力机制，使模型能够自适应地学习不同任务下它们之间的关系。各任务的具体掩码机制描述如下：

图 3：掩码区域 Transformer 架构示意图。我们通过一个共享的掩码区域扩散 Transformer，将文本到图层、图像到图层以及图层到图层这三种不同任务统一起来。左侧：文本到图层任务直接将一组噪声潜变量转换为一组透明图层和一张合成画布图像（面板 #1）。在训练过程中，我们对所有透明图层的潜变量添加噪声。中间：图像到图层任务旨在将一张光栅图像分解为一组高质量的透明图层。我们将掩码潜变量设置为无噪声的全局图像 token，并对与空间区域（由自动布局检测器或手动标注定义）对应的图层 token 应用扩散过程（面板 #2）。右侧：图层到图层任务实现了两种编辑能力：(i) 根据现有图层，从图层提示词生成新图层（面板 #3），以及 (ii) 将参考图像转换为视觉风格与现有构图一致的图层（面板 #4）。在图层添加和图层风格重设这两种场景中，我们将掩码 token 定义为参考内容、现有图层和全局构图的无噪声潜变量表示。为清晰起见，省略了部分文本图层。

文本到图层。文本到图层生成任务旨在根据文本提示词合成一个多层透明设计，包含一个画布层、一个半透明背景层以及多个前景层，这些前景层组合成最终图像并支持溢出。画布层定义了完整的设计尺寸以容纳溢出元素，并且默认是完全透明的。因此，我们对潜变量的拼接结果应用扩散过程，但不包括画布层，并以共享的文本嵌入作为条件。参照 [38]，我们加入以确保图层一致性。由于不存在预先存在的图层，我们将掩码 token 设置为。详情见图 3（面板 1）。

设 表示所有未掩码干净潜变量的拼接， 表示噪声先验。流匹配框架学习一个向量场，该向量场通过连续时间插值路径将样本从噪声分布传输到数据分布。在时间步 处，插值后的潜变量由下式给出：

(1)

我们训练扩散模型，使其基于插值潜变量 、时间步 和文本提示词 预测流速度：。训练目标是最小化预测速度与真实速度之间的均方误差：

(2)

其中，沿插值路径的真实速度为 ()，期望值在干净潜变量 、随机噪声 和均匀采样的时间步 上计算。

图像到图层。图像到图层任务已成为商业生成系统中的一项关键能力，Adobe Firefly 的分层图像编辑和 Lovart 的 Edit Elements 等产品近期已引入对此功能的支持。图像到图层任务旨在将一张光栅图像（或 ）分解为包含一个画布层 、一个背景层 和多个前景层 的多层透明设计，其条件为指定每个图层空间位置的目标布局，以及一个用于语义引导的可选文本提示词。该任务本质上包含两个子任务：分割（通过精确的 alpha 蒙版识别图层区域）和补全（完成被遮挡区域）。我们使用人工标注或布局检测器从输入光栅图像中提取目标布局。

被掩码的干净 token 被设置为全局合成图像表示 ，该表示编码了待分解的条件图像。我们对未掩码 token 的拼接 添加噪声。通过区域扩散过程，扩散模型被训练为在给定全局图像和布局的条件下提取所有透明图层。由于要求用户提供带有溢出图层的设计不切实际，我们转而使用位于可见画布内的像素的潜变量编码。详情见图 3（面板 2）。

我们观察到，单个层往往存在结构模糊性，并且可以进一步分解。为了解决这个问题，我们提出了层分组增强方法，即在训练过程中随机对重叠或相邻的层进行分组。这种策略增加了结构多样性，提高了对模糊边界的鲁棒性，并增强了对具有杂乱布局的域外图像的泛化能力。

层到层。为了实现灵活、逐层的交互体验，我们将分层图像编辑任务定义为一个层到层的任务，涵盖两个关键场景：(i) 层添加——根据文本提示，在现有层的条件下生成新的连贯层，同时保持整个构图的空间和风格一致性；(ii) 层风格重设——专注于将任何用户提供的图像或透明层转换为风格对齐的层，使其与现有构图的外观和视觉特征相匹配。

为了对层到层任务进行建模，我们将现有的层潜变量保留为掩码干净 token，并仅对以下内容应用扩散：(i) 根据文本提示条件新添加的层，或 (ii) 根据视觉参考条件进行风格重设的指定层。考虑到为这些场景构建训练数据的挑战，我们从每个设计中随机选择一部分层作为条件现有层，并将剩余层视为生成目标。对于层风格重设训练，我们使用图像编辑模型来转换未选中层的风格，创建风格变换后的变体作为训练对。数据集构建流程的详细信息请参见附录。

形式上，在图层添加任务中，我们的目标是基于剩余图层及图层级文本描述，合成前景图层的子集。我们将扩散模型应用于潜在 token 序列，其中 编码了由背景及所有非目标图层构成的 Alpha 合成上下文。设 为待生成图层的索引（任意子集，不要求连续）。我们将掩码后的干净 token 设为 ，并将目标槽位视为需加噪与去噪的非掩码 token。文本条件来源于图层描述提示词，该提示词通过按图层顺序拼接所有 的 `<layer> </layer>` 构建而成，其中 为图层 的描述。训练时，我们对 添加噪声，并基于条件 优化流匹配目标；推理时，我们从噪声初始化 ，在相同条件下对其进行去噪，从而在原始索引位置生成新增图层。

在图层重风格化任务中，我们通过保留其余图层的同时，在额外外观条件下对选定图层进行重风格化，从而更新用户上传的分层设计。给定目标索引后，我们通过将背景与非目标原始图层合成来构建，并将 保留为掩码干净条件。对于每个 ，我们还额外提供一个条件潜变量，用于指定图层 的期望外观。我们将 作为额外条件 token 追加，并将其视为掩码 token，因此它们不是预测目标。为了明确这一角色，我们向追加的条件 token 添加了一个可学习的条件 token 嵌入。我们进一步将对应原始图层 token 的 RoPE 位置编码复制到其条件 token，确保两个 token 共享相同的空间位置线索。相应地，我们仅对非掩码的原始目标槽位 应用扩散，以 和固定指令提示词（例如“协调这些图层”）为条件。在训练期间，仅向 添加噪声，模型被训练为在条件潜变量下对原始目标槽位进行去噪。在推理期间，我们从噪声初始化 ，并在相同条件下对其进行去噪，从原始目标槽位读取最终重风格化的图层，同时从输出图层集合中排除追加的条件 token。

3.3 加速多层生成器

我们采用改进的分布匹配蒸馏（DMD）技术 [61, 60, 35, 8]，将我们的多步扩散模型（教师模型）压缩为少步生成器（学生模型），同时保持教师模型与学生模型之间的分布一致性。设教师模型表示标准多步扩散模型的反向过程，学生模型则使用更少的去噪步骤来近似该过程。DMD 的目标是最小化教师模型与学生模型转移分布之间的 Kullback–Leibler（KL）散度：

(3)

在推理阶段，经过知识蒸馏的学生模型以更少的步骤执行生成，有效逼近教师模型的多步轨迹：其中我们设定 。我们证明，蒸馏后的模型在保持教师模型样本质量的同时，大幅减少了采样步数，从而实现更快、更高效的生成。我们还支持多种技术，例如 CacheDiT 以及跨多 GPU 的序列并行化，以进一步加速推理速度。

4 实验

4.1 实现细节

我们所有实验均以 Qwen-Image 作为基础架构，该架构包含 60 层，每层隐藏维度为 3584，并配备 24 个注意力头。我们从 HuggingFace 上开源预训练检查点初始化模型权重。与以往因资源限制仅微调 LoRA 权重的方法不同，我们采用 FSDP2 进行全参数微调，以探索模型的性能上限。考虑到标准平面图像生成与多层合成固有复杂性之间存在显著的分布偏移，这种方法十分必要。

在消融实验中，我们使用 H200 GPU，在分辨率为 的条件下，对精心筛选的 50 万条分层设计子集进行 4000 次迭代训练，每 GPU 批次大小为 16，全局批次大小为 128。我们采用 AdamW 优化器，学习率恒定为 。在系统级实验中，我们采用两阶段训练：首先在完整 1000 万数据集上以 分辨率进行 7 万次迭代，随后在 分辨率下进行 2 万次迭代。这种渐进式策略使模型能够先建立多层分解能力，再扩展到高分辨率。训练使用 H200 GPU，每 GPU 批次大小为 16，全局批次大小为 1024。

4.2 评估协议

基准测试。我们将我们的方法与先前的最先进方法在 ART [38] 提出的 Design-Multi-Layer-Bench 上进行了比较，该基准测试源自 VistaCreate 平面设计平台 [49]。然而，该评估数据集不包含溢出层。为弥补这一不足，我们构建了 overflowerflow-Design-Bench，以评估模型从完整布局生成完整图层的能力，这对于确保溢出层的可复用性至关重要。

评估指标。我们从多个角度评估模型性能。对于合并后的图像质量，我们报告 PSNR、SSIM、FID（衡量整体连贯性），并遵循 [38] 的方法计算 FID。由于我们的图层是带有透明度的 RGBA 图像，我们仅对非透明像素计算 PSNR 和 SSIM。在人工评估方面，我们在 Design-Multi-Layer-Bench 的一个子集上，针对文本到图层（T2L）任务和图像到图层（I2L）任务收集了多维度的用户偏好，以反映真实用户体验。评估协议和界面详见补充材料。

图 4：文本到图层任务的定性结果。单个图层可视化结果见补充材料。

图 5：在文本到图层任务上与先前最先进方法的用户研究对比。我们的方法在多个方面显著优于 ART。

4.3 主要结果

4.3.1 文本到图层：与最先进方法的比较

我们在 Design-Multi-Layer-Bench 的一个子集上将我们的方法与 ART [38] 进行了比较。在图 5 所示的用户研究中，参与者在指令遵循、整体美学和图层质量方面始终更偏好我们的结果。这些发现表明提示词与分层构图之间的对齐更强，图 4 中展示的布局进一步说明了这一点，这些布局更好地保留了空间意图和风格一致性。

只有我们的方法原生支持在完整尺寸画布上生成超出背景边界的溢出 RGBA 图层，从而保留了可编辑性和复用性；先前的系统（例如 ART）将像素限制在背景区域内，导致内容被裁剪或缺失。可视化结果见图 6 和图 8。

图 6：层溢出的定性结果。我们的方法支持生成具有部分可见像素、延伸至背景区域之外的溢出层。

4.3.2 图像到图层：与当前最优方法的比较

在一项比较最新工作 LayerD [45] 以及 RoboNeo 和 Lovart 等商业系统的图层分解能力的用户研究中，参与者在图层质量、内容完整性和分解粒度方面始终更偏好我们的方法。由于 I2L 评估假设存在图层布局（带有 Z 顺序的边界框），我们使用由 Z 顺序感知检测器提取的布局来评估我们的方法（详情见补充材料）。图 19 中的定性比较也显示，我们的方法能生成更完整、可复用的 RGBA 图层，且边界更清晰。我们还在图 23 中进一步展示了我们的模型在自然场景上的泛化能力。

4.3.3 图像到图层：与同期 Qwen-Image-Layered 的比较

近期，Qwen-Image-Layered [59] 自其在 Huggingface 上发布以来，因其在各种设计图像上强大的泛化能力而引起了社区的广泛关注。我们通过从质量、延迟和内存三个方面进行严格的比较，来展示我们方法的优势。

更优的质量。我们首先构建了一个由 100 个创意设计组成的域外测试集，这些设计来自三个来源：由最新的 Nano-Banana-Pro（以及 Ideogram 3.0）图像生成模型生成的图像，以及来自官方 Qwen-Image-Layered 仓库 [39] 的测试图像。我们在表 1 中报告了定量比较结果，显示我们的方法实现了显著更高的信噪比和结构相似性指数。我们根据图层数量将指标分为三组进行计算，我们的 MRT 在所有组别中均表现更优。

图9、图10、图11、图12、图13、图14、图15和图16提供了进一步的定性比较结果。我们通过实验发现，当需要将平面设计分解为数量越来越多的透明图层时，我们的方法表现显著更优；我们的方法持续表现良好，而Qwen-Image-Layered则难以将有意义的对象分配到每个图层。这些可视化结果不仅印证了上述发现，也表明即使我们的模型大幅优于Qwen-Image-Layered，仍有很大的改进空间。我们还在此测试集上进行了公平的用户研究，结果如图7所示。我们的方法在图层质量、完整性和粒度方面分别取得了____、____和____的胜率。

更低延迟。如图18所示，得益于我们的区域扩散Transformer架构，与Qwen-Image-Layered相比，我们实现了显著的加速——后者无论每个透明图层在画布中的实际面积大小，都使用相同数量的全分辨率模型token来建模每个透明图层。我们实现了与ART [38]中统计结果相似的延迟加速，并进一步应用了各种先进的缓存技术、模型蒸馏、低精度计算和并行推理，将模型延迟优化至在H100 GPU上运行时仅需____秒，在单张H100 GPU上将一张1K高分辨率图像分解为近20个透明图层时仅需____秒。

高效内存。与Qwen-Image-Layered需要更多视觉token来从平面图像中提取不同图层不同，我们的方法在内存效率上显著更优，将图像分解为多个透明图层所需的token数量少得多。图18展示了延迟与图层数量的关系、延迟与token数量的关系，以及峰值内存消耗与图层数量的关系。我们的方法在推理速度和内存使用方面均具有明显优势；例如，使用我们的MRT生成超过____个图层时，可实现超过____倍的加速。

图7：在图像到图层任务上与Qwen-Image-Layered的用户研究对比。

挑战。我们识别出图像到图层分解任务中尚存的若干关键挑战：（一）对逼真图像的泛化能力有限，模型难以在多样化的真实场景中保持保真度与真实感；（二）图层粒度的模糊性，源于图层定义本身的不适定性以及缺乏明确的标准真值分离；（三）遮挡图层补全，当分层遮挡涉及半透明或复杂混合时，该任务仍然困难；（四）背景修复，在严重遮挡情况下，重建合理的不可见区域具有挑战性。我们在图17中可视化了代表性的失败案例。遮挡图层补全失败的主要原因有两个：一方面，布局检测器可能无法为遮挡图层预测准确的非模态边界区域；另一方面，图像到图层生成模型可能因缺乏足够的上下文线索和数据多样性，而无法忠实地重建复杂的被遮挡像素。这些局限性指明了未来研究的方向。

图8：更多文本到图层结果。

图9：使用 Nano-Banana-Pro 生成的设计上的图像到图层结果（1/3）：与 Qwen-Image-Layered 的对比

图10：使用 Nano-Banana-Pro 生成的设计上的图像到图层结果（2/2）：与 Qwen-Image-Layered 的对比

图11：使用 Nano-Banana-Pro 生成的设计上的图像到图层结果（3/3）：与 Qwen-Image-Layered 的对比

图12：使用 Ideogram 生成的设计上的更多图像到图层结果（1/2）。

图13：使用 Ideogram 生成的设计上的更多图像到图层结果（2/2）。

图14：使用 Nano-Banana-Pro 生成的设计上的更多图像到图层结果（1/2）。

图15：使用 Nano-Banana-Pro 生成的设计上的更多图像到图层结果（2/2）。

图16：Qwen-Image-Layered 测试集上的更多图像到图层结果。

图 17：说明图像到图层（Image-to-Layers）的挑战。我们展示了一些处理被遮挡图层补全时的代表性失败案例。我们发现，当边界框仅紧密贴合可见像素时，由于区域裁剪设计，我们的模型无法生成被遮挡的部分。我们推测另一个关键原因是这些测试用例与我们的训练数据分布不同，我们将这一挑战留待未来工作解决。

媒体内容 · 前往原文查看

PSNRmerged SSIMmerged

图层（Layers）

MRT（我们的方法） 27.3440 25.9068 25.7229 0.9034 0.8762 0.8485

Qwen-Image-Layered 25.8111 23.0645 22.1828 0.8706 0.8319 0.8065

表 1：在图像到图层任务上与 Qwen-Image-Layered 的对比。

图 18：MRT 与 Qwen-Image-Layered 的推理效率对比。(a) 延迟随图层数量的变化。MRT 保持接近恒定的延迟（5 秒），而 Qwen-Image-Layered 呈线性增长，在 20 个图层时加速比高达 108.5 倍。(b) MRT 在 H200 和 B200 GPU 上的推理时间与 token 数量的关系，展示了线性扩展行为。(c) 不同图层配置下的峰值 GPU 内存消耗。阴影区域表示分配给模型权重的基线内存。MRT 降低了内存消耗，效率提升与图层数量成比例增长。所有报告的结果均在单 GPU 上使用相同图层数量，基于 100 个样本进行。

图 19：图像到图层对比。每个面板的左上角显示合成图像及其分解后的图层。我们的方法优于所有基线方法。Lovart 分解质量差，RoboNeo 存在伪影，LayerD 和 Qwen-Image-Layered 产生了过度分组的图层。左上角：合成图像及其图层。（建议放大查看）

4.3.4 图层到图层：分层编辑

据我们所知，此前没有研究工作涉及分层图像编辑这一任务。为了为此任务建立对比基准，我们使用支持多条件图像输入和透明 RGBA 图层输出的 GPT-Image-1 实例化了一个基线方法。我们报告了我们的方法在两个关键任务上的结果，详细说明了如何将 GPT-Image-1 配置为有竞争力的基线，并强调了我们的方法的独特属性。

图 20：与 SOTA 及商业系统在图像分层任务上的对比。我们进行了一项盲测用户研究，参与者从成对样本中选出更优结果。盲测用户研究表明，我们的方法显著优于 LayerD 及商业系统（Lovart、RoboNeo）。参与者从三个方面评估结果：（i）质量：语义正确性与透明度；（ii）完整性：对输入的真实还原；（iii）粒度：适当的分层程度——避免过度合并图层。根据用户研究，我们的方法在所有评估维度上均展现出显著优势。

图层添加。图层添加旨在根据逐层提示词，将新图层插入现有设计中。在此对比中，我们通过提供模板上的两个目标边界框及对应的逐层提示词来模拟用户操作。我们的模型并行预测所需图层，同时保持跨图层一致性。对于 GPT-Image-1，我们采用迭代生成流程：以当前合成图像为条件，在插入位置绘制红色边界框，并输入对应的逐层提示词给 GPT-Image-1，由其输出透明的 RGBA 图层。随后，我们将生成的图层插入指定位置，并对剩余图层重复该过程。由于我们的方法能一次性生成多个图层并以所有图层为条件，因此能更好地捕捉图层间关系，生成保持全局构图与风格的连贯插入结果（如图 21 所示），且性能优于 GPT-Image-1。

图层重风格化。对于目标图层的重风格化，用户提供要放置在画布上的素材；我们将这些素材重风格化为与整体构图相协调的图层。对于 GPT-Image-1，我们提供多图像输入：现有图层的合并图像，并用红色边界框标注插入位置，以及用户指定的素材。在预测一个图层后，我们将其插入指定位置，并对剩余目标进行迭代。我们的方法在单次处理中协调所有选定图层，而 GPT-Image-1 需要逐层生成，这会增加延迟，并可能在多次编辑中传播不一致性。图 21 显示，我们的编辑在适应目标风格外观的同时，能更好地保留几何形状。

图 21：图层到图层任务的定性比较。图层添加（前两行）和图层重风格化（后两行）。对于图层添加，我们的方法也比 GPT-Image-1 更好地遵循逐层指令。对于图层重风格化，我们的方法在图层连贯性和风格一致性方面也优于 GPT-Image-1。图层到图层任务通过迭代式逐层编辑，使用户能够与生成模型进行灵活的交互。

图 22：基线模型与少步蒸馏模型的比较。

图 23：图像到图层任务在域外自然图像上的定性结果。尽管仅在海报风格设计数据集上训练，我们的模型仍能泛化到自然场景。

4.4 消融研究与分析

更大的模型和数据集可提升质量。为证明模型和数据集规模的重要性，我们在相同的 0.5M 样本数据集上，使用 FLUX.1 [dev]（13B）和 Qwen-Image（20B）训练文本到图层模型。仅模型规模提升就将 FID 从 降低至 。随后将数据集规模扩展到 10M 样本，在有限的训练预算下进一步将 FID 降低至 ，更长时间的训练预计会带来更多收益。这些结果证实，模型容量和数据集规模对于高质量生成都至关重要。

媒体内容 · 前往原文查看

训练数据 FIDmerged PSNR SSIM

无溢出数据 15.68 21.81 0.8543

有溢出数据 16.15 22.75 0.8711

表 2：文本到图层（T2L）的溢出支持。

媒体内容 · 前往原文查看

方法 任务混合比例 FIDmerged PSNR SSIM

T2L 100% / 0% / 0% 16.15 22.75 0.8711

T2L+I2L 80% / 20% / 0% 15.68 23.06 0.8924

T2L+I2L+L2L 70% / 15% / 15% 17.06 21.97 0.8606

表 3：多任务训练。T2L：文本到图层。I2L：图像到图层。L2L：图层到图层。

媒体内容 · 前往原文查看

方法 PSNR SSIM PSNR SSIM

无文本条件 21.27 0.8697 26.03 0.9794

有文本条件 21.65 0.8805 27.24 0.9846

表 4：图像到图层（I2L）任务的文本条件。

媒体内容 · 前往原文查看

方法 PSNR SSIM PSNR SSIM

无合并增强 21.65 0.8805 27.24 0.9846

有合并增强 21.97 0.8864 26.96 0.9840

表 5：图像到图层（I2L）任务的图层分组增强。

媒体内容 · 前往原文查看

方法 去噪步数 FIDmerged

基线 50 16.02

+ DMD2 知识蒸馏 16 16.21

+ DMD2 知识蒸馏 8 18.58

表 6：多层生成器知识蒸馏。

无性能损失的溢出支持。表 6 评估了溢出感知生成的影响。超过 60% 的设计包含溢出图层，而此前的工作均截断这些元素，严重限制了可编辑性和可复用性。使用溢出数据进行训练能够以极小的性能代价实现完整的图层生成：我们的模型在取得可比的 FID、PSNR 和 SSIM 分数的同时，独特地保留了溢出元素。

多任务训练与性能权衡。表 6 展示了采用随机任务采样的统一多任务训练。我们的框架整合了全部三个任务，无需多阶段微调，同时在各配置下保持了可比的性能，表明统一化带来的性能退化极小。我们观察到，引入图层到图层任务会略微降低整体性能，我们将其归因于图层到图层数据集的质量问题——这是留给未来工作的一个方向。

文本条件对于图像到图层并非必需。一个重要的问题是，全局描述对于图像到图层的分解是否必要。表 6 对描述条件进行了消融实验，结果显示各指标均有适度且一致的提升。这揭示了一个值得注意的发现：虽然文本引导有助于边界消歧，并为复杂的重叠构图提供语义线索，但它并非我们框架的必需条件。

层分组增强提升了鲁棒性。表6验证了层分组增强的效果。由于我们的框架需要布局输入，精确的训练布局标注与用户或检测器提供的含噪测试时布局之间存在分布差异。我们通过在训练过程中随机合并层来解决这一问题，以增加布局多样性。即使在具有高质量布局标注的Design-Multi-Layer-Bench上，该策略也带来了一致的改进，并且在含噪布局条件下预期会有更大的收益。

蒸馏式多层生成器带来了显著的加速。通过引入DMD2蒸馏[61, 60]，我们将多层生成过程从多个去噪步骤加速到少量步骤，实现了速度提升且性能下降极小。表6中的FID分数保持可比，图22中的视觉质量也基本得以保留，这证明了蒸馏技术在多图层图像扩散模型中实现少步生成的有效性。

其他消融实验。我们在补充材料中提供了关于提示词长度、多语言设计生成以及使用PrismLayers数据进行微调的其他消融研究。

5 结论

在本文中，我们首次系统性地研究了大规模多层透明图像生成的性能边界。我们引入了掩码区域Transformer（Masked Region Transformer），这是一个大规模扩散框架，在共享的掩码区域范式下统一了文本到图层、图像到图层以及图层到图层的生成。该模型在超过1000万个多语言设计样本上训练，参数量达200亿，融合了多项关键技术革新：用于完整边界处理的溢出感知画布层，以及用于实时生成的分布匹配蒸馏。这些贡献共同实现了对高保真、半透明、完全可编辑视觉图层的高效合成。

参考文献

[1] O. Bar-Tal, L. Yariv, Y. Lipman, and T. Dekel (2023) MultiDiffusion: fusing diffusion paths for controlled image generation. In ICML, 引用于§2.

[2] C. Braunstein, H. Petekkaya, J. E. Lenssen, M. Toneva, and E. Ilg (2024) SLayR: scene layout generation with rectified flow. arXiv preprint arXiv:2412.05003. 引用于§2.

[3] S. Chai、L. Zhuang 和 F. Yan (2023) 《LayoutDM：基于 Transformer 架构扩散模型的布局生成》。发表于 CVPR，引用自 §2。

[4] J. Chen、R. Zhang、Y. Zhou、J. Healey、J. Gu、Z. Xu 和 C. Chen (2024) 《TextLap：定制语言模型实现文本到布局规划》。发表于 EMNLP Findings，引用自 §2。

[5] J. Chen、H. Jiang、Y. Wang、K. Wu、J. Li、C. Zhang、K. Yanai、D. Chen 和 Y. Yuan (2025) 《PrismLayers：面向高质量多层透明图像生成模型的开放数据》。arXiv 预印本 arXiv:2505.22523。引用自 §1、§2、§3.1、§4.1。

[6] C. Cheng、F. Huang、G. Li 和 Y. Li (2023) 《Play：基于参数条件化潜扩散模型的布局生成》。发表于 ICML，引用自 §2。

[7] Y. Cheng、Z. Zhang、M. Yang、H. Nie、C. Li、X. Wu 和 J. Shao (2024) 《基于大型多模态模型的平面设计》。arXiv:2404.14368。引用自 §2。

[8] Z. Dong、R. Zhao、S. Wu、J. Yi、L. Li、Z. Yang、L. Wang 和 A. J. Wang (2025) 《Glance：基于 1 个样本加速扩散模型》。外部链接：2512.02899，链接，引用自 §3.3。

[9] P. Esser、S. Kulal、A. Blattmann、R. Entezari、J. Müller、H. Saini、Y. Levi、D. Lorenz、A. Sauer、F. Boesel 等人 (2024) 《扩展修正流 Transformer 架构以实现高分辨率图像合成》。发表于第四十一届国际机器学习大会，引用自 §1。

[10] W. Feng、W. Zhu、T. Fu、V. Jampani、A. Akula、X. He、S. Basu、X. E. Wang 和 W. Y. Wang (2024) 《LayoutGPT：基于大语言模型的组合式视觉规划与生成》。发表于 NeurIPS，引用自 §2。

[11] A. Fontanella、P. Tudosiu、Y. Yang、S. Zhang 和 S. Parisot (2024) 《通过文本到图像 RGBA 实例生成实现组合式场景生成》。arXiv 预印本 arXiv:2411.10913。引用自 §2。

[12] K. Frans、D. Hafner、S. Levine 和 P. Abbeel (2024) 《通过捷径模型实现单步扩散》。arXiv 预印本 arXiv:2410.12557。引用自 §1。

[13] Y. Gao、L. Gong、Q. Guo、X. Hou、Z. Lai、F. Li、L. Li、X. Lian、C. Liao、L. Liu 等人 (2025) 《Seedream 3.0 技术报告》。arXiv 预印本 arXiv:2504.11346。引用自 §1。

[14] L. Gong, X. Hou, F. Li, L. Li, X. Lian, F. Liu, L. Liu, W. Liu, W. Lu, Y. Shi 等人 (2025) Seedream 2.0：原生中英双语图像生成基础模型。arXiv 预印本 arXiv:2503.07703。引用于 §1。

[15] J. J. A. Guerreiro, N. Inoue, K. Masui, M. Otani 和 H. Nakayama (2024) LayoutFlow：用于布局生成的流匹配。ECCV 会议。引用于 §2。

[16] E. J. Hu, Y. Shen, P. Wallis, Z. Allen-Zhu, Y. Li, S. Wang, L. Wang, W. Chen 等人 (2022) LoRA：大语言模型的低秩适配。ICLR 1(2)，第 3 页。引用于 §4.1。

[17] R. Huang, K. Cai, J. Han, X. Liang, R. Pei, G. Lu, S. Xu, W. Zhang 和 H. Xu (2024) LayerDiff：通过层协同扩散模型探索文本引导的多层可组合图像合成。ECCV 会议。引用于 §1, §2。

[18] M. Hui, Z. Zhang, X. Zhang, W. Xie, Y. Wang 和 Y. Lu (2023) 利用解耦扩散模型统一布局生成。CVPR 会议。引用于 §2。

[19] N. Inoue, K. Kikuchi, E. Simo-Serra, M. Otani 和 K. Yamaguchi (2023) LayoutDM：用于可控布局生成的离散扩散模型。CVPR 会议。引用于 §2。

[20] N. Inoue, K. Kikuchi, E. Simo-Serra, M. Otani 和 K. Yamaguchi (2023) 面向灵活的多模态文档模型。CVPR 会议。引用于 §2。

[21] N. Inoue, K. Masui, W. Shimoda 和 K. Yamaguchi (2024) OpenCOLE：迈向可复现的自动平面设计生成。CVPR 研讨会。引用于 §1, §2。

[22] P. Jia, C. Li, Z. Liu, Y. Shen, X. Chen, Y. Yuan, Y. Zheng, D. Chen, J. Li, X. Xie 等人 (2023) COLE：面向平面设计的分层生成框架。arXiv 预印本 arXiv:2311.16974。引用于 §1, §2。

[23] Z. Jiang, J. Guo, S. Sun, H. Deng, Z. Wu, V. Mijovic, Z. J. Yang, J. Lou 和 D. Zhang (2023) LayoutFormer++：通过约束序列化和解码空间限制实现条件式图形布局生成。CVPR 会议。引用于 §2。

[24] Z. Jiang, S. Sun, J. Zhu, J. Lou 和 D. Zhang (2022) 面向图形布局的由粗到细生成式建模。AAAI 会议。引用于 §2。

[25] K. Kikuchi, N. Inoue, M. Otani, E. Simo-Serra 和 K. Yamaguchi (2024) 用于平面设计补全的多模态标记文档模型。arXiv:2409.19051。引用于 §2。

[26] Y. Kim, J. Lee, J. Kim, J. Ha, 和 J. Zhu (2023) 基于注意力调制的密集文本到图像生成。发表于 ICCV，引用自：§2。

[27] X. Kong, L. Jiang, H. Chang, H. Zhang, Y. Hao, H. Gong, 和 I. Essa (2022) BLT：面向可控布局生成的双向布局 Transformer。发表于 ECCV，引用自：§2。

[28] P. Li, Q. Huang, Y. Ding, 和 Z. Li (2023) Layerdiffusion：基于扩散模型的分层可控图像编辑。发表于 SIGGRAPH Asia 2023 技术通讯，第 1–4 页。引用自：§1。

[29] Y. Li, H. Liu, Q. Wu, F. Mu, J. Yang, J. Gao, C. Li, 和 Y. J. Lee (2023) GLIGEN：开放集接地文本到图像生成。发表于 CVPR，引用自：§2。

[30] Y. Lipman, R. T. Chen, H. Ben-Hamu, M. Nickel, 和 M. Le (2022) 生成建模中的流匹配。arXiv 预印本 arXiv:2210.02747。引用自：§1。

[31] B. Liu, E. Akhgari, A. Visheratin, A. Kamko, L. Xu, S. Shrirao, C. Lambert, J. Souza, S. Doshi, 和 D. Li (2024) Playground v3：通过深度融合大语言模型改进文本到图像对齐。arXiv 预印本 arXiv:2409.10695。引用自：§1。

[32] Z. Liu, W. Liang, Z. Liang, C. Luo, J. Li, G. Huang, 和 Y. Yuan (2024) Glyph-byt5：用于精确视觉文本渲染的定制文本编码器。发表于欧洲计算机视觉会议，第 361–377 页。引用自：§1。

[33] C. Lu 和 Y. Song (2024) 简化、稳定并扩展连续时间一致性模型。arXiv 预印本 arXiv:2410.11081。引用自：§1。

[34] W. Luo, Z. Huang, Z. Geng, J. Z. Kolter, 和 G. Qi (2024) 通过分数隐式匹配实现单步扩散蒸馏。神经信息处理系统进展 37，第 115377–115408 页。引用自：§1。

[35] Y. Luo, T. Hu, J. Sun, Y. Cai, 和 J. Tang (2025) 通过轨迹分布匹配学习少步扩散模型。外部链接：2503.06674，链接。引用自：§3.3。

[36] N. Ma, M. Goldstein, M. S. Albergo, N. M. Boffi, E. Vanden-Eijnden, 和 S. Xie (2024) Sit：利用可扩展插值 Transformer 探索基于流和扩散的生成模型。发表于欧洲计算机视觉会议，第 23–40 页。引用自：§1。

[37] W. Peebles 和 S. Xie (2023) 基于 Transformer 的可扩展扩散模型。载于《IEEE/CVF 国际计算机视觉大会论文集》，第 4195–4205 页。引用于：§1。

[38] Y. Pu、Y. Zhao、Z. Tang、R. Yin、H. Ye、Y. Yuan、D. Chen、J. Bao、S. Zhang、Y. Wang 等 (2025) ART：面向可变多层透明图像生成的匿名区域 Transformer。载于《计算机视觉与模式识别会议论文集》，第 7952–7962 页。引用于：§1、§1、§2、§3.1、§3.1、§3.2、§4.1、§4.2、§4.2、§4.3.1、§4.3.3。

[39] Qwen (2025) Qwen-Image-Layered。注：https://github.com/QwenLM/Qwen-Image-Layered/tree/main/assets/test_images 引用于：§4.3.3。

[40] V. Sarukkai、L. Li、A. Ma、C. Ré 和 K. Fatahalian (2024) 拼贴扩散。载于《WACV》。引用于：§2。

[41] A. Sauer、D. Lorenz、A. Blattmann 和 R. Rombach (2024) 对抗性扩散蒸馏。载于《欧洲计算机视觉会议》，第 87–103 页。引用于：§1。

[42] C. Schuhmann、R. Beaumont、R. Vencu、C. Gordon、R. Wightman、M. Cherti、T. Coombes、A. Katta、C. Mullis、M. Wortsman 等 (2022) LAION-5B：用于训练下一代图文模型的开源大规模数据集。《神经信息处理系统进展》35，第 25278–25294 页。引用于：§1。

[43] T. Seedream、Y. Chen、Y. Gao、L. Gong、M. Guo、Q. Guo、Z. Guo、X. Hou、W. Huang、Y. Huang 等 (2025) Seedream 4.0：迈向下一代多模态图像生成。arXiv 预印本 arXiv:2509.20427。引用于：§1。

[44] M. A. Shabani、Z. Wang、D. Liu、N. Zhao、J. Yang 和 Y. Furukawa (2024) 视觉布局合成器：面向设计布局生成的图像-向量双扩散模型。载于《CVPR》。引用于：§2。

[45] T. Suzuki、K. Liu、N. Inoue 和 K. Yamaguchi (2025) LayerD：将栅格图形设计分解为图层。载于《IEEE/CVF 国际计算机视觉大会论文集》，第 17783–17792 页。引用于：§2、§4.3.2。

[46] Z. Tang、C. Wu、J. Li 和 N. Duan (2023) LayoutNUWA：揭示大语言模型的隐藏布局专长。载于《ICLR》。引用于：§2。

[47] O. Team (2024) Omost GitHub 页面。引用于：§2。

[48] P. Tudosiu、Y. Yang、S. Zhang、F. Chen、S. McDonagh、G. Lampouras、I. Iacobacci 和 S. Parisot（2024）《MULAN：面向可控文本到图像生成的多层标注数据集》。收录于《IEEE/CVF 计算机视觉与模式识别会议论文集》，第 22413–22422 页。引用于：§1。

[49] VistaCreate 团队（2025）《VistaCreate（原名 crello）平面设计平台》。注：https://create.vista.com/ 访问日期：2025-11-09 引用于：§4.2。

[50] T. Wan、A. Wang、B. Ai、B. Wen、C. Mao、C. Xie、D. Chen、F. Yu、H. Zhao、J. Yang 等（2025）《Wan：开放且先进的大规模视频生成模型》。arXiv 预印本 arXiv:2503.20314。引用于：§3.1。

[51] X. Wang、S. Fu、Q. Huang、W. He 和 H. Jiang（2024）《MS-Diffusion：基于布局引导的多主体零样本图像个性化》。arXiv:2406.07209。引用于：§2。

[52] X. Wang、T. Darrell、S. S. Rambhatla、R. Girdhar 和 I. Misra（2024）《InstanceDiffusion：面向图像生成的实例级控制》。收录于 CVPR。引用于：§2。

[53] Y. Wang、Z. Chen、L. Zhong、Z. Ding、Z. Sha 和 Z. Tu（2024）《Dolfin：无需自编码器的扩散布局 Transformer》。收录于 ECCV。引用于：§2。

[54] H. Weng、D. Huang、Y. Qiao、Z. Hu、C. Lin、T. Zhang 和 C. Chen（2024）《Desigen：面向可控设计模板生成的流水线》。收录于 CVPR。引用于：§2。

[55] C. Wu、J. Li、J. Zhou、J. Lin、K. Gao、K. Yan、S. Yin、S. Bai、X. Xu、Y. Chen 等（2025）《Qwen-Image 技术报告》。arXiv 预印本 arXiv:2508.02324。引用于：§1、§1、§3.1。

[56] K. Yamaguchi（2021）《CanvasVAE：学习生成矢量图形文档》。arXiv 预印本 arXiv:2108.01249。引用于：§2。

[57] L. Yang、Z. Yu、C. Meng、M. Xu、S. Ermon 和 B. Cui（2024）《掌握文本到图像扩散：利用多模态大语言模型进行重述、规划与生成》。收录于 ICML。引用于：§2。

[58] T. Yang、Y. Luo、Z. Qi、Y. Wu、Y. Shan 和 C. W. Chen（2024）《PosterLLaVa：利用大语言模型构建统一的多模态布局生成器》。arXiv:2406.02884。引用于：§2。

[59] S. Yin, Z. Zhang, Z. Tang, K. Gao, X. Xu, K. Yan, J. Li, Y. Chen, Y. Chen, H. Shum, L. M. Ni, J. Zhou, J. Lin, 和 C. Wu (2025) 《Qwen-image-layered：通过图层分解实现内在可编辑性》。外部链接：2512.15603，链接 被引用：§2, §4.3.3。

[60] T. Yin, M. Gharbi, T. Park, R. Zhang, E. Shechtman, F. Durand, 和 B. Freeman (2024) 《改进的分布匹配蒸馏用于快速图像合成》。神经信息处理系统进展 37, 页码 47455–47487。被引用：§1, §3.3, §4.4。

[61] T. Yin, M. Gharbi, R. Zhang, E. Shechtman, F. Durand, W. T. Freeman, 和 T. Park (2024) 《基于分布匹配蒸馏的单步扩散》。收录于 IEEE/CVF 计算机视觉与模式识别会议论文集，页码 6613–6623。被引用：§1, §3.3, §4.4。

[62] L. Zhang 和 M. Agrawala (2024) 《利用潜在透明度实现透明图像图层扩散》。ACM 图形学交易 43 (4), 页码 1–15。外部链接：文献编号 被引用：§1, §2。

[63] X. Zhang, L. Yang, G. Li, Y. Cai, J. Xie, Y. Tang, Y. Yang, M. Wang, 和 B. Cui (2024) 《IterComp：从模型库中迭代式组合感知反馈学习用于文本到图像生成》。arXiv:2410.07171。被引用：§2。

[64] X. Zhang, W. Zhao, X. Lu, 和 J. Chien (2023) 《Text2layer：使用潜在扩散模型进行分层图像生成》。arXiv 预印本 arXiv:2307.09781。被引用：§1, §2。

[65] K. Zheng, Y. Wang, Q. Ma, H. Chen, J. Zhang, Y. Balaji, J. Chen, M. Liu, J. Zhu, 和 Q. Zhang (2025) 《通过分数正则化连续时间一致性进行大规模扩散蒸馏》。arXiv 预印本 arXiv:2510.08431。被引用：§1。

[66] Z. Zhou, D. Chen, C. Wang, C. Chen, 和 S. Lyu (2024) 《扩散模型的简单快速蒸馏》。神经信息处理系统进展 37, 页码 40831–40860。被引用：§1。

[67] Y. Zhu, X. Wang, S. Lathuilière, 和 V. Kalogeiton (2025) 《Di[m]o：将掩码扩散模型蒸馏为单步生成器》。收录于 IEEE/CVF 国际计算机视觉会议论文集，页码 18606–18618。被引用：§1。

\thetitle

补充材料

1 额外的消融实验

媒体内容 · 前往原文查看

训练描述长度 FIDmerged

短描述 长描述

短描述 17.64 18.56

长描述 17.95 16.15

混合（50% 短描述 + 50% 长描述） 16.13 15.93

表 1：训练时描述长度的影响。我们分别使用短描述、长描述以及两者的混合来训练模型，并分别使用短描述和长描述在 VC5K 测试集上评估 FID。

媒体内容 · 前往原文查看

方法 去噪步数 延迟（秒） 加速比 FIDmerged

基线 50 14.4 - 16.02

+ 蒸馏 16 4.5 3.2 倍 16.21

+ 蒸馏 8 2.3 6.26 倍 18.58

表 2：带推理时间的多层生成器蒸馏。

1.1 使用可变描述长度的混合训练

表 1 展示了训练过程中描述多样性的重要性。使用混合描述长度训练的模型实现了最佳泛化能力，在短描述上的 FID 为 16.13，在长描述上的 FID 为 15.93。仅使用一种描述类型进行训练会产生领域差距：仅使用短描述训练在长描述上的 FID 降至 18.56，而仅使用长描述训练的 FID 为 16.15，显示出更好的鲁棒性，但在短描述上仍非最优。

媒体内容 · 前往原文查看

层数 27 811 1214 1550

PSNR 22.51 21.99 21.36 20.65

SSIM 0.8932 0.8869 0.8780 0.8610

表 3：层数对图像到图层（I2L）生成质量的影响。我们评估了模型在生成结果中不同层数范围内的性能。

1.2 层数对图像到图层的影响

表 3 展示了我们的方法在图像到图层任务中，针对不同层数的可扩展性。该模型能有效处理 2 到 50 层的构图范围，在此宽范围内保持稳定的性能。这种灵活性使得无需修改架构即可分解简单设计和复杂的多元素构图。

1.3 蒸馏模型分析

为了评估我们方法在实际应用中的效率，我们在单块 NVIDIA H200 GPU 上进行了推理速度基准测试。我们将标准基线方法（使用 50 步去噪）与经过蒸馏的 MRT 模型在减少推理步数（16 步和 8 步）的情况下进行了对比。如表 2 所示，基线模型完成生成过程需要 14.4 秒。相比之下，应用 DMD2 蒸馏显著加速了推理过程。具体来说，我们的模型在 16 步时实现了加速（4.5 秒），且生成质量几乎没有下降（FID 仅从 16.02 略微上升至 16.21）。此外，将推理预算降至仅 8 步，可实现大幅加速（2.3 秒），这表明我们的方法成功地在高保真生成与交互级延迟之间取得了平衡。我们还在图 1 中展示了生成的样本，并对原始模型与蒸馏模型进行了比较。

图 1：蒸馏模型的生成质量。我们实现了高达 6 倍的加速，且不牺牲图像的质量与保真度。

2 图像到图层模型的注意力分析

为了验证我们的模型学习的是有意义的语义表征，而不仅仅是记忆布局先验，我们可视化了分解过程中生成的逐像素注意力图。图 2 展示了生成的透明图层与其相关注意力激活之间的对应关系。可以观察到，注意力机制表现出强大的空间定位能力。对于每个预测的图层，注意力权重（以热力图形式可视化）与目标元素的语义边界高度相关。例如，在重建高频成分（如第二个案例中的“Bundle of Joy”、第三个案例中的“Love NEVER FELT…”等文本）或精细图形元素时，注意力紧密聚焦于相关的字符笔画和形状，有效抑制了背景噪声。相反，对于背景图案或较大的几何形状，注意力则更广泛地作用，以捕捉该区域的纹理和空间范围。这一可视化证实，模型通过关注由布局引导的不同视觉特征，成功地将合成图像解耦，确保生成的 RGBA 图层具有清晰的 Alpha 遮罩和连贯的纹理。

图 2：图像到图层任务的注意力图可视化。我们通过可视化图层生成过程中的内部注意力权重，展示了模型的可解释性。左图：输入的合成图像及其对应的布局。右图：分解结果。顶行显示预测的透明图层，底行显示叠加在输入图像上的相应注意力图。红色区域表示高激活值。结果表明，模型的注意力具有语义选择性，能够准确对齐特定的视觉元素（如文本、前景物体、背景图案），从而生成高质量、解耦的图层。

3 用户研究详情

3.1 文本到图层任务的用户研究

为了评估我们的模型在文本到图层任务上的生成质量，我们进行了一项用户研究，将我们的方法（MRT）与基线方法（ART）进行了比较。我们采用了盲测、成对比较的设置。对于每个样本，参与者首先看到输入文本提示，随后并排展示由 MRT 和 ART 生成的相应结果。为了消除位置偏差，这两个结果的显示顺序（左侧或右侧）在每次评估中都是随机分配的。参与者被要求根据四个不同的维度进行三选一的强制选择投票——“方法 A 更好”、“方法 B 更好”或“平局”：(1) 元素（布局），(2) 视觉吸引力（美学），(3) 文本的正确性（排版），以及 (4) 每个图层的连贯性和质量（协调性）。

基于网页的评估界面如图 33 所示，两个生成结果并排显示，文本说明位于右侧面板。

3.2 图像到图层任务的用户研究

对于图像到图层任务，我们进行了一项全面的用户研究，通过在我们的方法与三个最先进的基线方法之间分别进行三组成对比较：(1) 我们的方法 vs. LayerD，(2) 我们的方法 vs. Lovart，以及 (3) 我们的方法 vs. Roboneo。每次比较都作为独立的盲测进行。每项研究中的参与者会看到一个三图像布局：原始输入图像作为中心参考显示，而我们的方法的结果和相应基线方法的结果则并排展示。为了消除位置偏差，我们的结果和基线结果的显示顺序（左侧或右侧）在每次试验中都是完全随机的。参与者被要求根据三个关键指标进行三选一的强制选择投票（“方法 A 更好”、“方法 B 更好”或“平局”）：(1) 粒度，(2) 图层完整性，以及 (3) 图层质量。

评估界面如图 34 所示，参考输入图像显示在中心，两种方法的分解结果显示在两侧。

4 局限性

尽管我们的模型在图像到图层任务中表现出色，但在应用于真实世界照片时仍面临挑战。具体来说，我们的方法通常无法正确处理阴影，导致分割出的对象图层排除了阴影区域，而将阴影留在背景图层上，从而造成视觉上的不一致。我们将这一局限性主要归因于训练数据：我们的模型仅在设计数据集上训练，这些数据集是平面化的，缺乏自然场景中常见的阴影、反射和折射等物理效果。尽管存在这一领域差距，我们惊喜地发现，即使没有任何真实世界多层数据的监督，我们的方法仍然能够相当好地泛化到真实图像上。如我们的示例所示，大多数对象都能被成功分离，我们认为这得益于从 Qwen-Image 主干继承而来的强大视觉理解能力，证明了我们方法的鲁棒性、适应性和可扩展性。在未来的工作中，我们计划通过收集并训练包含阴影和反射等真实视觉效果的数据集，将我们的方法扩展到真实世界图像场景。我们相信，这样的扩展将进一步提升模型生成连贯且物理上合理的图层分解的能力。

5 可视化与定性分析

5.1 多样化的文本到图层生成

我们在图3至图9中展示了文本到图层任务的定性结果。我们的掩码区域Transformer展现了卓越的通用性，能够仅凭文本描述生成高保真的多层设计。如图3至图8所示，该模型成功合成了一致性构图，范围从简单布局到包含超过25层甚至更多图层的复杂设计，同时保持了严格的空间一致性和风格和谐。我们方法的一个关键优势是对多样化排版的原生支持；图9展示了我们独特的溢出生成能力。与以往将内容截断在画布边缘的方法不同，我们的模型能够生成完整的、全尺寸的RGBA图层，这些图层延伸至可见背景边界之外，从而为下游合成任务保留了完整的可编辑性和可复用性。此外，图10突出了该模型在多种语言（包括中文）中渲染准确视觉文本的能力，确保了其在全球设计应用中的实用价值。

5.2 图像到图层的对比分析

在图11至图18中，我们提供了我们的方法与最先进基线（包括LayerD、Lovart和RoboNeo）之间的全面定性比较。结果一致表明，我们的方法为图层分解质量树立了新的标准。虽然像RoboNeo这样的商业系统常常引入视觉伪影或无法生成干净的透明度，而像LayerD这样的学术基线则倾向于生成过度分组的图层，限制了编辑灵活性，但我们的掩码区域Transformer实现了更优的平衡。我们的方法在生成精确的Alpha遮罩、保持语义完整性以及实现恰当的分割粒度（例如，分离不同的视觉元素而非合并它们）方面表现出色。这在复杂的重叠区域尤为明显，我们的模型成功解开了其他方法无法分离的元素。

5.3 图像到图层任务中图层数量的可扩展性

为评估我们框架的鲁棒性，我们在图19至图23中展示了从6层到16层不同复杂度下的图像到图层分解结果。这些可视化结果证实，我们的架构能够有效扩展且性能不会下降。在多种图层数量情况下，模型在边界检测和内容保留方面均保持了一致的质量。这种跨不同图层数量的稳定性验证了我们的掩码注意力机制的有效性，证明该模型能够处理专业级平面设计的结构复杂性。

5.4 上下文感知的图层添加

图24展示了我们的图层到图层任务的能力，特别聚焦于图层添加。在此，我们模拟了一个用户编辑工作流，其中新元素（如文本或装饰性对象）根据文本提示和指定的边界框被插入到现有设计中。结果表明，我们的模型并非简单地粘贴孤立对象；相反，它生成的新图层具有上下文感知能力，能够匹配现有图层的照明、透视和艺术风格。通过以完整构图作为条件，添加的图层与原始设计无缝融合，在满足用户语义需求的同时保持了整体美学效果。

5.5 图层重风格化与协调

在图25中，我们展示了图层重风格化能力，即用户提供的素材被转换以符合目标设计的视觉特征。我们的模型在保留输入素材几何结构的同时，有效地进行了风格迁移。可视化结果表明，我们的单次生成方法确保了跨图层的一致性，成功地将外部素材的调色板、纹理和艺术渲染效果适配到已有的构图中。这一能力对于将不同元素统一整合为连贯的平面设计至关重要。

5.6 文本到图层任务中的布局泛化

图 26 和图 27 展示了文本提示词与空间控制之间相互作用的分析。在这些实验中，文本提示词包含对元素位置的隐式或显式描述，同时我们提供了可能与这些文本描述相冲突的不同空间布局（边界框）。值得注意的是，结果表明我们的模型表现出对用户提供布局的强遵循性，有效覆盖了文本提示词中存在的空间偏差，同时保留了语义内容。这证实了我们的框架成功地将语义生成与空间排列解耦，允许用户强制执行任意布局——例如将标题从顶部移动到底部——而不会影响生成内容的质量或提示词的语义保真度。

5.7 布局引导的图像分解

针对图像到图层任务，图 28 至图 30 可视化了输入光栅图像及其在推理过程中使用的相应布局结构（边界框和 Z 轴顺序）。这些示例说明了模型如何利用布局信息——无论是来自自动检测器还是人工标注——作为结构先验来指导分解过程。可视化结果表明，模型通过利用提供的空间线索，准确解决了光栅图像中的歧义，从而生成严格符合指定边界、具有语义意义的图层。这突显了模型能够生成专业编辑工作流程所必需的可控且可预测的分解结果。

5.8 对自然场景的泛化

尽管我们的模型仅在平面设计数据集（海报、传单等）上训练，图 31 展示了其对真实世界自然图像的零样本泛化能力。该模型利用从 Qwen-Image 主干继承而来的强大视觉理解能力，成功将照片中的物体分割到透明图层中。然而，我们观察到由于领域差异带来的一个特定局限：与平面设计不同，真实场景包含复杂的物理光照效果。因此，模型常常无法将投影与其对应的物体关联起来，导致投影留在背景层而非物体层上。尽管存在这一关于物理光照效果的局限，但模型在域外数据上的结构分解能力仍然出奇地稳健。

5.9 失败案例

最后，我们在图 32 中分析了具有代表性的失败案例，以提供对我们方法当前局限性的平衡视角。我们观察到所有四个任务中存在一个共性问题：部分透明背景被解码为灰色，而非保持透明。这种歧义的产生是因为我们的 VAE 编码器目前使用 3 通道输入，将透明图层压缩为灰色表示，解码器有时会错误地解读这种表示。未来的工作可以通过采用 4 通道编码器或替代编码方案来解决这一问题。此外，我们还识别出特定任务的局限：1）对于文本生成任务，模型有时难以准确渲染非常小的字形；2）对于图层间任务，我们偶尔会观察到身份保持（IP）和指令遵循方面的失败，尤其是在需要复杂风格迁移或精确物体插入时。这些案例为多层生成建模领域的未来研究指明了关键方向。

图 3：文本到图层生成示例。我们展示了本方法生成的多样化文本到图层结果，呈现了输入文本提示词及对应的多层输出。每个示例都展示了独立的透明 RGBA 图层以及合并后的合成效果。我们的方法能够生成连贯的多层设计，保持空间一致性、风格和谐性以及精确的图层边界，充分体现了文本提示词与分层构图之间的强对齐能力。

图 4：更多文本到图层生成示例。更多示例展示了本方法根据文本描述生成多层设计的能力。这些结果体现了生成布局、图层构成和视觉风格的多样性。

图 5：更多文本到图层生成示例。

图 6：更多文本到图层生成示例。

图 7：更多文本到图层生成示例。

图 8：更多文本到图层生成示例。我们的统一框架能够处理各种设计复杂度，从简单的构图到包含超过 25 个图层的复杂多元素设计，同时保持生成质量。

图 9：带溢出图层的文本到图层生成。更多示例突出了本方法生成超出背景边界的溢出图层的独特能力。如第 3 节所述及图 2 所示，超过 60% 的设计包含溢出图层。我们的方法在画布上生成完整的全尺寸 RGBA 图层，保留了先前方法因在背景边界处截断像素而牺牲的可编辑性和可复用性。

图 10：支持多语言的文本到图层生成。示例展示了本模型生成包含多语言文本图层设计的能力。我们的数据集包含多种语言（如图 1 所示），能够生成包括中文在内的多种语言视觉渲染文本。这展示了模型在处理不同书写系统的排版时保持设计质量的能力。

图 11：图像到图层任务的定性比较。我们将我们的方法与 LayerD、Lovart 和 RoboNeo 在将平面设计分解为透明图层方面进行了比较。每个面板显示：输入图像（左上角），随后是我们的结果以及基线结果及其分解出的图层。与基线方法相比，我们的方法生成了更清晰的图层边界、更好的粒度以及更完整的 RGBA 图层。

图 12：图像到图层任务的额外定性比较。我们的方法在图层分解质量上表现出色，具有更好的语义正确性和透明度处理能力。我们方法分解出的图层保持了更高的完整性，能够忠实地重建输入图像，而基线方法则存在图层伪影、分组不当或分解不完整等问题。

图 13：图像到图层任务的额外定性比较。此示例进一步展示了我们的方法在图层质量、完整性和适当粒度方面的优势。我们的方法成功分解了复杂的构图，同时避免了 LayerD 产生的过度分组图层或商业系统输出中存在的伪影。

图 14：图像到图层任务的额外定性比较。我们的方法在不同设计风格和复杂度上始终优于基线方法。可视化结果表明，我们的方法能够生成高质量的透明图层，具有精确的 Alpha 通道和恰当的语义分解，这对于下游编辑任务至关重要。

图 15：图像到图层任务的额外定性比较。此案例凸显了我们的方法处理复杂多元素设计的能力。虽然像 RoboNeo 这样的商业系统存在严重伪影，LayerD 产生的过度分组图层损害了细粒度编辑的灵活性，但我们的方法同时保持了高质量和恰当的分辨粒度。

图 16：图像到图层任务的额外定性比较。我们的方法在分解具有重叠元素和复杂视觉层次的设计方面表现出色。比较表明，该方法在所有三个评估维度上均具有优越性能：质量（语义正确性和透明度）、完整性（忠实重建）和粒度（适当的分解层级）。

图 17：图像到图层任务的额外定性比较。此示例展示了我们的方法在不同设计类别中的鲁棒性。我们分解出的图层保持了清晰的边界、干净的透明度和语义连贯性，从而实现了商业和学术基线方法难以支持的实际编辑工作流程。

图 18：图像到图层任务的额外定性比较。最后一个比较案例展示了我们方法始终如一的品质优势。分解过程在保持视觉保真度的同时，保留了图层的可复用性和可编辑性，证实了我们的掩码区域 Transformer 框架在图像到图层任务中的有效性。

图 19：6 层图像到图层可视化。我们可视化了逐层分解过程，展示了带有透明度的各个 RGBA 图层。每个图层及其 Alpha 遮罩被单独显示，合并后的合成结果则证明了输入设计的忠实重建。该可视化展示了我们的方法生成干净、可复用图层以及精确空间边界和 Alpha 通道的能力。

图 20：8 层图像到图层可视化。分解结果显示图层复杂度增加，包含 8 个不同的透明图层。我们的方法成功处理了更复杂的合成，在扩展的图层层级中保持了图层质量和恰当的分解释粒度。每个图层都保留了语义含义，并且可以独立编辑。

图 21：10 层图像到图层可视化。进一步展示了在包含 10 个透明图层的组合上的可扩展性。我们的掩码区域 Transformer 在不同图层数量下均能保持稳定性能，无需修改架构即可生成连贯的分解结果。可视化结果显示了从背景到前景元素的图层质量一致性。

图 22：12 层图像到图层可视化。将一个复杂设计分解为 12 个透明图层，展示了我们的方法在处理高图层数量时保持分解质量的能力。每个图层都保留了清晰的边界和合适的 Alpha 遮罩，这对于专业编辑工作流程至关重要。

图 23：14 层和 16 层图像到图层可视化。两个示例展示了我们的方法在极高图层数量（分别为 14 层和 16 层）下的可扩展性。如表 3 所示，我们的方法在 2 到 50 层的广泛图层数量范围内均能保持稳定性能，展现了处理简单和复杂多元素组合的灵活性。

图 24：图层添加任务的更多示例。我们通过基于文本提示向现有组合中添加新图层，展示了图层到图层的能力。我们的方法生成的新图层能够保持跨图层一致性，并与现有设计的空间布局和视觉风格相协调。通过一次性生成多个图层并以所有现有图层为条件，我们的方法能更好地捕捉图层间关系，生成保持全局构图的连贯插入内容。

图 25：图层重风格化任务的更多示例。我们展示了将用户提供的素材转换为风格协调的图层，使其与整体构图相匹配的过程。我们的方法对所有目标图层一次性完成此重风格化操作，在保留几何结构的同时调整外观以符合现有设计的视觉特征。结果展示了有效的风格迁移，同时保持了图层连贯性和构图和谐。

图 26：文本到图层——合并图像与布局可视化。另一个示例展示了我们的模型能够根据文本提示生成结构良好的多层设计。并排对比显示了文本描述如何被转化为视觉构图（左图）以及结构化的图层层级（右图），突显了模型学习美学与结构设计原则的能力。

图 27：文本到图层——合并图像与布局可视化。另一个示例展示了生成的合并设计与其底层图层布局结构之间的关系。布局可视化揭示了我们的模型如何组织多个图层，使其具备恰当的空间关系、Z 轴顺序和构图平衡，从而根据文本描述生成美观的设计。

图 28：图像到图层——合并图像与布局可视化。我们将输入图像与提取出的图层布局结构一同可视化，用于图像到图层的分解任务。这展示了我们的方法如何将光栅图像分解为语义上有意义且具有清晰空间边界的图层。布局表示中显示了边界框和 Z 轴顺序，用于指导分解过程。

图 29：图像到图层——合并图像与布局可视化。另一个示例展示了输入光栅图像与其图层布局之间的对应关系。我们的方法利用布局信息（来自自动检测器或人工标注）来执行精确的图层分解。图层分组增强策略有助于提高对噪声或模糊布局规范的鲁棒性。

图 30：图像到图层——合并图像与布局可视化。图像到图层分解中输入与布局关系的最后一个示例。该可视化证实了我们的方法能够处理多样化的设计类别和布局复杂度，生成高质量的透明图层，这些图层可独立编辑，同时忠实还原原始构图。

图 31：真实世界照片的“图像到图层”处理：局限性分析。我们展示了该方法在领域外自然图像上的泛化能力。尽管模型仅在设计数据集上训练，它仍能将真实照片分解为图层。然而，如局限性部分所述，模型在处理阴影等物理效果时面临挑战——通常会将阴影区域排除在物体图层之外，而将其留在背景上。这一局限性源于平面设计与具有光照效果的真实世界场景之间的领域差距。尽管如此，Qwen-Image 主干网络强大的视觉理解能力仍使模型实现了合理的泛化，大多数物体都能被成功分离。

图 32：失败案例与局限性。我们展示了各项任务中的代表性失败案例。一个常见问题（右上）是“灰色背景”伪影，即由于三通道 VAE 编码的模糊性，透明区域被解码为灰色。其他局限性包括（左下）生成极小文本时出现字形变形，以及（右下）在图层间编辑过程中偶尔出现的身份保持失败和指令遵循失败。

图 33：文本到图层评估的用户研究界面。两个生成结果并排显示，右侧展示文本描述。参与者从四个维度进行投票：元素（布局）、美学、排版和整体偏好。

图 34：图像到图层评估的用户研究界面。参考输入图像居中显示，两侧分别展示两种方法的分解结果。参与者基于三个指标进行评估：粒度、图层完整性和图层质量。
