# i1：面向强文生图模型的简单且完全开源配方

- 来源：HuggingFace Daily Papers（社区热门论文）
- 发布时间：2026-06-09 08:00
- AIHOT 分数：82
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmq8ws2lj06ikslldd7r6waue
- 原文链接：https://arxiv.org/abs/2606.11289

## 精选理由

i1 是第一个用全公开数据、完全开源代码/权重/数据管线打造的 3B 模型，直接把全开放模型的性能拉到可与闭源竞争，对做文生图研究的同行是个扎实起点。

## AI 摘要

i1 是一个 3B 参数的文本到图像扩散模型，仅使用公开数据集训练。在 GenEval、DPG、PRISM、CVTG-2K 和 LongText 五个基准上，i1 性能与领先模型相当，平均比最佳现有完全开源模型高 29.5 个百分点。研究基于 300 余项控制实验（超 700K TPU v6e 小时），发现等权重混合 curated 数据集是强默认配置、更大文本编码器适配器以极少参数提升性能。i1 的检查点、训练与推理代码及数据处理流程已全部开源。

## 正文

图 1：我们探究了文生图扩散模型的设计空间，以理解建模和数据选择如何影响模型能力。这一探索最终催生了 i1，一个拥有 30 亿参数的模型，在 1024 分辨率下，根据 GenEval、DPG-Bench、PRISM、CVTG-2K 和 LongText-Bench 的平均百分比得分衡量，其性能与领先模型不相上下。我们开源了模型、代码和数据，以支持未来的研究。

扩散模型持续推动着文生图领域的进步。然而，将近期进展归因于特定的建模和数据选择颇具挑战性：最先进的开放权重模型提供的消融研究有限，且不公开其训练数据和完整的训练细节。研究社区需要完全开放（权重、数据和代码）的模型作为进一步研究的基础；然而，现有的完全开放模型在性能上仍远落后于领先模型。在本项目中，我们通过 300 多次受控实验（总计超过 70 万 TPU v6e 小时），对文生图扩散训练和推理中的建模与数据设计选择进行了系统性研究。我们的实验突出了若干实证发现（例如，在混合精选数据集时，等权加权是一个强大的默认设置）和简单的设计决策（例如，更大的文本编码器适配器能以极少的参数增加来提升性能），用于训练强大的模型。在这些见解的指导下，我们仅使用公开可用的数据集训练了 i1，一个拥有 30 亿参数的文生图扩散模型。i1 在五个代表性基准测试（GenEval、DPG、PRISM、CVTG-2K 和 LongText）上与领先模型具有竞争力，并且在平均得分上比现有最好的完全开放模型高出 29.5 个绝对百分点。我们提供了 i1 的检查点、训练和推理代码以及数据处理流程。我们的发现与 i1 方案共同为未来文生图扩散模型的开放研究奠定了实践基础。

图 2：i1 在通用图像生成方面的精选展示（更多示例见附录 B.1）。

图 3：i1 在文本渲染方面的精选展示（更多示例见附录 B.1）。

目录

第一节 引言

自 DALL-E 2（ramesh2022hierarchical）、Imagen（saharia2022photorealistic）和 Stable Diffusion（rombach2022high）等早期模型以来，基于扩散的模型凭借其生成具有精细细节的逼真图像的强大能力，推动了文生图领域的重大进展（wu2025qwen; labs2025flux; cai2025z; gao2025seedream）。然而，尽管当今最先进的模型具备卓越能力，我们往往难以厘清究竟是哪些建模和数据选择真正推动了性能提升。这种不清晰性源于两个因素。

首先，领先模型通常不公开其训练数据和完整的训练方案（wu2025qwen; cai2025z; qin2025lumina; cai2025hidream），即便它们公开发布了模型检查点。这限制了可复现性，并阻碍了在其设计基础上开展受控分析和后续工作。虽然存在完全开源（权重、数据和代码）的模型（chen2025blip3; chen2025blip3o; ma2026deco; wang2026pixnerd），但它们在性能上远不及领先模型。

其次，领先模型通常不对其设计选择进行详尽的消融实验（wu2025qwen; cai2025z; cai2025hidream; gao2025seedream; ryu2025flite; fang2026flux）。在实践中，许多模型将大量架构、训练和数据决策捆绑到单一方案中，使得难以将性能提升归因于任何特定因素。因此，现代文生图扩散模型在诸多重要设计选择上仍缺乏共识（例如，使用单个文本编码器（qin2025lumina; wu2025qwen）与使用多个文本编码器（esser2024scaling; cai2025hidream））。

为了更深入地理解现有及新型架构与数据设计在文生图扩散模型中的影响，我们开展了一系列受控实验，主要聚焦于 256×256 低分辨率预训练阶段。从一个简单的基线模型（yao2025reconstruction）出发，我们首先探索了来自文本编码器的文本条件注入策略，以及噪声/时间步条件注入策略（sun2025noise）。随后，我们识别出能带来更强性能的主干架构设计（bao2023all；esser2024scaling）。最后，我们比较了高质量图文数据集筛选与推理时提示词增强方面的设计选择，以及混合图像数据集的策略。

在建模方面，我们发现：（1）使用单个强大的文本编码器配合更大的适配器，比组合多个文本编码器效果更佳；（2）时间步/噪声条件注入与自适应层归一化（peebles2023scalable）在我们的文生图设定中收益甚微；（3）采用长跳跃连接（bao2023all）的双流 DiT 架构（esser2024scaling）是一种强大的主干设计。

在数据方面，我们发现：（1）使用长描述进行训练能产生比短描述训练更强的模型，但会导致模型在短提示词上表现不佳，这一问题可通过推理时的提示词改写来缓解；（2）合成描述生成器的选择对下游性能至关重要；（3）在混合精选数据集时，对每个数据集按重复次数计算、使用相同数量的图像进行训练（下文称为“数据集间等权重分配”）是一种强大的默认策略；（4）在多样化数据集混合的情况下，重复训练数据仅会造成轻微的性能下降；（5）从低分辨率模型获得强大的高分辨率生成能力，并不需要广泛的高分辨率数据覆盖。

为了给未来的开放研究提供一个强有力的基线，我们利用受控实验中的洞察，在公开可用的数据集上训练了 i1——一个拥有 30 亿参数的文生图扩散模型。在 1024 分辨率下，i1 在完全开放模型中达到了最先进的性能，并在多个代表性基准测试中超越了多个参数量大得多的领先开放权重模型（例如，170 亿参数的 HiDream-I1 (cai2025hidream) 和 120 亿参数的 FLUX.1 [Dev] (labs2025flux)）。

图 4：我们最终 i1 模型的高层示意图。i1 并未引入重大的新网络模块，而是将精心选择的建模与数据设计选择相结合，构建成一个简洁而强大的文生图模型。

i1 表明，仅使用规模适中的公开图像数据集也能实现强大的性能，并凸显了仔细探索设计空间的价值：如图 4 所示，i1 没有引入任何显著的新网络模块，而是识别了先前工作中存在但未被充分利用的设计（例如，长跳跃连接），并对标准组件进行了简单的修改（例如，使用更大的文本编码器适配器）。我们提供了模型权重、代码、数据集以及模型训练和评估的详细配方。我们的发现与 i1 配方共同为开放的文生图研究奠定了实践基础，既提供了一个强大的完全开放基线，也为构建能力更强的模型提供了设计思路。

第 2 节 预备知识

在本节中，我们提供必要的术语和背景知识，以帮助理解和推动后续的受控实验设置（第 3 节）以及建模与数据设计实验（第 4 节和第 5 节），重点关注骨干架构、文本与噪声条件机制，以及现有的开放训练数据配方。

文生图骨干架构

尽管存在其他范式（chang2023muse; sun2024autoregressive; zhou2024transfusion），但大多数领先的文生图系统都采用基于流匹配（lipman2022flow）训练的扩散Transformer（DiT）（peebles2023scalable）。根据文本特征融入方式的不同，当前的扩散模型通常可分为三类：交叉注意力模型（chen2024pixart; xie2025sana; ryu2025flite）、单流模型（qin2025lumina; cai2025z; chen2025dit）和双流MMDiT模型（esser2024scaling; wu2025qwen）。交叉注意力模型通过交叉注意力层注入文本嵌入向量，而单流和双流模型则将图像与文本的token序列进行拼接。双流模型对图像和文本token使用各自模态专用的注意力机制和MLP参数，而单流模型则在各模态间共享注意力机制和MLP参数。长跳跃连接是一种架构上的改进，它在早期层与后期层之间添加了快捷连接。早期工作（bao2023all）曾对此进行过探索，但在现代文生图模型中并未得到广泛应用。

文本与噪声条件机制

在当前的模型中，输入提示词由一个（cai2025z; qin2025lumina; wu2025qwen）或多个（esser2024scaling; cai2025hidream）文本编码器进行编码。由此产生的文本特征通常会经过一个线性层（labs2025flux; cai2025hidream; wu2025qwen; cai2025z）或MLP（xie2025sana）适配器，将其映射到扩散模型的隐藏维度。在各类主干架构中，自适应层归一化（AdaLN）（peebles2023scalable）被普遍用于注入时间步信息。AdaLN学习一个从时间步嵌入向量到注意力机制和MLP输入的缩放因子与偏移因子的线性投影，以及针对其输出的门控因子。在某些模型中，时间步嵌入向量会与池化后的文本嵌入向量通过逐元素相加的方式结合，然后再用于AdaLN条件处理（esser2024scaling; cai2025hidream; labs2025flux）。

开放文生图数据配方

许多领先模型（wu2025qwen; cai2025z; qin2025lumina; cai2025hidream; labs2025flux）会公开其权重，但并未披露训练数据的配方。除少数模型（qin2025lumina; ryu2025flite）外，甚至连训练数据集的来源和规模也仍未公开，这限制了开放研究社区对如何构建高质量文生图训练数据的理解。完全开放的模型（chen2025blip3; chen2025blip3o; sehwag2025stretching; ma2026deco; tong2026scaling; wang2026pixnerd）在性能上通常仍落后于领先系统，且其数据集往往来自相似且有限的来源（例如 JourneyDB (sun2023journeydb)、SA-1B (kirillov2023segment) 和 CC12M (changpinyo2021conceptual)）。此外，完全开放的配方几乎不涉及数据平衡技术的探索。

第 3 节 受控实验的基线

在第 2 节介绍现有设计的基础上，我们通过第 4 节和第 5 节中 256 分辨率预训练阶段的受控实验，对文生图扩散模型的设计空间进行研究。对于每组实验，我们都从相同的强基线出发，并独立改变单一设计选择（即，各实验间的修改不进行累积）。性能得到提升的设计将在第 6 节中组合，以构建我们的最终模型 i1（见图 21）。下文描述了基线设置，图 5 提供了高级示意图，详细架构则绘制于附录 A.2 中。

图 5：受控实验基线的高级示意图。我们在 LightningDiT (yao2025reconstruction) 的基础上构建了一个标准的交叉注意力架构，并添加了 QK-norm 以保证训练稳定性。我们还加入了长跳跃连接 (bao2023all)，这是一种未被充分利用的设计选择，我们将在第 4.2 节中重新审视它，并发现其对性能有益。

模型

如图5所示，我们的骨干架构基于LightningDiT-XL/2（yao2025reconstruction）。LightningDiT是一种现代DiT架构（peebles2023scalable），它融合了用于提升性能的常见设计（例如RoPE（su2024roformer）、RMS归一化（zhang2019root）、SwiGLU FFN（shazeer2020glu））。我们添加了QK归一化（dehghani2023scaling）以稳定训练。为确保后续消融实验能与强基线进行对比，我们还应用了长跳跃连接（bao2023all）（见第2节），这是一种不太常用的设计，我们在第4.2节中重新审视了它，并发现它有助于提升性能。

默认情况下，我们使用交叉注意力机制来注入文本嵌入。在某些实验中，我们还会在骨干网络的单流和双流变体（见第2节）上进行额外验证，以确保我们发现的通用性。我们使用AdaLN将模型条件设置为时间步嵌入与池化文本嵌入（通过对文本嵌入token求平均计算得出）之和。对于单流架构，我们遵循Lumina-Image 2.0（qin2025lumina）的做法，在骨干网络前添加两个特定于模态的精炼模块。对于单流和双流骨干网络，我们都采用了多模态RoPE（wang2024qwen2）。默认情况下，我们使用T5Gemma-2B的编码器部分作为文本编码器，并使用FLUX.2 VAE。

媒体内容 · 前往原文查看

ImageNet-22K YFCC RedCaps Megalith

Places Pexels iNaturalist FLUX-Reason

Midjourney v6 GPT-Edit TextAtlas RenderedText

图6：来自每个图像数据集的示例图像（更多示例见附录E.1）。我们在受控实验中使用12个精选图像数据集，包括7个真实图像数据集、3个合成数据集和2个文本渲染数据集。

数据

我们仅使用公开可用的图像数据集，包括 7 个真实图像数据集（ImageNet-22K、YFCC100M、RedCaps、Megalith、Pexels、iNaturalist 2024、Places365-Challenge 2016）、3 个合成数据集（GPT-Image-Edit-1.5M、FLUX-Reason-6M 和 Midjourney v6），以及 2 个文本渲染数据集（RenderedText 和 TextAtlas）。默认情况下，我们简单地将这些数据集中的 1.68 亿张图像合并，不进行加权处理（这一设计选择将在后续第 5.2 节中重新审视）。在预训练中，所有图像均被中心裁剪为正方形，并调整大小为 256x256。我们在图 6 中展示了每个数据集的示例图像。我们使用 Qwen3-VL-30B-A3B，在 FP8 精度下，通过提示词“用一段话详细描述该图像。”为每张图像生成一条长的合成描述（该视觉语言模型接收中心裁剪为正方形、若原图大于 512x512 则调整大小为 512x512 的图像）。更多信息见附录 E。

媒体内容 · 前往原文查看

基线变体 DPG PRISM LongText

交叉注意力 84.66 56.4 0.211

单流 85.89 55.6 0.293

双流 86.82 58.3 0.439

表 1：基线模型的基准测试性能。我们报告了在对照实验中各基线模型的基准测试分数。默认情况下，我们使用交叉注意力变体，并在所有三种变体上验证了部分设计。

训练与推理

我们使用流匹配目标训练模型，共进行 50 万次迭代（即最终 i1 模型 200 万步 256 分辨率预训练阶段的 25%），批次大小为 512，学习率为 1e-4。我们使用 250 步欧拉积分器进行采样，无分类器引导尺度设为 12。更多细节见附录 A.1。

提示词：在一张反光的金属桌子上，有一个色彩鲜艳、带有花卉图案的手提包，旁边是一个刚切开的牛油果…… 餐具和一个透明玻璃水瓶整齐地摆放在牛油果旁边……（77 词）

(a) DPG-Bench

提示词：Lindsey Wixson 自信地站在一片金色麦田中，头戴宽檐草帽，佩戴醒目的红色太阳镜，身穿一件鲜艳的红色毛边上衣，搭配一条闪耀的钻石项链，尽显夏日优雅。

(b) PRISM-Bench

提示词：一款名为“DailyFlow”的优雅、专业外观的移动端生产力与习惯追踪应用界面。应用名称以粗体圆润字体、舒缓的蓝绿色显示，醒目地位于顶部……（170词）

(c) LongText-Bench

图7：我们控制实验中所用基准测试的示例提示词，以及对应的 i1 生成图像。DPG 和 PRISM 评估跨多样化提示词的通用提示跟随能力，而 LongText 专门评估文本渲染能力。

评估

。我们使用三个广泛采用的基准测试来为控制实验提供信号：DPG-Bench、PRISM-Bench 和 LongText-Bench。这三个基准测试均使用 VLM 作为评估器。DPG 和 PRISM 衡量跨多样化提示词的细粒度提示跟随能力，其中 PRISM 额外评估图像美学。LongText 专门评估文本渲染能力。我们在图7中展示了每个基准测试的示例提示词。我们使用 DPG 和 LongText 的原始提示词，并使用 Qwen3-4B 配合第5.1节中的简单元提示词重写了 PRISM 的提示词。表1报告了我们的基线模型在这些基准测试上的性能。

第4节 建模

我们研究了对第3节中介绍的基线模型进行的建模设计修改。我们首先重新审视文本和噪声调节机制，包括多个文本编码器和 AdaLN，并确定了更强的替代设计方案。然后我们探索了主干架构的选择。更多结果见附录C。

4.1 文本与噪声调节

现有方法已探索了将文本和噪声条件融入骨干扩散模型的各种方式。有些方法使用单一文本编码器（cai2025z; qin2025lumina; wu2025qwen），另一些则拼接来自多个文本编码器的特征（esser2024scaling; cai2025hidream）。此外，噪声水平的嵌入向量通常通过 AdaLN 注入模型（peebles2023scalable），有时还会与池化后的文本嵌入向量一起使用（esser2024scaling; cai2025hidream; labs2025flux）。我们研究了这一广阔的设计空间，并表明，与其组合多个编码器，不如使用一个更强的单一文本编码器配合更大的适配器。我们还发现，基于 AdaLN 的噪声水平和池化文本嵌入条件对于文生图模型可能并非必要。

文本编码器

早期模型（例如 SD 1.5（rombach2022high））主要使用 CLIP 风格的文本编码器。后来的模型采用了编码器-解码器模型 T5（raffel2020exploring; esser2024scaling; cai2025hidream）。最近，模型常使用仅解码器的大语言模型或视觉语言模型（wu2025qwen; qin2025lumina），这一趋势通常归因于它们强大的推理能力和复杂指令遵循能力（xie2025sana）。

在此，我们比较了（1）一个基于现代 CLIP 的编码器（FG-CLIP 2（xie2025fg）），（2）两个现代编码器-解码器模型系列，T5Gemma（zhang2025encoder）和 T5Gemma2（zhang2025t5gemma），（3）一个现代仅解码器大语言模型系列（Qwen3（yang2025qwen3）），以及（4）一个现代仅解码器视觉语言模型系列（Qwen3-VL（bai2025qwen3））。除非另有说明，我们在可用时使用指令微调后的检查点，否则使用相应的基础检查点。图 8 报告了使用每个模型作为文本编码器时的文生图性能（其他设置下的比较见附录 C.3 和 C.4）。

图 8：各基准测试中文本编码器的性能。在我们的建模设置下，编码器-解码器模型 T5Gemma 的表现优于具有代表性的仅解码器大语言模型/视觉语言模型和 CLIP 风格模型。更多结果见附录 C。

我们观察到，指令微调的影响微乎其微（例如，T5Gemma-2B 与 T5Gemma-2B（基础版）对比），并且更大的模型并不一定表现更好（例如，T5Gemma-2B 与 T5Gemma-9B 对比）。最重要的是，编码器-解码器模型（T5Gemma 和 T5Gemma2）取得了最佳的整体性能，超越了 FG-CLIP 2 以及仅解码器的大语言模型和视觉语言模型。这引出了影响我们设计的第一个发现：

结合文本编码器

。许多近期模型（esser2024scaling; cai2025hidream）会结合来自多个编码器（例如 CLIP、T5 和大语言模型）的文本特征。在此，我们实验了图 8 中评估的不同文本编码器组合。先前的工作采用不同策略来组合来自不同编码器的嵌入向量（例如，沿嵌入维度拼接与沿序列维度拼接）。在本工作中，我们沿序列维度拼接文本特征，并为每个编码器使用独立的适配器，以适应它们不同的嵌入维度。这避免了将文本特征填充到统一序列长度的需要——当沿嵌入维度拼接特征时，通常需要这样做。

我们将图 8 中最强的文本编码器之一 T5Gemma-2B 与另一个额外的编码器相结合。如表 2 所示，将其与 T5Gemma2-1B 或 FG-CLIP 2 结合能取得最佳性能。然而，将三者（T5Gemma-2B、T5Gemma2-1B 和 FG-CLIP 2）全部结合并未带来显著的进一步提升。

媒体内容 · 前往原文查看

类型 T5G-2B T5G2-1B T5G2-4B Qwen3-VL-2B FG-CLIP 2 DPG PRISM LongText

基线 ✓ 84.66 56.4 0.211

+1 编码器 ✓ ✓ 85.62 58.4 0.303

✓ ✓ 84.86 55.8 0.270

✓ ✓ 84.80 57.4 0.264

✓ ✓ 85.72 57.7 0.285

+2 编码器 ✓ ✓ ✓ 85.37 58.8 0.272

✓ ✓ ✓ 85.28 58.1 0.351

表 2：结合文本编码器可以提升性能。我们探索了将 T5Gemma-2B 与一个或两个额外的文本编码器相结合，并发现与 T5Gemma2-1B 和 FG-CLIP 2 的组合是最强的。

尽管结合多个文本编码器能提升性能，但这种提升究竟源于不同编码器提供的多样化表征，还是仅仅来自序列长度增加以及适配器引入的额外参数？为探究此问题，我们构建了两个基线，对 T5Gemma-2B 文本嵌入进行重复：第一个基线对两份相同的嵌入副本使用两个独立的适配器（从而同时增加序列长度和适配器参数），第二个基线则使用共享适配器（因此仅增加序列长度）。如表 3 所示，使用两个独立适配器重复嵌入带来了显著提升，而使用共享适配器的结果与未重复的基线相似。这表明，结合多个文本编码器带来的增益可能主要源于额外的适配器，而非多样化的文本编码器特征或更长的序列。

文本编码器 DPG PRISM LongText

T5Gemma-2B 84.66 56.4 0.211

重复 w/1 MLP 84.93 55.8 0.225

重复 w/2 MLP 85.09 56.5 0.309

媒体内容 · 前往原文查看

表 3：将 T5Gemma-2B 特征序列的两份副本拼接，并使用两个独立的 MLP 适配器（相当于结合两个 T5Gemma-2B 文本编码器），其带来的提升与结合不同文本编码器相似；而使用共享的 MLP 适配器则无此效果。这表明提升可能来自额外的适配器参数，而非独立的文本编码器。

媒体内容 · 前往原文查看

图 9：两个 MLP 学习到不同的特征。我们使用两个 MLP 为每个提示词获取两组特征，计算每对 token 级特征向量之间的余弦相似度，并可视化每个提示词中所有 token 的平均相似度分布。

我们通过比较来自每个适配器的 DPG-Bench、PRISM 和 LongText 提示词的嵌入，来验证两个 MLP 适配器确实学习了不同的特征。我们测量每个 token 的两个嵌入之间的余弦相似度，并对每个提示词中所有 token 取平均。如图 9 所示，得到的分布大部分为负值，表明两个适配器确实捕捉到了不同的表征。

更大的文本编码器适配器

为了进一步探究组合多个文本编码器带来的性能提升是否主要源于额外的适配器参数而非多样化的文本编码器特征，我们将默认设置（第3节）中使用的小型MLP适配器（260万参数）替换为与主干模块宽度相同的大型Transformer适配器（每块1720万参数）。如图10所示，尽管参数量增加幅度不大，但提升适配器容量在所有主干架构上均能持续改善性能。不过，将适配器扩展到两个Transformer模块以上后，带来的额外收益就非常有限了。

图10：为文本编码器使用更大的适配器，在所有主干架构上均能持续提升性能。超过2个Transformer模块后，使用更大的适配器带来的额外收益就非常有限了。

此外，如表4中“default”和“+2 encoders”两行所示，当使用更大的适配器时，组合多个文本编码器在所有主干上带来的收益都大幅减小，尤其是在DPG和PRISM指标上。这进一步表明，多个文本编码器的优势可以通过增加单个文本编码器的适配器容量来获得。重要的是，使用多个编码器会增加文本序列长度，从而大幅提升内存和计算成本，而使用更大的适配器则不会。

媒体内容 · 前往原文查看

MLP适配器（默认） Transformer适配器（1个模块）

参数量 DPG PRISM LongText 参数量 DPG PRISM LongText

交叉注意力

默认 0.89B 84.66 56.4 0.211 0.91B 86.33 58.7 0.414

+2个编码器 0.90B 85.37 0.71 58.8 2.4 0.272 0.061 0.94B 86.47 0.14 59.5 0.8 0.491 0.077

无池化嵌入 0.89B 85.98 1.32 57.5 1.1 0.391 0.180 0.91B 86.37 0.04 59.4 0.7 0.446 0.032

无时间步 0.89B 82.58 2.08 54.7 1.7 0.185 0.026 0.91B 84.71 1.62 58.9 0.2 0.418 0.004

无AdaLN 0.66B 84.99 0.33 57.4 1.0 0.351 0.140 0.67B 85.13 1.20 59.7 1.0 0.413 0.001

单流

默认 0.82B 85.89 55.6 0.293 0.83B 87.64 60.0 0.472

+2个编码器 0.83B 84.89 1.00 56.3 0.7 0.439 0.146 0.87B 87.29 0.35 59.0 1.0 0.428 0.044

无AdaLN 0.57B 87.38 1.49 59.0 3.4 0.390 0.097 0.58B 87.39 0.25 59.5 0.5 0.410 0.062

双流

默认 1.24B 86.82 58.3 0.439 1.25B 87.67 60.7 0.576

+2个编码器 1.25B 87.34 0.52 59.6 1.3 0.514 0.075 1.29B 87.76 0.09 60.8 0.1 0.588 0.012

无 AdaLN 1.01B 87.82 1.00 60.3 2.0 0.508 0.069 1.02B 87.38 0.29 60.7 0.0 0.554 0.022

表 4：使用 MLP 与 Transformer 适配器时文本和噪声条件化的影响。(1) 在大多数情况下，更大的 Transformer 适配器能在仅增加少量参数的同时提升性能。(2) 使用更大的适配器时，组合多个文本编码器带来的收益显著减小，这表明先前的性能提升可能主要源于适配器容量的增加。(3) 从 AdaLN 中移除池化文本嵌入或时间步嵌入，或完全移除 AdaLN 条件化，几乎不会降低性能。我们在附录 C.6 中基于一个 3B 参数的 MMDiT 模型验证了这些发现。

移除 AdaLN 条件化

自适应层归一化（AdaLN）（peebles2023scalable）是现代文生图扩散模型（labs2025flux; wu2025qwen; qin2025lumina; cai2025hidream）中的标准组件。它通常用于将时间步嵌入和池化文本嵌入注入到主干网络中。最近一项研究（sun2025noise）表明，在类别条件图像生成中，移除噪声条件化对性能的影响极小，尤其是对于流匹配模型。如果能在不损害性能的情况下移除 AdaLN，模型将变得更加参数高效。

有趣的是，如表 4 所示，当文本编码器适配器是一个小型 MLP 时，从默认设置（第 3 节）中移除 AdaLN 能持续提升性能。然而，当使用更大的 Transformer 适配器时，这种效果变得非常微弱。为了更好地理解这一行为，我们对交叉注意力主干网络进行了额外的消融实验，其中 AdaLN 仅对池化文本嵌入或仅对时间步嵌入进行条件化，而非对两者之和进行条件化。我们分别使用小型和大型适配器评估了这些变体。

我们发现，当适配器较小时，对池化文本嵌入进行 AdaLN 条件化会降低性能（DPG 上 84.99 vs 82.58），但当适配器较大时，其影响则小得多（DPG 上 85.13 vs 84.71）。这表明，移除 AdaLN 带来的性能提升可能主要源于使用小型 MLP 适配器时特征学习不佳。然而，即使使用更大的适配器，通过 AdaLN 对池化文本和时间步嵌入进行条件化处理，其带来的额外收益仍然微乎其微。

4.2 主干架构

在本小节中，我们重新审视了长跳跃连接设计，并基于第 3 节的基线设置，对主流主干架构系列进行了受控对比。我们在附录 C.1 和 C.2 中包含了关于位置嵌入、归一化和 VAE 的额外分析。

图 11：长跳跃连接（bao2023all）可以改善双流模型的性能-参数量权衡。基于 FLOPs 的额外分析见图 44，其他主干架构系列的结果见附录 C.7。

长跳跃连接

在早期层和后期层之间添加捷径。它们最初由 U-Net（ronneberger2015u）推广，后来被应用于 U-ViT（bao2023all）中的扩散模型。虽然已有研究表明它们能提升性能（bao2023all; li2024hunyuan; liu2024playground），但它们尚未被广泛应用于现代文生图模型。在图 11 中，我们通过训练基线的双流变体（第 3 节）来重新审视这一设计，这些变体在多种模型宽度（1152、1296、1440、1584 和 1728）下，分别采用和不采用长跳跃连接，同时保持所有其他配置不变。我们发现，长跳跃连接能持续提升不同规模模型的性能，这可能是由于增强了模型的表达能力。基于 FLOPs 的额外分析见图 44，其他主干架构的结果见附录 C.7。

主干架构系列

当今领先的模型在主干网络的选择上各不相同：有的采用交叉注意力，有的采用单流架构，还有的采用双流架构（详见第 2 节）。我们在多种模型宽度下（对于所有三种主干网络家族，宽度分别为 1152、1296、1440、1584 和 1728），同时保持所有其他模型配置不变，测量了交叉注意力、单流和双流主干网络的模型性能。图 12 绘制了模型性能与参数量的关系。我们观察到，双流主干网络实现了最佳的性能-参数量权衡。

图 12：主干网络家族。我们比较了不同模型规模下的交叉注意力、单流和双流主干网络（训练 FLOPs 分析见图 41）。我们发现双流主干网络实现了最佳的整体性能。

第 5 节 数据

除了模型架构之外，高质量的图像-标题数据对于文生图训练也很重要。在本节中，我们首先研究合成标题的设计，并表明在长标题上训练能产生更强的模型，但可能导致在短提示词上表现不佳，我们通过在推理时进行提示词重写来缓解这一问题。接着，我们探索了数据集混合，并发现跨数据集等权重分配是一个稳健的默认方案。

5.1 合成标题与提示词重写

文生图模型中的提示词遵循能力从根本上依赖于训练数据中高质量的图像-标题对。早期的工作，如 Parti (yu2022scaling) 和 DALL-E 3 (betker2023improving)，表明在由视觉语言模型生成的高度描述性合成标题上进行训练可以显著提升性能。自那以后，大多数文生图模型 (chen2024pixart; esser2024scaling; qin2025lumina; xie2025sana) 都在训练中利用了合成标题。

在此，我们探讨了合成字幕生成中的若干设计选择及其对模型性能的影响（更多结果见附录 D.1）。我们特别发现，使用长合成字幕进行训练能产生更强的模型，但这些模型在短提示词上可能表现不佳，因此需要在推理时进行提示词重写。为降低字幕生成的计算成本，本节所有实验均在 ImageNet-22K 数据集上进行，而非默认基线设置（第 3 节）中使用的完整训练集。

为探究字幕质量如何影响下游文生图性能，我们使用五种视觉语言模型生成字幕：Qwen2-VL 2B、Qwen2.5-VL 3B、Qwen3-VL-2B、Qwen3-VL-4B 和 Qwen3-VL-30B-A3B。如图 13 所示，合成字幕生成器的选择对下游文生图性能有显著影响。我们注意到，LongText 上的微小差异主要源于在 ImageNet-22K 上训练的模型整体文本渲染能力较差，因为该数据集包含的文本丰富图像很少。因此，这一结果并不意味着字幕生成器的质量对文本渲染不重要。

图 13：合成字幕生成器的选择对下游文生图性能至关重要。由于资源限制，我们仅在 ImageNet-22K 图像上生成字幕并进行训练，而非使用完整图像数据集。

默认情况下，我们仅使用长合成字幕训练模型（见第 3 节）。虽然我们的模型在原始 DPG 和 LongText 提示词上能取得强劲性能，但在原始 GenEval 提示词上表现不佳。我们发现，这可能是由于 GenEval 中的提示词比 DPG 和 LongText 短得多（见图 35）：仅将 GenEval 提示词重复 12 次就能带来性能的大幅提升（0.17 提升至 0.49）。这一观察结果表明，在原始短 GenEval 提示词上的糟糕表现可能源于仅使用长字幕进行训练。

图 14：在 T5Gemma 分词器下，ImageNet-22K 字幕（10K 随机子集）以及原始、重复和重写后的 GenEval 提示词的序列长度。

为了进一步理解这一点，我们使用提示词“用一句话描述该图像”生成了另一组短描述。提示词长度的分布如图14所示。我们将这些短描述与原始长描述按不同采样权重混合，并在表5中报告了由此得到的GenEval评分。我们观察到：(1) 主要使用短描述进行训练（例如，长描述占比0%或20%）能提升在原始短GenEval提示词上的表现；(2) 当GenEval提示词被重复时，训练数据中长描述比例越高的模型表现越好。

媒体内容 · 前往原文查看

训练描述中长描述的占比 GenEval提示词上的表现

原始提示词（短） 重复提示词 重写提示词（长）

4 12 20

0% 0.47 0.55 0.34 0.24 0.60

20% 0.47 0.54 0.53 0.50 0.67

40% 0.35 0.59 0.55 0.54 0.70

60% 0.37 0.60 0.57 0.54 0.73

80% 0.26 0.57 0.54 0.47 0.73

100% 0.17 0.48 0.49 0.46 0.73

表5：训练描述与推理提示词的长度应保持一致（每个数字均为GenEval评分）。我们完全使用长描述训练的模型在短GenEval提示词上表现不佳，但通过重复短GenEval提示词或应用基于大语言模型的重写，可以恢复较强的性能。总体而言，仅使用长描述进行训练，并利用基于大语言模型的提示词重写来增加推理提示词长度，可获得最佳性能。

虽然重复短提示词可以恢复性能，但这会引入不自然的提示词结构。为解决此问题，我们改用一个大语言模型（Qwen3-4B），通过以下元提示词对GenEval提示词进行重写：

“我有一个简短的文生图提示词 {prompt}。请将其扩展为一段描述性文字，同时确保生成的图像仍然清晰地包含原始提示词中提到的所有内容。请仅输出重写后的提示词，不要输出其他任何内容。”

如表 5 最右列和图 15 所示，改写 GenEval 提示词能显著提升模型性能。值得注意的是，使用长描述进行训练并在改写后的提示词上进行评估（0.73），其表现明显优于使用短描述训练并在原始、重复或改写后的提示词上进行评估。这表明，即使推理提示词原本较短（例如 GenEval），也更倾向于使用长描述进行训练，并通过增加推理提示词长度（例如通过提示词改写）来匹配训练分布，而不是使用短描述训练来匹配原始的推理提示词长度。

提示词：一张葡萄酒杯和一只熊的照片

提示词：一张停车计时器右侧斑马的照片

训练：短描述，测试：原始（短描述） 训练：长描述，测试：原始（短描述） 训练：长描述，测试：重复 12 次（长描述） 训练：长描述，测试：改写后（长描述）

图 15：来自在 ImageNet-22K 描述变体上训练并在 GenEval 提示词变体上测试的模型示例。使用长描述进行训练会导致在短提示词上性能较弱，但提示词重复和改写可以缓解这一问题。

5.2 数据混合

到目前为止的所有实验都是将所有数据集简单组合，没有进行显式的数据集级别加权。由于我们的训练语料库（见第 3 节）高度不平衡（例如，YFCC 在 1.68 亿张图像中贡献了 9800 万张），我们隐式地将更大的权重分配给了少数几个大型数据集，这可能会主导训练信号。在本小节中，我们研究数据集组成和数据集级别重新加权如何影响性能。

数据集组成部分的贡献

为了理解每个数据集对性能的贡献，我们在每个数据集上分别训练了一个模型。评估结果如图 16(a) 所示。在真实图像数据集中，ImageNet-22K 和 YFCC 取得了最佳的整体性能，而 iNaturalist 的表现则明显较差，这可能是由于其领域范围狭窄所致。FLUX-Reason 和 GPT-Edit 在 PRISM 上的表现尤为出色。除 TextAtlas 外，每个数据集在 LongText 上的得分都很低，这与真实和合成数据集中包含文本的图像稀缺的情况一致。这表明文本渲染能力依赖于专门的、富含文本的数据集。为了控制数据集大小，我们进一步在每个数据集的随机 100 万子集上训练模型。如图 16(b) 所示，相对性能趋势与完整数据集的情况基本保持一致。

(a) 完整数据集

(b) 100 万子集

图 16：单数据集训练的基准测试性能。在真实数据集中，ImageNet-22K 和 YFCC 表现最佳，而 iNaturalist 表现最差。文本渲染能力强烈依赖于专门的、富含文本的图像数据集（例如 TextAtlas）。在大多数数据集中，将每个数据集子采样至 100 万后，性能变化微乎其微。

此外，我们测试了是否可以在不损害性能的情况下，从基线（第 3 节）中移除真实数据、合成数据或文本渲染数据。如图 17 所示，移除真实图像会损害 DPG 性能，而移除合成图像则会损害 PRISM 性能。此外，LongText 性能与文本渲染数据的比例直接相关（“完整”为 10.4%，“移除真实”为 66.7%，“移除合成”为 10.9%，“移除文本”为 0%）。这些结果表明，这三组图像提供了互补的益处。

图 17：真实图像、合成图像和文本渲染图像对模型性能都至关重要。移除其中任何一种都会导致至少在一个基准测试上的性能下降。

数据集等权重

默认情况下（第 3 节），我们简单地将所有数据集合并，不进行显式的数据集级别加权，因此每个数据集的有效采样权重就是其图像数量。受 VLM 训练中对单一来源数据点数量设置上限的数据平衡策略启发（tong2024cambrian），我们使用四个手动选取的阈值对每个数据集的采样权重进行上限设定。图 18 的结果显示，阈值为 120 万（即所有数据集权重相等）时，整体性能表现强劲。

图 18：基于阈值的加权。默认情况下，数据集的采样权重是其图像数量。我们通过将所有权重上限设定为四个手动选取的阈值，来探索数据集级别的平衡。我们发现，较低的阈值（即更均衡的权重）通常能带来更强的性能。

鉴于数据集等权重分配的有效性（见图 18），我们进一步探索了两种简单变体。首先，我们逐一移除低质量的真实数据集，同时保持其余数据集权重相等。表 6 显示，移除 iNaturalist 在所有基准测试中均带来了明显提升，而进一步移除其他真实数据集则没有带来实质性改善。其次，在移除 iNaturalist 之后，我们测试了是否应通过将某个数据集的权重提高 3 倍或 5 倍，同时保持其余数据集权重相等，来强调该单一数据集。如图 19 和图 46 所示，提高任何单一数据集的权重都无法超越完全平衡数据集的性能。

媒体内容 · 前往原文查看

数据集 DPG PRISM LongText

完整 85.14 58.2 0.335

移除 iNaturalist 85.56 58.7 0.384

移除 iNaturalist + Megalith 85.13 59.0 0.438

移除 iNaturalist + Megalith + Places 85.18 57.9 0.453

表 6：在等权重条件下，基于单数据集结果（图 16）逐一移除最弱的真实图像数据集。移除 iNaturalist 提升了所有基准测试分数，而进一步移除 Megalith 和 Places 则没有改善。

图 19：与所有数据集等权重的基线相比，将单一数据集权重提高 3 倍（图 46 中为 5 倍）带来的性能变化。在所有情况下，提高任何数据集的权重均未优于精确的等权重分配。

数据规模

图 16 提供了初步证据，表明对数据集进行子采样通常对模型性能影响甚微。为了探究性能在多大程度上依赖于训练集中独特图像的数量，我们还在 ImageNet-22K 的随机子集上进行了训练。如图 20 所示，尤其是在每张图像使用 5 条描述的情况下，将图像数量从 1370 万子采样至 40 万仅会导致轻微的性能下降。只有当图像数量缩减至 10 万时，我们才观察到显著的性能下降。由于我们的 50 万步训练方案已经将完整的 ImageNet-22K 数据集重复了 18.7 次，这些结果表明，对于文生图扩散模型而言，使用更少的独特图像并更频繁地重复它们，可能不会显著损害模型性能。

图 20：对 ImageNet-22K 数据集进行子采样对性能影响很小；仅在图像数量降至 10 万时性能才会显著下降。在有限图像数据条件下，每张图像使用更多描述能带来更强的性能提升。

媒体内容 · 前往原文查看

每个数据集的子集大小 已见独特图像数量 DPG PRISM LongText

完整 8810 万∗ 85.56 58.7 0.384

100 万 1100 万 85.34 57.7 0.384

40 万 440 万 84.67 57.7 0.382

10 万 110 万 84.71 57.4 0.349

表 7：对混合数据集进行子采样。从最终的数据方案（即除 iNaturalist 外所有数据集等权重）开始，我们将每个数据集子采样至包含固定数量的图像。即使将每个数据集子采样至 40 万张图像（即已见独特图像从 8810 万张降至 440 万张），模型性能也仅轻微下降。∗这些数据集总共包含 1.629 亿张图像，但训练期间每个数据集仅被采样 2330 万次，这包含了重复采样的图像。由于 YFCC 数据集未被完全遍历，8810 万更能准确估计已见独特图像的数量。

我们进一步将单个数据集上的数据子采样实验扩展到了数据集混合场景。具体来说，我们从一种数据混合方案开始，该方案对除 iNaturalist 之外的 11 个数据集赋予相同权重。对于混合中的每个数据集，我们随机对其进行子采样，使其恰好包含 1.0M、0.4M 或 0.1M 张图像，同时保持各数据集之间的采样权重相等。由此产生的模型性能如表 7 所示。即使每个数据集缩减到 0.4M 张图像（导致看到的唯一图像数量为 4.4M，而非 88.1M），各基准测试的性能下降也微乎其微。这表明，在多样化的数据集混合中，重复训练数据在文生图扩散模型训练中仅会导致边际性能损失。

第 6 节 i1-3B：完全开放模型中的顶尖性能

(a) 整体架构

(b) 一个 Transformer 块

图 21：我们最终 i1 模型的架构。基于 MMDiT 主干，我们使用了一个由 2 个 Transformer 块组成的大型文本编码器适配器，移除了噪声条件化（即 AdaLN），添加了长跳跃连接，结合了正弦和 RoPE 位置嵌入，并在文本和图像流之间共享了夹层归一化。

在前面的章节中，我们探索了能够提升文生图性能的建模和数据处理方案。基于这些见解，我们训练了 i1，一个拥有 3B 参数的模型，其在多个代表性基准测试中与领先模型性能相当。111我们还在额外训练一个 1B 模型，并将很快发布。在本节中，我们将描述最终的预训练、高分辨率训练和推理设置及实验，并展示评估结果。

6.1 低分辨率预训练

模型

i1 的架构如图 21 所示。它采用带有长跳跃连接的双流 MMDiT 主干网络、FLUX.2 VAE 以及 T5Gemma-2B 作为文本编码器，并配有一个由两个 Transformer 模块组成的大型适配器。i1 移除了所有 AdaLN 参数，因此不使用噪声条件化。此外，我们同时使用了正弦位置嵌入和 RoPE 位置嵌入，并在文本流和图像流之间共享 Sandwich 归一化（相应的对照实验见附录 C.1）。

数据

我们采用了第 5.2 节中确定的最佳数据混合方案，其中对 6 个真实图像数据集、3 个合成数据集和 2 个文本渲染数据集分配了相同的权重。我们使用 Qwen3-VL-30B-A3B 为每张图像生成多个长合成描述。由于资源限制，我们为 ImageNet-22K、Pexels、RenderedText、GPT-Edit、RedCaps、FLUX-Reason、TextAtlas 和 Midjourney v6 每张图像生成五条合成描述，为 YFCC 每张图像生成两条，为 Places 和 Megalith 每张图像生成一条。

图 22：i1 在 256 分辨率预训练期间的基准性能。性能在大约 50 万次迭代后趋于稳定，并在 200 万次迭代时基本收敛。评估遵循对照实验中使用的设置（第 3 节）。

提示词：阿根廷足球巨星莱昂内尔·梅西在 2022 年 FIFA 世界杯决赛对阵法国队的激烈比赛中。他……正准备用左脚射门……（240 词）

提示词：一张吸引人的海报……宣布一场民谣音乐会活动……在顶部中央，写着诱人的短语“让原声旋律启迪你的灵魂”……（109 词）

10 万次迭代 20 万次迭代 50 万次迭代 200 万次迭代

图 23：在 256 分辨率训练的不同迭代阶段生成的示例图像。整体图像质量和文本渲染能力在整个训练过程中持续提升，这与基准分数的提高相一致。

训练

我们将默认训练方案（第3节）中的训练迭代次数延长至200万步，同时保持所有其他超参数不变。我们以256分辨率训练i1，直到性能在大约200万步时趋于稳定，如图22所示。我们还在图23中展示了示例生成图像，并观察到基准测试的改进伴随着图像质量的提升。训练设置和计算资源的详细信息见附录A.1。

6.2 高分辨率训练

数据与建模

。为了构建512和1024分辨率的训练集，我们仅保留短边分别至少为512或1024像素的图像。如果过滤后的集合包含少于30万张图像，我们将完全移除该数据集（每个数据集的分辨率统计信息见附录E.2）。基于我们在第5.2节中的发现，我们进一步对每个超过100万张图像的数据集进行子采样至100万张，并为每个数据集分配相等的采样权重。在1024分辨率下，我们因质量低下而丢弃了RenderedText数据集（见图16）。遵循esser2024scaling的方法，我们在512和1024分辨率训练期间执行位置索引插值和时间步调度偏移（详细信息见附录A.1）。

结果

。我们在512分辨率下训练模型50万步，在1024分辨率下训练30万步。训练期间的基准测试性能趋势见附录A.1，最终的1024分辨率检查点在6.3节中进行评估。如图24所示，512分辨率训练显著提高了LongText分数（0.75 → 0.92）。我们进一步在图25中通过定性示例展示了文本渲染方面的改进。

图24：i1在512分辨率下使用不同训练集的基准测试性能。即使未使用文本渲染数据，512分辨率训练也显著提升了PRISM和LongText的得分。

我们还研究了不同数据集组成部分对 512 分辨率训练的贡献。从 256 分辨率检查点出发，我们分别使用仅真实图像数据集、仅合成图像数据集或仅文本渲染数据集在 512 分辨率下训练单独的模型。如图 24 所示，仅使用真实或合成图像数据集进行训练，在 LongText 指标上取得的提升与使用完整数据集训练相当，尽管这两个子集包含的富文本图像数量有限。这表明，强大的高分辨率生成能力并不需要高分辨率训练数据来匹配低分辨率预训练数据的全部广度。

(a) 256 分辨率模型

(b) 512 分辨率模型

图 25：经过 512 分辨率训练后，文本渲染能力显著提升，如图所示，这些示例图像分别由我们的 256 分辨率和 512 分辨率检查点使用 LongText-Bench 中相同的输入提示词生成。

6.3 推理与评估

推理设置

。在推理过程中，我们使用 CFG 缩放系数 12，并应用 Rescale CFG 技术（lin2024common），重缩放强度为 1。与之前的方法（wang2024emu3; deng2025emerging; pan2025transfer）针对特定基准应用提示词重写不同，我们使用单个元提示词（详见附录 B.3）来重写所有输入提示词，使其匹配训练提示词长度，其动机已在第 5.1 节中阐述。

基准测试

。我们在近期图像生成模型技术报告（cai2025z; qin2025lumina; cai2025hidream; cui2025emu3）中常用的五个代表性基准上评估我们的模型：GenEval（ghosh2023geneval）、DPG-Bench（hu2024ella）、PRISM-Bench（fang2026flux）、CVTG-2K（du2025textcrafter）和 LongText-Bench（geng2025x）。GenEval 专注于以物体为中心的图像生成，并评估一组固定的物体属性和关系。DPG-Bench 和 PRISM-Bench 提供对通用提示词遵循能力的细粒度评估，其中 PRISM-Bench 还额外评估图像美学。CVTG-2K 和 LongText-Bench 评估模型生成包含可检测文本且该文本与输入提示词描述相匹配的图像的能力。

我们注意到，先前已有研究指出 GenEval 可能与人类判断存在偏差（kamath2025geneval），并且与人类感知的模型能力相关性较差（cao2025hunyuanimage）。此外，当前模型（chen2025blip3; ma2026deco; wang2026pixnerd）中普遍存在在 BLIP3o-60K（chen2025blip3）上进行微调的做法，这可能会虚高 GenEval 分数，因为研究发现 BLIP3o-60K 微调能显著提升 GenEval 分数，但对其他基准测试并无帮助（wu2025openuni）。因此，我们报告 GenEval 结果仅出于完整性考虑，并指出这些结果可能无法准确反映模型能力。

媒体内容 · 前往原文查看

模型 #参数量 GenEval DPG-Bench PRISM CVTG-2K LongText-Bench 仅 API 调用 GPT Image 1 [High] (gptimage1) - 0.84* 85.15* - 0.8569* 0.956* Seedream 3.0 (gao2025seedream) - 0.84* 88.27* - 0.5924* 0.896* 仅开放权重 FLUX.1 [Dev] (labs2025flux) 12B 0.66* 83.84* 65.1 0.4965* 0.607* SD3 Medium (esser2024scaling) 2B 0.62* 84.08* 61.9 0.4037 0.322 Janus-Pro-7B (chen2025janus) 7B 0.80* 84.19* 60.0 0.0667 0.019* BAGEL (deng2025emerging) 14B 0.88* 85.44 61.8 0.3642 0.373* HiDream-I1-Full (cai2025hidream) 17B 0.83* 85.89* 66.1 0.7738 0.543* Lumina-Image 2.0 (qin2025lumina) 3B 0.73* 87.20* 63.5 0.1577 0.088 Z-Image (cai2025z) 6B 0.84* 88.14* 74.2 0.8671* 0.935* Qwen-Image (wu2025qwen) 20B 0.87* 88.32* 73.9 0.8288* 0.943* 开放权重 + 数据 + 训练代码 BLIP3o-4B (chen2025blip3) 4B 0.77 79.73 53.2 0.0353 0.023 PixNerd (wang2026pixnerd) 1B 0.73* 80.9* 53.3 0.0006 0.020 DeCo (ma2026deco) 1B 0.86* 81.4* 53.1 0.0014 0.003 BLIP3o-N-S (chen2025blip3o) 3B 0.87 81.98 56.8 0.2493 0.110 BLIP3o-N-G-G (chen2025blip3o) 3B 0.90 81.93 57.5 0.2442 0.114 BLIP3o-N-G-T (chen2025blip3o) 3B 0.86 79.77 56.8 0.3330 0.153 i1 (Ours) 3B 0.84 86.73 70.1 0.8531 0.922

表 8：代表性文生图基准测试性能。标有 * 的结果来自先前论文（cai2025z; deng2025emerging; ma2026deco; wang2026pixnerd）。我们使用 Qwen2.5-VL-72B 复现了所有 PRISM 结果，因为官方结果（fang2026flux）与我们的复现结果始终存在差异。我们将 BLIP3o-NEXT 的 SFT、GRPO-GenEval 和 GRPO-Text 模型分别简称为“BLIP3o-N-S”、“BLIP3o-N-G-G”和“BLIP3o-N-G-T”。

结果

。我们在表 8 中将 i1 模型与领先的图像生成系统进行了比较。除 GenEval 外，i1 在所有五个基准测试中均达到了完全开放模型中的最先进性能。它还超越了多个领先的仅权重模型，包括 Lumina-Image 2.0、HiDream-I1 和 FLUX.1 [Dev]。i1 的强劲性能反映了我们整个研究中确定的建模和数据选择的综合效果。

第 7 节 讨论与结论

完全开放的配方支持文生图建模中的累积性研究。

当前文生图研究中的一个挑战是，强大的模型通常作为不透明的端点发布，而非可作为科学制品进行检验。因此，进展往往难以归因于各种（可能未公开的）设计因素。我们的研究倡导完全开放的配方，旨在理解哪些设计选择确实重要。通过发布 i1 背后的模型、代码、数据配方和消融实验，我们不仅希望提供一个强大的基线，也希望为更具累积性和可复现性的研究提供一个参考点。

强大的性能并不需要复杂的设计。

近期文生图模型的强劲性能可能会造成一种印象，即前沿能力需要日益专业化的架构、专有数据或高度工程化的配方。我们的研究提供了一个反例：使用规模适中（例如 440 万，见第 5.2 节）且公开可用的数据集，并结合对当前建模设计空间的仔细探索，即可实现强劲性能。我们认为这对开放研究来说是令人鼓舞的，因为具有竞争力的文生图模型无需从难以获取的数据或未公开的训练流程起步。

局限性与未来工作

本工作存在若干局限性。首先，我们的评估主要依赖自动化基准测试，这些测试侧重于提示词遵循能力，而非人类偏好。因此，尽管 i1 在这些基准测试上接近领先的纯权重模型（例如 Qwen-Image），但其生成的图像在整体视觉质量上仍明显逊色（我们在附录 B.5 中展示了失败案例）。其次，受资源限制，所有实验均使用约 3B 参数或更小的模型进行。需要进一步实验来确定我们的发现在更大规模下是否仍然成立。第三，我们的探索仅覆盖了文生图扩散模型设计空间的一个子集：诸如多宽高比训练（我们正在开发多宽高比模型，并将很快发布）、数据过滤（startsev2026alchemist）、解码器专用 LLM 与扩散 Transformer 在文本编码方面的深度融合（liu2024playground; shi2026lmfusion）以及强化学习（wallace2024diffusion; liu2026flow）等设计均未涉及。未来的工作可以将我们的方案扩展到更大的模型，并在保持整体流程简洁性和开放性的同时，进一步探索设计空间。

致谢

我们衷心感谢 Google TPU 研究云（TRC）项目为本项目提供主要计算资源。普林斯顿大学的普林斯顿研究计算资源提供了额外支持，这些资源由普林斯顿计算科学与工程研究所（PICSciE）和研究计算部门领导的联合小组管理。我们要感谢 Liang-Chieh Chen、Ishan Misra、Kaiming He、Yida Yin、Haozhe Chen、Wenhao Chai、Linrong Cai、Linzhan Mou 和 Xingyu Fu 提供的宝贵讨论和反馈。我们还感谢 Yufeng Xu、Shengbang Tong、Yiyang Lu 和 Hanhong Zhao 在 TPU 方面的有益讨论。我们感谢 Cihang Xie 的研究小组分享他们的 JAX DiT 代码库，该代码库是我们研究的起点。

参考文献

附录

附录 A 实现细节

在本节中，我们提供关于建模和训练配置的更多细节。

A.1 配置

硬件

我们的模型训练和推理在 TPU v4、v5p 和 v6e 上使用 JAX（jax2018github）进行。基准评估则在 NVIDIA A100、H100 和 H200 GPU 上执行。

通用配置

我们的默认基线模型主要沿用此前扩散模型（peebles2023scalable; yao2025reconstruction）中使用的 XL/2 模型配置，即隐藏层大小为 1152、16 个注意力头、MLP 比率为 4.0、补丁大小为 2。不过，与这些模型不同的是，我们使用了 29 层而非 28 层。默认情况下，在训练和推理过程中，我们将文本编码器保持为 bf16，同时将所有其他参数保持为 fp32。为确保模型能够装入内存，我们使用 JAX pjit/GSPMD（xu2021gspmd）跨设备对模型参数和优化器状态进行分片，遵循 ZeRO 风格的全分片数据并行（rajbhandari2020zero）。

媒体内容 · 前往原文查看

配置 值

优化器 Adam

学习率 1e-4

权重衰减 0

优化器动量

批量大小 512

学习率调度 常数

梯度裁剪 1

训练目标 流匹配

训练步数 500K

训练时间步分布 lognorm(0, 1)

推理时间步偏移值（esser2024scaling） 0.3

推理步数 250

CFG 缩放（ho2022classifier） 12

CFG 重新缩放强度（lin2024common） 0

CFG 区间（kynkaanniemi2024applying） [0, 1]

表 9：第 4 节和第 5 节中所有 256 分辨率受控实验的训练和推理配置。

256 分辨率受控实验

表 9 总结了第 4 节和第 5 节中所有受控实验的训练配置。所有模型均训练 500K 次迭代，但由于不同实验使用了不同的模型组件，训练时间有所不同。对于交叉注意力基线，在 TPU v6e-64 机器上，500K 步需要 31.0 小时。

媒体内容 · 前往原文查看

训练阶段 图像数量 训练步数 批量大小 训练时间步偏移值（esser2024scaling） TPU v5p-128 小时

256 分辨率 162.9M 2.0M 512 不适用 383.0

512 分辨率 9.7M 0.5M 512 不适用 174.4

1024 分辨率 4.3M 0.3M 128 3.33 150.9

表 10：最终 i1 模型在每个训练阶段的训练配置和计算资源。

i1 训练

在表10中，我们详细列出了最终i1模型在每个训练阶段的训练配置和计算资源。所有未指定的配置均与表9保持一致。高分辨率训练阶段各迭代轮次的基准性能趋势如图26所示。我们观察到，512分辨率训练显著提升了PRISM和LongText上的性能，而1024分辨率训练的效果较小，其性能与初始化所用的512分辨率检查点相近。对于1024分辨率训练，我们额外比较了使用时间步偏移值3.33训练的模型与未使用时间步偏移训练的模型，发现应用训练时间步偏移能持续提升性能。

(a) 512分辨率训练

(b) 1024分辨率训练

图26：i1在高分辨率训练阶段的基准性能。PRISM和LongText在512分辨率训练期间显著提升，而1024分辨率训练对基准分数的影响较小。对于1024分辨率训练，我们比较了使用时间步偏移值3.33训练的模型与未使用时间步偏移训练的模型，发现训练时间步偏移能持续提升性能。

A.2 基线架构

如第3节所述，我们在第4节和第5节中的控制实验均基于固定的基线架构。我们每次只改变一个设计选择，同时保持所有其他配置与基线相同。虽然我们在基线中默认使用交叉注意力主干，但我们也在单流和双流主干上额外验证了一些设计选择。在本节中，我们提供三种主干架构的图示。

交叉注意力主干

通过插入在自注意力和前馈网络层之间的交叉注意力层，将文本条件信息传递给主干。该架构如图27所示。

(a) 整体架构

(b) 一个Transformer块

图 27：我们交叉注意力基线模型的架构。对于交叉注意力主干系列，文本条件信息通过插入在自注意力层和前馈网络层之间的交叉注意力层传递给主干网络。

单流主干

将文本特征和带噪图像特征沿序列维度拼接，并使用一组主干权重处理整个序列。该架构如图 28 所示。

(a) 整体架构

(b) 一个 Transformer 块

图 28：我们基线模型单流变体的架构。对于单流主干系列，文本特征和带噪图像特征沿序列维度拼接，并使用一组注意力权重和 MLP 权重进行处理。

双流主干

将文本特征和带噪图像特征沿序列维度拼接，但对文本 token 和图像 token 使用不同的主干参数。该架构如图 29 所示。

(a) 整体架构

(b) 一个 Transformer 块

图 29：我们基线模型双流变体的架构。对于双流主干系列，文本特征和带噪图像特征沿序列维度拼接，并使用独立的、按模态区分的注意力权重和 MLP 权重进行处理。

A.3 文本编码器详情

模型版本。对于所有 T5Gemma 模型，我们使用 UL2（tay2023ul）变体，因为它具有更好的编码器表示（zhang2025encoder）。对于 T5Gemma-9B 模型，我们使用带有 2B 解码器的变体，而非带有 9B 解码器的变体。对于 FG-CLIP 2 模型，我们使用“长”模式。

截断。遵循主流实现（esser2024scaling; blackforestlabs_flux2_2025; cai2025z; wu2025qwen），我们对文本分词器采用右侧截断。除 FG-CLIP 2 外，所有文本编码器均截断至 256 个 token；FG-CLIP 2 截断至 196 个 token，因为其训练数据最多包含 196 个 token。

隐藏状态。

. Following mainstream implementations (esser2024scaling; blackforestlabs_flux2_2025; cai2025z; wu2025qwen), we use right truncation for the text tokenizers. We truncate to 256 tokens for all text encoders except FG-CLIP 2, which we truncate to 196 tokens because it is trained on up to 196 tokens.

Hidden states

对于编码器-解码器模型（即 T5Gemma 和 T5Gemma2 系列），我们使用编码器最后一层的隐藏状态作为文本 token 特征。对于仅解码器模型（即 Qwen3 和 Qwen3-VL 系列），我们使用最后一个 Transformer 层的隐藏状态作为文本 token 特征。默认情况下，我们直接将文生图提示词输入文本编码器以获取特征。此前的一些工作（ma2024exploring; xie2025sana; wu2025qwen）对 LLM/VLM 文本编码器应用了系统提示词；我们在附录 C.4 中消融分析了系统提示词的影响。

附录 B 推理与评估补充信息

B.1 与 Stable Diffusion 3 Medium 的定性对比

在图 2 和图 3 中，我们展示了由 i1 模型生成的精选示例图像。在图 30 和图 31 中，我们额外提供了四个精心挑选的模型生成示例，并将其与使用相同提示词由 Stable Diffusion 3 Medium 生成的图像进行了对比。

提示词：美国女演员维罗妮卡·莱克（1922-1973）坐在扶手椅上，身穿白色围裙裙搭配红色衬衫，正全神贯注地阅读一本书，营造出约 1955 年的场景氛围。

(a) Stable Diffusion 3 Medium

(b) i1（我们的模型）

提示词：一间明亮、温馨的面包店内部，在温暖柔和的晨光中拍摄，展示了一块诱人的、质朴木框黑板菜单，醒目地放置在白砖墙前。黑板中央，用优雅的手绘大号字体清晰写着“今日特供：酸面包与肉桂卷”。在这条中央信息正下方，较小的文字工整地标注着“每日清晨新鲜烘焙”。黑板右上角，以俏皮的草书字体隐约写着“用心手工制作”。菜单边框周围，略带褪色、复古风格的小麦穗和糕点插画，巧妙地勾勒出文字，增强了手工面包店的氛围。主黑板旁边立着一块较小的木牌，上面手写着“免费试吃供应！”，并配有一个装饰性箭头，引导顾客前往展示柜台。文字元素清晰、别致，且为自然手写风格，唤起一种真实的手工感，完美衬托了这家面包店诱人的氛围。

图 30：与 Stable Diffusion 3 Medium 的定性比较。

提示词：一幅由 David Forks 创作的名为“午夜之月”的宁静油画，捕捉了在明亮满月下，一个孤独的身影立于岩石海岸的场景，以戏剧性的光影和深蓝色调渲染，唤起一种沉思且富有氛围的情绪。

(a) Stable Diffusion 3 Medium

(b) i1（我们的模型）

提示词：一幅当代艺术风格电影海报，采用极简且富有冲击力的文字排版。顶部居中位置，以粗体、流畅字体书写的标题“最后的航程”置于一艘古老帆船迎向汹涌波涛的微妙剪影之上。剪影正下方，以稍小字体呈现一句引人入胜的宣传语：“当勇气意味着驶向未知”。海报下半部分中央，以清晰的水平排列方式，整齐地列出了关键信息：“由获奖导演亚历克斯·里弗斯执导”、“艾米莉·克拉克与雅各布·班尼特联袂主演”、“丹尼尔·哈珀原创配乐”。在最底部，以简洁的大写字母清晰分隔，上映信息写道：“2023年10月6日 全球影院上映”。左下角有一行较小的斜体细线文字：“你敢于踏上这段旅程吗？”

图31：与Stable Diffusion 3 Medium的定性比较（续）。

B.2 在不同推理设置下评估其他模型

i1的推理设置（见第6.3节）使用了12的CFG尺度，这高于许多现有文生图扩散模型的默认值。例如，PixArt-（chen2024pixart）使用的默认CFG尺度为4.5，Lumina-Image 2.0（qin2025lumina）使用4，SANA（xie2025sana）使用4.5，Stable Diffusion 3（esser2024scaling）使用7。此外，我们使用了一个自定义的元提示词用于推理时的提示词重写。这些选择可能引发疑问：我们的推理设置是否使我们的方法相比基线模型具有不公平的优势。为了检验这一点，我们在替代推理设置下评估了Lumina-Image 2.0和Stable Diffusion 3 Medium，包括更大的CFG尺度以及使用我们的元提示词重写后的提示词（见附录B.3）。结果如表11所示。我们发现，无论是增大CFG尺度还是使用重写后的提示词，都未能显著提升这两个模型的性能。

媒体内容 · 前往原文查看

提示词 CFG尺度 DPG PRISM LongText

原始 4 87.20 63.5 0.088

8 87.39 60.7 0.100

12 87.56 60.9 0.101

16 87.84 58.6 0.107

重写后 4 85.37 63.1 0.092

(a) Lumina-Image 2.0

提示词 CFG尺度 DPG PRISM LongText

原始 7 84.08 61.9 0.322

8 85.49 61.2 0.341

12 84.94 56.2 0.361

16 82.82 50.1 0.368

重写后 7 84.43 61.0 0.313

(b) Stable Diffusion 3 Medium

表 11：使用更高 CFG 尺度和重写提示词的其他模型评估（参见附录 B.3）。我们观察到，这两种设置均未对性能产生实质性影响。灰色阴影行显示默认推理设置。

B.3 用于提示词重写的元提示词

在第 5.1 节中，我们发现，在短描述上训练会导致整体模型较弱，而在长描述上训练则能产生更强的模型，但会导致在短提示词上表现不佳。提示词重写可以通过扩展短推理提示词来缓解这种训练-推理提示词长度不匹配的问题，使得即使在原始推理提示词较短的情况下，在长描述上训练也优于在短描述上训练。对于表 5 中的实验，我们使用了一个简单、极简的元提示词，将较短的 GenEval 提示词扩展为更长的提示词。

然而，始终指示提示词重写 LLM 扩展输入提示词可能并非最优方案，因为推理提示词的长度是可变的，甚至可能比训练描述还要长。因此，我们设计了一个更全面的元提示词，指示模型根据输入提示词的复杂程度遵循两套不同的指导原则。在元提示词的末尾，我们还额外包含了 20 对人工编写的原始提示词与重写提示词作为上下文示例，以引导 LLM。

包含这 20 个上下文示例的元提示词如下所示。

B.4 推理步数的消融实验

在第 4 节和第 5 节的受控实验以及表 8 中对 i1 的评估中，我们将推理步数固定为 250。然而，我们注意到，要实现强大的模型性能，250 步并非必需。在图 32 中，我们使用 5、10、20 和 50 个推理步数评估了 i1 模型的性能，并在图 33 中展示了一个定性示例。我们观察到，可以将推理步数减少至低至 20 步，而不会显著损害生成质量。

图 32：推理步数对模型性能的影响。即使采样步数显著减少，i1 模型仍能保持强劲性能，当步数降至 20 时仅出现轻微性能下降。

10 20 250

图 33：随着推理步数减少，视觉质量呈现优雅降级。即使仅使用 10 个推理步数，生成的图像仍保持合理可信。

B.5 i1 的失败案例

尽管 i1 性能强劲，但我们注意到该模型仍存在若干重要失败案例，如图 34 所示。如图 34(a) 所示，特别是在需要生成群体场景中的多个小人像时，i1 有时会生成保真度较低的人脸、不自然的面部表情，以及畸形的手部或肢体。此外，i1 并不总能遵循物理属性，有时会生成物理上不合理的图像。图 34(b) 提供了这样一个例子：i1 未能捕捉镜子的物理特性，因为反射图像显示镜子与车窗平行，这在物理上是不一致的。

(a) 提示词：在古树斑驳的树荫下，一家人聚集在法国乡村的怀抱中，他们的笑声在自然的轻柔低语和共享时光的温暖中，编织出一幅永恒连接的画卷。

(b) 提示词（截断）：在一个潮湿阴天，一位女性的倒影被捕捉在汽车侧视镜的黑色边框内。她正在自拍，手持一部智能手机，手机壳独具特色，白色底面上印有绿色龟背竹叶图案。

图 34：i1 生成失败的示例。左图显示了一个群体场景，其中 i1 未能高保真地生成人脸和手部。右图展示了一个案例，其中 i1 未能遵循镜子的物理特性，生成了不合理的反射效果。

B.6 各基准测试的提示词长度分布

在图 35 中，我们可视化了 i1 最终评估（见表 8）所用基准测试的提示词长度分布。我们观察到，GenEval 的提示词比其他基准测试短得多。这促使我们在分析仅使用长描述训练的模型在短提示词上表现不佳时，重点关注 GenEval，以及相应的缓解技术（见第 5.1 节）。

图 35：本文使用的五个基准测试的提示词长度分布，通过 T5Gemma tokenizer 以 token 序列长度衡量。GenEval 的提示词明显比其他基准测试短，这促使我们在第 5.1 节中重点关注 GenEval，以研究短提示词上的性能以及推理时的提示词增强。

附录 C 关于建模设计的额外结果

在第 4 节中，我们通过控制实验得出了关于建模设计的几个结论。在此，我们在附录 C.1 和 C.2 中提供额外的实验结果，这些结果支撑了最终 i1 模型中使用的位置编码、归一化和 VAE。在其余小节中，我们提供额外的结果和分析，以验证我们在第 4 节中得出的结论在替代设置下依然成立。

C.1 位置编码与归一化

在我们的最终 i1 模型中，我们同时使用了正弦位置编码和 RoPE 位置编码，采用了三明治归一化，并在 MMDiT 的文本和图像流之间共享归一化层。我们在下面描述了促使这些设计选择的实验。

图 36：对于交叉注意力和双流主干系列，结合两种位置编码相比仅使用正弦编码或仅使用 RoPE 编码，能带来更优的性能。

位置编码

当前的文生图扩散模型通常只使用一种位置嵌入（例如正弦位置嵌入（esser2024scaling）或旋转位置编码（cai2025z; wu2025qwen; qin2025lumina））。受 LightningDiT（yao2025reconstruction）设计的启发，我们探索了将正弦位置嵌入和旋转位置编码相结合是否能提升扩散 Transformer 的文生图性能。如图 36 所示，将两者结合能显著提升交叉注意力模型和双流模型的基准测试性能。因此，我们在最终的 i1 模型中同时使用了正弦位置嵌入和旋转位置编码。

图 37：三明治归一化在所有骨干架构上的性能均优于标准前归一化。

归一化

尽管前归一化（xiong2020layer）（即对注意力模块和前馈网络模块的输入进行归一化）一直是扩散 Transformer 的主流选择，但早期工作（ding2021cogview）引入了三明治归一化（即同时对注意力模块和前馈网络模块的输入和输出进行归一化）以稳定训练，该方法近期已被 Z-Image（cai2025z）采用。我们将三明治归一化引入基线模型，如图 37 所示，并发现它能在不同骨干架构和基准测试中稳定地提升性能。

媒体内容 · 前往原文查看

模型 DPG PRISM LongText

共享归一化 86.82 58.3 0.439

独立归一化 86.16 57.6 0.415

表 12：MMDiT 中文本和图像流的共享归一化。虽然按模态进行归一化是 MMDiT 的标准做法，但我们发现跨模态共享归一化参数能提升性能。

此外，虽然为文本和图像模态使用独立的归一化层是现有 MMDiT 模型（esser2024scaling; cai2025hidream; wu2025qwen）的默认做法，但我们探索了跨模态共享归一化层所带来的更统一的特征分布是否有利于模型性能。如表 12 所示，共享归一化确实能持续提升性能。

C.2 变分自编码器

媒体内容 · 前往原文查看

VAE DPG PRISM LongText

FLUX.2 84.66 56.4 0.211

Qwen-Image 83.29 54.3 0.266

VA-VAE 85.07 55.5 0.126

表 13：VAE 对比。FLUX.2 VAE 在所有基准测试中表现最为均衡。

我们将 VA-VAE（yao2025reconstruction）与前沿模型 FLUX.2（blackforestlabs_flux2_2025）和 Qwen-Image（wu2025qwen）中使用的 VAE 进行了比较。总体而言，FLUX.2 在所有基准测试中取得了最均衡的性能。可能由于其在训练过程中与预训练语义特征的对齐，VA-VAE 在 DPG-Bench 上取得了最强性能，该基准侧重于生成图像与提示词之间的语义对齐。然而，在评估细粒度文本渲染的 LongText 基准上，它的表现远逊于其他模型。这可能是由于其较低的重建保真度所致。

原始图像 FLUX.2 VAE Qwen-Image VAE VA-VAE

图 38：VAE 在富含文本图像上的重建定性示例。与 FLUX.2 VAE 和 Qwen-Image VAE 不同，VA-VAE 在字符上引入了明显的失真和损坏。这种较差的重建能力可能解释了使用 VA-VAE 时 LongText 性能较低的原因（表 13）。

从量化角度来看，先前的工作（wu2025qwen; yao2025reconstruction）报告称，在 256×256 分辨率的 ImageNet 验证集上，VA-VAE 的重建性能（PSNR 27.96，SSIM 0.79）低于 FLUX.2 VAE（31.46，0.90）和 Qwen-Image VAE（33.42，0.92）。在图 38 中，我们进一步提供了在富含文本图像上的定性重建示例。虽然 FLUX.2 VAE 和 Qwen-Image VAE 能够忠实地重建，但 VA-VAE 在渲染的字符中引入了可见的损坏和失真。造成这一局限的一个可能原因是，VA-VAE 是在缺乏富含文本图像的 ImageNet（deng2009imagenet）上训练的。

C.3 在替代设置下比较文本编码器

更大的适配器

在 4.2 节中，我们在默认基线模型上使用小型 MLP 适配器对文本编码器候选方案进行了比较。然而，正如我们在 4.1 节中后续展示的，适配器的大小对模型性能有显著影响。因此，在此我们额外探究：当我们使用由两个 Transformer 模块组成的更大文本编码器适配器（与最终 i1 方案一致）时，文本编码器之间的比较结果是否仍然成立。如图 39 所示，我们的观察结果基本保持不变：T5Gemma 和 T5Gemma2 系列的编码器-解码器模型表现最强，而 FG-CLIP 2 表现最弱。

图 39：使用更大适配器时，文本编码器在所有基准测试上的表现趋势，与默认设置下使用小型 MLP 适配器时的趋势相似（见图 8）。

移除 AdaLN

在我们的基线设置（第 3 节）中，池化后的文本嵌入与时间步嵌入相结合，并通过 AdaLN 传入主干网络。由于这为注入文本信息提供了额外路径，因此在最终 i1 方案中移除 AdaLN 可能会影响不同文本编码器的相对性能。我们在图 40 中展示了每个文本编码器的基准测试结果。我们观察到，整体趋势与使用 AdaLN 的默认设置（图 8）中的趋势高度相似。

图 40：移除 AdaLN 后，文本编码器在所有基准测试上的表现趋势，与默认设置中使用 AdaLN 时的趋势相似（见图 8）。

C.4 对文本编码器应用系统提示词

在默认设置（见附录 A.3）中，我们直接使用每个文本编码器处理原始提示词，并将最后的隐藏状态作为文本特征。虽然这种设置很常见（cai2025z），但先前的工作也设计了专门的提示词策略，用于将仅解码器语言模型用作文本编码器（ma2024exploring; xie2025sana）。在此，我们遵循 Qwen-Image（wu2025qwen）为 Qwen2.5-VL 文本编码器使用的策略，并将其应用于 Qwen3-VL-2B 和 Qwen3-VL-4B 文本编码器。

具体来说，我们将文生图提示词包裹在一条系统消息中（“通过详细描述物体和背景的颜色、形状、大小、纹理、数量、文字以及空间关系来描述图像：”），并将完整序列输入文本编码器。在前向传播之后，我们丢弃与系统前缀对应的隐藏状态，只保留与文生图提示词对应的部分。由此得到的性能如表 14 所示。我们观察到，使用系统提示词为 Qwen3-VL-2B 带来了小幅提升，但 Qwen3-VL 模型的性能仍不及 T5Gemma 和 T5Gemma2 模型。

媒体内容 · 前往原文查看

文本编码器 系统提示词 DPG PRISM LongText

Qwen3-VL-2B ✗ 82.29 52.2 0.076

✓ 82.82 52.8 0.093

Qwen3-VL-4B ✗ 82.07 52.9 0.071

✓ 82.41 52.4 0.065

表 14：对 Qwen3-VL 文本编码器应用系统提示词带来了小幅性能提升。

C.5 基于训练 FLOPs 比较骨干网络家族

在图 12 中，我们通过训练宽度为 1152、1296、1440、1584 和 1728 的交叉注意力、单流和双流模型，并绘制性能与模型大小的关系图，比较了不同的骨干网络家族。然而，根据实际的训练和推理设置，基于 FLOPs 比较性能可能更具参考价值。因此，在图 41 中，我们绘制了性能与可训练模型 FLOPs 的关系图。这些 FLOPs 是使用 JAX/XLA 的“cost_analysis”计算的，针对扩散模型中所有可训练模块（例如包括文本编码器适配器）的一次前向和反向传播。我们使用训练张量形状，并将结果按全局批次大小和训练步数进行缩放。双流骨干网络仍然实现了最佳的权衡。

图 41：骨干网络家族。我们比较了交叉注意力、单流和双流骨干网络在可训练模块的估计训练 FLOPs 上的表现。与图 12（我们绘制了性能与模型大小的关系）一致，我们发现双流骨干网络实现了最佳的整体性能。

C.6 在更大模型上验证建模设计

性能与模型大小的关系

在第4节和附录C.1中，除了我们在不同模型规模上验证过的骨干网络族对比和长跳跃连接外，我们主要使用XL/2尺寸的基线模型来识别建模设计发现。在图43中，我们通过在{1152, 1296, 1440, 1584, 1728}中每个宽度训练一个模型，进一步在多个模型规模的双流MMDiT模型上验证了这些发现。

在不同模型规模下，更大的文本编码器适配器（第4.1节）始终能提供更好的性能-参数权衡。当使用MLP文本编码器适配器时，移除AdaLN（第4.1节）也带来了明显的优势。然而，当使用更大的Transformer文本编码器适配器时，带和不带AdaLN的模型在可比较的参数数量下实现了相似的性能。我们注意到，这仍然表明在文生图扩散模型中，噪声条件化可能并非必要。

最后，虽然附录C.1提供了初步结果，表明结合正弦位置编码和RoPE位置编码、使用三明治归一化以及跨图像和文本流共享归一化可以提升性能，但我们并未在不同模型规模上一致地观察到这些趋势。

性能与训练FLOPs对比

除了在图11和图43中比较不同模型规模的性能外，我们在图44中将性能与可训练模块的估计训练FLOPs进行了对比。我们按照附录C.5中的相同流程计算这些FLOPs。

在基于FLOPs的对比下，大多数趋势保持不变。一个例外是AdaLN在使用更大的基于Transformer的文本编码器适配器时的效果：在这种设置下，带有AdaLN的模型比不带AdaLN的模型具有更好的性能-FLOPs权衡。这是因为AdaLN贡献了模型参数中不可忽视的一部分（例如，在双流基线模型中占参数的18.9%），但仅极小程度地增加了训练FLOPs，因为其投影是对每个样本计算一次，而非对每个token计算一次。

C.7 在其他骨干网络上验证长跳跃连接结果

在 4.2 节中，我们基于双流 MMDiT 主干网络的实验表明，长跳跃连接能够持续提升不同规模模型的性能。在此，我们通过训练基线模型（XL/2 尺寸）的其他变体（分别包含和不包含长跳跃连接），进一步在其他主干网络上验证了这一设计。如图 42 所示，移除长跳跃连接会显著降低大多数主干网络和评测基准上的性能，尤其是在 DPG 和 LongText 上。这进一步表明，长跳跃连接可以广泛地提升模型性能。

图 42：长跳跃连接（bao2023all）提升了各主干网络上的评测基准性能。这进一步支持了我们在图 11 中关于不同规模模型的双流主干网络上的观察结果。

图 43：在不同规模模型的双流主干网络上消融建模设计。

图 44：在不同可训练模型 FLOPs 的双流主干网络上消融建模设计。

C.8 文本特征适配器与图像特征适配器

在 4.1 节中，我们发现，尽管只增加了少量参数，但将文本编码器的小型 MLP 适配器替换为更大的 Transformer 适配器，能显著提升各评测基准的性能。我们推测，这是因为来自预训练语言模型的文本特征需要针对文本到图像生成等下游任务进行适配。在附录 C.6 中，我们展示了更大的 Transformer 适配器比小型 MLP 适配器实现了更好的性能-参数权衡。

媒体内容 · 前往原文查看

主干网络 适配器 DPG PRISM LongText

交叉注意力 默认 84.66 56.4 0.211

+ 文本特征的 Transformer 适配器 86.33 58.7 0.414

+ 图像特征的 Transformer 适配器 85.27 55.4 0.250

单流 默认 85.89 55.6 0.293

+ 文本特征的 Transformer 适配器 87.64 60.0 0.472

+ 图像特征的 Transformer 适配器 86.10 59.7 0.345

双流 默认 86.82 58.3 0.439

+ 文本特征的 Transformer 适配器 87.67 60.7 0.576

+ 图像特征的 Transformer 适配器 86.23 57.0 0.378

表 15：文本与图像特征的 Transformer 适配器对比。在文本特征上使用 Transformer 适配器能显著提升各主干网络的性能，而在图像特征上添加同样的适配器则没有这种效果。这表明，更大的文本适配器带来的收益并不仅仅是因为参数数量的增加。

为了进一步验证这种性能提升并非仅仅源于参数数量的增加，我们在图像特征上同样添加了一个 Transformer 模块，具体位置是在图像分块之后、应用位置嵌入之前（详见附录 A.2）。如表 15 所示，与在文本特征上使用该适配器相比，在图像特征上添加此适配器所带来的性能提升要小得多。这表明，更大适配器带来的增益是专门针对适配预训练文本特征的，而不仅仅是简单地增加模型容量。

C.9 探索长跳跃连接的变体

长跳跃连接由 U-Net（ronneberger2015u）推广开来，其作用是为来自早期层的低级特征提供快捷路径，从而简化像素级预测任务的训练。后来，U-ViT（bao2023all）沿用了这一设计，并将其应用于基于 Transformer 架构的扩散模型。然而，尽管这些连接完全对称的结构（即，从左数第 i 层连接到从右数第 i 层）对于 U-Net 的多分辨率编码器-解码器结构来说是自然而然的，但对于基于 Transformer 的模型来说却未必是最优的，因为后者的各模块通常具有相同的特征维度。因此，我们在此探索了 U-ViT 中原始长跳跃连接的不同变体。

图 45：消融实验——长跳跃连接所应用的层范围。x 轴表示跳跃连接可以起始的所有层索引。每条水平线对应一个变体，在该变体中，从左端点索引到右端点索引（含两端）之间的所有层都有从它们起始的跳跃连接。所有变体均未持续优于默认的长跳跃连接设置，即第 1 层到第 14 层全部具有跳跃连接。

层范围

来自较早层的长跳跃连接会跨越更多模块，而靠近中间层的跳跃连接则跨越较少模块。因此，靠近中间层的特征在到达目标层时可能变化较小，这使得这些跳跃连接可能不那么必要。移除它们或许能保持甚至提升性能。为验证这一假设，我们在图45中探索了长跳跃连接可以起始的若干层范围：1-3、1-7、1-11、4-7、4-11、4-14、8-11、8-14 和 12-14。然而，这些变体均未持续优于默认设置。

媒体内容 · 前往原文查看

跳跃类型 DPG PRISM LongText

默认 84.66 56.4 0.211

83.70 55.2 0.134

84.78 55.8 0.180

表16：消融长跳跃连接模式。我们将默认的对称跳跃模式与将交叉注意力主干上第 层连接到第 层或第 层的变体进行比较。默认模式实现了最佳整体性能。

连接模式

我们进一步探索了长跳跃连接是否应连接表征差异更大的层。我们没有使用默认的对称模式（即将最左侧的第 层连接到最右侧的第 层），而是测试了将第 层连接到第 层或第 层的变体。如表16所示，在交叉注意力主干上，该变体略微提升了DPG，但默认模式整体表现仍然最佳，取得了最高的PRISM和LongText分数。

附录D 数据设计方面的额外结果

在第5节中，我们展示了控制实验，以论证我们在合成字幕生成、提示词改写和数据混合方面的设计动机。我们在附录D.1中提供了关于合成字幕生成设计的更多细节及相应的控制实验，并在附录D.2中提供了支持我们关于数据混合结论的额外结果。

D.1 合成字幕生成中的额外设计

在 5.1 节中，我们通过在 ImageNet-22K 图像上使用不同描述集训练一个基线交叉注意力模型，研究了合成描述生成。在此，我们提供额外的结果，这些结果促使我们在描述生成流程中做出两个选择：在生成描述前对图像进行中心裁剪，以及为每张图像生成多条描述。

媒体内容 · 前往原文查看

描述生成器 DPG PRISM LongText

Qwen3-VL-30B-A3B 83.72 50.8 0.007

+ 无中心裁剪 83.16 51.3 0.006

+ 5 条描述/图像 83.56 51.9 0.010

表 17：合成描述生成。使用每张图像的多条描述以及在生成描述前对输入图像进行中心裁剪，可以带来更好的性能。图 20 进一步表明，在图像数据有限的情况下，使用每张图像多条描述的优势更为显著。

图像裁剪

。在我们的实验设置中，我们通过将较长边中心裁剪至与较短边等长，从而在正方形图像上进行训练。如果合成描述生成器接收的是未经裁剪的完整图像，生成的描述可能会描述那些后续被裁剪掉的对象，从而在训练图像和描述之间产生语义不匹配。podell2023sdxl 指出，这可能导致文生图模型生成不完整对象的失败模式。此外，默认情况下，在中心裁剪之后，我们会将尺寸大于 512x512 的图像缩小至 512x512，以避免在较大图像上生成描述时速度过慢。

为了理解我们预处理操作的影响，我们使用由 Qwen3-VL-30B-A3B 生成的两组合成描述来训练模型：一组来自完整图像，另一组来自经过裁剪和缩放的方形图像。如表 17 的前两行所示，由裁剪和缩放后的图像生成的描述，其下游性能与由完整图像生成的描述相似。由于中心裁剪和缩放提高了描述生成速度，且未对下游性能产生显著影响，我们在生成所有合成描述之前都应用了这两种操作。

图 46：将单个数据集的权重提高 5 倍（图 19 中为 3 倍）相对于所有数据集等权重基线的性能变化。在所有情况下，提高任何数据集的权重均未优于精确的等权重分配。

增加每张图像的描述数量，提供了除增加图像数量之外的另一个数据扩展维度。为探索这一点，我们使用 Qwen3-VL-30B-A3B 为每张图像生成了五条描述。如表 17 所示，这在 PRISM 和 LongText 上带来了小幅改进。此外，如图 20 所示，当独特训练图像数量有限时，这种收益变得更加明显。

D.2 等数据集权重下的实验

在第 5.2 节中，在确定所有数据集等权重可以带来强劲性能后，我们进一步探索了在保持其他数据集等权重的同时，对单个数据集进行上采样是否能进一步提升结果。在图 19 中，我们展示了任意一个数据集的上采样并不能在所有基准测试上持续提升性能。在此，我们进一步在图 46 中展示了每个数据集上采样 5 倍的结果，并发现这些结果与图 19 中的观察结果一致。

附录 E 数据集的补充信息

我们在第 3 节简要介绍了用于模型训练的图像数据集，并在第 5 节探讨了合成描述和数据混合策略。在此，我们提供关于训练期间所用图像和描述的更多细节。

E.1 图像可视化

(a)

(b)

(c)

(d)

(e)

(f)

(g)

(h)

(i)

(j)

(k)

(l)

图 47：来自每个训练数据集的随机图像样本。

在我们的研究中，我们探索了数据混合策略，并在 12 个公开可用的图像数据集上训练了模型，其中包括 7 个真实图像数据集（ImageNet-22K、YFCC100M、RedCaps、Megalith、Pexels、iNaturalist 2024、Places365-Challenge 2016）、3 个合成数据集（GPT-Image-Edit-1.5M、FLUX-Reason-6M 和 Midjourney v6）以及 2 个文本渲染数据集（RenderedText 和 TextAtlas）。为了定性地了解它们的分布情况，我们从每个数据集中随机抽取 9 张图像，将每张图像调整大小使其短边为 256 像素，中心裁剪为 256x256 的正方形，并将得到的图像可视化在图 47 中。

E.2 图像分辨率统计

如第 6.2 节所述，我们使用除 iNaturalist 之外的所有图像数据集进行 i1 的 256 分辨率训练。对于 512/1024 分辨率的高分辨率训练，我们过滤掉短边小于 512/1024 像素的图像。我们还移除了过滤后图像数量少于 30 万张的任何数据集。

在此，我们在表 18 中报告了在每个分辨率阈值下剩余的图像数量。对于 512 分辨率训练，我们使用除 YFCC 和 iNaturalist 之外的所有数据集。对于 1024 分辨率训练，我们仅使用 FLUX-Reason、TextAtlas、RedCaps、GPT-Edit 和 Midjourney v6（尽管 RenderedText 在基于分辨率过滤后满足图像数量要求，但由于其质量较低，我们将其排除在外）。

我们使用的 RedCaps 数据集包含 500 万张图像，这与原始论文中报告的 1200 万张图像不同。这是因为 RedCaps 图像以 URL 形式提供，其中许多 URL 已无法访问。

媒体内容 · 前往原文查看

图像类型 数据集 图像数量 短边 ≥ 512 的图像数量 短边 ≥ 1024 的图像数量

真实 YFCC 98,121,424 0 0

ImageNet-22K 13,673,551 719,427 0

Megalith 9,393,971 9,202,294 61,701

Places 8,026,628 7,345,764 0

RedCaps 4,817,431 4,705,536 4,134,303

iNaturalist 4,813,543 0 0

Pexels 2,810,634 2,810,621 0

合成 FLUX-Reason 5,890,279 5,890,279 5,890,279

GPT-Edit 1,553,575 1,552,821 357,482

Midjourney v6 1,240,185 1,240,185 1,240,185

文本渲染 RenderedText 11,977,824 11,977,824 11,977,824

TextAtlas 5,397,762 4,036,973 919,913

表 18：每个数据集在不同分辨率阈值下的图像数量。对于 512 和 1024 分辨率训练，我们仅使用较短边分别至少为 512 像素和 1024 像素的图像。

E.3 不同 VLM 描述器生成的描述文本长度分布

在第 5.1 节中，我们使用相同的元提示词来提示 Qwen2-VL 2B (wang2024qwen2)、Qwen2.5-VL 3B (qwen2.5-vl)、Qwen3-VL-2B、Qwen3-VL-4B 和 Qwen3-VL-30B-A3B (bai2025qwen3)，为 ImageNet-22K 生成合成描述文本。然后，我们在每个生成的图像-描述文本数据集上训练一个扩散模型。我们发现，用于合成描述文本的 VLM 选择对下游文生图性能有显著影响。在图 48 中，我们进一步绘制了每个 VLM 生成的描述文本的序列长度分布。我们观察到，能带来更强性能的描述文本集通常也更长。

图 48：使用不同描述器时 ImageNet-22K 的描述文本长度分布，通过 T5Gemma tokenizer 以 token 序列长度衡量。能带来强文生图性能的提示词集总体上往往也更长。

E.4 不同数据集的描述文本长度分布

在此，我们从每个数据集中随机抽取 10K 张图像，并在图 49 中绘制其合成描述文本的序列长度分布。尽管不同数据集的描述文本长度分布有所差异，但没有哪个数据集与其他数据集存在显著不同。

图 49：使用 T5Gemma tokenizer 对每个数据集随机抽取 10K 样本后的跨数据集描述文本序列长度。

E.5 用于合成描述文本的元提示词

对于大多数图像数据集，我们使用以下最简提示词进行合成描述文本生成：

然而，对于文本渲染数据集，可以获取到真实文本标注。为了减少 VLM 生成描述文本中的模型幻觉，我们将真实文本包含在描述文本生成的提示词中。对于 TextAtlas，我们使用：

RenderedText 包含使用 Blender 在数字 3D 纸张上渲染的手写文本图像。文本的字体大小、颜色和旋转角度各不相同，纸张在随机光照条件下进行渲染。每个真实标注都包含一个字段“text”，它是一个字符串列表，其中 是图像中的文本行数。列表中的第 个元素对应第 行文本。因此，对于 RenderedText，我们使用：

E.6 数据泄露的完整性检查

除 FLUX-Reason 外，所有数据集的描述文本均由视觉语言模型（VLM）合成生成，因此我们的评估基准中使用的提示词集与用于训练文生图模型的描述文本之间不太可能存在重叠。然而，对于 FLUX-Reason，我们使用了五组描述文本：其中一组是数据集中提供的原始“caption_detail”字段（因其质量已足够高），其余四组由我们合成生成。根据原始论文（fang2026flux），PRISM-Bench 中一半的提示词直接选自 FLUX-Reason，随后已从数据集中移除。为确保 FLUX-Reason 与 PRISM-Bench 之间不存在重叠，我们对每个 FLUX-Reason 的“caption_detail”描述文本与每个 PRISM-Bench 提示词进行了精确字符串匹配。未发现任何重叠。
