HuggingFace Daily Papers(社区热门论文)
精选
76AI 编辑部评分,满分 100

Any-OPD:面向流匹配模型的异构同策略蒸馏框架

2026-08-04 08:00· 6天前
AI 导读

Any-OPD 提出首个支持任意异构流匹配生成器对的同策略蒸馏框架,仅通过冻结的 DINOv2 表示空间桥接教师与学生模型,无需共享 VAE、架构或噪声调度。将 FLUX.1-dev 蒸馏至 SD3.5-Medium 后,学生模型 PickScore 与 HPSv3 均显著提升,以教师五分之一的参数量达到接近其性能,而直接潜在回归训练完全失败。

推荐理由

将异构流匹配蒸馏转化为在独立视觉空间求解固定点,配合噪声级对齐跨过VAE与架构差异,2.5B学生模型在偏好指标上逼近12B教师。

正文 · AI 翻译

傅思明

,傅哲铭

,何睿哲

,王华亮

,黄杰

,马晓晓

钟明辰

,黄伟虎

,何晓萱

,徐浩钧

摘要

在策略蒸馏(on-policy distillation)中,教师模型会纠正学生模型自身生成的样本,这种方法预设了两个模型使用同一种语言:相同的 VAE 潜变量、匹配的架构,以及共同的时间步网格。我们探讨当这些条件都不成立时会发生什么——例如,当可用的最强教师模型与希望部署的学生模型来自不同模型家族时——并发现标准方案无法应对:教师模型的潜变量无法在异质坐标系中作为目标,针对随机重绘局部细节的教师模型进行逐像素损失会导致模糊或发散,而时间步索引在不匹配的调度方案之间也失去了意义。我们提出 Any-OPD,据我们所知,这是首个适用于任意潜变量流匹配生成器对之间进行在策略蒸馏的框架。Any-OPD 将教师模型纯粹视为黑盒采样器,并仅在一点上连接两个模型:一个冻结的、与模型无关的视觉表征,在此表征中比较两者独立解码的输出,从而绕过了关于潜变量、特征或架构的所有假设。轨迹对应关系通过匹配连续噪声水平而非步索引来恢复,而一个简短的锚定阶段——将教师样本通过学生自身的 VAE 重新编码——确保在策略梯度衡量的是样本质量而非域不匹配。将 B FLUX.1-dev 蒸馏到 B SD3.5-Medium,Any-OPD 将学生的 PickScore 从 提升至 ,HPSv3 从 提升至 ,在仅有其五分之一规模的情况下媲美教师模型,而直接潜变量回归则完全无法训练。122.50.8460.8849.1210.97

1 引言

流匹配生成器(Lipman 等人,2023;Esser 等人,2024b)如今已定义了文生图合成领域的最先进水平,但它们最强的实例规模庞大:像 FLUX.1-dev(Black Forest Labs 2024)这样的模型,仅去噪 Transformer 就携带了 B 级参数,使其在延迟或内存受限的部署场景中难以落地。知识蒸馏(Hinton 等人,2015)提供了自然的解决方案——让一个小学生模型继承大教师模型的质量,而其最有效的形式是策略内(on-policy)蒸馏:学生并非从固定数据中模仿教师输出,而是在自身采样轨迹所生成的状态上接受监督,这消除了纯离线模仿的暴露偏差(Agarwal 等人,2024;Lin 等人,2020;Ross 等人,2011)。然而,现有的扩散模型策略内方案(Salimans 和 Ho 2022;Yin 等人,2024b;Luo 等人,2023a)建立在一个如此普遍以至于很少被明确表述的假设之上:教师和学生是同构的。它们共享同一个 VAE,因此共享一个潜变量坐标系,在这个坐标系中教师预测可以作为回归目标;它们通常共享架构,因此内部特征可以对齐;它们还共享时间步网格,因此“同一步”对两者而言意味着相同的噪声水平(Salimans 和 Ho 2022)。这一假设悄然将蒸馏限制在源自单一模型家族的配对中。然而,人们实际想要进行蒸馏的配对往往是异构的:可用的教师和学生通常由不同方围绕不同的 VAE、架构和噪声调度开发而成。12

在本文中,我们提出并解决了异构同策略蒸馏(heterogeneous on-policy distillation)问题:在冻结的教师模型监督下,用学生模型自身生成的轨迹训练学生模型,而学生与教师之间既不共享 VAE,也不共享架构,更不共享噪声调度,教师仅作为采样器被访问。放弃同构假设会从两个独立维度破坏同策略蒸馏。首先,这对模型没有共享空间:教师模型的潜变量在学生模型的坐标系中并非有效目标;更不明显的是,将两个模型都解码到像素空间也无法恢复可用的目标函数。教师模型的精炼(refinement)是一种随机再合成过程,在保留语义的同时重新绘制局部细节,因此逐像素回归会趋向于模糊的条件均值,而在我们的实验中,这直接导致训练崩溃。其次,这对模型没有共享时钟:两种噪声调度源自不同的偏移函数,因此相同的求解器索引对应不同的噪声水平(Esser et al. 2024b),而按索引对齐的监督会将来自不可比噪声区间(Karras et al. 2022)的状态配对在一起。

我们提出 Any-OPD(任意教师、任意学生、同策略蒸馏),它通过一种不引用两个模型内部结构的机制解决了上述每一种失败情形。针对空间差距,两个模型仅在两者外部的第三种表征中耦合:学生和教师各自用自己的 VAE 解码,所得图像由冻结的 DINOv2(Oquab 等人,2023)的 CLS 嵌入进行比较。这种全局的、与坐标无关的比较方式,恰好对像素回归和潜空间回归所无法处理的局部再合成具有不变性,而且由于该特征提取器与模型无关,更换教师既不会改变损失函数,也不需要改动训练流程中的任何一行代码。针对时间步差距,两条轨迹按噪声水平本身对齐,而非按步索引对齐:在教师从选定的噪声水平对学生样本进行精炼之后,梯度恰好流经那些噪声水平不低于该水平的学生步骤,这一规则对任意调度组合都保持良定义。第三个组件使该信号从一开始就可使用:一个离线锚定阶段首先通过学生的编码器将教师的输出分布移植到学生自身的潜空间中,用数据弥合分布层面的差距,从而让同策略目标只需修正逐样本误差。我们在一个最大异质性的模型对上实例化了 Any-OPD,将 FLUX.1-dev(Black Forest Labs 2024)(B)蒸馏到 SD3.5-Medium(Stability AI 2024)(B):两者具有不同的 VAE、不同的 Transformer 架构、不同的噪声调度。蒸馏后的学生在偏好导向指标上相比其初始状态有显著提升,将 PickScore(Kirstain 等人,2023)从 提升到 ,将 HPSv3(Ma 等人,2025)从 提升到 ,并在约为教师五分之一规模的情况下接近或超过 B 教师,而直接的潜空间回归方案则完全失效。我们的贡献如下:122.50.8460.8849.1210.9712

  • 我们为流匹配生成器提出了异质性同策略蒸馏框架,并识别出使现有同策略方法无法适用的两个障碍:缺乏共享表征(无共享空间)以及缺乏可比较的时间步网格(无共享时钟)。

  • 我们提出 Any-OPD,该方法仅通过一个冻结的、与模型无关的表示空间将两个模型耦合,并依据噪声级别匹配而非求解器索引来对齐它们的轨迹。因此,该流程适用于任意潜在流匹配生成器的师生模型对。

  • 我们展示了首次跨模型族的在策略蒸馏,从 FLUX.1-dev 蒸馏到 SD3.5-Medium,其中 B 学生模型在多项偏好指标上达到或超越了其 B 教师模型。我们对每个组件进行了消融实验,并特别表明,在 VAE 边界上进行朴素的潜在回归会导致训练崩溃。2.512

2 相关工作

扩散模型与流匹配。

扩散模型(Ho 等人,2020;Song 等人,2021)通过逆转逐步加噪过程来生成样本,而流匹配(Lipman 等人,2023;Liu 等人,2024)则学习从噪声到数据的连续传输,并支持高效的确定性采样。这一范式已成为近期高分辨率文生图系统的常见主干,包括 SD3(Esser 等人,2024a)、FLUX(Black Forest Labs 2024)和 Z-Image(Cai 等人,2025)。在实践中,这些模型不仅在规模上有所不同,在 VAE 设计、Transformer 架构和噪声调度参数化方面也存在差异。这些差异使得跨模型族的蒸馏远比同质检查点之间的蒸馏困难得多。

扩散蒸馏。

扩散模型和流模型的早期蒸馏方法主要压缩采样成本。渐进式方法和基于一致性方法(Salimans and Ho 2022; Luo et al. 2023b; Song and Dhariwal 2024)训练少步学生模型以匹配多步教师模型,而分布匹配方法(Yin et al. 2024c, a; Zhou et al. 2024)则使学生的输出分布与教师偏好对齐。这些方法通常是离线的:监督信号从固定数据或教师轨迹中收集,因此教师不会直接纠正学生在训练过程中访问的状态。策略内蒸馏(OPD)最初在语言模型蒸馏中提出,通过让学生从教师对学生生成轨迹的反馈中学习来减少这种暴露偏差(Agarwal et al. 2024; Gu et al. 2024; Ko et al. 2025)。近期扩散和流模型的扩展将该思想引入迭代式图像生成。DiffusionOPD(Li et al. 2026)为扩散转移过程制定了策略内监督,Flow-OPD(Fang et al. 2026)则将 OPD 适配到流匹配中,并采用密集的轨迹级教师监督。然而,这些公式假设教师和学生可以在共享状态上交互,这自然适用于同构模型,但当它们的 VAE 潜在空间不兼容时就会失效。

Refer to caption
图 1:Any-OPD 概览。左图:锚定阶段通过速度匹配在教师生成的目标上训练学生,将教师的分布迁移到学生自身的潜在坐标中。右图:策略内训练对学生进行 rollout,通过噪声-去噪精炼将样本投影到教师的流形上,并通过噪声级别匹配选择的学生片段进行反向传播。学生和教师各自使用自己的 VAE 解码;两幅图像仅在冻结的 DINOv2 表示空间中相遇。

3 方法

3.1 预备知识:流匹配与潜在生成器

流匹配(Flow Matching,Lipman et al. 2023)学习一个速度场,该速度场沿 ODE 将噪声传输到数据。在最优传输插值下,vθ:d×[0,1]ddxt=vθ(xt,t)dt

xt=(1t)x0+tx1,x0pdata,x1𝒩(0,I), (1)

因此 本身即为噪声级别,训练最小化t

FM(θ)=𝔼t,x0,x1[vθ(xt,t)(x1x0)2]. (2)

推理过程采用离散步进欧拉调度,并带有噪声水平,其中由模型特定的偏移函数生成(Karras et al. 2022; Esser et al. 2024a)。在整个过程中,求解器索引为纯噪声,索引为干净样本,因此随索引单调递减。N1=σ0>σ1>>σN=0σi0Nσ

我们考虑潜变量生成器,每个生成器由编码器、解码器、速度场和调度组成:图像通过在潜空间中积分并解码端点来生成(Rombach et al. 2022; Esser et al. 2024a)。我们的学生模型为,冻结的教师模型为,两者的速度场作用于不相交的域上,(,𝒟,v,{σi})v𝒵S=(S,𝒟S,vθ,{σiS})T=(T,𝒟T,vϕ,{σiT})

vθ:𝒵S×[0,1]𝒵S,vϕ:𝒵T×[0,1]𝒵T. (3)

3.2 异构设置:无共享空间,无共享时钟

同策略蒸馏要求教师模型对学生模型自身轨迹上的状态进行监督(Ross et al. 2011; Agarwal et al. 2024; Li et al. 2026; Fang et al. 2026),而对于异构配对,这一过程会在两个维度上失效。无共享空间:由于,教师模型的潜变量在学生模型的坐标系中并非有效目标,且架构差异排除了特征匹配的可能性;像素级信息也无济于事,因为教师模型的细化过程是一种随机的重新合成,在保留语义的同时重新绘制局部细节,因此逐像素的均方误差会回归到所有可行重新合成的平均值,从而导致训练崩溃(Zhang et al. 2018; Blau and Michaeli 2018)。监督必须转移到第三种表示上,这种表示独立于两个模型之外,并且对局部坐标不敏感。无共享时钟:不同的偏移函数导致,因此按索引对齐的监督会将来自不可比噪声状态的状态配对;噪声水平是两条轨迹之间唯一共享的量,必须作为对齐变量。这些补救措施说明了如何进行监督,但并未说明监督何时有用:当学生模型的样本仍远离教师模型的流形时,每个梯度都指向从一个域到另一个域的方向,不携带任何逐样本信息。因此,Any-OPD 首先离线锚定学生模型的分布,然后才将同策略修正应用于逐样本残差。𝒵S𝒵TσiSσiT

3.3 将学生模型锚定在教师模型的流形上

分布层面的差距并不需要通过在线策略训练来弥合,因为它不要求一一对应:学生模型只需学会生成与教师模型同类别的图像,而非复现某一张特定的图像。这使得该差距可以在离线状态下解决,使用标准的流匹配目标函数即可,前提是教师模型的分布能够在学生模型的坐标系中表达出来。学生模型自身的编码器恰好提供了这种表达。

给定一个提示词,教师模型生成目标图像,我们使用学生模型的 VAE 对其进行重新编码,得到。由此,教师模型的流形被呈现在学生模型实际优化的坐标系中——这是任何跨越两个潜在空间定义的损失函数都无法实现的。从学生模型自身的步调度中均匀抽取一个索引,我们构造出cxT=𝒟T(SampleT(c))z=S(xT)mM

zm=(1σmS)z+σmSϵ,ϵ𝒩(0,I), (4)

并使用以下目标进行训练

WS=𝔼m,ϵ,c[vθ(zm,σmS,c)(ϵz)2], (5)

其中由(4)式给出;上述形式与相匹配,并避免了在时除以的问题。锚定无法修复的问题同样清晰明确。学生模型在训练中只观察到从正确端点插值得到的状态,而在推理时它遵循的是自身不完美的轨迹;锚定决定了学生模型分布的位置,却无法决定学生模型在它实际到达的状态上如何表现。这一残余误差本质上是逐样本的,弥合它正是在线策略阶段的任务。ϵz=(zmz)/σmSFMσmSσmS0

3.4 任意教师模型与任意学生模型之间的在线策略蒸馏

在线策略阶段围绕单一算子展开。对于噪声水平,令σ

ΠTσ(x)=𝒟T(EulerT((1σ)T(x)+σϵ 0,c)) (6)

记教师的加噪-去噪映射为:将图像扰动到噪声水平,并在教师的速度场下重新生成它(Nie 等人,2022)。由于去噪过程会向教师的模型分布收缩,因此它充当了到教师图像流形上的随机投影(Permenter 和 Yuan,2023),其中 设定了投影可以移动样本的半径范围:当 趋近于恒等映射时,当 趋近于无条件重采样时(Ho 等人,2020;Song 等人,2021)。评估 对教师的要求仅仅是具备采样能力;这个采样接口就是 Any-OPD 对教师所做的全部假设,而第 3.1 节意义上的任何潜在生成器都能提供这一点。该阶段训练学生模型,使其自身样本成为该投影在特征等价意义下的不动点:当且仅当 时,即教师被允许在半径 内重绘样本却无法产生任何语义上更好的结果时,样本收到的梯度为零。因此,每次训练迭代做三件事:投影一个在策略样本,将由此产生的修正通过能够表达它的学生步骤进行路由,并检验不动点条件。设 和 分别表示学生和教师的求解器步骤。σΠTσσσ0σ1ΠTσxf(x)=f(ΠTσ(x))σNSNT

媒体内容 · 前往原文查看
表 1:主要结果。FLUX.1-dev 使用其标准的 50 步 Euler 采样器;SD3.5-Medium 和 Any-OPD 使用 40 步 Euler 采样。Aesth.:美学评分;ImgRwd:ImageReward;HPSv3:人类偏好评分 v3;UniRwd/UniRwd2:UnifiedReward 和 UnifiedReward2。蓝色阴影加粗标记表示相对于 SD3.5-Medium 基线的改进。
DrawBench DPG-Bench
角色 模型 参数量 Aesth. ImgRwd PickScore HPSv3 UniRwd UniRwd2 总体
教师 FLUX.1-dev 12B 5.765 0.971 0.878 11.19 3.38 3.35 83.84
学生 SD3.5-Medium 2.5B 5.383 0.922 0.866 9.12 3.23 3.21 84.58
学生 + Any-OPD SD3.5-Medium 2.5B 5.788 1.116 0.884 10.97 3.31 3.26 84.71
Refer to caption
图 2:DrawBench 提示词上的定性比较。Any-OPD(2.5B,带 LoRA 的 SD3.5-Medium)在保持学生架构和 40 步采样不变的情况下,接近 12B FLUX.1-dev 教师的视觉质量。
投影在策略样本。

每一次迭代都恰好监督学生模型在推理时所部署分布中的一个样本。投影半径是预先固定的,方法是先抽取并设定教师模型的起始索引;由于事先知道半径,就能确定后续梯度传播所需的唯一中间状态,因此 rollout 只需存储一个潜变量,而非整条轨迹。随后学生模型在无梯度的情况下,依据自身的时间表进行积分。r𝒰{rmin,,rmax}k=NTrz0𝒩(0,I)

zi+1=zi+(σi+1SσiS)vθ(zi,σiS,c),i=0,,NS1, (7)

其输出在层级上被投影。具体而言,通过格式转换进入教师模型的坐标空间,这一转换不产生任何信息损失;随后教师模型重新加噪,σkTxS=𝒟S(zNS)zNTT=T(xS)

zkT=(1σkT)zNTT+σkTϵ,ϵ𝒩(0,I), (8)

并沿自身的时间表积分至干净的终点,

xref=𝒟T(EulerT(zkT,kNT,vϕ,c))=ΠTσkT(xS). (9)

半径在信号与相关性之间进行权衡。当半径较小时,投影趋近于恒等映射,目标中不包含任何修正信息;当半径较大时,投影趋近于重采样,此时该样本不再是对原样本的改进,梯度也因此继承了未配对目标的方差。有价值的精炼介于这两种退化情形之间——此时投影保留了学生模型的构成,仅替换其执行过程;第 4.3 节将对此范围进行实证刻画。rrxref

按噪声层级路由修正。

修正既有尺度,也有内容。投影仅在由噪声层级所决定的尺度上改变样本,因此学生模型若要吸收这一修正,其梯度必须覆盖自身在该范围内运作的每一个求解器步骤;任何更窄的片段都无法表达这一编辑。由于时间表无法按索引直接比较,该片段需依据噪声层级本身来定位,[0,σkT]

j=max{i:σiSσkT},i.e.σjSσkT>σj+1S, (10)

即最不嘈杂的学生状态,其噪声程度仍不低于投影起始点的噪声程度,因此这是噪声范围恰好包含修正范围的最紧凑片段,适用于任意一对偏移函数。学生模型从缓存的潜变量处启用梯度进行重放,zj

z^NS=EulerS(zj,jNS,vθ,c), (11)

因此只有 Transformer 的求值过程携带激活值,且每一步都单独设置检查点。将视为常数,使得梯度以学生模型实际到达的状态为条件,而非以任何正确模型本应到达的状态为条件;正是这种条件化——而非单纯的 rollout——使得该更新成为在策略(on-policy)更新。NSjzj

在表征空间中耦合模型。

该条件只能在第 3.2 节所识别的第三种表示中进行测试。每个模型通过其自身的解码器渲染结果,并且根据 (9),损失函数通过一个冻结的提取器将两者耦合,该提取器对两者施加相同的操作:f(x^S)=f(xref)x^S=𝒟S(z^NS)xreff

OPD=1cos(f(x^S),f(xref)), (12)

其中返回冻结的 DINOv2-Base(Oquab 等人,2023)的 CLS token,梯度通过冻结的解码器流入。该选择同时满足了第 3.2 节的两个要求。它是外部的:不触及任一模型的潜在表示或架构,因此替换教师模型仅替换投影,而损失函数和流程保持不变。它是无坐标的:CLS token 聚合所有 patch,DINOv2 的判别式自监督使余弦距离能够惩罚结构和语义偏差,同时对于 (9) 的每次应用所引入的局部再合成保持不变。f𝒟SvθffΠT

Refer to caption
图 3:教师细化步骤的效果(对比,其他条件相同)。目标中的模糊传播到学生模型中,表明教师的去噪预算限制了可迁移的质量上限。NT1020NT=10

4 实验

4.1 实验设置

模型。

学生模型为 SD3.5-Medium(2.5B;SD3 VAE,静态偏移,引导);教师模型为 FLUX.1-dev(12B;FLUX VAE,动态偏移,引导)。该配对在 VAE、架构和噪声调度上同时存在差异。我们仅训练学生 Transformer 中的 LoRA 适配器(秩,);其余一切保持冻结。3.04.53.532α=64

数据与训练。

训练提示词从 Pick-a-Pic 训练集(Kirstain 等人,2023)中采样,Pick-a-Pic 测试提示词留作验证。锚定运行 400 步(噪声水平;教师目标在 50 步 Euler 采样下生成)。在策略训练在 800 步下进行。两个阶段均使用学习率和每 GPU 批大小。M=10512×512512×512NS=NT=201044

评估。

所有模型均在其标准推理设置下进行评估(教师模型:50 步 Euler;学生模型和 Any-OPD:40 步 Euler)。在 DrawBench(Saharia 等人,2022)上,我们针对每个提示词生成五张图像,并报告 Aesthetic Score(Schuhmann,2022)、ImageReward(Xu 等人,2023)、PickScore(Kirstain 等人,2023)、HPSv3(Ma 等人,2025)以及 UnifiedReward/UnifiedReward2(Wang 等人,2025)的得分;在 GenEval(Ghosh 等人,2023)和 DPG-Bench(Hu 等人,2024)上,我们报告四项结果的官方综合得分。模型版本、提示词数量及类别级结果详见补充材料。1024×1024

4.2 主要结果

表 1 包含了核心结果:经过蒸馏的 2.5B 学生模型在 Aesthetic Score、ImageReward 和 PickScore 上超越了其 12B 教师模型,并在 HPSv3 和 UnifiedReward 得分上缩小了大部分差距,在架构和采样预算不变的情况下,相较于基线模型,DrawBench 的全部六项指标均有所提升。学生模型能够超越教师模型,这源于监督信号本身:训练目标是教师模型对学生样本的投影,将学生的构图与教师的渲染相结合,因此训练可以将学生模型置于两个模型单独都无法达到的位置;在 ImageReward 上,相较于基线模型()的提升几乎是教师模型自身优势()的四倍。构图准确性得以保持,DPG-Bench 基本不变():该目标函数是偏好导向的,而教师模型在此基准上没有提升空间,相比之下,构图能力更强的 Z-Image 教师模型在相同流程下确实提升了该指标(见第 4.4 节)。图 2 展示了定性层面的提升:更干净的纹理、更一致的光照和更精细的结构,同时保留了基线模型的布局,这与“保留构图、替换执行”的投影机制相一致。+0.194+0.049+0.13

4.3 消融研究

目标函数:只有表示空间得以保留

只有表示空间的目标函数能够稳定训练,这印证了第 3.2 节的核心论断:异构样本对既不能在潜在空间中进行逐坐标比较,也不能在像素层面进行局部比较。图 4 对比了使用潜在空间 MSE、LPIPS(Zhang 等人,2018)以及三种 DINOv2 变体(CLS;来自第 5、9、12 层的多层 CLS;CLS+Patch)训练的 OPD。在 ImageReward 和 Aesthetic Score 上,潜在空间 MSE 在最初的训练步骤内就发生崩溃:跨越 VAE 边界的逐坐标回归不仅不是次优的,而且是不稳定的。LPIPS 起初有所改善,随后退化,因为其补丁级局部特征仍然要求空间对应关系,而教师模型的随机再合成并不遵循这种对应关系。所有 DINOv2 变体都能稳定训练至结束,且单纯的 CLS 与更丰富的变体表现相当甚至更优,因此一个单一的全局嵌入就足够了。MSE、LPIPS、DINOv2 的排序恰好反映了每种目标函数所假设的局部对应程度。<<

Refer to caption
(a)ImageReward
Refer to caption
(b)Aesthetic Score
图 4:不同目标函数下的 OPD 训练曲线。潜在空间 MSE 崩溃;LPIPS 后期退化;DINOv2 CLS 稳定且表现最佳。

锚定是前提条件,而非额外奖励

锚定质量严格决定了 OPD 能达到的上限,正如第 3.3 节所预测的那样。图 5 对比了从无锚定、预稳定检查点(Anchor-100)和已稳定检查点(Anchor-400)开始的 OPD。三条曲线在整个训练过程中严格排序,且尽管 OPD 预算相同,Anchor-100 始终无法追上 Anchor-400:差距在于初始化质量,而非总计算量,因此 OPD 应在锚定收敛之后才开始。锚定曲线见补充材料。

Refer to caption
(a)ImageReward
Refer to caption
(b)Aesthetic Score
图 5:不同初始化下的 OPD 曲线。已稳定检查点(Anchor-400)在整个过程中占优。
Refer to caption
(a)ImageReward
Refer to caption
(b)Aesthetic Score
图 6:带 CPS rollout 随机性的 OPD 曲线。确定性 Euler()在两个指标上均表现最佳。η=0

教师精炼调度

精炼强度。r

强细化是必要的:在表 2 中,将教师模型从中等偏低噪声(,)起始,在所有指标上均不如其他设置,因为教师模型几乎不改变样本,目标携带的信号极少。两个较强区间表现接近,其中 在 PickScore 和 ImageReward 上略占优势,并在 DPG-Bench 和 HPSv3 上胜出;我们采用 作为整体最佳平衡点。r[0,10)σ<0.63[10,15)[15,20][15,20]

媒体内容 · 前往原文查看
表 2:教师细化强度对 20 步教师调度的影响。较大的 表示从更高噪声水平开始细化。更强的细化带来更好的结果。r
DrawBench DPG
强度 r区间 HPSv3 Pick ImgRwd 总体
中低 [0,10) 10.24 0.881 0.891 81.21
中高 [10,15) 10.80 0.885 1.120 84.68
[15,20] 10.97 0.884 1.116 84.71
细化步数 。NT

教师的去噪预算限制了可迁移质量:在图 3 中,减半的调度在细化目标中留下可见模糊,学生模型忠实地复现了这一点,而 则产生清晰的目标和相应更清晰的学生模型。NT=10NT=20

展开随机性

展开随机性虽然在 RL 式微调中通常有益,但在此处有害。我们将 Euler 替换为系数保持采样(CPS)(Wang and Yu 2025),该方法将每一步的噪声分量从模型预测方向旋转一个由 设定的角度,朝向新的高斯分布,同时保持总噪声尺度 不变:ϵ^=xi+(1σi)vθξ𝒩(0,I)ησi+1

xi+1=(1σi+1)x^0+σi+1[cosηπ2ϵ^+sinηπ2ξ], (13)

其中 。确定性 Euler()在所有情况下最优,并在 – 步后性能下降(图 6):扰动展开会使监督轨迹与部署轨迹脱钩。x^0=xiσivθη=0η0.3200300

4.4 泛化:更换教师模型

Any-OPD 的核心主张是教师模型可以在不修改方法的情况下被替换。我们直接验证这一点:将 FLUX.1-dev 替换为 Z-Image(6B;其自带 VAE,偏移 ,引导 ),其他一切不变:相同的学生模型、损失、超参数和评估。表 3 显示学生模型在每项报告的指标上均有提升,包括组合基准 GenEval()和 DPG-Bench()。值得注意的是,增益与教师模型的特征一致:Z-Image 本身在 GenEval()上表现强劲,而 Any-OPD-Z 在继承这一优势的同时也获得了感知质量上的提升。65.0+0.80+0.9574.90

媒体内容 · 前往原文查看
表 3:以 Z-Image 作为教师模型的知识蒸馏结果,采用与主实验完全相同的流程和超参数。蓝色底纹加粗标记表示相较于 SD3.5-Medium 基线的提升;† 标记教师模型参考值。
DrawBench GenEval DPG
模型 ImgRwd Pick HPSv3 综合 综合
SD3.5-Medium 0.922 0.866 9.12 70.70 84.58
Z-Image† 0.958 0.864 9.96 74.90 86.73
Any-OPD-Z 1.082 0.872 9.75 71.50 85.53

5 结论

我们提出了 Any-OPD,将在线策略蒸馏从迄今为止仅限于同构设定的范围拓展到了更广阔的领域。我们的公式识别出异构配对所打破的两个假设——共享表征和共享时间步网格——并分别用不依赖任一模型内部机制的方案取而代之:教师模型仅通过对学生自身输出进行加噪-去噪投影来充当采样器;两个模型仅在冻结的外部表征中相遇,学生在该表征中被训练向其自身投影的固定点收敛;监督信号则通过噪声水平本身在不兼容的时间表之间实现对齐。前置的锚定阶段按粒度分离蒸馏过程,用数据弥合分布层面的差距,使在线策略目标仅携带逐样本信息。由于这些组件均不依赖教师模型的 VAE、架构或时间表,教师模型在构造上就是可互换的——我们通过在不改动流程任何一行的情况下直接替换模型家族验证了这一特性。我们希望这种解耦能让当前最强的生成模型——无论由谁构建——都能成为任何需要部署的模型的可用的教师模型。

局限性与未来工作。

组合互补的教师模型是一种自然的改进方向。由于除特征提取器外,该公式中没有任何部分针对图像特化,将 Any-OPD 扩展到其他潜在生成模态是另一个值得探索的方向。

参考文献

  • R. Agarwal, N. Vieillard, Y. Zhou, P. Stanczyk, S. Ramos Garea, M. Geist, 和 O. Bachem (2024) 语言模型的在线策略蒸馏:从自生成错误中学习。载于国际学习表征会议,2024 年卷,第 21246–21263 页。引用位置:§1、§2、§3.2。
  • Black Forest Labs(2024)FLUX.1。注:https://github.com/black-forest-labs/flux 引用位置:§1、§1、§2。
  • Y. Blau 和 T. Michaeli(2018)感知-失真权衡。载于《IEEE 计算机视觉与模式识别会议论文集》,第 6228–6237 页。引用位置:§3.2。
  • H. Cai、S. Cao、R. Du、P. Gao、S. Hoi、Z. Hou、S. Huang、D. Jiang、X. Jin、L. Li 等(2025)Z-image:基于单流扩散 Transformer 的高效图像生成基础模型。arXiv 预印本 arXiv:2511.22699。引用位置:§2。
  • P. Esser、S. Kulal、A. Blattmann、R. Entezari、J. Müller、H. Saini、Y. Levi、D. Lorber、A. Sauer、F. Boesel 等(2024a)扩展修正流 Transformer 以实现高分辨率图像合成。arXiv 预印本 arXiv:2403.03206。引用位置:§2、§3.1、§3.1。
  • P. Esser、S. Kulal、A. Blattmann、R. Entezari、J. Müller、H. Saini、Y. Levi、D. Lorenz、A. Sauer、F. Boesel 等(2024b)扩展修正流 Transformer 以实现高分辨率图像合成。载于《第四十一届国际机器学习大会》。引用位置:§1、§1。
  • Z. Fang、W. Huang、Y. Zeng、Y. Zhao、S. Chen、K. Feng、Y. Lin、L. Chen、Z. Chen、S. Cao 等(2026)Flow-OPD:面向流匹配模型的在线策略蒸馏。arXiv 预印本 arXiv:2605.08063。引用位置:§2、§3.2。
  • D. Ghosh、H. Hajishirzi 和 L. Schmidt(2023)Geneval:面向文本到图像对齐评估的对象聚焦框架。《神经信息处理系统进展》第 36 卷,第 52132–52152 页。引用位置:§4.1。
  • Y. Gu、L. Dong、F. Wei 和 M. Huang(2024)MiniLLM:大语言模型的知识蒸馏。载于《国际学习表征会议》,2024 年第 2024 卷,第 32694–32717 页。引用位置:§2。
  • G. Hinton、O. Vinyals 和 J. Dean(2015)蒸馏神经网络中的知识。arXiv 预印本 arXiv:1503.02531。引用位置:§1。
  • J. Ho、A. Jain 和 P. Abbeel(2020)去噪扩散概率模型。NeurIPS。引用位置:§2、§3.4。
  • X. Hu、R. Wang、Y. Fang、B. Fu、P. Cheng 和 G. Yu(2024)ELLA:为扩散模型配备大语言模型以增强语义对齐。arXiv 预印本 arXiv:2403.05135。引用位置:§4.1。
  • T. Karras、M. Aittala、T. Aila 和 S. Laine(2022)《阐明基于扩散的生成模型的设计空间》。神经信息处理系统进展第 35 卷,第 26565–26577 页。引用位置:§1、§3.1。
  • Y. Kirstain、A. Polyak、U. Singer、S. Matiana、J. Penna 和 O. Levy(2023)《Pick-a-pic:一个用于文生图用户偏好的开放数据集》。NeurIPS。引用位置:§1、§4.1、§4.1。
  • J. Ko、T. Chen、S. Kim、T. Ding、L. Liang、I. Zharkov 和 S. Yun(2025)《Distillm-2:一种提升大语言模型蒸馏效果的对比方法》。arXiv 预印本 arXiv:2503.07067。引用位置:§2。
  • Q. Li、J. Yu、K. Jiang、Y. Wei、Z. Xing、P. Li、R. Chu、S. Zhang、Y. Liu 和 Z. Wu(2026)《DiffusionOPD:扩散模型中在线策略蒸馏的统一视角》。arXiv 预印本 arXiv:2605.15055。引用位置:§2、§3.2。
  • A. Lin、J. Wohlwend、H. Chen 和 T. Lei(2020)《通过模仿学习进行自回归知识蒸馏》。载于 2020 年自然语言处理经验方法会议(EMNLP)论文集,第 6121–6133 页。引用位置:§1。
  • Y. Lipman、R. T. Chen、H. Ben-Hamu、M. Nickel 和 M. Le(2023)《用于生成建模的流匹配》。ICLR。引用位置:§1、§2、§3.1。
  • X. Liu、C. Gong 和 Q. Liu(2023)《流直且快:利用修正流学习生成与迁移数据》。ICLR。引用位置:§2。
  • S. Luo、Y. Tan、L. Huang、J. Li 和 H. Zhao(2023a)《潜在一致性模型:用少步推理合成高分辨率图像》。arXiv 预印本 arXiv:2310.04378。引用位置:§1。
  • S. Luo、Y. Tan、L. Huang、J. Li 和 H. Zhao(2023b)《潜在一致性模型:用少步推理合成高分辨率图像》。arXiv 预印本 arXiv:2310.04378。引用位置:§2。
  • Y. Ma、X. Wu、K. Sun 和 H. Li(2025)《Hpsv3:迈向广谱人类偏好评分》。载于 IEEE/CVF 国际计算机视觉会议论文集,第 15086–15095 页。引用位置:§1、§4.1。
  • W. Nie、B. Guo、Y. Huang、C. Xiao、A. Vahdat 和 A. Anandkumar(2022)《用于对抗净化的扩散模型》。arXiv 预印本 arXiv:2205.07460。引用位置:§3.4。
  • M. Oquab、T. Darcet、T. Moutakanni、H. Vo、M. Szafraniec、V. Khalidov、P. Fernandez、D. Haziza、F. Massa、A. El-Nouby 等人(2023)Dinov2:无需监督学习鲁棒视觉特征。arXiv 预印本 arXiv:2304.07193。引用位置:§1、§3.4。
  • F. Permenter 和 C. Yuan(2023)从优化视角解读并改进扩散模型。arXiv 预印本 arXiv:2306.04848。引用位置:§3.4。
  • R. Rombach、A. Blattmann、D. Lorenz、P. Esser 和 B. Ommer(2022)基于潜在扩散模型的高分辨率图像合成。载于 IEEE/CVF 计算机视觉与模式识别会议论文集,第 10684–10695 页。引用位置:§3.1。
  • S. Ross、G. Gordon 和 D. Bagnell(2011)将模仿学习和结构化预测归约为无遗憾在线学习。载于第十四届国际人工智能与统计会议论文集,第 627–635 页。引用位置:§1、§3.2。
  • C. Saharia、W. Chan、S. Saxena、L. Li、J. Whang、E. L. Denton、K. Ghasemipour、R. Gontijo Lopes、B. Karagol Ayan、T. Salimans 等人(2022)具备深度语言理解的照片级真实感文生图扩散模型。NeurIPS。引用位置:§4.1。
  • T. Salimans 和 J. Ho(2022)用于扩散模型快速采样的渐进式蒸馏。arXiv 预印本 arXiv:2202.00512。引用位置:§1、§2。
  • C. Schuhmann(2022)LAION-Aesthetics。注:https://laion.ai/blog/laion-aesthetics/ LAION 博客文章。引用位置:§4.1。
  • Y. Song 和 P. Dhariwal(2024)改进一致性模型训练技术。载于国际学习表征会议,第 2024 卷,第 15078–15097 页。引用位置:§2。
  • Y. Song、J. Sohl-Dickstein、D. P. Kingma、A. Kumar、S. Ermon 和 B. Poole(2021)基于随机微分方程的分数生成建模。ICLR。引用位置:§2、§3.4。
  • Stability AI(2024)推出 Stable Diffusion 3.5。注:https://stability.ai/news/introducing-stable-diffusion-3-5 官方模型发布公告;访问日期:2026-07-28。引用位置:§1。
  • F. Wang 和 Z. Yu(2025)基于流匹配的强化学习保系数采样。arXiv 预印本 arXiv:2509.05952。引用位置:§4.3。
  • Y. Wang、Y. Zang、H. Li、C. Jin 和 J. Wang(2025)面向多模态理解与生成的统一奖励模型。arXiv 预印本 arXiv:2503.05236。引用自:§4.1。
  • J. Xu、X. Liu、Y. Wu、Y. Tong、Q. Li、M. Ding、J. Tang 和 Y. Dong(2023)ImageReward:学习并评估文生图的人类偏好。神经信息处理系统进展第 36 卷,第 15903–15935 页。引用自:§4.1。
  • T. Yin、M. Gharbi、T. Park、R. Zhang、E. Shechtman、F. Durand 和 W. T. Freeman(2024a)改进的分布匹配蒸馏用于快速图像合成。arXiv 预印本 arXiv:2405.14867。引用自:§2。
  • T. Yin、M. Gharbi、T. Park、R. Zhang、E. Shechtman、F. Durand 和 W. T. Freeman(2024b)改进的分布匹配蒸馏用于快速图像合成。收录于第三十八届神经信息处理系统年度会议。引用自:§1。
  • T. Yin、M. Gharbi、R. Zhang、E. Shechtman、F. Durand、W. T. Freeman 和 T. Park(2024c)基于分布匹配蒸馏的单步扩散。arXiv 预印本 arXiv:2311.18828。引用自:§2。
  • R. Zhang、P. Isola、A. A. Efros、E. Shechtman 和 O. Wang(2018)深度特征作为感知指标的惊人有效性。CVPR。引用自:§3.2、§4.3。
  • M. Zhou、H. Zheng、Z. Wang、M. Yin 和 H. Huang(2024)分数恒等蒸馏:预训练扩散模型用于单步生成的指数级快速蒸馏。收录于第四十一届国际机器学习会议。引用自:§2。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org

Any-OPD:面向流匹配模型的异构同策略蒸馏框架

HuggingFace Daily Papers(社区热门论文)·2026-08-04 08:00·6天前
AI 导读

Any-OPD 提出首个支持任意异构流匹配生成器对的同策略蒸馏框架,仅通过冻结的 DINOv2 表示空间桥接教师与学生模型,无需共享 VAE、架构或噪声调度。将 FLUX.1-dev 蒸馏至 SD3.5-Medium 后,学生模型 PickScore 与 HPSv3 均显著提升,以教师五分之一的参数量达到接近其性能,而直接潜在回归训练完全失败。

正文 · AI 翻译

傅思明

,傅哲铭

,何睿哲

,王华亮

,黄杰

,马晓晓

钟明辰

,黄伟虎

,何晓萱

,徐浩钧

摘要

在策略蒸馏(on-policy distillation)中,教师模型会纠正学生模型自身生成的样本,这种方法预设了两个模型使用同一种语言:相同的 VAE 潜变量、匹配的架构,以及共同的时间步网格。我们探讨当这些条件都不成立时会发生什么——例如,当可用的最强教师模型与希望部署的学生模型来自不同模型家族时——并发现标准方案无法应对:教师模型的潜变量无法在异质坐标系中作为目标,针对随机重绘局部细节的教师模型进行逐像素损失会导致模糊或发散,而时间步索引在不匹配的调度方案之间也失去了意义。我们提出 Any-OPD,据我们所知,这是首个适用于任意潜变量流匹配生成器对之间进行在策略蒸馏的框架。Any-OPD 将教师模型纯粹视为黑盒采样器,并仅在一点上连接两个模型:一个冻结的、与模型无关的视觉表征,在此表征中比较两者独立解码的输出,从而绕过了关于潜变量、特征或架构的所有假设。轨迹对应关系通过匹配连续噪声水平而非步索引来恢复,而一个简短的锚定阶段——将教师样本通过学生自身的 VAE 重新编码——确保在策略梯度衡量的是样本质量而非域不匹配。将 B FLUX.1-dev 蒸馏到 B SD3.5-Medium,Any-OPD 将学生的 PickScore 从 提升至 ,HPSv3 从 提升至 ,在仅有其五分之一规模的情况下媲美教师模型,而直接潜变量回归则完全无法训练。122.50.8460.8849.1210.97

1 引言

流匹配生成器(Lipman 等人,2023;Esser 等人,2024b)如今已定义了文生图合成领域的最先进水平,但它们最强的实例规模庞大:像 FLUX.1-dev(Black Forest Labs 2024)这样的模型,仅去噪 Transformer 就携带了 B 级参数,使其在延迟或内存受限的部署场景中难以落地。知识蒸馏(Hinton 等人,2015)提供了自然的解决方案——让一个小学生模型继承大教师模型的质量,而其最有效的形式是策略内(on-policy)蒸馏:学生并非从固定数据中模仿教师输出,而是在自身采样轨迹所生成的状态上接受监督,这消除了纯离线模仿的暴露偏差(Agarwal 等人,2024;Lin 等人,2020;Ross 等人,2011)。然而,现有的扩散模型策略内方案(Salimans 和 Ho 2022;Yin 等人,2024b;Luo 等人,2023a)建立在一个如此普遍以至于很少被明确表述的假设之上:教师和学生是同构的。它们共享同一个 VAE,因此共享一个潜变量坐标系,在这个坐标系中教师预测可以作为回归目标;它们通常共享架构,因此内部特征可以对齐;它们还共享时间步网格,因此“同一步”对两者而言意味着相同的噪声水平(Salimans 和 Ho 2022)。这一假设悄然将蒸馏限制在源自单一模型家族的配对中。然而,人们实际想要进行蒸馏的配对往往是异构的:可用的教师和学生通常由不同方围绕不同的 VAE、架构和噪声调度开发而成。12

在本文中,我们提出并解决了异构同策略蒸馏(heterogeneous on-policy distillation)问题:在冻结的教师模型监督下,用学生模型自身生成的轨迹训练学生模型,而学生与教师之间既不共享 VAE,也不共享架构,更不共享噪声调度,教师仅作为采样器被访问。放弃同构假设会从两个独立维度破坏同策略蒸馏。首先,这对模型没有共享空间:教师模型的潜变量在学生模型的坐标系中并非有效目标;更不明显的是,将两个模型都解码到像素空间也无法恢复可用的目标函数。教师模型的精炼(refinement)是一种随机再合成过程,在保留语义的同时重新绘制局部细节,因此逐像素回归会趋向于模糊的条件均值,而在我们的实验中,这直接导致训练崩溃。其次,这对模型没有共享时钟:两种噪声调度源自不同的偏移函数,因此相同的求解器索引对应不同的噪声水平(Esser et al. 2024b),而按索引对齐的监督会将来自不可比噪声区间(Karras et al. 2022)的状态配对在一起。

我们提出 Any-OPD(任意教师、任意学生、同策略蒸馏),它通过一种不引用两个模型内部结构的机制解决了上述每一种失败情形。针对空间差距,两个模型仅在两者外部的第三种表征中耦合:学生和教师各自用自己的 VAE 解码,所得图像由冻结的 DINOv2(Oquab 等人,2023)的 CLS 嵌入进行比较。这种全局的、与坐标无关的比较方式,恰好对像素回归和潜空间回归所无法处理的局部再合成具有不变性,而且由于该特征提取器与模型无关,更换教师既不会改变损失函数,也不需要改动训练流程中的任何一行代码。针对时间步差距,两条轨迹按噪声水平本身对齐,而非按步索引对齐:在教师从选定的噪声水平对学生样本进行精炼之后,梯度恰好流经那些噪声水平不低于该水平的学生步骤,这一规则对任意调度组合都保持良定义。第三个组件使该信号从一开始就可使用:一个离线锚定阶段首先通过学生的编码器将教师的输出分布移植到学生自身的潜空间中,用数据弥合分布层面的差距,从而让同策略目标只需修正逐样本误差。我们在一个最大异质性的模型对上实例化了 Any-OPD,将 FLUX.1-dev(Black Forest Labs 2024)(B)蒸馏到 SD3.5-Medium(Stability AI 2024)(B):两者具有不同的 VAE、不同的 Transformer 架构、不同的噪声调度。蒸馏后的学生在偏好导向指标上相比其初始状态有显著提升,将 PickScore(Kirstain 等人,2023)从 提升到 ,将 HPSv3(Ma 等人,2025)从 提升到 ,并在约为教师五分之一规模的情况下接近或超过 B 教师,而直接的潜空间回归方案则完全失效。我们的贡献如下:122.50.8460.8849.1210.9712

  • 我们为流匹配生成器提出了异质性同策略蒸馏框架,并识别出使现有同策略方法无法适用的两个障碍:缺乏共享表征(无共享空间)以及缺乏可比较的时间步网格(无共享时钟)。

  • 我们提出 Any-OPD,该方法仅通过一个冻结的、与模型无关的表示空间将两个模型耦合,并依据噪声级别匹配而非求解器索引来对齐它们的轨迹。因此,该流程适用于任意潜在流匹配生成器的师生模型对。

  • 我们展示了首次跨模型族的在策略蒸馏,从 FLUX.1-dev 蒸馏到 SD3.5-Medium,其中 B 学生模型在多项偏好指标上达到或超越了其 B 教师模型。我们对每个组件进行了消融实验,并特别表明,在 VAE 边界上进行朴素的潜在回归会导致训练崩溃。2.512

2 相关工作

扩散模型与流匹配。

扩散模型(Ho 等人,2020;Song 等人,2021)通过逆转逐步加噪过程来生成样本,而流匹配(Lipman 等人,2023;Liu 等人,2024)则学习从噪声到数据的连续传输,并支持高效的确定性采样。这一范式已成为近期高分辨率文生图系统的常见主干,包括 SD3(Esser 等人,2024a)、FLUX(Black Forest Labs 2024)和 Z-Image(Cai 等人,2025)。在实践中,这些模型不仅在规模上有所不同,在 VAE 设计、Transformer 架构和噪声调度参数化方面也存在差异。这些差异使得跨模型族的蒸馏远比同质检查点之间的蒸馏困难得多。

扩散蒸馏。

扩散模型和流模型的早期蒸馏方法主要压缩采样成本。渐进式方法和基于一致性方法(Salimans and Ho 2022; Luo et al. 2023b; Song and Dhariwal 2024)训练少步学生模型以匹配多步教师模型,而分布匹配方法(Yin et al. 2024c, a; Zhou et al. 2024)则使学生的输出分布与教师偏好对齐。这些方法通常是离线的:监督信号从固定数据或教师轨迹中收集,因此教师不会直接纠正学生在训练过程中访问的状态。策略内蒸馏(OPD)最初在语言模型蒸馏中提出,通过让学生从教师对学生生成轨迹的反馈中学习来减少这种暴露偏差(Agarwal et al. 2024; Gu et al. 2024; Ko et al. 2025)。近期扩散和流模型的扩展将该思想引入迭代式图像生成。DiffusionOPD(Li et al. 2026)为扩散转移过程制定了策略内监督,Flow-OPD(Fang et al. 2026)则将 OPD 适配到流匹配中,并采用密集的轨迹级教师监督。然而,这些公式假设教师和学生可以在共享状态上交互,这自然适用于同构模型,但当它们的 VAE 潜在空间不兼容时就会失效。

Refer to caption
图 1:Any-OPD 概览。左图:锚定阶段通过速度匹配在教师生成的目标上训练学生,将教师的分布迁移到学生自身的潜在坐标中。右图:策略内训练对学生进行 rollout,通过噪声-去噪精炼将样本投影到教师的流形上,并通过噪声级别匹配选择的学生片段进行反向传播。学生和教师各自使用自己的 VAE 解码;两幅图像仅在冻结的 DINOv2 表示空间中相遇。

3 方法

3.1 预备知识:流匹配与潜在生成器

流匹配(Flow Matching,Lipman et al. 2023)学习一个速度场,该速度场沿 ODE 将噪声传输到数据。在最优传输插值下,vθ:d×[0,1]ddxt=vθ(xt,t)dt

xt=(1t)x0+tx1,x0pdata,x1𝒩(0,I), (1)

因此 本身即为噪声级别,训练最小化t

FM(θ)=𝔼t,x0,x1[vθ(xt,t)(x1x0)2]. (2)

推理过程采用离散步进欧拉调度,并带有噪声水平,其中由模型特定的偏移函数生成(Karras et al. 2022; Esser et al. 2024a)。在整个过程中,求解器索引为纯噪声,索引为干净样本,因此随索引单调递减。N1=σ0>σ1>>σN=0σi0Nσ

我们考虑潜变量生成器,每个生成器由编码器、解码器、速度场和调度组成:图像通过在潜空间中积分并解码端点来生成(Rombach et al. 2022; Esser et al. 2024a)。我们的学生模型为,冻结的教师模型为,两者的速度场作用于不相交的域上,(,𝒟,v,{σi})v𝒵S=(S,𝒟S,vθ,{σiS})T=(T,𝒟T,vϕ,{σiT})

vθ:𝒵S×[0,1]𝒵S,vϕ:𝒵T×[0,1]𝒵T. (3)

3.2 异构设置:无共享空间,无共享时钟

同策略蒸馏要求教师模型对学生模型自身轨迹上的状态进行监督(Ross et al. 2011; Agarwal et al. 2024; Li et al. 2026; Fang et al. 2026),而对于异构配对,这一过程会在两个维度上失效。无共享空间:由于,教师模型的潜变量在学生模型的坐标系中并非有效目标,且架构差异排除了特征匹配的可能性;像素级信息也无济于事,因为教师模型的细化过程是一种随机的重新合成,在保留语义的同时重新绘制局部细节,因此逐像素的均方误差会回归到所有可行重新合成的平均值,从而导致训练崩溃(Zhang et al. 2018; Blau and Michaeli 2018)。监督必须转移到第三种表示上,这种表示独立于两个模型之外,并且对局部坐标不敏感。无共享时钟:不同的偏移函数导致,因此按索引对齐的监督会将来自不可比噪声状态的状态配对;噪声水平是两条轨迹之间唯一共享的量,必须作为对齐变量。这些补救措施说明了如何进行监督,但并未说明监督何时有用:当学生模型的样本仍远离教师模型的流形时,每个梯度都指向从一个域到另一个域的方向,不携带任何逐样本信息。因此,Any-OPD 首先离线锚定学生模型的分布,然后才将同策略修正应用于逐样本残差。𝒵S𝒵TσiSσiT

3.3 将学生模型锚定在教师模型的流形上

分布层面的差距并不需要通过在线策略训练来弥合,因为它不要求一一对应:学生模型只需学会生成与教师模型同类别的图像,而非复现某一张特定的图像。这使得该差距可以在离线状态下解决,使用标准的流匹配目标函数即可,前提是教师模型的分布能够在学生模型的坐标系中表达出来。学生模型自身的编码器恰好提供了这种表达。

给定一个提示词,教师模型生成目标图像,我们使用学生模型的 VAE 对其进行重新编码,得到。由此,教师模型的流形被呈现在学生模型实际优化的坐标系中——这是任何跨越两个潜在空间定义的损失函数都无法实现的。从学生模型自身的步调度中均匀抽取一个索引,我们构造出cxT=𝒟T(SampleT(c))z=S(xT)mM

zm=(1σmS)z+σmSϵ,ϵ𝒩(0,I), (4)

并使用以下目标进行训练

WS=𝔼m,ϵ,c[vθ(zm,σmS,c)(ϵz)2], (5)

其中由(4)式给出;上述形式与相匹配,并避免了在时除以的问题。锚定无法修复的问题同样清晰明确。学生模型在训练中只观察到从正确端点插值得到的状态,而在推理时它遵循的是自身不完美的轨迹;锚定决定了学生模型分布的位置,却无法决定学生模型在它实际到达的状态上如何表现。这一残余误差本质上是逐样本的,弥合它正是在线策略阶段的任务。ϵz=(zmz)/σmSFMσmSσmS0

3.4 任意教师模型与任意学生模型之间的在线策略蒸馏

在线策略阶段围绕单一算子展开。对于噪声水平,令σ

ΠTσ(x)=𝒟T(EulerT((1σ)T(x)+σϵ 0,c)) (6)

记教师的加噪-去噪映射为:将图像扰动到噪声水平,并在教师的速度场下重新生成它(Nie 等人,2022)。由于去噪过程会向教师的模型分布收缩,因此它充当了到教师图像流形上的随机投影(Permenter 和 Yuan,2023),其中 设定了投影可以移动样本的半径范围:当 趋近于恒等映射时,当 趋近于无条件重采样时(Ho 等人,2020;Song 等人,2021)。评估 对教师的要求仅仅是具备采样能力;这个采样接口就是 Any-OPD 对教师所做的全部假设,而第 3.1 节意义上的任何潜在生成器都能提供这一点。该阶段训练学生模型,使其自身样本成为该投影在特征等价意义下的不动点:当且仅当 时,即教师被允许在半径 内重绘样本却无法产生任何语义上更好的结果时,样本收到的梯度为零。因此,每次训练迭代做三件事:投影一个在策略样本,将由此产生的修正通过能够表达它的学生步骤进行路由,并检验不动点条件。设 和 分别表示学生和教师的求解器步骤。σΠTσσσ0σ1ΠTσxf(x)=f(ΠTσ(x))σNSNT

媒体内容 · 前往原文查看
表 1:主要结果。FLUX.1-dev 使用其标准的 50 步 Euler 采样器;SD3.5-Medium 和 Any-OPD 使用 40 步 Euler 采样。Aesth.:美学评分;ImgRwd:ImageReward;HPSv3:人类偏好评分 v3;UniRwd/UniRwd2:UnifiedReward 和 UnifiedReward2。蓝色阴影加粗标记表示相对于 SD3.5-Medium 基线的改进。
DrawBench DPG-Bench
角色 模型 参数量 Aesth. ImgRwd PickScore HPSv3 UniRwd UniRwd2 总体
教师 FLUX.1-dev 12B 5.765 0.971 0.878 11.19 3.38 3.35 83.84
学生 SD3.5-Medium 2.5B 5.383 0.922 0.866 9.12 3.23 3.21 84.58
学生 + Any-OPD SD3.5-Medium 2.5B 5.788 1.116 0.884 10.97 3.31 3.26 84.71
Refer to caption
图 2:DrawBench 提示词上的定性比较。Any-OPD(2.5B,带 LoRA 的 SD3.5-Medium)在保持学生架构和 40 步采样不变的情况下,接近 12B FLUX.1-dev 教师的视觉质量。
投影在策略样本。

每一次迭代都恰好监督学生模型在推理时所部署分布中的一个样本。投影半径是预先固定的,方法是先抽取并设定教师模型的起始索引;由于事先知道半径,就能确定后续梯度传播所需的唯一中间状态,因此 rollout 只需存储一个潜变量,而非整条轨迹。随后学生模型在无梯度的情况下,依据自身的时间表进行积分。r𝒰{rmin,,rmax}k=NTrz0𝒩(0,I)

zi+1=zi+(σi+1SσiS)vθ(zi,σiS,c),i=0,,NS1, (7)

其输出在层级上被投影。具体而言,通过格式转换进入教师模型的坐标空间,这一转换不产生任何信息损失;随后教师模型重新加噪,σkTxS=𝒟S(zNS)zNTT=T(xS)

zkT=(1σkT)zNTT+σkTϵ,ϵ𝒩(0,I), (8)

并沿自身的时间表积分至干净的终点,

xref=𝒟T(EulerT(zkT,kNT,vϕ,c))=ΠTσkT(xS). (9)

半径在信号与相关性之间进行权衡。当半径较小时,投影趋近于恒等映射,目标中不包含任何修正信息;当半径较大时,投影趋近于重采样,此时该样本不再是对原样本的改进,梯度也因此继承了未配对目标的方差。有价值的精炼介于这两种退化情形之间——此时投影保留了学生模型的构成,仅替换其执行过程;第 4.3 节将对此范围进行实证刻画。rrxref

按噪声层级路由修正。

修正既有尺度,也有内容。投影仅在由噪声层级所决定的尺度上改变样本,因此学生模型若要吸收这一修正,其梯度必须覆盖自身在该范围内运作的每一个求解器步骤;任何更窄的片段都无法表达这一编辑。由于时间表无法按索引直接比较,该片段需依据噪声层级本身来定位,[0,σkT]

j=max{i:σiSσkT},i.e.σjSσkT>σj+1S, (10)

即最不嘈杂的学生状态,其噪声程度仍不低于投影起始点的噪声程度,因此这是噪声范围恰好包含修正范围的最紧凑片段,适用于任意一对偏移函数。学生模型从缓存的潜变量处启用梯度进行重放,zj

z^NS=EulerS(zj,jNS,vθ,c), (11)

因此只有 Transformer 的求值过程携带激活值,且每一步都单独设置检查点。将视为常数,使得梯度以学生模型实际到达的状态为条件,而非以任何正确模型本应到达的状态为条件;正是这种条件化——而非单纯的 rollout——使得该更新成为在策略(on-policy)更新。NSjzj

在表征空间中耦合模型。

该条件只能在第 3.2 节所识别的第三种表示中进行测试。每个模型通过其自身的解码器渲染结果,并且根据 (9),损失函数通过一个冻结的提取器将两者耦合,该提取器对两者施加相同的操作:f(x^S)=f(xref)x^S=𝒟S(z^NS)xreff

OPD=1cos(f(x^S),f(xref)), (12)

其中返回冻结的 DINOv2-Base(Oquab 等人,2023)的 CLS token,梯度通过冻结的解码器流入。该选择同时满足了第 3.2 节的两个要求。它是外部的:不触及任一模型的潜在表示或架构,因此替换教师模型仅替换投影,而损失函数和流程保持不变。它是无坐标的:CLS token 聚合所有 patch,DINOv2 的判别式自监督使余弦距离能够惩罚结构和语义偏差,同时对于 (9) 的每次应用所引入的局部再合成保持不变。f𝒟SvθffΠT

Refer to caption
图 3:教师细化步骤的效果(对比,其他条件相同)。目标中的模糊传播到学生模型中,表明教师的去噪预算限制了可迁移的质量上限。NT1020NT=10

4 实验

4.1 实验设置

模型。

学生模型为 SD3.5-Medium(2.5B;SD3 VAE,静态偏移,引导);教师模型为 FLUX.1-dev(12B;FLUX VAE,动态偏移,引导)。该配对在 VAE、架构和噪声调度上同时存在差异。我们仅训练学生 Transformer 中的 LoRA 适配器(秩,);其余一切保持冻结。3.04.53.532α=64

数据与训练。

训练提示词从 Pick-a-Pic 训练集(Kirstain 等人,2023)中采样,Pick-a-Pic 测试提示词留作验证。锚定运行 400 步(噪声水平;教师目标在 50 步 Euler 采样下生成)。在策略训练在 800 步下进行。两个阶段均使用学习率和每 GPU 批大小。M=10512×512512×512NS=NT=201044

评估。

所有模型均在其标准推理设置下进行评估(教师模型:50 步 Euler;学生模型和 Any-OPD:40 步 Euler)。在 DrawBench(Saharia 等人,2022)上,我们针对每个提示词生成五张图像,并报告 Aesthetic Score(Schuhmann,2022)、ImageReward(Xu 等人,2023)、PickScore(Kirstain 等人,2023)、HPSv3(Ma 等人,2025)以及 UnifiedReward/UnifiedReward2(Wang 等人,2025)的得分;在 GenEval(Ghosh 等人,2023)和 DPG-Bench(Hu 等人,2024)上,我们报告四项结果的官方综合得分。模型版本、提示词数量及类别级结果详见补充材料。1024×1024

4.2 主要结果

表 1 包含了核心结果:经过蒸馏的 2.5B 学生模型在 Aesthetic Score、ImageReward 和 PickScore 上超越了其 12B 教师模型,并在 HPSv3 和 UnifiedReward 得分上缩小了大部分差距,在架构和采样预算不变的情况下,相较于基线模型,DrawBench 的全部六项指标均有所提升。学生模型能够超越教师模型,这源于监督信号本身:训练目标是教师模型对学生样本的投影,将学生的构图与教师的渲染相结合,因此训练可以将学生模型置于两个模型单独都无法达到的位置;在 ImageReward 上,相较于基线模型()的提升几乎是教师模型自身优势()的四倍。构图准确性得以保持,DPG-Bench 基本不变():该目标函数是偏好导向的,而教师模型在此基准上没有提升空间,相比之下,构图能力更强的 Z-Image 教师模型在相同流程下确实提升了该指标(见第 4.4 节)。图 2 展示了定性层面的提升:更干净的纹理、更一致的光照和更精细的结构,同时保留了基线模型的布局,这与“保留构图、替换执行”的投影机制相一致。+0.194+0.049+0.13

4.3 消融研究

目标函数:只有表示空间得以保留

只有表示空间的目标函数能够稳定训练,这印证了第 3.2 节的核心论断:异构样本对既不能在潜在空间中进行逐坐标比较,也不能在像素层面进行局部比较。图 4 对比了使用潜在空间 MSE、LPIPS(Zhang 等人,2018)以及三种 DINOv2 变体(CLS;来自第 5、9、12 层的多层 CLS;CLS+Patch)训练的 OPD。在 ImageReward 和 Aesthetic Score 上,潜在空间 MSE 在最初的训练步骤内就发生崩溃:跨越 VAE 边界的逐坐标回归不仅不是次优的,而且是不稳定的。LPIPS 起初有所改善,随后退化,因为其补丁级局部特征仍然要求空间对应关系,而教师模型的随机再合成并不遵循这种对应关系。所有 DINOv2 变体都能稳定训练至结束,且单纯的 CLS 与更丰富的变体表现相当甚至更优,因此一个单一的全局嵌入就足够了。MSE、LPIPS、DINOv2 的排序恰好反映了每种目标函数所假设的局部对应程度。<<

Refer to caption
(a)ImageReward
Refer to caption
(b)Aesthetic Score
图 4:不同目标函数下的 OPD 训练曲线。潜在空间 MSE 崩溃;LPIPS 后期退化;DINOv2 CLS 稳定且表现最佳。

锚定是前提条件,而非额外奖励

锚定质量严格决定了 OPD 能达到的上限,正如第 3.3 节所预测的那样。图 5 对比了从无锚定、预稳定检查点(Anchor-100)和已稳定检查点(Anchor-400)开始的 OPD。三条曲线在整个训练过程中严格排序,且尽管 OPD 预算相同,Anchor-100 始终无法追上 Anchor-400:差距在于初始化质量,而非总计算量,因此 OPD 应在锚定收敛之后才开始。锚定曲线见补充材料。

Refer to caption
(a)ImageReward
Refer to caption
(b)Aesthetic Score
图 5:不同初始化下的 OPD 曲线。已稳定检查点(Anchor-400)在整个过程中占优。
Refer to caption
(a)ImageReward
Refer to caption
(b)Aesthetic Score
图 6:带 CPS rollout 随机性的 OPD 曲线。确定性 Euler()在两个指标上均表现最佳。η=0

教师精炼调度

精炼强度。r

强细化是必要的:在表 2 中,将教师模型从中等偏低噪声(,)起始,在所有指标上均不如其他设置,因为教师模型几乎不改变样本,目标携带的信号极少。两个较强区间表现接近,其中 在 PickScore 和 ImageReward 上略占优势,并在 DPG-Bench 和 HPSv3 上胜出;我们采用 作为整体最佳平衡点。r[0,10)σ<0.63[10,15)[15,20][15,20]

媒体内容 · 前往原文查看
表 2:教师细化强度对 20 步教师调度的影响。较大的 表示从更高噪声水平开始细化。更强的细化带来更好的结果。r
DrawBench DPG
强度 r区间 HPSv3 Pick ImgRwd 总体
中低 [0,10) 10.24 0.881 0.891 81.21
中高 [10,15) 10.80 0.885 1.120 84.68
[15,20] 10.97 0.884 1.116 84.71
细化步数 。NT

教师的去噪预算限制了可迁移质量:在图 3 中,减半的调度在细化目标中留下可见模糊,学生模型忠实地复现了这一点,而 则产生清晰的目标和相应更清晰的学生模型。NT=10NT=20

展开随机性

展开随机性虽然在 RL 式微调中通常有益,但在此处有害。我们将 Euler 替换为系数保持采样(CPS)(Wang and Yu 2025),该方法将每一步的噪声分量从模型预测方向旋转一个由 设定的角度,朝向新的高斯分布,同时保持总噪声尺度 不变:ϵ^=xi+(1σi)vθξ𝒩(0,I)ησi+1

xi+1=(1σi+1)x^0+σi+1[cosηπ2ϵ^+sinηπ2ξ], (13)

其中 。确定性 Euler()在所有情况下最优,并在 – 步后性能下降(图 6):扰动展开会使监督轨迹与部署轨迹脱钩。x^0=xiσivθη=0η0.3200300

4.4 泛化:更换教师模型

Any-OPD 的核心主张是教师模型可以在不修改方法的情况下被替换。我们直接验证这一点:将 FLUX.1-dev 替换为 Z-Image(6B;其自带 VAE,偏移 ,引导 ),其他一切不变:相同的学生模型、损失、超参数和评估。表 3 显示学生模型在每项报告的指标上均有提升,包括组合基准 GenEval()和 DPG-Bench()。值得注意的是,增益与教师模型的特征一致:Z-Image 本身在 GenEval()上表现强劲,而 Any-OPD-Z 在继承这一优势的同时也获得了感知质量上的提升。65.0+0.80+0.9574.90

媒体内容 · 前往原文查看
表 3:以 Z-Image 作为教师模型的知识蒸馏结果,采用与主实验完全相同的流程和超参数。蓝色底纹加粗标记表示相较于 SD3.5-Medium 基线的提升;† 标记教师模型参考值。
DrawBench GenEval DPG
模型 ImgRwd Pick HPSv3 综合 综合
SD3.5-Medium 0.922 0.866 9.12 70.70 84.58
Z-Image† 0.958 0.864 9.96 74.90 86.73
Any-OPD-Z 1.082 0.872 9.75 71.50 85.53

5 结论

我们提出了 Any-OPD,将在线策略蒸馏从迄今为止仅限于同构设定的范围拓展到了更广阔的领域。我们的公式识别出异构配对所打破的两个假设——共享表征和共享时间步网格——并分别用不依赖任一模型内部机制的方案取而代之:教师模型仅通过对学生自身输出进行加噪-去噪投影来充当采样器;两个模型仅在冻结的外部表征中相遇,学生在该表征中被训练向其自身投影的固定点收敛;监督信号则通过噪声水平本身在不兼容的时间表之间实现对齐。前置的锚定阶段按粒度分离蒸馏过程,用数据弥合分布层面的差距,使在线策略目标仅携带逐样本信息。由于这些组件均不依赖教师模型的 VAE、架构或时间表,教师模型在构造上就是可互换的——我们通过在不改动流程任何一行的情况下直接替换模型家族验证了这一特性。我们希望这种解耦能让当前最强的生成模型——无论由谁构建——都能成为任何需要部署的模型的可用的教师模型。

局限性与未来工作。

组合互补的教师模型是一种自然的改进方向。由于除特征提取器外,该公式中没有任何部分针对图像特化,将 Any-OPD 扩展到其他潜在生成模态是另一个值得探索的方向。

参考文献

  • R. Agarwal, N. Vieillard, Y. Zhou, P. Stanczyk, S. Ramos Garea, M. Geist, 和 O. Bachem (2024) 语言模型的在线策略蒸馏:从自生成错误中学习。载于国际学习表征会议,2024 年卷,第 21246–21263 页。引用位置:§1、§2、§3.2。
  • Black Forest Labs(2024)FLUX.1。注:https://github.com/black-forest-labs/flux 引用位置:§1、§1、§2。
  • Y. Blau 和 T. Michaeli(2018)感知-失真权衡。载于《IEEE 计算机视觉与模式识别会议论文集》,第 6228–6237 页。引用位置:§3.2。
  • H. Cai、S. Cao、R. Du、P. Gao、S. Hoi、Z. Hou、S. Huang、D. Jiang、X. Jin、L. Li 等(2025)Z-image:基于单流扩散 Transformer 的高效图像生成基础模型。arXiv 预印本 arXiv:2511.22699。引用位置:§2。
  • P. Esser、S. Kulal、A. Blattmann、R. Entezari、J. Müller、H. Saini、Y. Levi、D. Lorber、A. Sauer、F. Boesel 等(2024a)扩展修正流 Transformer 以实现高分辨率图像合成。arXiv 预印本 arXiv:2403.03206。引用位置:§2、§3.1、§3.1。
  • P. Esser、S. Kulal、A. Blattmann、R. Entezari、J. Müller、H. Saini、Y. Levi、D. Lorenz、A. Sauer、F. Boesel 等(2024b)扩展修正流 Transformer 以实现高分辨率图像合成。载于《第四十一届国际机器学习大会》。引用位置:§1、§1。
  • Z. Fang、W. Huang、Y. Zeng、Y. Zhao、S. Chen、K. Feng、Y. Lin、L. Chen、Z. Chen、S. Cao 等(2026)Flow-OPD:面向流匹配模型的在线策略蒸馏。arXiv 预印本 arXiv:2605.08063。引用位置:§2、§3.2。
  • D. Ghosh、H. Hajishirzi 和 L. Schmidt(2023)Geneval:面向文本到图像对齐评估的对象聚焦框架。《神经信息处理系统进展》第 36 卷,第 52132–52152 页。引用位置:§4.1。
  • Y. Gu、L. Dong、F. Wei 和 M. Huang(2024)MiniLLM:大语言模型的知识蒸馏。载于《国际学习表征会议》,2024 年第 2024 卷,第 32694–32717 页。引用位置:§2。
  • G. Hinton、O. Vinyals 和 J. Dean(2015)蒸馏神经网络中的知识。arXiv 预印本 arXiv:1503.02531。引用位置:§1。
  • J. Ho、A. Jain 和 P. Abbeel(2020)去噪扩散概率模型。NeurIPS。引用位置:§2、§3.4。
  • X. Hu、R. Wang、Y. Fang、B. Fu、P. Cheng 和 G. Yu(2024)ELLA:为扩散模型配备大语言模型以增强语义对齐。arXiv 预印本 arXiv:2403.05135。引用位置:§4.1。
  • T. Karras、M. Aittala、T. Aila 和 S. Laine(2022)《阐明基于扩散的生成模型的设计空间》。神经信息处理系统进展第 35 卷,第 26565–26577 页。引用位置:§1、§3.1。
  • Y. Kirstain、A. Polyak、U. Singer、S. Matiana、J. Penna 和 O. Levy(2023)《Pick-a-pic:一个用于文生图用户偏好的开放数据集》。NeurIPS。引用位置:§1、§4.1、§4.1。
  • J. Ko、T. Chen、S. Kim、T. Ding、L. Liang、I. Zharkov 和 S. Yun(2025)《Distillm-2:一种提升大语言模型蒸馏效果的对比方法》。arXiv 预印本 arXiv:2503.07067。引用位置:§2。
  • Q. Li、J. Yu、K. Jiang、Y. Wei、Z. Xing、P. Li、R. Chu、S. Zhang、Y. Liu 和 Z. Wu(2026)《DiffusionOPD:扩散模型中在线策略蒸馏的统一视角》。arXiv 预印本 arXiv:2605.15055。引用位置:§2、§3.2。
  • A. Lin、J. Wohlwend、H. Chen 和 T. Lei(2020)《通过模仿学习进行自回归知识蒸馏》。载于 2020 年自然语言处理经验方法会议(EMNLP)论文集,第 6121–6133 页。引用位置:§1。
  • Y. Lipman、R. T. Chen、H. Ben-Hamu、M. Nickel 和 M. Le(2023)《用于生成建模的流匹配》。ICLR。引用位置:§1、§2、§3.1。
  • X. Liu、C. Gong 和 Q. Liu(2023)《流直且快:利用修正流学习生成与迁移数据》。ICLR。引用位置:§2。
  • S. Luo、Y. Tan、L. Huang、J. Li 和 H. Zhao(2023a)《潜在一致性模型:用少步推理合成高分辨率图像》。arXiv 预印本 arXiv:2310.04378。引用位置:§1。
  • S. Luo、Y. Tan、L. Huang、J. Li 和 H. Zhao(2023b)《潜在一致性模型:用少步推理合成高分辨率图像》。arXiv 预印本 arXiv:2310.04378。引用位置:§2。
  • Y. Ma、X. Wu、K. Sun 和 H. Li(2025)《Hpsv3:迈向广谱人类偏好评分》。载于 IEEE/CVF 国际计算机视觉会议论文集,第 15086–15095 页。引用位置:§1、§4.1。
  • W. Nie、B. Guo、Y. Huang、C. Xiao、A. Vahdat 和 A. Anandkumar(2022)《用于对抗净化的扩散模型》。arXiv 预印本 arXiv:2205.07460。引用位置:§3.4。
  • M. Oquab、T. Darcet、T. Moutakanni、H. Vo、M. Szafraniec、V. Khalidov、P. Fernandez、D. Haziza、F. Massa、A. El-Nouby 等人(2023)Dinov2:无需监督学习鲁棒视觉特征。arXiv 预印本 arXiv:2304.07193。引用位置:§1、§3.4。
  • F. Permenter 和 C. Yuan(2023)从优化视角解读并改进扩散模型。arXiv 预印本 arXiv:2306.04848。引用位置:§3.4。
  • R. Rombach、A. Blattmann、D. Lorenz、P. Esser 和 B. Ommer(2022)基于潜在扩散模型的高分辨率图像合成。载于 IEEE/CVF 计算机视觉与模式识别会议论文集,第 10684–10695 页。引用位置:§3.1。
  • S. Ross、G. Gordon 和 D. Bagnell(2011)将模仿学习和结构化预测归约为无遗憾在线学习。载于第十四届国际人工智能与统计会议论文集,第 627–635 页。引用位置:§1、§3.2。
  • C. Saharia、W. Chan、S. Saxena、L. Li、J. Whang、E. L. Denton、K. Ghasemipour、R. Gontijo Lopes、B. Karagol Ayan、T. Salimans 等人(2022)具备深度语言理解的照片级真实感文生图扩散模型。NeurIPS。引用位置:§4.1。
  • T. Salimans 和 J. Ho(2022)用于扩散模型快速采样的渐进式蒸馏。arXiv 预印本 arXiv:2202.00512。引用位置:§1、§2。
  • C. Schuhmann(2022)LAION-Aesthetics。注:https://laion.ai/blog/laion-aesthetics/ LAION 博客文章。引用位置:§4.1。
  • Y. Song 和 P. Dhariwal(2024)改进一致性模型训练技术。载于国际学习表征会议,第 2024 卷,第 15078–15097 页。引用位置:§2。
  • Y. Song、J. Sohl-Dickstein、D. P. Kingma、A. Kumar、S. Ermon 和 B. Poole(2021)基于随机微分方程的分数生成建模。ICLR。引用位置:§2、§3.4。
  • Stability AI(2024)推出 Stable Diffusion 3.5。注:https://stability.ai/news/introducing-stable-diffusion-3-5 官方模型发布公告;访问日期:2026-07-28。引用位置:§1。
  • F. Wang 和 Z. Yu(2025)基于流匹配的强化学习保系数采样。arXiv 预印本 arXiv:2509.05952。引用位置:§4.3。
  • Y. Wang、Y. Zang、H. Li、C. Jin 和 J. Wang(2025)面向多模态理解与生成的统一奖励模型。arXiv 预印本 arXiv:2503.05236。引用自:§4.1。
  • J. Xu、X. Liu、Y. Wu、Y. Tong、Q. Li、M. Ding、J. Tang 和 Y. Dong(2023)ImageReward:学习并评估文生图的人类偏好。神经信息处理系统进展第 36 卷,第 15903–15935 页。引用自:§4.1。
  • T. Yin、M. Gharbi、T. Park、R. Zhang、E. Shechtman、F. Durand 和 W. T. Freeman(2024a)改进的分布匹配蒸馏用于快速图像合成。arXiv 预印本 arXiv:2405.14867。引用自:§2。
  • T. Yin、M. Gharbi、T. Park、R. Zhang、E. Shechtman、F. Durand 和 W. T. Freeman(2024b)改进的分布匹配蒸馏用于快速图像合成。收录于第三十八届神经信息处理系统年度会议。引用自:§1。
  • T. Yin、M. Gharbi、R. Zhang、E. Shechtman、F. Durand、W. T. Freeman 和 T. Park(2024c)基于分布匹配蒸馏的单步扩散。arXiv 预印本 arXiv:2311.18828。引用自:§2。
  • R. Zhang、P. Isola、A. A. Efros、E. Shechtman 和 O. Wang(2018)深度特征作为感知指标的惊人有效性。CVPR。引用自:§3.2、§4.3。
  • M. Zhou、H. Zheng、Z. Wang、M. Yin 和 H. Huang(2024)分数恒等蒸馏:预训练扩散模型用于单步生成的指数级快速蒸馏。收录于第四十一届国际机器学习会议。引用自:§2。

来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org