HuggingFace Daily Papers(社区热门论文)
精选
76AI 编辑部评分,满分 100

Any-OPD:面向流匹配模型的异构同策略蒸馏框架

2026-08-04 08:00· 1天前
AI 导读

Any-OPD 提出首个支持任意异构流匹配生成器对的同策略蒸馏框架,仅通过冻结的 DINOv2 表示空间桥接教师与学生模型,无需共享 VAE、架构或噪声调度。将 FLUX.1-dev 蒸馏至 SD3.5-Medium 后,学生模型 PickScore 与 HPSv3 均显著提升,以教师五分之一的参数量达到接近其性能,而直接潜在回归训练完全失败。

推荐理由

将异构流匹配蒸馏转化为在独立视觉空间求解固定点,配合噪声级对齐跨过VAE与架构差异,2.5B学生模型在偏好指标上逼近12B教师。

正文 · AI 翻译

傅思明

,傅哲铭

,何睿哲

,王华亮

,黄杰

,马晓晓

钟明辰

,黄伟虎

,何晓萱

,徐浩钧

摘要

同策略蒸馏(on-policy distillation)是指教师模型纠正学生模型自身生成的样本,其前提是这两个模型使用相同的“语言”:相同的VAE潜在空间、匹配的架构以及共同的时间步网格。我们探讨当这些条件均不成立时会发生什么,例如当可用的最强教师模型与希望部署的学生模型来自不同模型家族时,我们发现标准方案无法解决此问题:教师模型的潜在变量无法在异源坐标系中作为目标使用;针对随机重绘局部细节的教师模型进行逐像素损失计算,会退化为模糊或发散;时间步索引在不匹配的调度方案之间也失去了意义。我们提出Any-OPD,据我们所知,这是首个适用于任意潜在流匹配生成器对之间进行同策略蒸馏的框架。Any-OPD将教师模型纯粹视为黑盒采样器,并仅在一点上连接两个模型:一个冻结的、与模型无关的视觉表示,在该表示中对两者独立解码的输出进行比较,从而绕过了关于潜在变量、特征或架构的所有假设。轨迹对应关系通过匹配连续噪声水平而非步索引来恢复,而一个简短的锚定阶段(将教师样本通过学生自身的VAE重新编码)确保同策略梯度衡量的是样本质量而非域不匹配。将B FLUX.1-dev蒸馏到B SD3.5-Medium中,Any-OPD将学生的PickScore从提升至,HPSv3从提升至,在仅为教师模型五分之一规模的情况下媲美教师模型,而直接潜在回归则完全无法训练。

1 引言

流匹配生成器(Lipman 等人,2023;Esser 等人,2024b)如今定义了文生图合成领域的最先进水平,但它们最强的实例规模庞大:像 FLUX.1-dev(Black Forest Labs 2024)这样的模型,仅去噪 Transformer 就携带 B 级参数,使其在延迟或内存受限的部署场景中难以落地。知识蒸馏(Hinton 等人,2015)提供了自然的解决方案——让一个小学生模型继承大教师模型的质量,而其最有效的形式是同策略(on-policy)蒸馏:学生模型不是从固定数据中模仿教师输出,而是在自身采样轨迹所生成的状态上接受监督,这消除了纯离线模仿的暴露偏差(Agarwal 等人,2024;Lin 等人,2020;Ross 等人,2011)。然而,现有的扩散模型同策略方案(Salimans 和 Ho 2022;Yin 等人,2024b;Luo 等人,2023a)建立在一个如此普遍以至于很少被明确表述的假设之上:教师模型和学生模型是同构的。它们共享同一个 VAE,因此共享一个潜在坐标系,在这个坐标系中教师预测可以作为回归目标;它们通常共享架构,因此内部特征可以对齐;它们还共享时间步网格,因此“同一步”对两者意味着相同的噪声水平(Salimans 和 Ho 2022)。这一假设悄悄地将蒸馏限制在源自单一模型家族的配对中。然而,人们实际想要进行蒸馏的配对是异构的:可用的教师模型和学生模型通常由不同方围绕不同的 VAE、架构和噪声调度开发。

在本文中,我们提出并解决了异构同策略蒸馏(heterogeneous on-policy distillation)问题:让学生在自身轨迹上,在一个冻结教师模型的监督下进行训练,而学生与教师既不共享 VAE,也不共享架构,更不共享噪声调度,教师仅作为采样器被访问。放弃同构假设会沿两个独立维度破坏同策略蒸馏。首先,这对模型没有共享空间:教师潜在变量在学生坐标系中不是有效目标,且更不明显的是,将两个模型都解码到像素空间也无法恢复可用的目标函数。教师细化是一种随机重合成过程,在保留语义的同时重新绘制局部细节,因此逐像素回归会趋向于模糊的条件均值,在我们的实验中直接导致训练崩溃。其次,这对模型没有共享时钟:两种噪声调度源自不同的偏移函数,因此相同的求解器索引对应不同的噪声水平(Esser 等人,2024b),而索引对齐的监督会将来自不可比噪声域的状态配对(Karras 等人,2022)。

我们提出 Any-OPD(任意教师、任意学生、同策略蒸馏),它通过一种不引用两个模型内部结构的机制解决了上述每一个失败情形。针对空间差距,两个模型仅在两者外部的第三种表征中耦合:学生和教师各自用自己的 VAE 解码,所得图像由冻结的 DINOv2(Oquab 等人,2023)的 CLS 嵌入进行比较。这种全局、无坐标系的比较恰好对像素回归和潜空间回归所无法应对的局部再合成具有不变性,而且由于该特征提取器与模型无关,更换教师既不会改变损失函数,也不会改动训练流程中的任何一行代码。针对时钟差距,两条轨迹按噪声水平本身而非步数索引对齐:在教师从选定噪声水平对学生样本进行精炼之后,梯度恰好流过那些噪声水平不低于该水平的学生的步,这一规则对任意调度组合都保持良定义。第三个组件使该信号从一开始就可用:一个离线锚定阶段首先通过学生的编码器将教师的输出分布移植到学生自身的潜空间中,用数据弥合分布层面的差距,使同策略目标只负责修正逐样本误差。我们在一个最大异质性的模型对上实例化了 Any-OPD,将 FLUX.1-dev(Black Forest Labs 2024)(B)蒸馏到 SD3.5-Medium(Stability AI 2024)(B):两者具有不同的 VAE、不同的 Transformer 架构、不同的噪声调度。蒸馏后的学生在偏好导向指标上相比其初始化有显著提升,将 PickScore(Kirstain 等人,2023)从 提升至 ,将 HPSv3(Ma 等人,2025)从 提升至 ,并在约为教师五分之一规模的情况下接近或超过 B 教师,而直接的潜空间回归替代方案则完全崩溃。我们的贡献如下:

  • 我们为流匹配生成器形式化了异质同策略蒸馏,并识别出使现有同策略方法无法适用的两个障碍:缺乏共享表征(无共享空间)以及缺乏可比较的时间步网格(无共享时钟)。

  • 我们提出 Any-OPD,该方法仅通过一个冻结的、与模型无关的表示空间将两个模型耦合,并依据噪声级别匹配而非求解器索引来对齐它们的轨迹。因此,该流程适用于任意潜在流匹配生成器的师生模型对。

  • 我们展示了跨模型家族的首次在线策略蒸馏,从 FLUX.1-dev 蒸馏到 SD3.5-Medium,其中 B 学生模型在多项偏好指标上达到或超越了其 B 教师模型。我们对每个组件进行了消融实验,并特别表明,在 VAE 边界上直接进行潜在回归会导致训练崩溃。

2 相关工作

扩散模型与流匹配。

扩散模型(Ho 等人,2020;Song 等人,2021)通过逆转逐步加噪过程来生成样本,而流匹配(Lipman 等人,2023;Liu 等人,2024)则学习从噪声到数据的连续传输,并支持高效的确定性采样。这一范式已成为近期高分辨率文生图系统的常见主干,包括 SD3(Esser 等人,2024a)、FLUX(Black Forest Labs 2024)和 Z-Image(Cai 等人,2025)。在实践中,这些模型不仅在规模上有所不同,在 VAE 设计、Transformer 架构和噪声调度参数化方面也存在差异。这些差异使得跨家族蒸馏比同质检查点之间的蒸馏困难得多。

扩散蒸馏。

扩散模型和流模型的早期蒸馏方法主要压缩采样成本。渐进式方法和基于一致性方法(Salimans 和 Ho 2022;Luo 等 2023b;Song 和 Dhariwal 2024)训练少步学生模型以匹配多步教师模型,而分布匹配方法(Yin 等 2024c,a;Zhou 等 2024)则将学生模型的输出分布与教师模型的偏好对齐。这些方法通常是离线的:监督信号从固定数据或教师轨迹中收集,因此教师模型不会直接纠正学生模型在训练过程中访问的状态。在线策略蒸馏(OPD)是在语言模型蒸馏中提出的,旨在通过让学生模型从教师模型对学生生成轨迹的反馈中学习,来减少这种暴露偏差(Agarwal 等 2024;Gu 等 2024;Ko 等 2025)。最近的扩散和流模型扩展将该思想引入迭代式图像生成。DiffusionOPD(Li 等 2026)为扩散转移制定了在线策略监督,Flow-OPD(Fang 等 2026)则将 OPD 适配到流匹配中,并采用密集的轨迹级教师监督。然而,这些公式假设教师和学生模型可以在共享状态上交互,这自然适用于同构模型,但当它们的 VAE 潜空间不兼容时就会失效。

Refer to caption
图 1:Any-OPD 概览。左图:锚定阶段通过教师生成目标上的速度匹配来训练学生模型,将教师模型的分布迁移到学生模型自身的潜坐标中。右图:在线策略训练对学生模型进行 rollout,通过加噪-去噪精炼将样本投影到教师模型的流形上,并通过噪声水平匹配选择的学生段进行反向传播。学生和教师模型各自使用自己的 VAE 解码;两张图像仅在冻结的 DINOv2 表示空间中相遇。

3 方法

3.1 预备知识:流匹配与潜空间生成器

流匹配(Lipman 等 2023)学习一个速度场,该速度场沿 ODE 将噪声传输到数据。在最优传输插值下,

(1)

因此 本身即为噪声水平,训练最小化

(2)

推理过程采用离散步进欧拉调度,并配有噪声水平,其中由模型专属的偏移函数生成(Karras et al. 2022; Esser et al. 2024a)。在整个过程中,求解器索引对应纯噪声,索引对应干净样本,因此随索引递增而单调递减。

我们考虑潜变量生成器,每个生成器由编码器、解码器、速度场和调度四元组构成:图像通过在潜空间中进行积分并对端点进行解码来生成(Rombach et al. 2022; Esser et al. 2024a)。我们的学生模型为,冻结的教师模型为,两者的速度场作用于互不相交的域上,

(3)

3.2 异构场景:无共享空间,无共享时钟

同策略蒸馏要求教师模型对学生模型自身轨迹上的状态进行监督(Ross et al. 2011; Agarwal et al. 2024; Li et al. 2026; Fang et al. 2026),而对于异构模型对,这一过程会在两个维度上失效。无共享空间:由于,教师模型的潜变量无法作为学生模型坐标系中的有效目标,且架构差异排除了特征匹配的可能性;像素级监督也无济于事,因为教师模型的细化过程是一种随机重合成,在保留语义的同时重新绘制局部细节,因此逐像素的均方误差会向所有可行重合成的均值回归,导致训练崩溃(Zhang et al. 2018; Blau and Michaeli 2018)。监督必须转移到第三种表示上,这种表示需独立于两个模型之外,且对局部坐标不敏感。无共享时钟:不同的偏移函数导致,因此按索引对齐的监督会将来自不可比噪声区间的状态配对;噪声水平是两条轨迹之间唯一共享的量,必须作为对齐变量。这些补救措施说明了如何进行监督,但并未说明监督在何时有效:当学生模型的样本仍远离教师模型的流形时,每个梯度都指向从一个域到另一个域的方向,不携带任何逐样本信息。因此,Any-OPD 首先离线锚定学生模型的分布,然后才将同策略修正应用于逐样本残差。

3.3 将学生模型锚定在教师模型的流形上

分布层面的差距不需要通过在线策略训练来弥合,因为它不要求一一对应:学生模型只需学会生成与教师模型同类别的图像,而非复现某一张特定的图像。这使得该差距可以在离线条件下解决,使用标准的流匹配目标函数即可,前提是教师模型的分布能够在学生模型的坐标系中表达出来。学生模型自身的编码器便提供了这种表达。

给定提示词后,教师模型生成目标图像,我们使用学生模型的 VAE 对其进行重新编码,得到。由此,教师模型的流形被呈现在学生模型实际优化的坐标系中——这是任何跨越两个潜在空间定义的损失函数都无法实现的。从学生模型自身的步调度中均匀抽取一个索引,我们构造出

(4)

并以

(5)

进行训练,其中根据 (4) 可得;上述形式与相匹配,并避免了在时除以。锚定无法修复的问题同样精确。学生模型只观察到从正确端点插值得到的状态,而在推理时它遵循的是自身不完美的轨迹;锚定决定了学生模型分布的位置,却不能决定学生模型在其实际到达的状态上的行为。这一残余问题本质上是个样本层面的问题,弥合它正是在线策略阶段的任务。

3.4 任意教师模型与任意学生模型之间的在线策略蒸馏

在线策略阶段围绕单一算子展开。对于噪声水平,令

(6)

记教师的加噪-去噪映射为:将图像扰动到噪声水平,再在教师的速度场下重新生成(Nie 等,2022)。由于去噪过程会向教师的模型分布收缩,因此该映射相当于对教师图像流形的一次随机投影(Permenter 和 Yuan,2023),其中 设定了投影可移动样本的半径范围:当 趋近于恒等映射时,当 趋近于无条件重采样时(Ho 等,2020;Song 等,2021)。评估 对教师的要求仅仅是具备采样能力;这个采样接口就是 Any-OPD 对教师的全部假设,而第 3.1 节意义上的任何潜空间生成器都能提供这一接口。该阶段训练学生模型,使其自身样本成为该投影在特征等价意义下的不动点:当且仅当 时,即教师被允许在半径 内重绘样本却无法产生任何语义上更好的结果时,样本收到的梯度为零。因此,每次训练迭代做三件事:投影一个策略内样本,将由此产生的修正通过能够表达该修正的学生求解步骤进行传递,并检验不动点条件。设 和 分别表示学生和教师的求解器步骤。

媒体内容 · 前往原文查看
表 1:主要结果。FLUX.1-dev 使用其标准的 50 步 Euler 采样器;SD3.5-Medium 和 Any-OPD 使用 40 步 Euler 采样。Aesth.:Aesthetic Score;ImgRwd:ImageReward;HPSv3:Human Preference Score v3;UniRwd/UniRwd2:UnifiedReward 和 UnifiedReward2。蓝色底纹加粗标记相对于 SD3.5-Medium 基线的改进。
DrawBench DPG-Bench
角色 模型 参数量 Aesth. ImgRwd PickScore HPSv3 UniRwd UniRwd2 总体
教师 FLUX.1-dev 12B 5.765 0.971 0.878 11.19 3.38 3.35 83.84
学生 SD3.5-Medium 2.5B 5.383 0.922 0.866 9.12 3.23 3.21 84.58
学生 + Any-OPD SD3.5-Medium 2.5B 5.788 1.116 0.884 10.97 3.31 3.26 84.71
Refer to caption
图 2:DrawBench 提示词上的定性比较。Any-OPD(2.5B,SD3.5-Medium 加 LoRA)在保持学生架构和 40 步采样不变的情况下,接近 12B FLUX.1-dev 教师的视觉质量。
投影策略内样本。

每次迭代都恰好监督学生模型在推理时所部署分布中的一个样本。投影半径首先被固定,通过抽取并设置教师模型的起始索引来实现;由于事先已知半径,就能确定后续梯度传播所需的唯一中间状态,因此 rollout 只需存储一个潜变量而非整条轨迹。随后学生模型在无梯度的情况下沿自身调度进行积分,

(7)

其输出在层级上被投影。具体而言,通过格式转换进入教师模型的坐标空间,该转换不产生任何信息损失;教师模型重新加噪,

(8)

并沿自身调度积分至干净端点,

(9)

半径在信号与相关性之间进行权衡。当半径较小时,投影趋近于恒等映射,目标中不包含任何修正;当半径较大时,投影趋近于重采样,此时该样本不再是对原样本的改进,梯度便继承了未配对目标的方差。有效的精炼介于这两种退化情形之间,此时投影保留学生模型的组成结构,仅替换其执行过程;第 4.3 节将对此范围进行实证刻画。

按噪声水平路由修正。

修正既有尺度也有内容。投影仅在由噪声水平所决定的尺度上改变样本,因此学生模型若要吸收该修正,梯度必须覆盖其自身在该范围内运作的每一个求解器步骤;任何更窄的片段都无法表达这一编辑。由于调度之间无法按索引进行比较,该片段通过噪声水平本身来定位,

(10)

即最不嘈杂的学生状态仍至少与投影起点同样嘈杂,因此这是噪声范围包含该修正的最紧凑片段,适用于任意一对偏移函数。学生模型从缓存的潜变量处启用梯度进行重放,

(11)

因此只有 Transformer 的评估会携带激活值,且每个评估都单独进行检查点保存。将视为常数,使得梯度以学生模型实际到达的状态为条件,而非以正确模型本应到达的任何状态为条件;正是这种条件化——而非单纯的 rollout——使得该更新成为在策略(on-policy)更新。

在表示空间中对模型进行耦合。

该条件只能在第 3.2 节所识别的第三种表示中进行测试。每个模型通过其自身的解码器渲染结果,并且根据 (9),损失函数通过一个冻结的提取器将两者耦合,该提取器对两者进行相同的应用:

(12)

其中返回冻结的 DINOv2-Base(Oquab 等人,2023)的 CLS token,梯度通过冻结的解码器流入。该选择同时满足了第 3.2 节的两个要求。它是外部的:不触及任一模型的潜在表示或架构,因此替换教师模型仅替换投影,损失函数和流程保持不变。它是无坐标的:CLS token 聚合所有 patch,DINOv2 的判别式自监督使余弦距离在惩罚结构和语义偏差的同时,对 (9) 的每次应用所引入的局部再合成保持不变。

Refer to caption
图 3:教师细化步骤的效果(对比,其他条件相同)。目标中的模糊传播到学生模型中,表明教师的去噪预算限制了可迁移的质量。

4 实验

4.1 实验设置

模型。

学生模型为 SD3.5-Medium(2.5B;SD3 VAE,静态偏移,引导);教师模型为 FLUX.1-dev(12B;FLUX VAE,动态偏移,引导)。该配对在 VAE、架构和噪声调度上同时存在差异。我们仅训练学生 Transformer 中的 LoRA 适配器(秩,);其他一切保持冻结。

数据与训练。

训练提示词从 Pick-a-Pic 训练集(Kirstain 等人,2023)中采样,Pick-a-Pic 测试提示词留作验证。锚定运行 400 步(噪声水平;教师目标在 50 步 Euler 采样下生成)。在策略训练在 800 步下进行,使用。两个阶段均使用学习率和每 GPU 批大小。

评估。

所有模型均在其标准推理设置下进行评估(教师模型:50 步 Euler;学生模型和 Any-OPD:40 步 Euler)。在 DrawBench(Saharia 等人,2022)上,我们针对每个提示词生成五张图像,并报告 Aesthetic Score(Schuhmann,2022)、ImageReward(Xu 等人,2023)、PickScore(Kirstain 等人,2023)、HPSv3(Ma 等人,2025)以及 UnifiedReward/UnifiedReward2(Wang 等人,2025)的得分;在 GenEval(Ghosh 等人,2023)和 DPG-Bench(Hu 等人,2024)上,我们报告四项结果的官方综合得分。模型版本、提示词数量以及分类别结果详见补充材料。

4.2 主要结果

表 1 包含了核心结果:经过蒸馏的 2.5B 学生模型在 Aesthetic Score、ImageReward 和 PickScore 上超越了其 12B 教师模型,并在 HPSv3 和 UnifiedReward 得分上缩小了大部分差距,在架构和采样预算不变的情况下,DrawBench 全部六项指标均较基线有所提升。学生模型能够超越教师模型,这源于监督信号本身:目标值是教师模型对学生样本的投影,将学生的构图与教师的渲染能力相结合,因此训练可以将学生模型置于两个模型单独都无法达到的位置;在 ImageReward 上,相较于基线()的提升幅度几乎是教师模型自身优势幅度()的四倍。构图准确性得以保持,DPG-Bench 基本不变():该目标函数以偏好为导向,而教师模型在此基准上没有提升空间,相比之下,构图能力更强的 Z-Image 教师模型在相同流程下确实提升了该基准的表现(见第 4.4 节)。图 2 展示了定性层面的提升:更干净的纹理、更一致的光照和更精细的结构,同时保留了基线的布局,这与“保留构图、替换执行”的投影机制相吻合。

4.3 消融研究

目标函数:只有表示空间得以保留

只有表示空间目标函数能够稳定训练,这印证了第 3.2 节的核心论断:异构样本对既不能在潜变量中逐坐标比较,也不能在像素层面局部比较。图 4 对比了使用潜变量 MSE、LPIPS(Zhang 等人,2018)以及三种 DINOv2 变体(CLS;来自第 5、9、12 层的多层 CLS;CLS+Patch)训练的 OPD。在 ImageReward 和 Aesthetic Score 上,潜变量 MSE 在训练最初几步内就崩溃了:跨越 VAE 边界的逐坐标回归不仅不是次优的,而且是不稳定的。LPIPS 初期有所改善,随后退化,因为其补丁局部特征仍然要求空间对应关系,而教师模型的随机再合成并不遵循这种对应。所有 DINOv2 变体都稳定训练至结束,且纯 CLS 达到或超过了更丰富的变体,因此单个全局嵌入就足够了。MSE、LPIPS、DINOv2 的排序恰好反映了每个目标函数所假设的局部对应程度。

Refer to caption
(a)ImageReward
Refer to caption
(b)Aesthetic Score
图 4:不同目标函数下的 OPD 训练曲线。潜变量 MSE 崩溃;LPIPS 后期退化;DINOv2 CLS 稳定且最优。

锚定是前提条件,而非额外加分项

锚定质量严格决定了 OPD 能达到的效果,正如第 3.3 节所预测的那样。图 5 对比了从无锚定、预稳定检查点(Anchor-100)和已稳定检查点(Anchor-400)开始的 OPD。三条曲线在整个训练过程中严格排序,且尽管 OPD 预算相同,Anchor-100 始终未能追上 Anchor-400:差距在于初始化质量,而非总计算量,因此 OPD 应在锚定收敛之后才开始。锚定曲线见补充材料。

Refer to caption
(a)ImageReward
Refer to caption
(b)Aesthetic Score
图 5:不同初始化下的 OPD 曲线。已稳定检查点(Anchor-400)在整个过程中占优。
Refer to caption
(a)ImageReward
Refer to caption
(b)Aesthetic Score
图 6:带 CPS 展开随机性的 OPD 曲线。确定性 Euler()在两个指标上均最优。

教师精炼调度

精炼强度。

强细化是必要的:在表 2 中,将教师模型从中等偏低噪声(,)起始,在所有指标上均不如其他设置,因为教师模型几乎不改变样本,目标携带的信号极少。两个较强区间表现接近,其中 在 PickScore 和 ImageReward 上略占优势,并在 DPG-Bench 和 HPSv3 上胜出;我们采用 作为整体最佳平衡点。

媒体内容 · 前往原文查看
表 2:教师细化强度对 20 步教师调度的影响。较大的 表示从更嘈杂的水平开始细化。更强的细化带来更好的结果。
DrawBench DPG
强度 区间 HPSv3 Pick ImgRwd 总体
中低 10.24 0.881 0.891 81.21
中高 10.80 0.885 1.120 84.68
10.97 0.884 1.116 84.71
细化步数。

教师的去噪预算限制了可迁移的质量上限:在图 3 中,减半的调度在细化目标中留下可见模糊,学生模型忠实地复现了这种模糊,而 则产生清晰的目标和相应更清晰的学生模型。

展开随机性

展开随机性虽然在 RL 式微调中通常有益,但在这里反而有害。我们将 Euler 替换为系数保持采样(CPS)(Wang and Yu 2025),该方法在固定总噪声尺度 下,通过角度 将每一步的噪声分量从模型预测方向旋转到新的高斯方向:

(13)

其中 。确定性 Euler()在所有情况下表现最佳,并且在 – 步后性能下降(图 6):扰动展开会使监督轨迹与部署轨迹脱钩。

4.4 泛化:更换教师模型

Any-OPD 的核心主张是教师模型可以在不改变方法的情况下被替换。我们直接进行了测试:将 FLUX.1-dev 替换为 Z-Image(6B;其自带 VAE,偏移 ,引导 ),其他一切不变:相同的学生模型、损失函数、超参数和评估。表 3 显示学生模型在每项报告的指标上都有提升,包括组合性基准 GenEval()和 DPG-Bench()。值得注意的是,提升与教师模型的特点一致:Z-Image 本身在 GenEval()上表现强劲,而 Any-OPD-Z 在获得感知质量提升的同时也继承了这一优势。

媒体内容 · 前往原文查看
表 3:以 Z-Image 作为教师模型进行知识蒸馏,采用与主实验完全相同的流程和超参数。蓝色底纹加粗标记表示相较于 SD3.5-Medium 基线的提升;† 标记教师模型参考值。
DrawBench GenEval DPG
模型 ImgRwd Pick HPSv3 综合 综合
SD3.5-Medium 0.922 0.866 9.12 70.70 84.58
Z-Image† 0.958 0.864 9.96 74.90 86.73
Any-OPD-Z 1.082 0.872 9.75 71.50 85.53

5 结论

我们提出了 Any-OPD,将在线策略蒸馏从迄今为止仅限于同构设定的范围拓展出去。我们的公式识别出异构配对所打破的两个假设——共享表示和共享时间步网格——并分别用不依赖任一模型内部机制的方案取而代之:教师模型纯粹通过对学生自身输出进行加噪-去噪投影来充当采样器,两个模型仅在一个冻结的外部表示中相遇,学生在该表示中被训练向其自身投影的固定点收敛,监督信号则通过噪声级别本身在不兼容的时间表之间对齐。前置的锚定阶段按粒度分离蒸馏,用数据弥合分布层面的差距,使在线策略目标只承载逐样本信息。由于这些组件均不依赖教师模型的 VAE、架构或时间表,教师模型在构造上就是可互换的,我们通过在不改动流程任何一行的情况下交换模型家族验证了这一特性。我们希望这种解耦能让当前最强的生成器——无论由谁构建——都能成为任何需要部署的模型的可用的教师模型。

局限性与未来工作。

组合互补的教师模型是一种自然的补救方案。由于除特征提取器外,该公式中没有任何部分针对图像特化,将 Any-OPD 扩展到其他潜在生成模态是进一步的研究方向。

参考文献

  • R. Agarwal, N. Vieillard, Y. Zhou, P. Stanczyk, S. Ramos Garea, M. Geist, 和 O. Bachem (2024) 语言模型的在线策略蒸馏:从自我生成的错误中学习。发表于国际学习表征会议,2024 年卷,第 21246–21263 页。引用位置:§1、§2、§3.2。
  • Black Forest Labs(2024)FLUX.1。注:https://github.com/black-forest-labs/flux 引用位置:§1、§1、§2。
  • Y. Blau 与 T. Michaeli(2018)感知-失真权衡。见《IEEE 计算机视觉与模式识别会议论文集》,第 6228–6237 页。引用位置:§3.2。
  • H. Cai、S. Cao、R. Du、P. Gao、S. Hoi、Z. Hou、S. Huang、D. Jiang、X. Jin、L. Li 等(2025)Z-image:基于单流扩散 Transformer 的高效图像生成基础模型。arXiv 预印本 arXiv:2511.22699。引用位置:§2。
  • P. Esser、S. Kulal、A. Blattmann、R. Entezari、J. Müller、H. Saini、Y. Levi、D. Lorber、A. Sauer、F. Boesel 等(2024a)扩展修正流 Transformer 以实现高分辨率图像合成。arXiv 预印本 arXiv:2403.03206。引用位置:§2、§3.1、§3.1。
  • P. Esser、S. Kulal、A. Blattmann、R. Entezari、J. Müller、H. Saini、Y. Levi、D. Lorenz、A. Sauer、F. Boesel 等(2024b)扩展修正流 Transformer 以实现高分辨率图像合成。见《第四十一届国际机器学习会议》。引用位置:§1、§1。
  • Z. Fang、W. Huang、Y. Zeng、Y. Zhao、S. Chen、K. Feng、Y. Lin、L. Chen、Z. Chen、S. Cao 等(2026)Flow-OPD:面向流匹配模型的在线策略蒸馏。arXiv 预印本 arXiv:2605.08063。引用位置:§2、§3.2。
  • D. Ghosh、H. Hajishirzi 与 L. Schmidt(2023)Geneval:面向文本到图像对齐评估的以对象为中心的框架。《神经信息处理系统进展》第 36 卷,第 52132–52152 页。引用位置:§4.1。
  • Y. Gu、L. Dong、F. Wei 与 M. Huang(2024)MiniLLM:大语言模型的知识蒸馏。见《国际学习表征会议》,2024 年卷,第 32694–32717 页。引用位置:§2。
  • G. Hinton、O. Vinyals 与 J. Dean(2015)蒸馏神经网络中的知识。arXiv 预印本 arXiv:1503.02531。引用位置:§1。
  • J. Ho、A. Jain 与 P. Abbeel(2020)去噪扩散概率模型。NeurIPS。引用位置:§2、§3.4。
  • X. Hu、R. Wang、Y. Fang、B. Fu、P. Cheng 与 G. Yu(2024)ELLA:为扩散模型配备大语言模型以增强语义对齐。arXiv 预印本 arXiv:2403.05135。引用位置:§4.1。
  • T. Karras、M. Aittala、T. Aila 和 S. Laine(2022)《阐明基于扩散的生成模型的设计空间》。神经信息处理系统进展第 35 卷,第 26565–26577 页。引用位置:§1、§3.1。
  • Y. Kirstain、A. Polyak、U. Singer、S. Matiana、J. Penna 和 O. Levy(2023)《Pick-a-pic:一个用于文本到图像生成的用户偏好开放数据集》。NeurIPS。引用位置:§1、§4.1、§4.1。
  • J. Ko、T. Chen、S. Kim、T. Ding、L. Liang、I. Zharkov 和 S. Yun(2025)《Distillm-2:一种提升大语言模型知识蒸馏的对比方法》。arXiv 预印本 arXiv:2503.07067。引用位置:§2。
  • Q. Li、J. Yu、K. Jiang、Y. Wei、Z. Xing、P. Li、R. Chu、S. Zhang、Y. Liu 和 Z. Wu(2026)《DiffusionOPD:扩散模型中在线策略蒸馏的统一视角》。arXiv 预印本 arXiv:2605.15055。引用位置:§2、§3.2。
  • A. Lin、J. Wohlwend、H. Chen 和 T. Lei(2020)《通过模仿学习进行自回归知识蒸馏》。载于 2020 年自然语言处理经验方法会议(EMNLP)论文集,第 6121–6133 页。引用位置:§1。
  • Y. Lipman、R. T. Chen、H. Ben-Hamu、M. Nickel 和 M. Le(2023)《用于生成建模的流匹配》。ICLR。引用位置:§1、§2、§3.1。
  • X. Liu、C. Gong 和 Q. Liu(2023)《流直且快:利用修正流学习生成与迁移数据》。ICLR。引用位置:§2。
  • S. Luo、Y. Tan、L. Huang、J. Li 和 H. Zhao(2023a)《潜在一致性模型:用少步推理合成高分辨率图像》。arXiv 预印本 arXiv:2310.04378。引用位置:§1。
  • S. Luo、Y. Tan、L. Huang、J. Li 和 H. Zhao(2023b)《潜在一致性模型:用少步推理合成高分辨率图像》。arXiv 预印本 arXiv:2310.04378。引用位置:§2。
  • Y. Ma、X. Wu、K. Sun 和 H. Li(2025)《Hpsv3:迈向广谱人类偏好评分》。载于 IEEE/CVF 国际计算机视觉会议论文集,第 15086–15095 页。引用位置:§1、§4.1。
  • W. Nie、B. Guo、Y. Huang、C. Xiao、A. Vahdat 和 A. Anandkumar(2022)《用于对抗净化的扩散模型》。arXiv 预印本 arXiv:2205.07460。引用位置:§3.4。
  • M. Oquab, T. Darcet, T. Moutakanni, H. Vo, M. Szafraniec, V. Khalidov, P. Fernandez, D. Haziza, F. Massa, A. El-Nouby, 等人(2023)Dinov2:无需监督学习鲁棒视觉特征。arXiv 预印本 arXiv:2304.07193。引用位置:§1, §3.4。
  • F. Permenter 和 C. Yuan(2023)从优化角度解读和改进扩散模型。arXiv 预印本 arXiv:2306.04848。引用位置:§3.4。
  • R. Rombach, A. Blattmann, D. Lorenz, P. Esser 和 B. Ommer(2022)基于潜在扩散模型的高分辨率图像合成。载于 IEEE/CVF 计算机视觉与模式识别会议论文集,第 10684–10695 页。引用位置:§3.1。
  • S. Ross, G. Gordon 和 D. Bagnell(2011)将模仿学习和结构化预测归约为无遗憾在线学习。载于第十四届国际人工智能与统计会议论文集,第 627–635 页。引用位置:§1, §3.2。
  • C. Saharia, W. Chan, S. Saxena, L. Li, J. Whang, E. L. Denton, K. Ghasemipour, R. Gontijo Lopes, B. Karagol Ayan, T. Salimans, 等人(2022)具备深度语言理解的照片级文本到图像扩散模型。NeurIPS。引用位置:§4.1。
  • T. Salimans 和 J. Ho(2022)用于扩散模型快速采样的渐进式蒸馏。arXiv 预印本 arXiv:2202.00512。引用位置:§1, §2。
  • C. Schuhmann(2022)LAION-Aesthetics。注:https://laion.ai/blog/laion-aesthetics/ LAION 博客文章。引用位置:§4.1。
  • Y. Song 和 P. Dhariwal(2024)改进一致性模型训练技术。载于国际学习表征会议,第 2024 卷,第 15078–15097 页。引用位置:§2。
  • Y. Song, J. Sohl-Dickstein, D. P. Kingma, A. Kumar, S. Ermon 和 B. Poole(2021)基于随机微分方程的分数生成建模。ICLR。引用位置:§2, §3.4。
  • Stability AI(2024)推出 Stable Diffusion 3.5。注:https://stability.ai/news/introducing-stable-diffusion-3-5 官方模型发布公告;访问时间:2026-07-28。引用位置:§1。
  • F. Wang 和 Z. Yu(2025)基于流匹配的强化学习系数保持采样。arXiv 预印本 arXiv:2509.05952。引用位置:§4.3。
  • Y. Wang、Y. Zang、H. Li、C. Jin 和 J. Wang(2025)面向多模态理解与生成的统一奖励模型。arXiv 预印本 arXiv:2503.05236。引用位置:§4.1。
  • J. Xu、X. Liu、Y. Wu、Y. Tong、Q. Li、M. Ding、J. Tang 和 Y. Dong(2023)ImageReward:学习并评估文生图的人类偏好。Advances in Neural Information Processing Systems 36,第 15903–15935 页。引用位置:§4.1。
  • T. Yin、M. Gharbi、T. Park、R. Zhang、E. Shechtman、F. Durand 和 W. T. Freeman(2024a)改进的分布匹配蒸馏,用于快速图像合成。arXiv 预印本 arXiv:2405.14867。引用位置:§2。
  • T. Yin、M. Gharbi、T. Park、R. Zhang、E. Shechtman、F. Durand 和 W. T. Freeman(2024b)改进的分布匹配蒸馏,用于快速图像合成。收录于第三十八届神经信息处理系统年度会议。引用位置:§1。
  • T. Yin、M. Gharbi、R. Zhang、E. Shechtman、F. Durand、W. T. Freeman 和 T. Park(2024c)基于分布匹配蒸馏的单步扩散。arXiv 预印本 arXiv:2311.18828。引用位置:§2。
  • R. Zhang、P. Isola、A. A. Efros、E. Shechtman 和 O. Wang(2018)深度特征作为感知度量的惊人有效性。CVPR。引用位置:§3.2、§4.3。
  • M. Zhou、H. Zheng、Z. Wang、M. Yin 和 H. Huang(2024)分数恒等蒸馏:预训练扩散模型的指数级快速蒸馏,实现单步生成。收录于第四十一届国际机器学习大会。引用位置:§2。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org

Any-OPD:面向流匹配模型的异构同策略蒸馏框架

HuggingFace Daily Papers(社区热门论文)·2026-08-04 08:00·1天前
AI 导读

Any-OPD 提出首个支持任意异构流匹配生成器对的同策略蒸馏框架,仅通过冻结的 DINOv2 表示空间桥接教师与学生模型,无需共享 VAE、架构或噪声调度。将 FLUX.1-dev 蒸馏至 SD3.5-Medium 后,学生模型 PickScore 与 HPSv3 均显著提升,以教师五分之一的参数量达到接近其性能,而直接潜在回归训练完全失败。

正文 · AI 翻译

傅思明

,傅哲铭

,何睿哲

,王华亮

,黄杰

,马晓晓

钟明辰

,黄伟虎

,何晓萱

,徐浩钧

摘要

同策略蒸馏(on-policy distillation)是指教师模型纠正学生模型自身生成的样本,其前提是这两个模型使用相同的“语言”:相同的VAE潜在空间、匹配的架构以及共同的时间步网格。我们探讨当这些条件均不成立时会发生什么,例如当可用的最强教师模型与希望部署的学生模型来自不同模型家族时,我们发现标准方案无法解决此问题:教师模型的潜在变量无法在异源坐标系中作为目标使用;针对随机重绘局部细节的教师模型进行逐像素损失计算,会退化为模糊或发散;时间步索引在不匹配的调度方案之间也失去了意义。我们提出Any-OPD,据我们所知,这是首个适用于任意潜在流匹配生成器对之间进行同策略蒸馏的框架。Any-OPD将教师模型纯粹视为黑盒采样器,并仅在一点上连接两个模型:一个冻结的、与模型无关的视觉表示,在该表示中对两者独立解码的输出进行比较,从而绕过了关于潜在变量、特征或架构的所有假设。轨迹对应关系通过匹配连续噪声水平而非步索引来恢复,而一个简短的锚定阶段(将教师样本通过学生自身的VAE重新编码)确保同策略梯度衡量的是样本质量而非域不匹配。将B FLUX.1-dev蒸馏到B SD3.5-Medium中,Any-OPD将学生的PickScore从提升至,HPSv3从提升至,在仅为教师模型五分之一规模的情况下媲美教师模型,而直接潜在回归则完全无法训练。

1 引言

流匹配生成器(Lipman 等人,2023;Esser 等人,2024b)如今定义了文生图合成领域的最先进水平,但它们最强的实例规模庞大:像 FLUX.1-dev(Black Forest Labs 2024)这样的模型,仅去噪 Transformer 就携带 B 级参数,使其在延迟或内存受限的部署场景中难以落地。知识蒸馏(Hinton 等人,2015)提供了自然的解决方案——让一个小学生模型继承大教师模型的质量,而其最有效的形式是同策略(on-policy)蒸馏:学生模型不是从固定数据中模仿教师输出,而是在自身采样轨迹所生成的状态上接受监督,这消除了纯离线模仿的暴露偏差(Agarwal 等人,2024;Lin 等人,2020;Ross 等人,2011)。然而,现有的扩散模型同策略方案(Salimans 和 Ho 2022;Yin 等人,2024b;Luo 等人,2023a)建立在一个如此普遍以至于很少被明确表述的假设之上:教师模型和学生模型是同构的。它们共享同一个 VAE,因此共享一个潜在坐标系,在这个坐标系中教师预测可以作为回归目标;它们通常共享架构,因此内部特征可以对齐;它们还共享时间步网格,因此“同一步”对两者意味着相同的噪声水平(Salimans 和 Ho 2022)。这一假设悄悄地将蒸馏限制在源自单一模型家族的配对中。然而,人们实际想要进行蒸馏的配对是异构的:可用的教师模型和学生模型通常由不同方围绕不同的 VAE、架构和噪声调度开发。

在本文中,我们提出并解决了异构同策略蒸馏(heterogeneous on-policy distillation)问题:让学生在自身轨迹上,在一个冻结教师模型的监督下进行训练,而学生与教师既不共享 VAE,也不共享架构,更不共享噪声调度,教师仅作为采样器被访问。放弃同构假设会沿两个独立维度破坏同策略蒸馏。首先,这对模型没有共享空间:教师潜在变量在学生坐标系中不是有效目标,且更不明显的是,将两个模型都解码到像素空间也无法恢复可用的目标函数。教师细化是一种随机重合成过程,在保留语义的同时重新绘制局部细节,因此逐像素回归会趋向于模糊的条件均值,在我们的实验中直接导致训练崩溃。其次,这对模型没有共享时钟:两种噪声调度源自不同的偏移函数,因此相同的求解器索引对应不同的噪声水平(Esser 等人,2024b),而索引对齐的监督会将来自不可比噪声域的状态配对(Karras 等人,2022)。

我们提出 Any-OPD(任意教师、任意学生、同策略蒸馏),它通过一种不引用两个模型内部结构的机制解决了上述每一个失败情形。针对空间差距,两个模型仅在两者外部的第三种表征中耦合:学生和教师各自用自己的 VAE 解码,所得图像由冻结的 DINOv2(Oquab 等人,2023)的 CLS 嵌入进行比较。这种全局、无坐标系的比较恰好对像素回归和潜空间回归所无法应对的局部再合成具有不变性,而且由于该特征提取器与模型无关,更换教师既不会改变损失函数,也不会改动训练流程中的任何一行代码。针对时钟差距,两条轨迹按噪声水平本身而非步数索引对齐:在教师从选定噪声水平对学生样本进行精炼之后,梯度恰好流过那些噪声水平不低于该水平的学生的步,这一规则对任意调度组合都保持良定义。第三个组件使该信号从一开始就可用:一个离线锚定阶段首先通过学生的编码器将教师的输出分布移植到学生自身的潜空间中,用数据弥合分布层面的差距,使同策略目标只负责修正逐样本误差。我们在一个最大异质性的模型对上实例化了 Any-OPD,将 FLUX.1-dev(Black Forest Labs 2024)(B)蒸馏到 SD3.5-Medium(Stability AI 2024)(B):两者具有不同的 VAE、不同的 Transformer 架构、不同的噪声调度。蒸馏后的学生在偏好导向指标上相比其初始化有显著提升,将 PickScore(Kirstain 等人,2023)从 提升至 ,将 HPSv3(Ma 等人,2025)从 提升至 ,并在约为教师五分之一规模的情况下接近或超过 B 教师,而直接的潜空间回归替代方案则完全崩溃。我们的贡献如下:

  • 我们为流匹配生成器形式化了异质同策略蒸馏,并识别出使现有同策略方法无法适用的两个障碍:缺乏共享表征(无共享空间)以及缺乏可比较的时间步网格(无共享时钟)。

  • 我们提出 Any-OPD,该方法仅通过一个冻结的、与模型无关的表示空间将两个模型耦合,并依据噪声级别匹配而非求解器索引来对齐它们的轨迹。因此,该流程适用于任意潜在流匹配生成器的师生模型对。

  • 我们展示了跨模型家族的首次在线策略蒸馏,从 FLUX.1-dev 蒸馏到 SD3.5-Medium,其中 B 学生模型在多项偏好指标上达到或超越了其 B 教师模型。我们对每个组件进行了消融实验,并特别表明,在 VAE 边界上直接进行潜在回归会导致训练崩溃。

2 相关工作

扩散模型与流匹配。

扩散模型(Ho 等人,2020;Song 等人,2021)通过逆转逐步加噪过程来生成样本,而流匹配(Lipman 等人,2023;Liu 等人,2024)则学习从噪声到数据的连续传输,并支持高效的确定性采样。这一范式已成为近期高分辨率文生图系统的常见主干,包括 SD3(Esser 等人,2024a)、FLUX(Black Forest Labs 2024)和 Z-Image(Cai 等人,2025)。在实践中,这些模型不仅在规模上有所不同,在 VAE 设计、Transformer 架构和噪声调度参数化方面也存在差异。这些差异使得跨家族蒸馏比同质检查点之间的蒸馏困难得多。

扩散蒸馏。

扩散模型和流模型的早期蒸馏方法主要压缩采样成本。渐进式方法和基于一致性方法(Salimans 和 Ho 2022;Luo 等 2023b;Song 和 Dhariwal 2024)训练少步学生模型以匹配多步教师模型,而分布匹配方法(Yin 等 2024c,a;Zhou 等 2024)则将学生模型的输出分布与教师模型的偏好对齐。这些方法通常是离线的:监督信号从固定数据或教师轨迹中收集,因此教师模型不会直接纠正学生模型在训练过程中访问的状态。在线策略蒸馏(OPD)是在语言模型蒸馏中提出的,旨在通过让学生模型从教师模型对学生生成轨迹的反馈中学习,来减少这种暴露偏差(Agarwal 等 2024;Gu 等 2024;Ko 等 2025)。最近的扩散和流模型扩展将该思想引入迭代式图像生成。DiffusionOPD(Li 等 2026)为扩散转移制定了在线策略监督,Flow-OPD(Fang 等 2026)则将 OPD 适配到流匹配中,并采用密集的轨迹级教师监督。然而,这些公式假设教师和学生模型可以在共享状态上交互,这自然适用于同构模型,但当它们的 VAE 潜空间不兼容时就会失效。

Refer to caption
图 1:Any-OPD 概览。左图:锚定阶段通过教师生成目标上的速度匹配来训练学生模型,将教师模型的分布迁移到学生模型自身的潜坐标中。右图:在线策略训练对学生模型进行 rollout,通过加噪-去噪精炼将样本投影到教师模型的流形上,并通过噪声水平匹配选择的学生段进行反向传播。学生和教师模型各自使用自己的 VAE 解码;两张图像仅在冻结的 DINOv2 表示空间中相遇。

3 方法

3.1 预备知识:流匹配与潜空间生成器

流匹配(Lipman 等 2023)学习一个速度场,该速度场沿 ODE 将噪声传输到数据。在最优传输插值下,

(1)

因此 本身即为噪声水平,训练最小化

(2)

推理过程采用离散步进欧拉调度,并配有噪声水平,其中由模型专属的偏移函数生成(Karras et al. 2022; Esser et al. 2024a)。在整个过程中,求解器索引对应纯噪声,索引对应干净样本,因此随索引递增而单调递减。

我们考虑潜变量生成器,每个生成器由编码器、解码器、速度场和调度四元组构成:图像通过在潜空间中进行积分并对端点进行解码来生成(Rombach et al. 2022; Esser et al. 2024a)。我们的学生模型为,冻结的教师模型为,两者的速度场作用于互不相交的域上,

(3)

3.2 异构场景:无共享空间,无共享时钟

同策略蒸馏要求教师模型对学生模型自身轨迹上的状态进行监督(Ross et al. 2011; Agarwal et al. 2024; Li et al. 2026; Fang et al. 2026),而对于异构模型对,这一过程会在两个维度上失效。无共享空间:由于,教师模型的潜变量无法作为学生模型坐标系中的有效目标,且架构差异排除了特征匹配的可能性;像素级监督也无济于事,因为教师模型的细化过程是一种随机重合成,在保留语义的同时重新绘制局部细节,因此逐像素的均方误差会向所有可行重合成的均值回归,导致训练崩溃(Zhang et al. 2018; Blau and Michaeli 2018)。监督必须转移到第三种表示上,这种表示需独立于两个模型之外,且对局部坐标不敏感。无共享时钟:不同的偏移函数导致,因此按索引对齐的监督会将来自不可比噪声区间的状态配对;噪声水平是两条轨迹之间唯一共享的量,必须作为对齐变量。这些补救措施说明了如何进行监督,但并未说明监督在何时有效:当学生模型的样本仍远离教师模型的流形时,每个梯度都指向从一个域到另一个域的方向,不携带任何逐样本信息。因此,Any-OPD 首先离线锚定学生模型的分布,然后才将同策略修正应用于逐样本残差。

3.3 将学生模型锚定在教师模型的流形上

分布层面的差距不需要通过在线策略训练来弥合,因为它不要求一一对应:学生模型只需学会生成与教师模型同类别的图像,而非复现某一张特定的图像。这使得该差距可以在离线条件下解决,使用标准的流匹配目标函数即可,前提是教师模型的分布能够在学生模型的坐标系中表达出来。学生模型自身的编码器便提供了这种表达。

给定提示词后,教师模型生成目标图像,我们使用学生模型的 VAE 对其进行重新编码,得到。由此,教师模型的流形被呈现在学生模型实际优化的坐标系中——这是任何跨越两个潜在空间定义的损失函数都无法实现的。从学生模型自身的步调度中均匀抽取一个索引,我们构造出

(4)

并以

(5)

进行训练,其中根据 (4) 可得;上述形式与相匹配,并避免了在时除以。锚定无法修复的问题同样精确。学生模型只观察到从正确端点插值得到的状态,而在推理时它遵循的是自身不完美的轨迹;锚定决定了学生模型分布的位置,却不能决定学生模型在其实际到达的状态上的行为。这一残余问题本质上是个样本层面的问题,弥合它正是在线策略阶段的任务。

3.4 任意教师模型与任意学生模型之间的在线策略蒸馏

在线策略阶段围绕单一算子展开。对于噪声水平,令

(6)

记教师的加噪-去噪映射为:将图像扰动到噪声水平,再在教师的速度场下重新生成(Nie 等,2022)。由于去噪过程会向教师的模型分布收缩,因此该映射相当于对教师图像流形的一次随机投影(Permenter 和 Yuan,2023),其中 设定了投影可移动样本的半径范围:当 趋近于恒等映射时,当 趋近于无条件重采样时(Ho 等,2020;Song 等,2021)。评估 对教师的要求仅仅是具备采样能力;这个采样接口就是 Any-OPD 对教师的全部假设,而第 3.1 节意义上的任何潜空间生成器都能提供这一接口。该阶段训练学生模型,使其自身样本成为该投影在特征等价意义下的不动点:当且仅当 时,即教师被允许在半径 内重绘样本却无法产生任何语义上更好的结果时,样本收到的梯度为零。因此,每次训练迭代做三件事:投影一个策略内样本,将由此产生的修正通过能够表达该修正的学生求解步骤进行传递,并检验不动点条件。设 和 分别表示学生和教师的求解器步骤。

媒体内容 · 前往原文查看
表 1:主要结果。FLUX.1-dev 使用其标准的 50 步 Euler 采样器;SD3.5-Medium 和 Any-OPD 使用 40 步 Euler 采样。Aesth.:Aesthetic Score;ImgRwd:ImageReward;HPSv3:Human Preference Score v3;UniRwd/UniRwd2:UnifiedReward 和 UnifiedReward2。蓝色底纹加粗标记相对于 SD3.5-Medium 基线的改进。
DrawBench DPG-Bench
角色 模型 参数量 Aesth. ImgRwd PickScore HPSv3 UniRwd UniRwd2 总体
教师 FLUX.1-dev 12B 5.765 0.971 0.878 11.19 3.38 3.35 83.84
学生 SD3.5-Medium 2.5B 5.383 0.922 0.866 9.12 3.23 3.21 84.58
学生 + Any-OPD SD3.5-Medium 2.5B 5.788 1.116 0.884 10.97 3.31 3.26 84.71
Refer to caption
图 2:DrawBench 提示词上的定性比较。Any-OPD(2.5B,SD3.5-Medium 加 LoRA)在保持学生架构和 40 步采样不变的情况下,接近 12B FLUX.1-dev 教师的视觉质量。
投影策略内样本。

每次迭代都恰好监督学生模型在推理时所部署分布中的一个样本。投影半径首先被固定,通过抽取并设置教师模型的起始索引来实现;由于事先已知半径,就能确定后续梯度传播所需的唯一中间状态,因此 rollout 只需存储一个潜变量而非整条轨迹。随后学生模型在无梯度的情况下沿自身调度进行积分,

(7)

其输出在层级上被投影。具体而言,通过格式转换进入教师模型的坐标空间,该转换不产生任何信息损失;教师模型重新加噪,

(8)

并沿自身调度积分至干净端点,

(9)

半径在信号与相关性之间进行权衡。当半径较小时,投影趋近于恒等映射,目标中不包含任何修正;当半径较大时,投影趋近于重采样,此时该样本不再是对原样本的改进,梯度便继承了未配对目标的方差。有效的精炼介于这两种退化情形之间,此时投影保留学生模型的组成结构,仅替换其执行过程;第 4.3 节将对此范围进行实证刻画。

按噪声水平路由修正。

修正既有尺度也有内容。投影仅在由噪声水平所决定的尺度上改变样本,因此学生模型若要吸收该修正,梯度必须覆盖其自身在该范围内运作的每一个求解器步骤;任何更窄的片段都无法表达这一编辑。由于调度之间无法按索引进行比较,该片段通过噪声水平本身来定位,

(10)

即最不嘈杂的学生状态仍至少与投影起点同样嘈杂,因此这是噪声范围包含该修正的最紧凑片段,适用于任意一对偏移函数。学生模型从缓存的潜变量处启用梯度进行重放,

(11)

因此只有 Transformer 的评估会携带激活值,且每个评估都单独进行检查点保存。将视为常数,使得梯度以学生模型实际到达的状态为条件,而非以正确模型本应到达的任何状态为条件;正是这种条件化——而非单纯的 rollout——使得该更新成为在策略(on-policy)更新。

在表示空间中对模型进行耦合。

该条件只能在第 3.2 节所识别的第三种表示中进行测试。每个模型通过其自身的解码器渲染结果,并且根据 (9),损失函数通过一个冻结的提取器将两者耦合,该提取器对两者进行相同的应用:

(12)

其中返回冻结的 DINOv2-Base(Oquab 等人,2023)的 CLS token,梯度通过冻结的解码器流入。该选择同时满足了第 3.2 节的两个要求。它是外部的:不触及任一模型的潜在表示或架构,因此替换教师模型仅替换投影,损失函数和流程保持不变。它是无坐标的:CLS token 聚合所有 patch,DINOv2 的判别式自监督使余弦距离在惩罚结构和语义偏差的同时,对 (9) 的每次应用所引入的局部再合成保持不变。

Refer to caption
图 3:教师细化步骤的效果(对比,其他条件相同)。目标中的模糊传播到学生模型中,表明教师的去噪预算限制了可迁移的质量。

4 实验

4.1 实验设置

模型。

学生模型为 SD3.5-Medium(2.5B;SD3 VAE,静态偏移,引导);教师模型为 FLUX.1-dev(12B;FLUX VAE,动态偏移,引导)。该配对在 VAE、架构和噪声调度上同时存在差异。我们仅训练学生 Transformer 中的 LoRA 适配器(秩,);其他一切保持冻结。

数据与训练。

训练提示词从 Pick-a-Pic 训练集(Kirstain 等人,2023)中采样,Pick-a-Pic 测试提示词留作验证。锚定运行 400 步(噪声水平;教师目标在 50 步 Euler 采样下生成)。在策略训练在 800 步下进行,使用。两个阶段均使用学习率和每 GPU 批大小。

评估。

所有模型均在其标准推理设置下进行评估(教师模型:50 步 Euler;学生模型和 Any-OPD:40 步 Euler)。在 DrawBench(Saharia 等人,2022)上,我们针对每个提示词生成五张图像,并报告 Aesthetic Score(Schuhmann,2022)、ImageReward(Xu 等人,2023)、PickScore(Kirstain 等人,2023)、HPSv3(Ma 等人,2025)以及 UnifiedReward/UnifiedReward2(Wang 等人,2025)的得分;在 GenEval(Ghosh 等人,2023)和 DPG-Bench(Hu 等人,2024)上,我们报告四项结果的官方综合得分。模型版本、提示词数量以及分类别结果详见补充材料。

4.2 主要结果

表 1 包含了核心结果:经过蒸馏的 2.5B 学生模型在 Aesthetic Score、ImageReward 和 PickScore 上超越了其 12B 教师模型,并在 HPSv3 和 UnifiedReward 得分上缩小了大部分差距,在架构和采样预算不变的情况下,DrawBench 全部六项指标均较基线有所提升。学生模型能够超越教师模型,这源于监督信号本身:目标值是教师模型对学生样本的投影,将学生的构图与教师的渲染能力相结合,因此训练可以将学生模型置于两个模型单独都无法达到的位置;在 ImageReward 上,相较于基线()的提升幅度几乎是教师模型自身优势幅度()的四倍。构图准确性得以保持,DPG-Bench 基本不变():该目标函数以偏好为导向,而教师模型在此基准上没有提升空间,相比之下,构图能力更强的 Z-Image 教师模型在相同流程下确实提升了该基准的表现(见第 4.4 节)。图 2 展示了定性层面的提升:更干净的纹理、更一致的光照和更精细的结构,同时保留了基线的布局,这与“保留构图、替换执行”的投影机制相吻合。

4.3 消融研究

目标函数:只有表示空间得以保留

只有表示空间目标函数能够稳定训练,这印证了第 3.2 节的核心论断:异构样本对既不能在潜变量中逐坐标比较,也不能在像素层面局部比较。图 4 对比了使用潜变量 MSE、LPIPS(Zhang 等人,2018)以及三种 DINOv2 变体(CLS;来自第 5、9、12 层的多层 CLS;CLS+Patch)训练的 OPD。在 ImageReward 和 Aesthetic Score 上,潜变量 MSE 在训练最初几步内就崩溃了:跨越 VAE 边界的逐坐标回归不仅不是次优的,而且是不稳定的。LPIPS 初期有所改善,随后退化,因为其补丁局部特征仍然要求空间对应关系,而教师模型的随机再合成并不遵循这种对应。所有 DINOv2 变体都稳定训练至结束,且纯 CLS 达到或超过了更丰富的变体,因此单个全局嵌入就足够了。MSE、LPIPS、DINOv2 的排序恰好反映了每个目标函数所假设的局部对应程度。

Refer to caption
(a)ImageReward
Refer to caption
(b)Aesthetic Score
图 4:不同目标函数下的 OPD 训练曲线。潜变量 MSE 崩溃;LPIPS 后期退化;DINOv2 CLS 稳定且最优。

锚定是前提条件,而非额外加分项

锚定质量严格决定了 OPD 能达到的效果,正如第 3.3 节所预测的那样。图 5 对比了从无锚定、预稳定检查点(Anchor-100)和已稳定检查点(Anchor-400)开始的 OPD。三条曲线在整个训练过程中严格排序,且尽管 OPD 预算相同,Anchor-100 始终未能追上 Anchor-400:差距在于初始化质量,而非总计算量,因此 OPD 应在锚定收敛之后才开始。锚定曲线见补充材料。

Refer to caption
(a)ImageReward
Refer to caption
(b)Aesthetic Score
图 5:不同初始化下的 OPD 曲线。已稳定检查点(Anchor-400)在整个过程中占优。
Refer to caption
(a)ImageReward
Refer to caption
(b)Aesthetic Score
图 6:带 CPS 展开随机性的 OPD 曲线。确定性 Euler()在两个指标上均最优。

教师精炼调度

精炼强度。

强细化是必要的:在表 2 中,将教师模型从中等偏低噪声(,)起始,在所有指标上均不如其他设置,因为教师模型几乎不改变样本,目标携带的信号极少。两个较强区间表现接近,其中 在 PickScore 和 ImageReward 上略占优势,并在 DPG-Bench 和 HPSv3 上胜出;我们采用 作为整体最佳平衡点。

媒体内容 · 前往原文查看
表 2:教师细化强度对 20 步教师调度的影响。较大的 表示从更嘈杂的水平开始细化。更强的细化带来更好的结果。
DrawBench DPG
强度 区间 HPSv3 Pick ImgRwd 总体
中低 10.24 0.881 0.891 81.21
中高 10.80 0.885 1.120 84.68
10.97 0.884 1.116 84.71
细化步数。

教师的去噪预算限制了可迁移的质量上限:在图 3 中,减半的调度在细化目标中留下可见模糊,学生模型忠实地复现了这种模糊,而 则产生清晰的目标和相应更清晰的学生模型。

展开随机性

展开随机性虽然在 RL 式微调中通常有益,但在这里反而有害。我们将 Euler 替换为系数保持采样(CPS)(Wang and Yu 2025),该方法在固定总噪声尺度 下,通过角度 将每一步的噪声分量从模型预测方向旋转到新的高斯方向:

(13)

其中 。确定性 Euler()在所有情况下表现最佳,并且在 – 步后性能下降(图 6):扰动展开会使监督轨迹与部署轨迹脱钩。

4.4 泛化:更换教师模型

Any-OPD 的核心主张是教师模型可以在不改变方法的情况下被替换。我们直接进行了测试:将 FLUX.1-dev 替换为 Z-Image(6B;其自带 VAE,偏移 ,引导 ),其他一切不变:相同的学生模型、损失函数、超参数和评估。表 3 显示学生模型在每项报告的指标上都有提升,包括组合性基准 GenEval()和 DPG-Bench()。值得注意的是,提升与教师模型的特点一致:Z-Image 本身在 GenEval()上表现强劲,而 Any-OPD-Z 在获得感知质量提升的同时也继承了这一优势。

媒体内容 · 前往原文查看
表 3:以 Z-Image 作为教师模型进行知识蒸馏,采用与主实验完全相同的流程和超参数。蓝色底纹加粗标记表示相较于 SD3.5-Medium 基线的提升;† 标记教师模型参考值。
DrawBench GenEval DPG
模型 ImgRwd Pick HPSv3 综合 综合
SD3.5-Medium 0.922 0.866 9.12 70.70 84.58
Z-Image† 0.958 0.864 9.96 74.90 86.73
Any-OPD-Z 1.082 0.872 9.75 71.50 85.53

5 结论

我们提出了 Any-OPD,将在线策略蒸馏从迄今为止仅限于同构设定的范围拓展出去。我们的公式识别出异构配对所打破的两个假设——共享表示和共享时间步网格——并分别用不依赖任一模型内部机制的方案取而代之:教师模型纯粹通过对学生自身输出进行加噪-去噪投影来充当采样器,两个模型仅在一个冻结的外部表示中相遇,学生在该表示中被训练向其自身投影的固定点收敛,监督信号则通过噪声级别本身在不兼容的时间表之间对齐。前置的锚定阶段按粒度分离蒸馏,用数据弥合分布层面的差距,使在线策略目标只承载逐样本信息。由于这些组件均不依赖教师模型的 VAE、架构或时间表,教师模型在构造上就是可互换的,我们通过在不改动流程任何一行的情况下交换模型家族验证了这一特性。我们希望这种解耦能让当前最强的生成器——无论由谁构建——都能成为任何需要部署的模型的可用的教师模型。

局限性与未来工作。

组合互补的教师模型是一种自然的补救方案。由于除特征提取器外,该公式中没有任何部分针对图像特化,将 Any-OPD 扩展到其他潜在生成模态是进一步的研究方向。

参考文献

  • R. Agarwal, N. Vieillard, Y. Zhou, P. Stanczyk, S. Ramos Garea, M. Geist, 和 O. Bachem (2024) 语言模型的在线策略蒸馏:从自我生成的错误中学习。发表于国际学习表征会议,2024 年卷,第 21246–21263 页。引用位置:§1、§2、§3.2。
  • Black Forest Labs(2024)FLUX.1。注:https://github.com/black-forest-labs/flux 引用位置:§1、§1、§2。
  • Y. Blau 与 T. Michaeli(2018)感知-失真权衡。见《IEEE 计算机视觉与模式识别会议论文集》,第 6228–6237 页。引用位置:§3.2。
  • H. Cai、S. Cao、R. Du、P. Gao、S. Hoi、Z. Hou、S. Huang、D. Jiang、X. Jin、L. Li 等(2025)Z-image:基于单流扩散 Transformer 的高效图像生成基础模型。arXiv 预印本 arXiv:2511.22699。引用位置:§2。
  • P. Esser、S. Kulal、A. Blattmann、R. Entezari、J. Müller、H. Saini、Y. Levi、D. Lorber、A. Sauer、F. Boesel 等(2024a)扩展修正流 Transformer 以实现高分辨率图像合成。arXiv 预印本 arXiv:2403.03206。引用位置:§2、§3.1、§3.1。
  • P. Esser、S. Kulal、A. Blattmann、R. Entezari、J. Müller、H. Saini、Y. Levi、D. Lorenz、A. Sauer、F. Boesel 等(2024b)扩展修正流 Transformer 以实现高分辨率图像合成。见《第四十一届国际机器学习会议》。引用位置:§1、§1。
  • Z. Fang、W. Huang、Y. Zeng、Y. Zhao、S. Chen、K. Feng、Y. Lin、L. Chen、Z. Chen、S. Cao 等(2026)Flow-OPD:面向流匹配模型的在线策略蒸馏。arXiv 预印本 arXiv:2605.08063。引用位置:§2、§3.2。
  • D. Ghosh、H. Hajishirzi 与 L. Schmidt(2023)Geneval:面向文本到图像对齐评估的以对象为中心的框架。《神经信息处理系统进展》第 36 卷,第 52132–52152 页。引用位置:§4.1。
  • Y. Gu、L. Dong、F. Wei 与 M. Huang(2024)MiniLLM:大语言模型的知识蒸馏。见《国际学习表征会议》,2024 年卷,第 32694–32717 页。引用位置:§2。
  • G. Hinton、O. Vinyals 与 J. Dean(2015)蒸馏神经网络中的知识。arXiv 预印本 arXiv:1503.02531。引用位置:§1。
  • J. Ho、A. Jain 与 P. Abbeel(2020)去噪扩散概率模型。NeurIPS。引用位置:§2、§3.4。
  • X. Hu、R. Wang、Y. Fang、B. Fu、P. Cheng 与 G. Yu(2024)ELLA:为扩散模型配备大语言模型以增强语义对齐。arXiv 预印本 arXiv:2403.05135。引用位置:§4.1。
  • T. Karras、M. Aittala、T. Aila 和 S. Laine(2022)《阐明基于扩散的生成模型的设计空间》。神经信息处理系统进展第 35 卷,第 26565–26577 页。引用位置:§1、§3.1。
  • Y. Kirstain、A. Polyak、U. Singer、S. Matiana、J. Penna 和 O. Levy(2023)《Pick-a-pic:一个用于文本到图像生成的用户偏好开放数据集》。NeurIPS。引用位置:§1、§4.1、§4.1。
  • J. Ko、T. Chen、S. Kim、T. Ding、L. Liang、I. Zharkov 和 S. Yun(2025)《Distillm-2:一种提升大语言模型知识蒸馏的对比方法》。arXiv 预印本 arXiv:2503.07067。引用位置:§2。
  • Q. Li、J. Yu、K. Jiang、Y. Wei、Z. Xing、P. Li、R. Chu、S. Zhang、Y. Liu 和 Z. Wu(2026)《DiffusionOPD:扩散模型中在线策略蒸馏的统一视角》。arXiv 预印本 arXiv:2605.15055。引用位置:§2、§3.2。
  • A. Lin、J. Wohlwend、H. Chen 和 T. Lei(2020)《通过模仿学习进行自回归知识蒸馏》。载于 2020 年自然语言处理经验方法会议(EMNLP)论文集,第 6121–6133 页。引用位置:§1。
  • Y. Lipman、R. T. Chen、H. Ben-Hamu、M. Nickel 和 M. Le(2023)《用于生成建模的流匹配》。ICLR。引用位置:§1、§2、§3.1。
  • X. Liu、C. Gong 和 Q. Liu(2023)《流直且快:利用修正流学习生成与迁移数据》。ICLR。引用位置:§2。
  • S. Luo、Y. Tan、L. Huang、J. Li 和 H. Zhao(2023a)《潜在一致性模型:用少步推理合成高分辨率图像》。arXiv 预印本 arXiv:2310.04378。引用位置:§1。
  • S. Luo、Y. Tan、L. Huang、J. Li 和 H. Zhao(2023b)《潜在一致性模型:用少步推理合成高分辨率图像》。arXiv 预印本 arXiv:2310.04378。引用位置:§2。
  • Y. Ma、X. Wu、K. Sun 和 H. Li(2025)《Hpsv3:迈向广谱人类偏好评分》。载于 IEEE/CVF 国际计算机视觉会议论文集,第 15086–15095 页。引用位置:§1、§4.1。
  • W. Nie、B. Guo、Y. Huang、C. Xiao、A. Vahdat 和 A. Anandkumar(2022)《用于对抗净化的扩散模型》。arXiv 预印本 arXiv:2205.07460。引用位置:§3.4。
  • M. Oquab, T. Darcet, T. Moutakanni, H. Vo, M. Szafraniec, V. Khalidov, P. Fernandez, D. Haziza, F. Massa, A. El-Nouby, 等人(2023)Dinov2:无需监督学习鲁棒视觉特征。arXiv 预印本 arXiv:2304.07193。引用位置:§1, §3.4。
  • F. Permenter 和 C. Yuan(2023)从优化角度解读和改进扩散模型。arXiv 预印本 arXiv:2306.04848。引用位置:§3.4。
  • R. Rombach, A. Blattmann, D. Lorenz, P. Esser 和 B. Ommer(2022)基于潜在扩散模型的高分辨率图像合成。载于 IEEE/CVF 计算机视觉与模式识别会议论文集,第 10684–10695 页。引用位置:§3.1。
  • S. Ross, G. Gordon 和 D. Bagnell(2011)将模仿学习和结构化预测归约为无遗憾在线学习。载于第十四届国际人工智能与统计会议论文集,第 627–635 页。引用位置:§1, §3.2。
  • C. Saharia, W. Chan, S. Saxena, L. Li, J. Whang, E. L. Denton, K. Ghasemipour, R. Gontijo Lopes, B. Karagol Ayan, T. Salimans, 等人(2022)具备深度语言理解的照片级文本到图像扩散模型。NeurIPS。引用位置:§4.1。
  • T. Salimans 和 J. Ho(2022)用于扩散模型快速采样的渐进式蒸馏。arXiv 预印本 arXiv:2202.00512。引用位置:§1, §2。
  • C. Schuhmann(2022)LAION-Aesthetics。注:https://laion.ai/blog/laion-aesthetics/ LAION 博客文章。引用位置:§4.1。
  • Y. Song 和 P. Dhariwal(2024)改进一致性模型训练技术。载于国际学习表征会议,第 2024 卷,第 15078–15097 页。引用位置:§2。
  • Y. Song, J. Sohl-Dickstein, D. P. Kingma, A. Kumar, S. Ermon 和 B. Poole(2021)基于随机微分方程的分数生成建模。ICLR。引用位置:§2, §3.4。
  • Stability AI(2024)推出 Stable Diffusion 3.5。注:https://stability.ai/news/introducing-stable-diffusion-3-5 官方模型发布公告;访问时间:2026-07-28。引用位置:§1。
  • F. Wang 和 Z. Yu(2025)基于流匹配的强化学习系数保持采样。arXiv 预印本 arXiv:2509.05952。引用位置:§4.3。
  • Y. Wang、Y. Zang、H. Li、C. Jin 和 J. Wang(2025)面向多模态理解与生成的统一奖励模型。arXiv 预印本 arXiv:2503.05236。引用位置:§4.1。
  • J. Xu、X. Liu、Y. Wu、Y. Tong、Q. Li、M. Ding、J. Tang 和 Y. Dong(2023)ImageReward:学习并评估文生图的人类偏好。Advances in Neural Information Processing Systems 36,第 15903–15935 页。引用位置:§4.1。
  • T. Yin、M. Gharbi、T. Park、R. Zhang、E. Shechtman、F. Durand 和 W. T. Freeman(2024a)改进的分布匹配蒸馏,用于快速图像合成。arXiv 预印本 arXiv:2405.14867。引用位置:§2。
  • T. Yin、M. Gharbi、T. Park、R. Zhang、E. Shechtman、F. Durand 和 W. T. Freeman(2024b)改进的分布匹配蒸馏,用于快速图像合成。收录于第三十八届神经信息处理系统年度会议。引用位置:§1。
  • T. Yin、M. Gharbi、R. Zhang、E. Shechtman、F. Durand、W. T. Freeman 和 T. Park(2024c)基于分布匹配蒸馏的单步扩散。arXiv 预印本 arXiv:2311.18828。引用位置:§2。
  • R. Zhang、P. Isola、A. A. Efros、E. Shechtman 和 O. Wang(2018)深度特征作为感知度量的惊人有效性。CVPR。引用位置:§3.2、§4.3。
  • M. Zhou、H. Zheng、Z. Wang、M. Yin 和 H. Huang(2024)分数恒等蒸馏:预训练扩散模型的指数级快速蒸馏,实现单步生成。收录于第四十一届国际机器学习大会。引用位置:§2。

来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org