摘要
大多数用于视觉生成的奖励模型将丰富的人类判断简化为一个无法解释的单一分数,丢弃了构成偏好基础的推理过程。我们证明,教会奖励模型在评分前生成明确、多维度的评判,能将其从被动的评估者转变为主动的优化工具——通过两种互补的方式改进生成器:在训练时,结构化的推理过程为强化学习提供了可解释、细粒度的奖励;在测试时,“生成–评判–优化”循环将评判转化为有针对性的提示词修订,无需任何参数更新即可提升输出质量。为了在没有昂贵推理过程标注的情况下训练此类模型,我们引入了偏好锚定合理化(PARROT)框架,这是一个通过锚定生成、一致性过滤和知识蒸馏,从现成的偏好数据中恢复高质量推理过程的原则性方法。由此产生的模型 RationalRewards(8B)在开源奖励模型中达到了最先进的偏好预测水平——与 Gemini-2.5-Pro 相当——同时使用的训练数据比同类基线少 10–20 倍。作为强化学习的奖励信号,它在文生图和图像编辑生成器上的表现持续优于标量奖励方案。最引人注目的是,其测试时的评判与优化循环在多个基准测试上达到或超越了基于强化学习的微调效果,这表明结构化推理能够解锁现有生成器中因提示词不佳而未能发挥的潜在能力。模型和代码可在项目页面获取。
1 引言
随着视觉生成技术向照片级真实感与指令遵循型输出迈进(Google DeepMind, 2025; OpenAI, 2025; Wu et al., 2025b; Esser et al., 2024),用于评估这些输出的奖励模型已成为制约进一步发展的瓶颈。然而,大多数奖励模型仍是标量黑箱:它们将多维的人类判断——感知质量、指令忠实度、物理合理性、文字渲染——压缩成一个无法解释的单一数字(Xu et al., 2023; Wu et al., 2025e; Liu et al., 2025b; Wei et al., 2024; Hu et al., 2025)。这种做法丢弃了人类偏好背后的结构化推理,导致生成器利用捷径相关性而非学习原则性评估标准(Li et al., 2025)。本文提出的问题是:能否让奖励模型具备推理能力——并且,其结构化批评意见能否不仅用于评估,还能主动改进视觉生成?
我们提出 RationalRewards,这是一种基于推理的奖励模型,它在推导出评分之前先生成结构化、多维度的批评意见。我们认为,从标量输出到结构化推理的这一转变,将奖励模型从被动的评估器转变为视觉生成中一种通用的优化接口。通过生成显式推理,RationalRewards 在两个互补空间中解锁了优化能力:
- •
参数空间:多维结构化推理依据为强化学习提供了语义上有依据的密集反馈——用关于改进内容及原因的解释,替代了易受奖励黑客攻击的不透明标量梯度(图3)。
- •
提示空间:RationalRewards 不仅仅作为奖励信号,它还是一个生成后的提示词优化器。它会对生成的图像进行评判,识别出具体的缺陷,并在“生成–评判–优化”循环中将这些缺陷转化为有针对性的提示词修改。与那些在合成前盲目改写输入的提示词增强器不同(Wang 等人,2025g),这种方法是事后且反应式的,通过牺牲测试时的计算量来换取更高的保真度,而无需更新参数(Snell 等人,2024;Wang 等人,2025c)。
要实现这一愿景,需要一个能生成高质量结构化推理依据的奖励模型(Mahan 等人,2024;Guo 等人,2025;Zelikman 等人,2022;Wang 等人,2025d),然而,大规模的人工推理依据标注成本高得令人望而却步。但我们观察到,成对偏好数据在在线 AIGC 平台上广泛可用。基于此,我们提出了偏好锚定推理(PARROT),这是一种变分训练框架,它将推理依据视为潜在变量,并推导出关于观测偏好的证据下界(ELBO)。该 ELBO 的各项直接映射到一个简单、可扩展的流程上:(1)一个教师 VLM 生成锚定于已知偏好标签的候选推理依据;(2)一个一致性过滤器剔除模型幻觉,并保留那些真正具有预测能力的推理依据;(3)训练一个学生模型,使其在未看到答案的情况下生成推理依据。这种紧密的理论与实践对应关系(图 4)能够将现有的偏好数据集转化为高质量的推理监督,所需数据量比同类标量奖励基线方法少 10–20 倍。
关键结果。基于 Qwen3-VL-Instruct-8B 骨干网络通过 PARROT 实例化后,RationalRewards 在开源奖励模型中实现了最先进的偏好预测能力,与 Gemini-2.5-Pro 性能相当(表 1)。作为强化学习奖励信号,它在文生图和图像编辑任务中均能持续提升生成器性能,超越标量基线方法(表 2–3)。最有趣的是,RationalRewards 的“生成–批判–优化”循环——无需任何参数更新——在多个基准测试中与基于强化学习的微调方法表现相当甚至更优,这表明结构化批判能够释放因次优提示词而未能激发的潜在生成器能力。我们预计 RationalRewards 能够赋能图 8 所示四个以上令人信服的应用场景。
2 方法
我们提出偏好锚定合理化(PARROT)框架,该框架训练奖励模型在输出评分之前生成显式、多维度的理由说明(Zelikman et al., 2022; Wang et al., 2025d)。评估维度——文本忠实度、物理/视觉质量、文字渲染效果以及(针对编辑任务的)图像忠实度——遵循 Hu et al. (2025) 的分类体系,选择这些维度是为了覆盖当前生成器的主要失效模式。
由于大规模标注真实理由的成本过高,我们将理由视为潜在变量,通过变分目标从成对偏好数据中推断得出。由此产生的 ELBO(公式 1)分解为三项,每一项对应一个具体的流水线阶段(图 4):(1) 生成锚定于已知偏好的理由,(2) 筛选具有预测一致性的理由,(3) 蒸馏至学生模型。主要关注实际流水线的读者可参考图 4,之后再返回查看推导过程的详细说明。
2.1 变分框架:后见之明与前瞻性分解
设 表示一个比较元组,包含两张生成图像和一个条件用户请求(包括文本指令,对于编辑任务还包括源图像)。设 表示真实的人类偏好。与直接建模 的奖励模型不同,PARROT 引入了一个潜在的自然语言理由 来解释偏好 。
我们将理由视为偏好背后的解释机制。这里所说的“解释性”是指预测充分性:如果一个理由包含足够的信息,能够从评估任务中预测出偏好,那么它就是有效的理由。我们的目标是学习一个能够生成理由并预测下游任务偏好的评估器奖励模型(学生模型)。为了仅从偏好数据中学习这一点,我们最大化证据下界(ELBO):
| (1) |
这一推导揭示了一种自然的“教师-学生”结构,将学习过程分解为两种互补的模式:
- •
后见(后验):在已知真实偏好时推断理由——类似于人类专家在形成初步判断后阐述证据的过程。
- •
前瞻(先验):仅从输入中预测理由和偏好——即我们目标中的合理化奖励模型。
阶段 1:理由生成(构建)。一种朴素的方法是让教师 VLM 在没有引导的情况下比较图像,从先验中进行采样。这种做法并非最优:即使是强大的 VLM 也经常误判细微的视觉细节(例如,表 1 显示,即使是 Gemini-3-Pro 与人类偏好的一致性也有 30% 的差异)。相反,我们采用偏好锚定:教师模型(Qwen3-VL-32B-Instruct)在已知偏好标签的条件下生成理由,将生成过程从开放式评估压缩为有针对性的论证。这将概率质量集中在与观察到的标签一致的理由上,从而产生比无条件生成更高质量的后验样本——表 1 中的实验证实了这一点。下面显示了简短的提示词模板。
阶段 2:预测一致性过滤:最大化项 1,。
第一阶段生成的推理过程在语言上看似合理,但合理性并不保证预测充分性。只有当推理过程成功解释偏好时,它才能对 ELBO 有所贡献;否则,其概率会很低,对应的样本会降低边界值。例如,一个 VLM 可能生成一个单独听起来正确的推理过程(如“图像 B 的文字扭曲”),但该推理过程与视觉内容不符,或者它完全忽略了给定的偏好标签。
为了强制实现预测充分性,从而最大化项 1,我们通过一致性检查来确保推理过程确实解释了偏好:在不提供偏好标签的情况下重新查询教师模型,验证仅凭推理过程本身是否足以恢复偏好:
| (2) |
我们仅保留满足条件的样本,从而得到过滤后的数据集。这通过将推理过程的支持范围限制在高似然区域,丢弃产生幻觉或信息不足的推理过程,来近似最大化目标。
第三阶段:前瞻学习——最小化项 2。我们通过在过滤后的后验样本上进行 SFT,训练学生模型在没有偏好标签的情况下生成推理过程。由于教师模型是固定的,最小化 KL 散度等价于最大化目标——这正是对过滤样本进行标准 SFT 的目标。
连接成对训练与单点部署。虽然我们从成对数据(更易收集)推导出 ELBO,但下游应用需要单点反馈,例如用于 RL 训练的标量分数、用于测试时提示词优化的单张图像批评、用于诊断的视觉定位以及密集的视觉奖励。仅基于成对比较训练的模型往往无法单独批评单张图像,因为它过度拟合了对比候选对象的存在。
我们通过一种逐点投影策略来解决这一问题,该策略基于成对评估与逐点评估共享共同评价原则的假设。我们引导教师模型对每张图像进行独立评估,并将经过验证的成对评估理由作为参考提示,以引导其关注已识别的缺陷。教师模型从四个维度给出 1-4 分(浮点精度)的绝对评分:文本忠实度、图像忠实度、物理质量和文本渲染。详细评分标准见附录。这种投影超出了严格的成对 ELBO 范围,但投影后的理由继承了经 ELBO 过滤的成对理由的质量,并保持了推理与分数之间相同的预测关系。
由此生成一个逐点数据集。我们在这两个数据集上共同训练学生模型,使其能够同时进行逐点和成对评估:
2.2 从评估器到优化器:参数空间与提示词空间的调优
带有理由的奖励模型能够在两个互补空间中进行优化,每个空间适用于不同的部署场景。
- •
参数空间(SFT/RL 微调)。多维分数为强化学习提供了语义分解的奖励信号,从而能够在各个质量维度上进行细粒度反馈,而非针对单一不透明标量进行优化。结构化的理由进一步作为奖励分配的自然语言解释,有助于提升可解释性并减少奖励破解(见图 3)。
- •
提示词空间(测试时优化)。自然语言理由能够识别生成图像中的具体缺陷,我们利用这一点构建了一个“生成-批评-优化”循环(图 7):RationalRewards 对初始生成结果进行批评,其批评意见用于生成针对性的提示词修改,以进行重新生成。这一过程由语言而非数值梯度引导,通过增加测试时计算量来换取质量提升,无需更新参数(Snell 等人,2024)。我们注意到,这种事后提示词优化数据集也可用于蒸馏,以训练事前提示词增强模型。
这种双空间表述与测试时计算扩展(Snell 等人,2024)相关联:提示词空间优化为提升生成质量提供了一个与参数空间训练正交的维度,并且可应用于任何冻结的生成器。我们假设,当生成器因次优提示词而未能充分激发其潜在能力时,该方法尤为有效——这是一个我们在第 3 节通过实验检验的工作假设。
3 实验
训练数据。
我们在图像生成和图像编辑任务上评估了 RationalRewards。我们的训练数据来源于现有的偏好数据集:来自 EditReward(Wu 等人,2025e)的 30K 查询-偏好对用于图像编辑,以及来自 HPDv3 和 RapidData(Ma 等人,2025)的 50K 对用于文生图生成。这些数据集仅提供二元或排序偏好标签,不包含解释。我们应用 PARROT 流程(§ 2.1),以 Qwen3-VL-32B-Instruct 作为教师模型,将这些原始偏好对转化为带有推理标注的训练数据。我们的数据规模小 10 到 20 倍——这种效率源于教师模型的预训练知识,PARROT 通过结构化推理过程而非原始标签来蒸馏这些知识;第 3.1 节的消融实验单独分析了这一因素。在第二阶段(一致性过滤)中,约 72% 生成的推理过程通过了预测一致性检查,这表明偏好锚定产生了大体上连贯的推理过程,同时该过滤器去除了相当一部分幻觉或信息不足的样本。完整的实现细节(训练超参数、硬件配置、强化学习设置)在附录中提供。所有代码、数据和模型均在项目页面发布,以促进可复现性和进一步研究。
3.1 偏好建模的准确性
| 评估器 | MMRB2 | EditReward | GenAI-Bench | ||
|---|---|---|---|---|---|
| T2I | 编辑 | T2I | 编辑 | ||
| Qwen2.5-VL-7B (Bai 等人,2025) | 50.4 | 57.1 | 52.69 | – | 40.48 |
| Qwen2.5-VL-72B | 59.1 | 64.6 | 63.9 | 66.6 | 74.3 |
| Qwen3-VL-8B(Yang 等人,2025) | 59.4 | 61.7 | 51.9 | 55.1 | 50.1 |
| Qwen3-VL-32B | 64.1 | 67.3 | 64.2 | 66.9 | 76.3 |
| EditReward-7B(Wu 等人,2025e) | – | 67.2 | 56.99 | – | 65.72 |
| UnifiedReward-7B(Wang 等人,2025h) | 59.8 | – | – | 67.9 | – |
| RationalRewards(Qwen2.5-VL-7B) | 62.3 | 68.5 | 63.6 | 66.4 | 75.7 |
| RationalRewards(Qwen3-VL-8B) | 64.2 | 70.3 | 66.2 | 69.8 | 80.1 |
| Qwen3-VL-32B-Instruct 知识蒸馏 | 57.4 | 65.6 | 56.8 | 59.3 | 62.8 |
| 商业模型 | |||||
| GPT-4.1 | 65.8 | 68.2 | 58.3 | 60.5 | 69.3 |
| Gemini 2.5 Flash(Comanici 等人,2025) | 63.1 | 66.5 | 58.6 | 65.8 | 73.0 |
| Gemini 2.5 Pro | 70.5 | 71.3 | 71.3 | 66.2 | 78.9 |
| Gemini 3 Pro(DeepMind,2025) | 74.4 | 74.9 | 72.2 | 73.1 | 80.5 |
我们首先评估 RationalRewards 是否能够产生与人类对齐的偏好判断。我们在三个已建立的基准上报告成对比较准确率:Multimodal Reward Bench 2(Hu 等人,2025)、GenAI-Bench(Jiang 等人,2024)以及 EditReward Bench(Wu 等人,2025e),这些基准涵盖了文本到图像和图像到图像两种生成任务。
主要结果。如表 1 所示,我们 8B 参数的 RationalRewards 在所有三个基准上以显著优势超越了所有开源标量奖励模型,且无需复杂的损失函数设计来处理标签噪声或标注歧义。值得注意的是,RationalRewards 在偏好预测方面优于包括 Gemini-2.5-Flash 在内的商业模型,并接近 GPT-5/Gemini-2.5-Pro 的性能水平,为视觉生成领域的质量评估提供了一种经济高效的替代方案。
PARROT 与直接知识蒸馏的消融实验。为了将 PARROT 的贡献与通用知识蒸馏区分开来,我们引入了一个基线方法,该方法直接从 Qwen3-VL-32B-Instruct 对相同的 8B 骨干模型进行直接的 SFT 蒸馏,使用相同的数据量,但不进行偏好锚定合理化(在表 1 中标记为“Qwen3-VL-32B-Instruct 蒸馏”)。该基线在所有基准测试上的表现均不如 RationalRewards——在 MMRB2(T2I)上低 6.8 分,在 GenAI(编辑)上低 17.3 分——这证实了性能提升源于结构化的合理化过程,而非仅仅依赖于更大的教师模型。我们还将骨干模型替换为 Qwen2.5-VL-7B-Instruct;其结果仍然超过了先前的标量奖励模型,这表明性能改进归因于 PARROT,而非特定的骨干模型选择。
3.2 双空间优化
鉴于 RationalRewards 强大的判别性能,我们现在研究其在改进下游生成任务中的实用性。我们探索两种互补的优化策略:通过 RL 进行参数空间调优,以及通过测试时批评与改进进行提示词空间调优。我们在图像编辑任务上使用 ImgEdit-Bench(Ye 等人,2025a)和 GEdit-Bench-EN(Liu 等人,2025c)进行评估,在文生图任务上使用 UniGen 基准进行评估。我们还在附录中包含了以物理为中心的 PICA-Bench(Pu 等人,2025),用于分布外压力测试,并遵循每个基准规定的评估协议。
参数空间调优(RL)。我们尝试了最近的扩散模型 RL 方法 DiffusionNFT(Zheng 等人,2025),该方法针对同一用户提示词采样一组生成结果,并使用加权扩散损失进行优化。为了确保可复现性,我们在附录中包含了算法和实现细节。我们使用 RationalRewards 为 RL 微调提供密集的、按维度划分的奖励信号,并系统地与跨两个轴线的替代奖励模型进行比较:标量型与推理型,以及通用型与偏好训练型。
- 1.
标量奖励模型:用于图像编辑的 EditReward(Wu 等人,2025e)和用于文生图的 MultiReward(被 DiffusionNFT(Zheng 等人,2025)使用)。这些模型输出单一的标量分数,不包含自然语言推理。
- 2.
通用推理模型:直接用作评判者的 Qwen3-VL-32B-Instruct。该模型能够生成自然语言评论,但并未通过 PARROT 在偏好数据上进行训练,从而将我们训练流程的贡献与原始模型规模分离开来。
| 模型 | 动作 | 属性 | 组合 | 布局 | 语法 | 逻辑 | 关系 | 风格 | 文本 | 世界知识 | 总体 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| FLUX.1-dev | 62.24 | 67.20 | 45.75 | 70.84 | 62.30 | 29.77 | 66.88 | 85.00 | 32.18 | 87.50 | 60.97 |
| +MultiReward | 59.78 | 68.23 | 44.21 | 74.37 | 59.33 | 28.25 | 68.35 | 76.05 | 36.21 | 86.03 | 60.12 |
| +Qwen3-VL-32B | 65.47 | 72.68 | 53.28 | 71.82 | 60.78 | 33.24 | 71.85 | 85.53 | 42.15 | 89.47 | 66.53 |
| +RationalRewards | 67.40 | 76.36 | 57.67 | 72.15 | 60.29 | 40.53 | 74.59 | 87.20 | 52.57 | 90.61 | 70.34 |
| SD-3.5-Medium | 60.41 | 66.99 | 53.35 | 70.31 | 59.89 | 37.73 | 68.78 | 89.80 | 15.23 | 84.34 | 60.71 |
| +RationalRewards | 64.36 | 81.49 | 67.98 | 75.88 | 58.68 | 42.37 | 75.60 | 89.60 | 10.05 | 91.77 | 70.56 |
| +MultiReward | 57.03 | 66.67 | 51.03 | 75.37 | 57.22 | 34.86 | 67.51 | 77.60 | 21.84 | 86.71 | 62.55 |
| +Qwen3-VL-32B | 61.23 | 74.48 | 63.85 | 75.34 | 59.67 | 31.23 | 72.84 | 84.73 | 14.87 | 88.86 | 66.71 |
| Qwen-Image | 82.49 | 87.93 | 72.94 | 86.56 | 60.96 | 51.59 | 80.08 | 94.70 | 72.13 | 94.15 | 78.36 |
| +MultiReward | 79.52 | 86.45 | 70.91 | 88.53 | 58.43 | 48.62 | 80.55 | 83.75 | 67.18 | 92.17 | 75.61 |
| +Qwen3-VL-32B | 81.95 | 87.45 | 76.42 | 87.73 | 62.93 | 51.14 | 81.55 | 95.20 | 75.67 | 95.63 | 80.17 |
| +RationalRewards | 82.11 | 87.82 | 78.82 | 88.07 | 66.21 | 52.88 | 82.21 | 96.60 | 79.76 | 96.57 | 82.60 |
如表 3 和表 2 所示,使用 RationalRewards 进行强化学习在几乎所有子类别上均能带来相较于两个基模型的一致提升,并超越了标量奖励基线和通用推理基线。在图像编辑方面,RationalRewards 引导的强化学习将 Flux.1 Kontext 在 ImgEdit-Bench 上的整体得分从 3.52 提升至 3.84,明显优于 EditReward 引导的强化学习(3.66)。在文生图任务上,RationalRewards 将 FLUX.1-dev 在 UniGen 上的得分从 60.97 提升至 70.34(提升 9.37 分),大幅超过 MultiReward(62.55)和直接使用 Qwen3-VL-32B 作为评判模型(66.71)。值得注意的是,8B 参数的 RationalRewards 表现优于直接用作评判模型的 Qwen3-VL-32B,这证实了 PARROT 的结构化偏好训练提供了超越原始模型能力的额外价值。
| 模型 | 代表性方面 | 整体 | ||
|---|---|---|---|---|
| 光照 | 反射 | 形变 | ||
| Flux.1 Kontext [dev] | 53.64 | 43.84 | 33.74 | 41.07 |
| +PromptEnhance | 55.53 | 45.87 | 38.14 | 45.28 |
| +PT (RationalRewards) | 56.87 | 51.43 | 41.08 | 48.12 |
| +PICA SFT | 51.21 | 47.22 | 33.99 | 41.93 |
| +RL (RationalRewards) | 51.75 | 54.81 | 39.36 | 44.25 |
| Qwen-Image-Edit | 52.02 | 49.07 | 38.14 | 49.71 |
| +PromptEnhance | 58.49 | 50.42 | 42.30 | 50.97 |
| +PT (RationalRewards) | 63.34 | 61.55 | 43.28 | 55.65 |
| +PICA SFT | 60.47 | 55.19 | 40.99 | 52.06 |
| +RL (RationalRewards) | 63.07 | 60.71 | 41.32 | 54.11 |
| 模型 | ImgEdit | GEdit-Bench-EN | ||
|---|---|---|---|---|
| 整体 | G_SC | G_PQ | G_O | |
| Flux.1 Kontext [dev] | 3.52 | 7.16 | 7.37 | 6.51 |
| +RL (EditReward) | 3.66 | 7.38 | 7.53 | 6.88 |
| +RL (Qwen3-VL-32B) | 3.67 | 7.42 | 7.48 | 6.82 |
| +RL (RationalRewards) | 3.84 | 7.75 | 8.24 | 7.37 |
| +PT (RationalRewards) | 4.01 | 7.77 | 7.61 | 7.23 |
| Qwen-Image-Edit | 4.27 | 8.00 | 7.86 | 7.56 |
| +RL (EditReward) | 4.25 | 8.36 | 7.91 | 7.77 |
| +RL (Qwen3-VL-32B) | 4.25 | 8.42 | 7.83 | 7.79 |
| +RL (RationalRewards) | 4.38 | 8.74 | 8.43 | 8.29 |
| +PT (RationalRewards) | 4.43 | 8.94 | 8.20 | 8.33 |
测试时提示词空间调优。我们利用 RationalRewards 的生成特性,采用“生成–评判–优化”协议:生成器生成初始图像;RationalRewards 从四个维度对其进行评估,并给出自然语言的评判和优化建议;如果任一维度的得分低于 3.0 的阈值,优化后的请求将被反馈给生成器。与对单个基础模型进行 384 GPU 小时的强化学习微调相比,这种单次迭代循环每张图像仅增加约 0.4 秒的 VLM 推理开销(通过 vLLM 前缀缓存和分页注意力机制实现)。
提示词调优达到或超越强化学习。表 3 中得出了一个引人注目的发现:推理时的提示词调优所带来的改进,常常能与计算成本高昂的强化学习相媲美,甚至超越后者。在 ImgEdit-Bench 上,提示词调优将经过强化学习调优的 Flux 模型整体得分从 3.84 提升至 4.01。对于 Qwen-Image-Edit,在强化学习基础上应用提示词调优,取得了 4.43 的最佳整体得分,两种方法呈现出互补性。在 GEdit-Bench-EN 总体得分上,提示词调优(8.33)略高于单独的强化学习(8.29)。
强化学习的性能上限部分源于结构性原因:基于 LoRA 的微调限制了参数更新能力,并且强化学习的查询分布可能无法完全覆盖评估分布。相比之下,提示词调优对每个实例进行单独优化,没有灾难性遗忘的风险。更根本的是,这些结果暗示了一种潜在能力假说:生成器本身已具备产生高质量输出的能力,但这种能力因次优的提示词而未能被充分激发。RationalRewards 的评判功能在无需修改权重的情况下,弥合了用户意图与模型能力之间的差距。我们注意到,这仍然是一个需要表征层面验证的假说。
4 相关工作
视觉生成的奖励模型。视觉生成的标准范式严重依赖于在大规模人类偏好数据集上训练的标量奖励模型。诸如 ImageReward(Xu 等人,2023)、VideoReward(Liu 等人,2025b)、PickScore(Kirstain 等人,2023)、UnifiedReward(Wang 等人,2025h)和 EditReward(Wu 等人,2025e)等模型通常作为不透明的判别器,将像素输入直接映射为标量分数。我们的工作为奖励建模提供了一条替代路径,将范式从标量回归转向理性化(Zelikman 等人,2022)。生成式奖励模型也在可验证领域得到了研究(Mahan 等人,2024;Guo 等人,2025;Chen 等人,2026)。
视觉生成中的训练与测试时扩展。最近的工作,例如 FlowGRPO(Liu 等人,2025a)、DanceGRPO(Xue 等人,2025)、Blip3o-Next(Chen 等人,2025)和 DiffusionNFT(Zheng 等人,2025;Li 等人,2025),成功地将强化学习整合到视觉生成中,在组合推理和文本渲染方面展现了显著的提升。虽然有效,但强化学习受限于奖励模型的质量,当代理奖励与人类偏好偏离时,常常遭受奖励破解问题。近期的工作已转向利用测试时计算来提升生成质量。ReflectionFLow(Zhuo 等人,2025)和 PromptEnhancer(Wang 等人,2025g)利用思维链(CoT)重写器,在生成之前将用户提示词扩展为详细的规格说明。对于图像编辑,Reason-Edit(Yin 等人,2025)引入了一个思考–编辑–反思循环。最近,一些方法开始利用统一多模态模型的多模态思维链能力,在测试时迭代改进视觉合成(Qin 等人,2025;Wu 等人,2025d;Deng 等人,2025a;Jiang 等人,2025;Ye 等人,2025b;Li 等人,2025)。我们的工作强调了奖励模型中偏好校准和理性化的重要性,揭示了利用测试时计算换取更优生成效果的基本机制。
5 结论
我们提出了 RationalRewards,一个基于推理的奖励模型,用结构化的、多维的思维链评判取代了不透明的标量评分;以及 PARROT,一个变分框架,通过将推理视为可从现成的偏好数据中恢复的潜在变量,使这一过程变得可行。我们的工作得出了三个主要发现。首先,结构化推理作为一种强大的归纳偏置:通过要求模型阐明为何偏好某一张图像,一个 8B 参数的模型实现了与 Gemini-2.5-Pro 相当、接近 GPT-5 的偏好预测准确率,同时消耗的训练数据比标量基线少 10–20 倍。其次,RationalRewards 生成的多维推理可作为语义上有依据的强化学习奖励,在文生图和图像编辑基准测试中,始终优于更大规模的标量奖励模型和通用 VLM 评判模型。第三,也是最值得注意的是,生成-评判-优化循环——一种纯测试时干预,无需任何参数更新——在多个基准测试中与基于强化学习的微调表现相当或更优,这为当前生成器具备次优提示词未能激发出的潜在能力这一假设提供了实证支持。
参考文献
- S. Bai, K. Chen, X. Liu, J. Wang, W. Ge, S. Song, K. Dang, P. Wang, S. Wang, J. Tang, 等. (2025) Qwen2.5-VL 技术报告. arXiv 预印本 arXiv:2502.13923. 引用于:表 1.
- J. Chen, L. Xue, Z. Xu, X. Pan, S. Yang, C. Qin, A. Yan, H. Zhou, Z. Chen, L. Huang, 等. (2025) Blip3o-next: 原生图像生成的下一个前沿. arXiv 预印本 arXiv:2510.15857. 引用于:表 4, §4.
- X. Chen, G. Li, Z. Wang, B. Jin, C. Qian, Y. Wang, H. Wang, Y. Zhang, D. Zhang, T. Zhang, H. Tong, and H. Ji (2026) RM-r1: 将奖励建模视为推理. 外部链接: 2505.02387, 链接 引用于:§4.
- G. Comanici、E. Bieber、M. Schaekermann、I. Pasupat、N. Sachdeva、I. Dhillon、M. Blistein、O. Ram、D. Zhang、E. Rosen 等人。(2025) Gemini 2.5:以高级推理、多模态、长上下文和下一代智能体能力推动前沿发展。arXiv 预印本 arXiv:2507.06261。引用于:表 1。
- G. DeepMind (2025) Google Gemini-3 系统卡。引用于:表 1。
- C. Deng、D. Zhu、K. Li、C. Gou、F. Li、Z. Wang、S. Zhong、W. Yu、X. Nie、Z. Song 等人。(2025a) 统一多模态预训练中的涌现特性。arXiv 预印本 arXiv:2505.14683。引用于:§4。
- C. Deng、D. Zhu、K. Li、C. Gou、F. Li、Z. Wang、S. Zhong、W. Yu、X. Nie、Z. Song、G. Shi 和 H. Fan (2025b) 统一多模态预训练中的涌现特性。arXiv 预印本 arXiv:2505.14683。引用于:表 4、表 5。
- P. Esser、S. Kulal、A. Blattmann、R. Entezari、J. Müller、H. Saini、Y. Levi、D. Lorenz、A. Sauer、F. Boesel 等人。(2024) 缩放整流流 Transformer 以实现高分辨率图像合成。第四十一届国际机器学习大会。引用于:§E.1、§1。
- Google DeepMind (2025) Gemini 2.5 Flash 图像(纳米香蕉)。注:https://ai.google.dev/gemini-api/docs/image-generation Google 的 AI 图像生成与编辑模型,正式名称为 Gemini 2.5 Flash Image,昵称为“纳米香蕉”。访问于 2025 年 9 月。引用于:表 4、§1。
- J. Guo、Z. Chi、L. Dong、Q. Dong、X. Wu、S. Huang 和 F. Wei (2025) 奖励推理模型。外部链接:2505.14674,链接。引用于:§1、§4。
- E. J. Hu、Y. Shen、P. Wallis、Z. Allen-Zhu、Y. Li、S. Wang、L. Wang、W. Chen 等人。(2022) LoRA:大语言模型的低秩适配。ICLR 1 (2),第 3 页。引用于:§E.1。
- Y. Hu、R. Askari-Hemmat、M. Hall、E. Dinan、L. Zettlemoyer 和 M. Ghazvininejad (2025) 多模态奖励基准 2:评估用于交错文本和图像的全能奖励模型。arXiv 预印本 arXiv:2512.16899。引用于:表 13、表 13、§1、§2、§3.1。
- D. Jiang、M. Ku、T. Li、Y. Ni、S. Sun、R. Fan 和 W. Chen (2024) GenAI 竞技场:生成式模型的开放评估平台。arXiv 预印本 arXiv:2406.04485。引用于:表 13、表 13、§3.1。
- D. Jiang, Z. Guo, R. Zhang, Z. Zong, H. Li, L. Zhuo, S. Yan, P. Heng, 和 H. Li (2025) T2i-r1: 通过协作的语义级和 token 级思维链强化图像生成。arXiv 预印本 arXiv:2505.00703。被 §4 引用。
- D. Jin, R. Xu, J. Zeng, R. Lan, Y. Bai, L. Sun, 和 X. Chu (2025) 语义上下文至关重要:改进自回归模型的条件控制。arXiv 预印本 arXiv:2511.14063。被 §E.1 引用。
- Y. Kirstain, A. Polyak, U. Singer, S. Matiana, J. Penna, 和 O. Levy (2023) Pick-a-pic:一个用于文本到图像生成的用户偏好开放数据集。Advances in Neural Information Processing Systems 36, 第 36652–36663 页。被 §4 引用。
- R. Lan, Y. Bai, X. Duan, M. Li, D. Jin, R. Xu, L. Sun, 和 X. Chu (2025) Flux-Text:一种用于场景文本编辑的简单且先进的扩散 Transformer 基线。arXiv 预印本 arXiv:2505.03329。被 §E.1 引用。
- Z. Li, Z. Liu, Q. Zhang, B. Lin, F. Wu, S. Yuan, Z. Yan, Y. Ye, W. Yu, Y. Niu, 等 (2025) UniWorld-v2:通过扩散负感知微调和 MLLM 隐式反馈强化图像编辑。arXiv 预印本 arXiv:2510.16888。被 §1, §4 引用。
- B. Lin, Z. Li, X. Cheng, Y. Niu, Y. Ye, X. He, S. Yuan, W. Yu, S. Wang, Y. Ge, 等 (2025) UniWorld:用于统一视觉理解与生成的高分辨率语义编码器。arXiv 预印本 arXiv:2506.03147。被 Table 4 引用。
- J. Liu, G. Liu, J. Liang, Y. Li, J. Liu, X. Wang, P. Wan, D. Zhang, 和 W. Ouyang (2025a) Flow-GRPO:通过在线强化学习训练流匹配模型。arXiv 预印本 arXiv:2505.05470。被 §4 引用。
- J. Liu, G. Liu, J. Liang, Z. Yuan, X. Liu, M. Zheng, X. Wu, Q. Wang, M. Xia, X. Wang, 等 (2025b) 利用人类反馈改进视频生成。arXiv 预印本 arXiv:2501.13918。被 §1, §4 引用。
- S. Liu, Y. Han, P. Xing, F. Yin, R. Wang, W. Cheng, J. Liao, Y. Wang, H. Fu, C. Han, 等 (2025c) Step1X-Edit:一个用于通用图像编辑的实用框架。arXiv 预印本 arXiv:2504.17761。被 Table 5, §3.2 引用。
- Y. Ma, X. Wu, K. Sun, 和 H. Li (2025) HPSv3:迈向广谱人类偏好评分。收录于 IEEE/CVF 国际计算机视觉大会论文集,第 15086–15095 页。被 §3 引用。
- D. Mahan, D. V. Phung, R. Rafailov, C. Blagden, N. Lile, L. Castricato, J. Fränken, C. Finn, 和 A. Albalak (2024) 生成式奖励模型。外部链接:2410.12832,链接 被引用自:§1, §4。
- OpenAI (2025) GPT-image-1。说明:https://platform.openai.com/docs/guides/image-generation?image-generation-model=gpt-image-1 OpenAI 的图像生成模型。访问于 2025 年 9 月。被引用自:表 5, §1。
- D. Podell, Z. English, K. Lacey, A. Blattmann, T. Dockhorn, J. Müller, J. Penna, 和 R. Rombach (2023) SDXL:改进用于高分辨率图像合成的潜在扩散模型。arXiv 预印本 arXiv:2307.01952。被引用自:表 4。
- Y. Pu, L. Zhuo, S. Han, J. Xing, K. Zhu, S. Cao, B. Fu, S. Liu, H. Li, Y. Qiao, 等人 (2025) PICABench:我们在物理逼真的图像编辑方面进展如何?arXiv 预印本 arXiv:2510.17681。被引用自:§3.2。
- L. Qin, J. Gong, Y. Sun, T. Li, M. Yang, X. Yang, C. Qu, Z. Tan, 和 H. Li (2025) Uni-cot:迈向文本与视觉的统一链式推理。arXiv 预印本 arXiv:2508.05606。被引用自:§4。
- S. Sheynin, A. Polyak, U. Singer, Y. Kirstain, A. Zohar, O. Ashual, D. Parikh, 和 Y. Taigman (2024) Emu Edit:通过识别与生成任务实现精确图像编辑。收录于 IEEE/CVF 计算机视觉与模式识别会议论文集,第 8871–8879 页。被引用自:表 4。
- C. Snell, J. Lee, K. Xu, 和 A. Kumar (2024) 最优地扩展大语言模型测试时计算可能比扩展模型参数更有效。外部链接:2408.03314,链接 被引用自:第 2 项, 第 2 项, §2.2。
- C. Wang, H. Wang, X. Chen, J. Liu, T. Xue, C. Peng, D. Qi, F. Lin, 和 Y. Yan (2025a) 从幻象到意图:面向视觉语言推理的视觉原理学习。arXiv 预印本 arXiv:2511.23031。被引用自:§B.1, §E.1。
- G. Wang, S. Zhao, X. Zhang, L. Cao, P. Zhan, L. Duan, S. Lu, M. Fu, J. Zhao, Y. Li, 和 Q. Chen (2025b) Ovis-u1 技术报告。arXiv 预印本 arXiv:2506.23044。被引用自:表 5。
- H. Wang, C. Qu, Z. Huang, W. Chu, F. Lin, 和 W. Chen (2025c) VL-Rethinker:通过强化学习激励视觉语言模型的自我反思。arXiv 预印本 arXiv:2504.08837。被引用自:§E.1, 第 2 项。
- H. Wang, H. Que, Q. Xu, M. Liu, W. Zhou, J. Feng, W. Zhong, W. Ye, T. Yang, W. Huang 等人 (2025d) 面向开放式生成的逆向工程推理。arXiv 预印本 arXiv:2509.06160。引用自:§1, §2。
- H. Wang, A. Su, W. Ren, F. Lin 和 W. Chen (2025e) Pixel Reasoner:利用好奇心驱动的强化学习激励像素空间推理。arXiv 预印本 arXiv:2505.15966。引用自:§E.1。
- H. Wang, Q. Xu, C. Liu, J. Wu, F. Lin 和 W. Chen (2025f) 大语言模型中通过强化学习涌现的分层推理。arXiv 预印本 arXiv:2509.03646。引用自:§E.1。
- H. Wang, J. Zhou 和 X. He (2020) 学习上下文感知的任务推理以实现高效的元强化学习。arXiv 预印本 arXiv:2003.01373。引用自:§B.1。
- L. Wang, X. Xing, Y. Cheng, Z. Zhao, D. Li, T. Hang, J. Tao, Q. Wang, R. Li, C. Chen 等人 (2025g) PromptEnhancer:一种通过思维链提示词重写增强文生图模型的简单方法。arXiv 预印本 arXiv:2509.04545。引用自:第2项, §2.2, 表3, §4。
- Y. Wang, Y. Zang, H. Li, C. Jin 和 J. Wang (2025h) 面向多模态理解与生成的统一奖励模型。arXiv 预印本 arXiv:2503.05236。引用自:表1, §4。
- C. Wei, Z. Xiong, W. Ren, X. Du, G. Zhang 和 W. Chen (2024) OmniEdit:通过专家监督构建图像编辑通才模型。arXiv 预印本 arXiv:2411.07199。引用自:§1。
- B. Wu, C. Zou, C. Li, D. Huang, F. Yang, H. Tan, J. Peng, J. Wu, J. Xiong, J. Jiang 等人 (2025a) 混元视频 1.5 技术报告。arXiv 预印本 arXiv:2511.18870。引用自:§E.1。
- C. Wu, J. Li, J. Zhou, J. Lin, K. Gao, K. Yan, S. Yin, S. Bai, X. Xu, Y. Chen, Y. Chen, Z. Tang, Z. Zhang, Z. Wang, A. Yang, B. Yu, C. Cheng, D. Liu, D. Li, H. Zhang, H. Meng, H. Wei, J. Ni, K. Chen, K. Cao, L. Peng, L. Qu, M. Wu, P. Wang, S. Yu, T. Wen, W. Feng, X. Xu, Y. Wang, Y. Zhang, Y. Zhu, Y. Wu, Y. Cai 和 Z. Liu (2025b) Qwen-Image 技术报告。外部链接:2508.02324, 链接 引用自:§1。
- C. Wu, P. Zheng, R. Yan, S. Xiao, X. Luo, Y. Wang, W. Li, X. Jiang, Y. Liu, J. Zhou, Z. Liu, Z. Xia, C. Li, H. Deng, J. Wang, K. Luo, B. Zhang, D. Lian, X. Wang, Z. Wang, T. Huang, 和 Z. Liu (2025c) OmniGen2:面向高级多模态生成的探索。arXiv 预印本 arXiv:2506.18871。引用于:表 4,表 5。
- C. Wu, P. Zheng, R. Yan, S. Xiao, X. Luo, Y. Wang, W. Li, X. Jiang, Y. Liu, J. Zhou, 等人 (2025d) OmniGen2:面向高级多模态生成的探索。arXiv 预印本 arXiv:2506.18871。引用于:第 4 节。
- K. Wu, S. Jiang, M. Ku, P. Nie, M. Liu, 和 W. Chen (2025e) Editreward:一种用于指令引导图像编辑的、与人类对齐的奖励模型。arXiv 预印本 arXiv:2509.26346。引用于:图 11,表 13,第 1 节,第 1 项,第 3 节,第 3.1 节,表 1,第 4 节。
- J. Xu, X. Liu, Y. Wu, Y. Tong, Q. Li, M. Ding, J. Tang, 和 Y. Dong (2023) Imagereward:学习并评估文本到图像生成中的人类偏好。Advances in Neural Information Processing Systems 36,第 15903–15935 页。引用于:第 1 节,第 4 节。
- R. Xu, D. Jin, Y. Bai, R. Lan, X. Duan, L. Sun, 和 X. Chu (2025) Scalar:尺度可控的视觉自回归学习。arXiv 预印本 arXiv:2507.19946。引用于:第 E.1 节。
- Z. Xue, J. Wu, Y. Gao, F. Kong, L. Zhu, M. Chen, Z. Liu, W. Liu, Q. Guo, W. Huang, 等人 (2025) DanceGRPO:在视觉生成中释放 GRPO 的潜力。arXiv 预印本 arXiv:2505.07818。引用于:第 4 节。
- A. Yang, A. Li, B. Yang, B. Zhang, B. Hui, B. Zheng, B. Yu, C. Gao, C. Huang, C. Lv, 等人 (2025) Qwen3 技术报告。arXiv 预印本 arXiv:2505.09388。引用于:表 1。
- Y. Ye, X. He, Z. Li, B. Lin, S. Yuan, Z. Yan, B. Hou, 和 L. Yuan (2025a) ImgEdit:一个统一的图像编辑数据集与基准。外部链接:2505.20275,链接。引用于:第 3.2 节。
- Z. Ye, Q. Liu, C. Wei, Y. Zhang, X. Wang, P. Wan, K. Gai, 和 W. Luo (2025b) 视觉感知的 CoT:在统一模型中实现高保真视觉一致性。arXiv 预印本 arXiv:2512.19686。引用于:第 4 节。
- F. Yin, S. Liu, Y. Han, Z. Wang, P. Xing, R. Wang, W. Cheng, Y. Wang, A. Li, Z. Yin, 等人 (2025) ReasonEdit:迈向推理增强的图像编辑模型。arXiv 预印本 arXiv:2511.22625。引用于:第 4 节。
- Q. Yu, W. Chow, Z. Yue, K. Pan, Y. Wu, X. Wan, J. Li, S. Tang, H. Zhang, 和 Y. Zhuang (2025) Anyedit: 掌握面向任意创意的统一高质量图像编辑。收录于计算机视觉与模式识别会议论文集,第26125–26135页。引用于:表5。
- E. Zelikman, Y. Wu, J. Mu, 和 N. Goodman (2022) Star: 用推理引导推理。神经信息处理系统进展 35, 第15476–15488页。引用于:§1, §2, §4。
- H. Zhao, X. Ma, L. Chen, S. Si, R. Wu, K. An, P. Yu, M. Zhang, Q. Li, 和 B. Chang (2024) UltraEdit: 基于指令的大规模细粒度图像编辑。arXiv预印本 arXiv:2407.05282。引用于:表5。
- K. Zheng, H. Chen, H. Ye, H. Wang, Q. Zhang, K. Jiang, H. Su, S. Ermon, J. Zhu, 和 M. Liu (2025) Diffusionnft: 结合前向过程的在线扩散强化学习。arXiv预印本 arXiv:2509.16117。引用于:图11, §E.1, §E.1, 条目1, §3.2, §4。
- L. Zhuo, L. Zhao, S. Paul, Y. Liao, R. Zhang, Y. Xin, P. Gao, M. Elhoseiny, 和 H. Li (2025) 从反思到完美:通过反思调优扩展文生图扩散模型的推理时优化。收录于IEEE/CVF国际计算机视觉会议论文集,第15329–15339页。引用于:§4。
附录A 扩展实验结果
UniGenBench++上的完整文生图结果
表4提供了所有类别和模型变体在UniGenBench++上的完整结果。
| 模型 | 动作 | 属性 | 组合 | 布局 | 语法 | 逻辑 | 关系 | 风格 | 文字 | 世界知识 | 整体 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 开源/商业模型 | |||||||||||
| Nano Banana Pro (Google DeepMind, 2025) | 91.30 | 91.95 | 92.91 | 93.30 | 89.59 | 80.24 | 95.43 | 99.30 | 95.65 | 97.47 | 92.72 |
| Seedream-4-5-251128 | 88.06 | 91.03 | 90.08 | 92.55 | 84.09 | 73.17 | 90.61 | 99.20 | 91.67 | 96.35 | 89.70 |
| UniWorld-V1 (Lin 等人, 2025) | 66.94 | 70.62 | 54.51 | 68.96 | 63.77 | 38.41 | 67.13 | 91.10 | 26.44 | 82.91 | 63.11 |
| OmniGen2 (Wu 等人, 2025c) | 62.68 | 72.12 | 56.31 | 71.54 | 59.89 | 32.50 | 68.27 | 91.90 | 29.02 | 86.39 | 63.09 |
| Bagel (Deng 等人, 2025b) | 61.89 | 67.73 | 56.86 | 76.59 | 65.85 | 23.85 | 70.64 | 90.08 | 0.00 | 85.42 | 59.91 |
| BLIP3-o (Chen 等人, 2025) | 64.25 | 64.77 | 54.57 | 67.23 | 69.05 | 36.78 | 65.99 | 92.81 | 0.00 | 79.97 | 59.57 |
| Emu3 (Sheynin 等人, 2024) | 40.21 | 50.11 | 36.21 | 43.87 | 50.67 | 19.32 | 48.60 | 87.50 | 1.15 | 76.42 | 45.42 |
| SDXL (Podell 等人, 2023) | 34.44 | 44.66 | 26.68 | 30.70 | 48.48 | 10.34 | 46.37 | 87.45 | 0.00 | 72.28 | 40.22 |
| 基于 RationalRewards 的训练时缩放 | |||||||||||
| FLUX.1-dev | 62.24 | 67.20 | 45.75 | 70.84 | 62.30 | 29.77 | 66.88 | 85.00 | 32.18 | 87.50 | 60.97 |
| +MultiReward | 59.78 | 68.23 | 44.21 | 74.37 | 59.33 | 28.25 | 68.35 | 76.05 | 36.21 | 86.03 | 60.12 |
| +Qwen3-VL-32B | 65.47 | 72.68 | 53.28 | 71.82 | 60.78 | 33.24 | 71.85 | 85.53 | 42.15 | 89.47 | 66.53 |
| +RationalRewards | 67.40 | 76.36 | 57.67 | 72.15 | 60.29 | 40.53 | 74.59 | 87.20 | 52.57 | 90.61 | 70.34 |
| SD-3.5-Medium | 60.41 | 66.99 | 53.35 | 70.31 | 59.89 | 37.73 | 68.78 | 89.80 | 15.23 | 84.34 | 60.71 |
| +RationalRewards | 64.36 | 81.49 | 67.98 | 75.88 | 58.68 | 42.37 | 75.60 | 89.60 | 10.05 | 91.77 | 70.56 |
| +MultiReward | 57.03 | 66.67 | 51.03 | 75.37 | 57.22 | 34.86 | 67.51 | 77.60 | 21.84 | 86.71 | 62.55 |
| +Qwen3-VL-32B | 61.23 | 74.48 | 63.85 | 75.34 | 59.67 | 31.23 | 72.84 | 84.73 | 14.87 | 88.86 | 66.71 |
| Qwen-Image | 82.49 | 87.93 | 72.94 | 86.56 | 60.96 | 51.59 | 80.08 | 94.70 | 72.13 | 94.15 | 78.36 |
| +MultiReward | 79.52 | 86.45 | 70.91 | 88.53 | 58.43 | 48.62 | 80.55 | 83.75 | 67.18 | 92.17 | 75.61 |
| +Qwen3-VL-32B | 81.95 | 87.45 | 76.42 | 87.73 | 62.93 | 51.14 | 81.55 | 95.20 | 75.67 | 95.63 | 80.17 |
| +RationalRewards | 82.11 | 87.82 | 78.82 | 88.07 | 66.21 | 52.88 | 82.21 | 96.60 | 79.76 | 96.57 | 82.60 |
完整图像编辑结果
表 5 提供了在通用图像编辑基准上的完整结果。
| 模型 | ImgEdit-Bench | GEdit-Bench-EN | |||||||||||
| 添加 | 调整 | 提取 | 替换 | 移除 | 背景 | 风格 | 组合 | 动作 | 总体 | G_SC | G_PQ | G_O | |
| AnyEdit (Yu 等人, 2025) | 3.18 | 2.95 | 1.88 | 2.47 | 2.23 | 2.23 | 2.85 | 1.56 | 2.65 | 2.45 | 3.18 | 5.82 | 3.21 |
| UltraEdit (Zhao 等人, 2024) | 3.44 | 2.81 | 2.13 | 2.96 | 1.45 | 2.86 | 3.76 | 1.91 | 2.98 | 2.70 | - | - | - |
| Step1X-Edit (Liu 等人, 2025c) | 3.88 | 3.14 | 1.76 | 3.40 | 2.41 | 3.16 | 4.63 | 2.64 | 2.52 | 3.06 | 7.66 | 7.35 | 6.97 |
| BAGEL (Deng 等人, 2025b) | 3.56 | 3.31 | 1.70 | 3.30 | 2.62 | 3.24 | 4.49 | 2.38 | 4.17 | 3.20 | 7.36 | 6.83 | 6.52 |
| OmniGen2 (Wu 等人, 2025c) | 3.57 | 3.06 | 1.77 | 3.74 | 3.20 | 3.57 | 4.81 | 2.52 | 4.68 | 3.44 | 7.16 | 6.77 | 6.41 |
| Ovis-U1 (Wang 等人, 2025b) | 4.13 | 3.62 | 2.98 | 4.45 | 4.06 | 4.22 | 4.69 | 3.45 | 4.61 | 4.00 | - | - | 6.42 |
| GPT-Image-1 (OpenAI, 2025) | 4.61 | 4.33 | 2.90 | 4.35 | 3.66 | 4.57 | 4.93 | 3.96 | 4.89 | 4.20 | 7.85 | 7.62 | 7.53 |
| 基于 RationalRewards 的训练/测试时缩放 | |||||||||||||
| Flux.1 Kontext [dev] | 3.76 | 3.45 | 2.15 | 3.98 | 2.94 | 3.78 | 4.38 | 2.96 | 4.26 | 3.52 | 7.16 | 7.37 | 6.51 |
| +RL (EditReward) | 3.91 | 3.83 | 2.39 | 4.15 | 2.99 | 3.99 | 4.56 | 2.73 | 4.11 | 3.66 | 7.38 | 7.53 | 6.88 |
| +RL (Qwen3-VL-32B) | 3.95 | 3.90 | 2.41 | 4.12 | 2.95 | 3.96 | 4.45 | 2.82 | 4.30 | 3.67 | 7.42 | 7.48 | 6.82 |
| +RL (RationalRewards) | 4.21 | 4.34 | 2.68 | 4.33 | 2.92 | 4.05 | 4.37 | 3.09 | 4.41 | 3.84 | 7.75 | 8.24 | 7.37 |
| +PT (RationalRewards) | 3.96 | 4.16 | 3.37 | 4.38 | 3.84 | 4.12 | 4.55 | 2.70 | 4.29 | 4.01 | 7.77 | 7.61 | 7.23 |
| Qwen-Image-Edit | 4.38 | 4.16 | 3.43 | 4.66 | 4.14 | 4.38 | 4.81 | 3.18 | 4.69 | 4.27 | 8.00 | 7.86 | 7.56 |
| +RL (EditReward) | 4.34 | 4.22 | 3.87 | 4.67 | 4.18 | 4.20 | 4.83 | 3.36 | 4.54 | 4.25 | 8.36 | 7.91 | 7.77 |
| +RL (Qwen3-VL-32B) | 4.40 | 4.18 | 3.35 | 4.60 | 4.10 | 4.35 | 4.80 | 3.10 | 4.72 | 4.25 | 8.42 | 7.83 | 7.79 |
| +RL (RationalRewards) | 4.41 | 4.32 | 4.09 | 4.63 | 4.26 | 4.25 | 4.91 | 3.44 | 4.52 | 4.38 | 8.74 | 8.43 | 8.29 |
| + PT (RationalRewards) | 4.46 | 4.40 | 4.18 | 4.63 | 4.27 | 4.40 | 4.88 | 3.27 | 4.54 | 4.43 | 8.94 | 8.20 | 8.33 |
完整的 PICA-Bench 结果
表 6 提供了所有物理感知维度的完整 PICA-Bench 结果,是对正文中表 3(左侧面板)所示代表性结果的扩展。
| 模型 | 光传播 | 光源效果 | 反射 | 折射 | 形变 | 因果性 | 全局状态转换 | 局部状态转换 | 总体 |
|---|---|---|---|---|---|---|---|---|---|
| Nano Banana | 53.27 | 54.45 | 55.99 | 56.58 | 47.68 | 58.93 | 58.17 | 52.81 | 55.40 |
| GPT-Image-1 | 59.56 | 61.99 | 52.61 | 61.84 | 44.99 | 53.16 | 70.53 | 51.56 | 57.83 |
| Nano Banana Pro | 59.32 | 64.69 | 61.38 | 60.09 | 53.55 | 64.70 | 72.08 | 63.41 | 63.29 |
| Seedream 4.0 | 58.84 | 66.04 | 58.85 | 62.72 | 50.12 | 67.09 | 77.37 | 63.62 | 64.91 |
| GPT-Image-1.5 | 62.95 | 71.43 | 61.21 | 62.28 | 57.18 | 67.23 | 76.93 | 66.11 | 67.01 |
| Uniworld-V1 | 37.77 | 34.50 | 37.44 | 30.70 | 30.32 | 34.18 | 28.81 | 38.67 | 33.80 |
| Bagel | 54.48 | 63.34 | 55.28 | 55.70 | 42.05 | 52.32 | 68.43 | 54.05 | 56.44 |
| Bagel-Think | 42.86 | 52.29 | 43.17 | 48.25 | 40.10 | 38.40 | 53.86 | 46.99 | 45.91 |
| OmniGen2 | 51.09 | 47.98 | 48.74 | 45.18 | 42.79 | 48.24 | 52.76 | 42.41 | 48.18 |
| Step1X-Edit | 43.10 | 52.29 | 47.05 | 47.37 | 40.34 | 46.69 | 57.95 | 47.19 | 48.83 |
| Flux.1 Kontext [dev] | 48.43 | 53.64 | 43.84 | 43.86 | 33.74 | 34.04 | 41.06 | 37.01 | 41.07 |
| +提示词增强 | 48.91 | 55.53 | 45.87 | 43.86 | 38.14 | 44.30 | 44.15 | 43.87 | 45.28 |
| +PT (RationalRewards) | 53.27 | 56.87 | 51.43 | 40.35 | 41.08 | 43.60 | 55.30 | 43.04 | 48.12 |
| +PICA SFT | 49.64 | 51.21 | 47.22 | 46.49 | 33.99 | 35.44 | 39.29 | 40.75 | 41.93 |
| +RL (RationalRewards) | 50.85 | 51.75 | 54.81 | 41.23 | 39.36 | 36.99 | 43.27 | 35.76 | 44.25 |
| Qwen-Image-Edit | 52.54 | 52.02 | 49.07 | 57.46 | 38.14 | 42.62 | 57.73 | 47.82 | 49.71 |
| +提示词增强 | 54.24 | 58.49 | 50.42 | 49.12 | 42.30 | 43.46 | 57.40 | 50.31 | 50.97 |
| +PT (RationalRewards) | 61.26 | 63.34 | 61.55 | 55.70 | 43.28 | 46.27 | 57.28 | 56.55 | 55.65 |
| +PICA SFT | 52.89 | 60.47 | 55.19 | 56.12 | 40.99 | 46.24 | 55.25 | 51.27 | 52.06 |
| +RL (RationalRewards) | 59.56 | 63.07 | 60.71 | 55.26 | 41.32 | 45.85 | 56.40 | 49.69 | 54.11 |
训练曲线与可视化
本节展示了正文第 3.2 节中引用的训练曲线,证明 RationalRewards 能够提供稳定的奖励梯度,并减少奖励破解现象,如图 9 所示。图 10 则可视化了整个强化学习训练过程中的定性结果。
奖励破解与可视化
图 11 将 RationalRewards 与文生图和图生图生成强化学习中使用的代表性标量奖励模型进行了对比。RationalRewards 展现出奖励曲线和标准差曲线平滑且收敛的良好特性。相比之下,EditReward 始终维持高方差,导致奖励曲线不稳定。MultiReward 则表现出低方差,因为它不足以区分高能力生成器所生成的样本。图 12 展示了奖励破解的清晰视觉证据。
批评可视化
我们提供了 RationalRewards 的额外使用示例,该示例可对问题区域进行可视化,并将其评分依据定位到图像中。具体而言,RationalRewards 经过进一步微调,能够生成描述问题区域的结构化指代表达式。这些表达式被 GroundingDINO 用于定位区域,随后生成的边界框被 SAM 用于生成分割掩码,如图 13 所示。
附录 B ELBO 推导与理论细节
本附录提供了正文(第 2.1 节)公式 1 中证据下界(ELBO)的完整推导,并讨论了逐点投影策略所依据的理论假设。
B.1 完整 ELBO 推导
我们从观测到的偏好相对于输入 的对数边际似然开始,其中 是两张生成的图像, 是条件用户请求。我们引入一个潜在的自然语言理由 来解释该偏好:
| (3) |
由于该边际量难以处理(积分是对所有可能的自然语言理由进行的),我们引入一个变分分布 ——即在给定输入和已知偏好的情况下,理由的后验分布。在积分内部进行乘除运算:
| (4) |
应用 Jensen 不等式(,因为 是凹函数):
| (5) |
现在我们使用链式法则 分解联合分布:
| (6) | ||||
| (7) | ||||
| (8) |
由此得到正文中的公式 1。
边界的紧致性。
ELBO 与真实对数似然之间的差距,恰好由变分后验与真实后验之间的 KL 散度给出:
| (9) |
这直接源于 KL 散度的定义:
| (10) | ||||
| (11) | ||||
| (12) |
由于 且 相对于 是固定的,最大化 ELBO 等价于最小化变分后验 与真实后验 之间的 KL 散度。
将 ELBO 项映射到流水线阶段。
分解中的三个项直接对应于 PARROT 流水线的三个阶段(图 3):
- 1.
阶段 1(理由生成)通过使用偏好锚定提示词提示教师 VLM 来构建变分后验。偏好标签作为提示提供,将生成过程聚焦于与观测到的偏好一致的理由。
- 2.
第二阶段(一致性过滤)通过仅保留那些仅凭自身即可恢复偏好的理由(公式 2),最大化项 1。这限制了 的有效支持范围在高似然区域,从而确保预测充分性。
- 3.
第三阶段(前瞻蒸馏)通过训练学生模型在无法访问 的情况下生成理由,最小化项 2。由于 是固定的,这简化为最大化 ,而这正是对过滤后验样本的标准监督微调(SFT)目标。
分解假设。
该推导假设联合分布可分解为 ,即模型首先根据输入 生成理由 ,然后基于两者预测偏好 。这种自回归分解对语言模型而言是自然的,其中 (理由)在偏好预测 之前逐 token 生成。该分解编码了因果假设:理由中介了偏好判断——模型在做出决策前必须“展示其推理过程”(Wang 等人,2025a;2020)。
B.2 逐点投影的合理性说明
逐点投影策略(正文第 2.1 节)将成对 ELBO 框架扩展至对单张图像的绝对评分。我们讨论该扩展所依据的假设。
共享评估原则。
核心假设是,成对偏好背后的评估标准(例如,“图像 A 的文本忠实度优于图像 B,因为……”)可迁移至绝对评估(例如,“该图像的文本忠实度得分为 3.2,因为……”)。这基于以下观察:相同的评分维度——文本忠实度、图像忠实度、物理质量和文字渲染——在两种场景中均适用,区别仅在于评估是相对还是绝对。
成对理由作为参考提示的作用。
在逐点投影过程中,经过验证的成对推理依据作为参考提示,引导教师模型的注意力聚焦于成对比较中已识别的特定缺陷或质量特征。这种锚定机制通过提供具体证据(例如,“如比较中所指出的,该图像中的文本渲染存在轻微拼写错误”),而非要求教师模型从头识别所有问题,从而降低了逐点评估的方差。因此,逐点推理依据的质量继承了经ELBO过滤后的成对推理依据的质量。
潜在失效模式。
我们承认两种潜在的失效模式:(1)校准漂移,即两幅图像之间的相对排序正确,但绝对分数校准有误(例如,尽管其中一幅图像明显较差,但两幅图像均获得高分);(2)上下文依赖,即教师模型的绝对评估受到成对推理依据中比较对象身份的影响,而非真正的绝对评估。我们通过采用带有详细评分标准锚点(附录D)的浮点值评分来缓解(1),并通过指示教师模型“如同依据自身判断”独立于参考提示进行评估来缓解(2)。
附录C 提示词模板
本附录提供了PARROT流程所有阶段以及生成-批评-优化(GCR)循环中使用的完整提示词模板,正文第2.1节中对此进行了引用。
C.1 阶段1:成对推理依据生成提示词
以下提示词用于查询教师视觉语言模型(Qwen3-VL-32B-Instruct),以进行带有偏好锚定的成对推理依据生成。正文(第2.1节)展示了一个简略版本;以下是完整模板。
文生图变体。
对于文生图任务,提示词修改如下:(1)仅提供两幅图像(生成图像A和生成图像B),无源图像;(2)“图像忠实度”维度替换为“不适用”,因为没有需要保留的源图像;(3)任务描述调整为“根据用户指令比较两幅生成图像”。
C.2 阶段2:一致性检查提示词
以下提示词用于在无偏好标签的情况下重新查询教师视觉语言模型,以验证仅凭生成的推理依据即可恢复偏好(公式 2)。
推理依据完整呈现(包括各维度论证、评分和总结)。教师必须仅凭推理依据预测偏好。若预测偏好与真实标签一致,则该样本通过一致性检查(公式 2 中的条件)。
C.3 逐点评分投影提示词
以下提示词用于从教师视觉语言模型获取逐点(绝对)评估,并以已验证的成对推理依据作为参考提示。
C.4 生成–批判–优化(GCR)循环提示词
测试时的 GCR 循环(第 2.2 节,图 6)分两个阶段使用训练好的 RationalRewards 模型。首先,批判提示词对单张生成图像在四个维度上进行评估,并附带自然语言论证。然后,模型生成优化内容,包括缺陷总结和修改后的用户提示词。
GCR 循环逻辑。
测试时,RationalRewards 在单次前向传播中生成完整的批判和优化输出。若任一维度评分低于 3.0 阈值,则提取优化后的请求并反馈给生成器进行重新生成。若所有评分均达标,则接受原始生成结果。在我们的实验中,我们使用单次迭代循环(即每张图像最多优化一次)。
附录 D 评分细则
本附录提供了逐点评估中使用的四个评估维度的详细评分细则,正文第 2.1 节已提及。评分采用 1–4 整数标度,允许浮点数插值(例如 2.5)以实现细粒度评估。
D.1 文本忠实度
评估生成或编辑后的图像在多大程度上准确遵循了文本指令。
| 评分 | 描述 |
|---|---|
| 4(完全匹配) | 所有关键元素(物体、颜色、动作)均完全按照描述呈现。无模型幻觉或未经请求的更改。 |
| 3(轻微不匹配) | 大部分关键元素存在,但少量细节缺失、错误或略有偏差。 |
| 2(部分不匹配) | 部分关键元素缺失、被更改或解释错误。 |
| 1(重大偏差) | 关键元素完全缺失、被篡改或相互矛盾。指令被忽略。 |
注:浮点数值(例如2.5)在相邻锚点描述之间进行插值,以反映细粒度的质量差异。
D.2 图像忠实度(仅限编辑任务)
评估编辑后的图像在多大程度上保留了源图像中应保持不变的元素。
| 分数 | 描述 |
|---|---|
| 4(充分利用输入) | 输入中的所有相关元素(背景、风格、光照、身份)均按照指令被准确保留或转换。 |
| 3(轻微不匹配) | 大部分相关元素得以保留,但少数方面(例如背景细节、光照一致性)缺失或处理不当。 |
| 2(部分不匹配) | 部分元素得以保留,但原始图像的关键方面丢失或失真。 |
| 1(未能使用输入) | 输入图像的关键元素被忽略、误解或破坏。 |
对于未提供源图像的文生图任务,评分为不适用(N/A)。
D.3 物理与视觉质量
评估生成图像的物理合理性和整体视觉质量。
| 分数 | 描述 |
|---|---|
| 4(无明显缺陷) | 图像在物理上合理(光照、阴影、几何结构、解剖结构正确)。无可见伪影(接缝、模糊、噪点)。 |
| 3(轻微缺陷) | 可察觉但不严重破坏图像的小错误(例如轻微的光照不匹配、细微的纹理问题)。 |
| 2(存在一些缺陷) | 破坏图像的明显物理或视觉错误(例如透视错误、物体“漂浮”、阴影方向错误、明显接缝)。 |
| 1(严重缺陷) | 重大的物理/视觉错误(例如不可能的几何结构、扭曲的解剖结构、混乱的物体、严重伪影)。 |
D.4 文本渲染
评估生成图像中渲染的任何文本的质量和准确性。
| 分数 | 描述 |
|---|---|
| 4(完全匹配) | 文本正确、清晰可读,且与图像融合良好。 |
| 3(大部分匹配) | 轻微的拼写错误或大小写不一致。 |
| 2(部分匹配) | 严重的拼写错误或文本扭曲。 |
| 1(重大偏差) | 文本无法辨认、严重扭曲或缺失。 |
当指令不要求文本渲染时,评分为不适用(N/A)。
附录 E 实现细节
本附录提供了正文第 3 节中引用的训练超参数、硬件配置和强化学习算法细节。
E.1 强化学习微调设置
我们采用 DiffusionNFT(Zheng 等人,2025)进行基于强化学习的参数空间优化。DiffusionNFT 是一个在线强化学习框架,它通过流匹配在前向扩散过程中运行,避免了逆向过程方法(如 FlowGRPO(Xu 等人,2025;Jin 等人,2025;Wu 等人,2025a;Lan 等人,2025;Esser 等人,2024))所需的似然估计、求解器限制或无分类器引导(CFG)。
算法概述。
DiffusionNFT(Zheng 等人,2025)将扩散模型的强化学习构建为一个有监督对比学习问题(Wang 等人,2025e;a)。在每次迭代中,该算法:(1)针对给定提示词,从当前策略中采样图像;(2)用奖励函数评估每张图像;(3)将图像隐式划分为高奖励正子集和低奖励负子集;(4)通过对比流匹配损失更新模型,推动策略向正样本生成方向靠近,远离负样本。其关键理论洞见在于,正负策略之间的速度场差异定义了一个能保证策略改进的强化引导方向。
与 RationalRewards 的集成。
RationalRewards 为每张生成的图像生成各维度的分数(文本忠实度、图像忠实度、物理质量、文本渲染)。我们通过对适用维度(排除不适用维度)进行等权平均,将这些分数聚合为 DiffusionNFT 损失的标量奖励。具体来说,对于给定提示词生成的图像:
| (13) |
其中 是维度 的分数, 是适用维度的集合(例如,对于文生图任务排除图像忠实度,当不需要生成文本时排除文本渲染)。
算法 1 提供了强化学习微调过程的伪代码。
强化学习超参数。
我们采用低秩适配(LoRA)(Hu 等人,2022)进行参数高效微调。实验在包含 16 块 NVIDIA A100-80GB GPU 的分布式系统上进行,其中 8 块 GPU 用于模型训练,8 块 GPU 用于运行奖励模型进行在线评估。表 11 总结了关键超参数。
| 超参数 | 值 |
|---|---|
| 分辨率 | 512 × 512 |
| 引导尺度(Flux.1 Kontext Dev) | 2.5 |
| 采样步数(训练) | 15(DPM 求解器) |
| 采样步数(评估) | 20 |
| 噪声水平 | 0.7 |
| 学习率 | 2e-4 |
| (引导强度) | 0.0001 |
| 批量大小(每块 GPU) | 8 |
| 组大小 | 16(分布在 16 个进程组中) |
| 质量过滤(均值阈值) | 0.9 |
| 质量过滤(标准差阈值) | 0.05 |
| LoRA 秩 | 64 |
| LoRA Alpha | 128 |
| GPU 配置 | 8 块 A100-80GB(训练)+ 8 块 A100-80GB(奖励) |
| 训练挂钟时间 | 每个生成器 16 GPU 小时 |
强化学习训练数据。
我们从 EditReward 数据集和 HPDv3 数据集中选取强化学习训练提示词,选择那些初始生成结果获得低于平均奖励(RationalRewards 的平均得分)的提示词,将训练重点放在生成器改进空间最大的案例上(Wang 等人,2025c;f)。
E.2 GCR 循环配置
在推理阶段,RationalRewards 通过 vLLM 提供服务,并启用了前缀缓存和分页注意力机制,完成完整的批评与优化流程,每张图像的额外开销约为 0.4 秒。优化阈值设置为 3.0:如果任何维度的得分低于此值,则使用优化后的提示词进行重新生成。该阈值被选为 1–4 分制评分区间的中点,对应我们评分细则中“轻微问题”(3 分)与“明显缺陷”(2 分)之间的分界线(附录 D)。
附录 F 数据集与基准测试详情
F.1 训练数据统计
表 12 提供了 PARROT 流程(正文第 3 节)所用训练数据的详细统计信息。
| 源数据集 | 任务 | 原始配对 | 过滤后配对 | 最终逐点样本 | |
|---|---|---|---|---|---|
| EditReward | 图像编辑 | 30K | 21.6K | 43.2K | |
| HPDv3 | 文生图 | 50K | 36K | 55K | |
| RapidData | 文生图 |
我们注意到,我们的总训练规模(80K 原始配对,过滤后 57.6K)远小于可比的基线方法:EditReward 使用了 200K 配对,UnifiedReward 使用了超过 1M 配对。这种数据效率部分源于教师模型的预训练知识,PARROT 通过结构化推理过程而非原始标签来蒸馏这些知识。
F.2 一致性过滤分析
一致性过滤步骤(第 2 节,阶段 2)整体保留了约 72% 的已生成推理过程。我们在被拒绝的推理过程中观察到以下常见失败模式:
- 1.
视觉幻觉:教师模型生成了描述图像中不存在的视觉内容的推理过程(例如,当图像中并无日落可见时,却写道“图像 A 背景中有清晰的日落”),导致在移除标签提示后产生错误的偏好预测。
- 2.
忽略标签的推理过程:尽管有偏好锚点,教师模型偶尔会生成偏向非偏好图像的推理过程,尤其是在图像之间质量差异细微的情况下。
- 3.
模糊、非预测性的推理:理由仅提供泛泛的表扬或批评(例如“两张图片质量都尚可”),缺乏足以区分两个选项的判别性细节。
F.3 评测基准总结
表 13 总结了本工作中使用的所有评测基准。
| 基准 | 任务 | 样本数 | 评测协议 | 指标 | 参考文献 |
|---|---|---|---|---|---|
| MMRB2 (T2I) | 偏好预测 | 1000 | 成对比较 | 准确率 | Hu 等人 (2025) |
| MMRB2 (编辑) | 偏好预测 | 1000 | 成对比较 | 准确率 | Hu 等人 (2025) |
| EditReward Bench | 偏好预测 | 133 | 成对比较 | 准确率 | Wu 等人 (2025e) |
| GenAI-Bench (T2I) | 偏好预测 | 1700 | 成对比较 | 准确率 | Jiang 等人 (2024) |
| GenAI-Bench (编辑) | 偏好预测 | 900 | 成对比较 | 准确率 | Jiang 等人 (2024) |
附录 G 局限性与更广泛影响
G.1 局限性
我们承认本工作存在以下局限性:
- 1.
教师模型依赖性。RationalRewards 的质量受限于用于生成训练理由的教师模型(Qwen3-VL-32B-Instruct)。在教师模型存在系统性盲点的领域——例如细粒度物理模拟、特定文化背景的美学或专业技术内容——学生模型会继承这些局限性。未来工作可以探索集成多个教师模型,或在高风险领域引入人工在环修正。
- 2.
偏差继承。偏好数据集(EditReward、HPDv3、RapidData)编码了其标注者的审美偏好和文化假设。教师 VLM 从其自身的预训练数据中引入了额外偏差。因此,RationalRewards 可能系统性地偏向某些视觉风格、人口统计特征或内容类型。我们尚未进行全面的偏差审计,并鼓励用户在部署前,针对多样化且可能代表性不足的内容评估模型的行为。
- 3.
潜在能力假说。我们发现测试时提示词调优能够匹配或超越基于强化学习的微调(第3.2节),这一结果支持了以下假说:生成器内部潜藏着因次优提示词而未被充分激发的能力。然而,这仍是一个待验证的假说:我们尚未在表征层面(例如通过探测内部激活)对其进行验证,并且无法排除其他解释——比如提示词优化仅仅是提供了任何模型都能受益的额外上下文。
- 4.
阈值敏感性。GCR循环使用固定的3.0阈值来触发优化。虽然这对应于我们评分标准中的一个自然边界(附录D),但我们并未在所有基准测试和生成器上进行全面的敏感性分析。最佳阈值可能因生成器能力和任务难度而异。
- 5.
语言与领域范围。本工作的所有评估均在英语基准测试上进行。RationalRewards的结构化评判结果能否迁移到其他语言,以及非写实领域(例如3D渲染、视频生成、科学可视化),仍有待检验。
G.2 更广泛的影响
RationalRewards和PARROT框架为评估和改进视觉生成的工具生态系统做出了贡献。我们预期其将产生积极和消极两方面的社会影响:
积极影响。
- •
评估民主化:通过提供一个与商业替代方案相竞争的开源、基于推理的奖励模型,我们降低了研究人员和从业者评估视觉生成质量的门槛,使其无需依赖昂贵的专有API。
- •
可解释性:结构化、多维度的评判结果为质量评估提供了透明的解释,使用户和开发者能够理解并解决特定的失败模式,而不是针对不透明的标量分数进行优化。
- •
可及性:GCR循环可以通过自动识别并解决用户指令中的缺陷,帮助提示词工程经验有限的用户获得更高质量的生成结果。
消极影响与缓解措施。
- •
滥用风险:图像生成质量的提升可能被用于制作误导性视觉内容、深度伪造或其他有害媒体。我们指出,RationalRewards 本身并不生成图像,而是对其进行评估和批评;然而,当其被用作强化学习奖励或提示词优化器时,可能会放大生成器的能力。
- •
偏见放大:正如在局限性部分所讨论的,基于有偏好的偏好数据训练的奖励模型可能会系统性地偏好某些内容类型,从而可能放大视觉表征中已有的差异。
- •
我们鼓励负责任地使用,并建议从业者在将 RationalRewards 部署到生产系统之前,特别是在敏感应用中,进行特定领域的评估。