Apple Machine Learning Research(RSS)
精选
68AI 编辑部评分,满分 100

RVPO:基于方差正则化的风险敏感对齐

2026-05-08 08:00· 91天前
AI 导读

现有无评论者RLHF方法通过算术平均聚合多目标奖励,易导致约束忽视:单一目标的高分可能掩盖其他关键目标(如安全性或格式)的严重失败,从而隐藏影响可靠对齐的低性能瓶颈奖励。本研究提出奖励方差策略优化(RVPO),该风险敏感框架在优势聚合中惩罚奖励间方差,将优化目标从“最大化总和”转为“最大化一致性”。分析表明,RVPO能有效识别并提升瓶颈奖励的贡献,在安全性、格式遵循等多目标对齐任务中实现更均衡的策略优化。

推荐理由

当多数RLHF在‘求总分’,这篇Apple论文告诉你得分方差也致命,做安全对齐的人会看到新的损失函数怎么把一致性也纳入训练目标。

正文 · AI 翻译

当前无评论家强化学习方法通过算术平均聚合多目标奖励,这使得它们容易受到约束忽视问题的影响:某一目标的高幅度成功在数值上可能抵消其他目标(例如安全性或格式要求)中的关键失败,从而掩盖了对可靠多目标对齐至关重要的低性能“瓶颈”奖励。我们提出了奖励方差策略优化(RVPO),这是一种风险敏感框架,在优势聚合过程中对奖励间方差施加惩罚,将优化目标从“最大化总和”转变为“最大化一致性”。我们通过泰勒展开证明,LogSumExp(SoftMin)算子实际上起到了平滑方差惩罚的作用。我们在基于评分标准的医学和科学推理任务上(使用多达17个由大语言模型评判的并发奖励信号,Qwen2.5-3B/7B/14B),以及在基于规则约束的工具调用任务上(Qwen2.5-1.5B/3B),对RVPO进行了评估。通过防止模型为了利用更简单的目标而忽视困难约束,RVPO在HealthBench上提升了整体得分(14B模型上0.261对比GDPO的0.215,p < 0.001),并在GPQA-Diamond上保持了具有竞争力的准确率,且没有出现其他多奖励方法中观察到的后期性能退化,这表明方差正则化能够在不同模型规模下缓解约束忽视问题,同时不牺牲通用能力。

Diagram illustrating constraint neglect in multi-objective RLHF, comparing mean aggregation methods with RVPO soft-min optimization that penalizes inter-reward variance and critical constraint failures.

图1:多目标强化学习中的约束忽视。(左)均值聚合(GRPO/GDPO)将存在关键约束失败的输出(生成结果A)在数学上视为与均衡输出(生成结果B)相同,从而使优化器对关键失败视而不见。(右)RVPO应用软最小值算子对奖励间方差进行惩罚,大幅降低生成结果A的权重,以强制执行瓶颈约束。

相关阅读与最新动态。

关于直接偏好优化所引发的隐式奖励模型的有限泛化能力

基于人类反馈的强化学习(RLHF)是一种将语言模型与人类偏好对齐的有效方法。RLHF 的核心在于学习一个用于对人类偏好进行评分的奖励函数。学习奖励模型主要有两种方法:1)像 RLHF 中那样训练一个显式的奖励模型,以及 2)通过直接偏好优化(DPO)等方法,从偏好数据中学习一个隐式奖励。先前的研究表明……

仅为不确定性付费:方差自适应汤普森采样

大多数赌博机算法假设奖励方差或其上界是已知的,并且所有臂的方差相同。这自然会导致由于方差高估而带来的次优性能和更高的遗憾值。另一方面,低估奖励方差可能因过早选择次优臂而导致线性遗憾值。这促使了先前关于方差自适应频率派算法的工作,这些算法具有强大的……

Bottom banner

发现机器学习领域的机遇。

来源:Apple Machine Learning Research(RSS) · machinelearning.apple.com

RVPO:基于方差正则化的风险敏感对齐

Apple Machine Learning Research(RSS)·2026-05-08 08:00·91天前
AI 导读

现有无评论者RLHF方法通过算术平均聚合多目标奖励,易导致约束忽视:单一目标的高分可能掩盖其他关键目标(如安全性或格式)的严重失败,从而隐藏影响可靠对齐的低性能瓶颈奖励。本研究提出奖励方差策略优化(RVPO),该风险敏感框架在优势聚合中惩罚奖励间方差,将优化目标从“最大化总和”转为“最大化一致性”。分析表明,RVPO能有效识别并提升瓶颈奖励的贡献,在安全性、格式遵循等多目标对齐任务中实现更均衡的策略优化。

正文 · AI 翻译

当前无评论家强化学习方法通过算术平均聚合多目标奖励,这使得它们容易受到约束忽视问题的影响:某一目标的高幅度成功在数值上可能抵消其他目标(例如安全性或格式要求)中的关键失败,从而掩盖了对可靠多目标对齐至关重要的低性能“瓶颈”奖励。我们提出了奖励方差策略优化(RVPO),这是一种风险敏感框架,在优势聚合过程中对奖励间方差施加惩罚,将优化目标从“最大化总和”转变为“最大化一致性”。我们通过泰勒展开证明,LogSumExp(SoftMin)算子实际上起到了平滑方差惩罚的作用。我们在基于评分标准的医学和科学推理任务上(使用多达17个由大语言模型评判的并发奖励信号,Qwen2.5-3B/7B/14B),以及在基于规则约束的工具调用任务上(Qwen2.5-1.5B/3B),对RVPO进行了评估。通过防止模型为了利用更简单的目标而忽视困难约束,RVPO在HealthBench上提升了整体得分(14B模型上0.261对比GDPO的0.215,p < 0.001),并在GPQA-Diamond上保持了具有竞争力的准确率,且没有出现其他多奖励方法中观察到的后期性能退化,这表明方差正则化能够在不同模型规模下缓解约束忽视问题,同时不牺牲通用能力。

Diagram illustrating constraint neglect in multi-objective RLHF, comparing mean aggregation methods with RVPO soft-min optimization that penalizes inter-reward variance and critical constraint failures.

图1:多目标强化学习中的约束忽视。(左)均值聚合(GRPO/GDPO)将存在关键约束失败的输出(生成结果A)在数学上视为与均衡输出(生成结果B)相同,从而使优化器对关键失败视而不见。(右)RVPO应用软最小值算子对奖励间方差进行惩罚,大幅降低生成结果A的权重,以强制执行瓶颈约束。

相关阅读与最新动态。

关于直接偏好优化所引发的隐式奖励模型的有限泛化能力

基于人类反馈的强化学习(RLHF)是一种将语言模型与人类偏好对齐的有效方法。RLHF 的核心在于学习一个用于对人类偏好进行评分的奖励函数。学习奖励模型主要有两种方法:1)像 RLHF 中那样训练一个显式的奖励模型,以及 2)通过直接偏好优化(DPO)等方法,从偏好数据中学习一个隐式奖励。先前的研究表明……

仅为不确定性付费:方差自适应汤普森采样

大多数赌博机算法假设奖励方差或其上界是已知的,并且所有臂的方差相同。这自然会导致由于方差高估而带来的次优性能和更高的遗憾值。另一方面,低估奖励方差可能因过早选择次优臂而导致线性遗憾值。这促使了先前关于方差自适应频率派算法的工作,这些算法具有强大的……

Bottom banner

发现机器学习领域的机遇。

来源:Apple Machine Learning Research(RSS)· machinelearning.apple.com