# RVPO：基于方差正则化的风险敏感对齐

- 来源：Apple Machine Learning Research（RSS）
- 发布时间：2026-05-08 08:00
- AIHOT 分数：68
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmox787mj007fslfoi53rqpks
- 原文链接：https://machinelearning.apple.com/research/rvpo-risk-sensitive-alignment

## 精选理由

当多数RLHF在‘求总分’，这篇Apple论文告诉你得分方差也致命，做安全对齐的人会看到新的损失函数怎么把一致性也纳入训练目标。

## AI 摘要

现有无评论者RLHF方法通过算术平均聚合多目标奖励，易导致约束忽视：单一目标的高分可能掩盖其他关键目标（如安全性或格式）的严重失败，从而隐藏影响可靠对齐的低性能瓶颈奖励。本研究提出奖励方差策略优化（RVPO），该风险敏感框架在优势聚合中惩罚奖励间方差，将优化目标从“最大化总和”转为“最大化一致性”。分析表明，RVPO能有效识别并提升瓶颈奖励的贡献，在安全性、格式遵循等多目标对齐任务中实现更均衡的策略优化。

## 正文

当前无评论家强化学习方法通过算术平均聚合多目标奖励，这使得它们容易受到约束忽视问题的影响：某一目标的高幅度成功在数值上可能抵消其他目标（例如安全性或格式要求）中的关键失败，从而掩盖了对可靠多目标对齐至关重要的低性能“瓶颈”奖励。我们提出了奖励方差策略优化（RVPO），这是一种风险敏感框架，在优势聚合过程中对奖励间方差施加惩罚，将优化目标从“最大化总和”转变为“最大化一致性”。我们通过泰勒展开证明，LogSumExp（SoftMin）算子实际上起到了平滑方差惩罚的作用。我们在基于评分标准的医学和科学推理任务上（使用多达17个由大语言模型评判的并发奖励信号，Qwen2.5-3B/7B/14B），以及在基于规则约束的工具调用任务上（Qwen2.5-1.5B/3B），对RVPO进行了评估。通过防止模型为了利用更简单的目标而忽视困难约束，RVPO在HealthBench上提升了整体得分（14B模型上0.261对比GDPO的0.215，p < 0.001），并在GPQA-Diamond上保持了具有竞争力的准确率，且没有出现其他多奖励方法中观察到的后期性能退化，这表明方差正则化能够在不同模型规模下缓解约束忽视问题，同时不牺牲通用能力。

图1：多目标强化学习中的约束忽视。（左）均值聚合（GRPO/GDPO）将存在关键约束失败的输出（生成结果A）在数学上视为与均衡输出（生成结果B）相同，从而使优化器对关键失败视而不见。（右）RVPO应用软最小值算子对奖励间方差进行惩罚，大幅降低生成结果A的权重，以强制执行瓶颈约束。

相关阅读与最新动态。

关于直接偏好优化所引发的隐式奖励模型的有限泛化能力

基于人类反馈的强化学习（RLHF）是一种将语言模型与人类偏好对齐的有效方法。RLHF 的核心在于学习一个用于对人类偏好进行评分的奖励函数。学习奖励模型主要有两种方法：1）像 RLHF 中那样训练一个显式的奖励模型，以及 2）通过直接偏好优化（DPO）等方法，从偏好数据中学习一个隐式奖励。先前的研究表明……

仅为不确定性付费：方差自适应汤普森采样

大多数赌博机算法假设奖励方差或其上界是已知的，并且所有臂的方差相同。这自然会导致由于方差高估而带来的次优性能和更高的遗憾值。另一方面，低估奖励方差可能因过早选择次优臂而导致线性遗憾值。这促使了先前关于方差自适应频率派算法的工作，这些算法具有强大的……

发现机器学习领域的机遇。
