当前无评论家强化学习方法通过算术平均聚合多目标奖励,这使得它们容易受到约束忽视问题的影响:某一目标的高幅度成功在数值上可能抵消其他目标(例如安全性或格式要求)中的关键失败,从而掩盖了对可靠多目标对齐至关重要的低性能“瓶颈”奖励。我们提出了奖励方差策略优化(RVPO),这是一种风险敏感框架,在优势聚合过程中对奖励间方差施加惩罚,将优化目标从“最大化总和”转变为“最大化一致性”。我们通过泰勒展开证明,LogSumExp(SoftMin)算子实际上起到了平滑方差惩罚的作用。我们在基于评分标准的医学和科学推理任务上(使用多达17个由大语言模型评判的并发奖励信号,Qwen2.5-3B/7B/14B),以及在基于规则约束的工具调用任务上(Qwen2.5-1.5B/3B),对RVPO进行了评估。通过防止模型为了利用更简单的目标而忽视困难约束,RVPO在HealthBench上提升了整体得分(14B模型上0.261对比GDPO的0.215,p < 0.001),并在GPQA-Diamond上保持了具有竞争力的准确率,且没有出现其他多奖励方法中观察到的后期性能退化,这表明方差正则化能够在不同模型规模下缓解约束忽视问题,同时不牺牲通用能力。
图1:多目标强化学习中的约束忽视。(左)均值聚合(GRPO/GDPO)将存在关键约束失败的输出(生成结果A)在数学上视为与均衡输出(生成结果B)相同,从而使优化器对关键失败视而不见。(右)RVPO应用软最小值算子对奖励间方差进行惩罚,大幅降低生成结果A的权重,以强制执行瓶颈约束。
相关阅读与最新动态。
关于直接偏好优化所引发的隐式奖励模型的有限泛化能力
基于人类反馈的强化学习(RLHF)是一种将语言模型与人类偏好对齐的有效方法。RLHF 的核心在于学习一个用于对人类偏好进行评分的奖励函数。学习奖励模型主要有两种方法:1)像 RLHF 中那样训练一个显式的奖励模型,以及 2)通过直接偏好优化(DPO)等方法,从偏好数据中学习一个隐式奖励。先前的研究表明……
仅为不确定性付费:方差自适应汤普森采样
大多数赌博机算法假设奖励方差或其上界是已知的,并且所有臂的方差相同。这自然会导致由于方差高估而带来的次优性能和更高的遗憾值。另一方面,低估奖励方差可能因过早选择次优臂而导致线性遗憾值。这促使了先前关于方差自适应频率派算法的工作,这些算法具有强大的……