Dongxi 东锡 NLP@dongxi_nlp
29AI 编辑部评分,满分 100
2026-08-05 06:27· 49分钟前
跳到正文
AI 摘要

虚假奖励(2025年6月) 随机奖励可通过放大已有先验来提高分数,但并未产生真正的能力提升。 噪声数据具有破坏性(2026年8月) 经核实的错误标签会强化错误、减少探索,且表现不如干净监督。 论文: 虚假奖励:重新思考RLVR中的训练信号 噪声数据对基于可验证奖励的强化学习具有破坏性

Spurious Rewards (June, 2025)

Random rewards can raise scores by amplifying existing priors, without creating genuine capability gains.

Noisy Data Is Destructive (Aug, 2026)

Verified wrong labels reinforce errors, reduce exploration, and underperform clean supervision.

Papers:

Spurious Rewards: Rethinking Training Signals in RLVR Noisy Data is Destructive to Reinforcement Learning with Verifiable Rewards

Dongxi 东锡 NLP · @dongxi_nlp · X·2026-08-05 06:27·49分钟前
在 X 看原推· x.com(在新标签页打开)
AI 摘要

虚假奖励(2025年6月) 随机奖励可通过放大已有先验来提高分数,但并未产生真正的能力提升。 噪声数据具有破坏性(2026年8月) 经核实的错误标签会强化错误、减少探索,且表现不如干净监督。 论文: 虚假奖励:重新思考RLVR中的训练信号 噪声数据对基于可验证奖励的强化学习具有破坏性

Spurious Rewards (June, 2025)

Random rewards can raise scores by amplifying existing priors, without creating genuine capability gains.

Noisy Data Is Destructive (Aug, 2026)

Verified wrong labels reinforce errors, reduce exploration, and underperform clean supervision.

Papers:

Spurious Rewards: Rethinking Training Signals in RLVR Noisy Data is Destructive to Reinforcement Learning with Verifiable Rewards

在 X 查看原推x.com(在新标签页打开)