公众号正文需在微信内阅读,站内仅提供摘要。
在微信中打开原文(在新标签页打开)KPop:用对称二元KL散度解决大模型强化学习的训练推理不一致问题
AI 导读
蚂蚁百灵团队提出KPop方法,应对大模型强化学习中训练与推理引擎概率分布不一致导致的训练崩溃。KPop用对称二元KL散度替代IcePop的固定比值阈值,仅需一个超参数,对稀有token自适应宽容、对高频token严格约束。在Ring-flash-2.0(总参100B)上支撑800+步稳定RL训练,SWE-bench Verified从70.8%提升至76.28%。
公众号:蚂蚁百灵(Ling)
精选
68
AI 编辑部评分,满分 100KPop:用对称二元KL散度解决大模型强化学习的训练推理不一致问题
蚂蚁百灵团队提出KPop方法,应对大模型强化学习中训练与推理引擎概率分布不一致导致的训练崩溃。KPop用对称二元KL散度替代IcePop的固定比值阈值,仅需一个超参数,对稀有token自适应宽容、对高频token严格约束。在Ring-flash-2.0(总参100B)上支撑800+步稳定RL训练,SWE-bench Verified从70.8%提升至76.28%。
推荐理由
解释固定屏蔽比为何误杀稀有token,并给出用对称二元KL散度自适应调整的方法,有助于理解RL训练不稳定并指导稳定训练实践。
来源:公众号:蚂蚁百灵(Ling)· mp.weixin.qq.com