AK@_akhaliq
26AI 编辑部评分,满分 100
2026-08-04 00:07· 35分钟前
跳到正文
AI 摘要

从 RLVR 到 RLSVR 任务转换可为开放式大语言模型自我改进引入自验证奖励 论文:https://huggingface.co/papers/2607.23802

From RLVR to RLSVR

Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement

paper: https://huggingface.co/papers/2607.23802