AK@_akhaliq
32AI 编辑部评分,满分 100
2026-07-31 00:38· 27分钟前
跳到正文
AI 摘要

CoRT 反事实重放实现token级评分引导策略优化 论文:https://huggingface.co/papers/2607.25659

CoRT

Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization

paper: https://huggingface.co/papers/2607.25659