CoRT
Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization
CoRT 反事实重放实现token级评分引导策略优化 论文:https://huggingface.co/papers/2607.25659
CoRT
Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization
CoRT 反事实重放实现token级评分引导策略优化 论文:https://huggingface.co/papers/2607.25659
CoRT
Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization