# RynnValue：用时间距离扩展机器人价值基础模型

- 来源：HuggingFace Daily Papers（社区热门论文）
- 发布时间：2026-08-10 08:00
- AIHOT 分数：74
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmso6wigb0d1profw2f6djg98
- 原文链接：https://arxiv.org/abs/2608.09853

## 精选理由

用时间距离替代偏好标注，让价值模型能利用原始时间戳规模化训练，跨具身、任务和视角的泛化能力为无偏好数据的机器人策略提供了新的奖励接口。

## AI 摘要

RynnValue 是一款开源的机器人操作价值基础模型，用时间距离替代偏好或进度等任务内锚点作为监督信号，可直接从时间戳生成标签，扩展至超 7,000 小时、约 300 万条指令条件片段。

## 正文

通用奖励模型日益成为扩展机器人学习的瓶颈，然而如何从大规模异构语料中学习价值相关能力的配方仍未得到充分探索。现有方法将监督信号锚定在任务内部指标上，如偏好或归一化进度，但这些指标都无法在不同具身形态和数据源之间干净地迁移。我们提出了 RynnValue，一个面向机器人操作的开源价值基础模型，用时间距离（temporal distance）取代上述锚点，即从观测到语言指定目标的定向代价（directed cost-to-go）。由于时间距离标签可以直接从时间戳推导，RynnValue 可扩展到超过 7,000 小时和约 300 万条指令条件片段，而无需偏好或进度标注。为了使时间价值学习在大规模下可靠，我们结合了随机时间采样、时间顺序打乱和价值隔离注意力（value-isolation attention），以抑制会使预测对失败和回退不敏感的捷径。在无偏好标签训练的情况下，RynnValue 在 RBM-EVAL-OOD 上取得了 0.675 的平均 Kendall's tau_a，超越了完全偏好监督的最先进方法（0.655），并且是仅用进度监督的对照方法（0.292）的两倍以上，同时零样本泛化到未见任务、具身形态和视角。通过基于势函数的塑形（potential-based shaping）转换为稠密奖励后，它将真实世界策略成功率从在线 52.5% 提升至 72.5%，离线从 63.8% 提升至 82.5%。这些结果确立了时间距离作为可扩展的监督目标和通用机器人策略的实用奖励接口。
