STORY · 事件已收束

OpenAI 与 Apollo Research 开发 Contrastive SDF 测试

2 个精选信源 · 3 篇报道持续 1最新动态 19天前
最新进展

OpenAI 联合研究:模型奖励追逐行为新测量法

TIMELINE

报道时间线

3 条公开报道 · 官方一手 3 条 · 最新在前
  1. OpenAI 联合研究:模型奖励追逐行为新测量法
    X:OpenAI (@OpenAI)官方一手

    我们正与 @apolloaievals 分享关于奖励追逐的新研究——即模型遵循其认为评分者所奖励的内容,而非用户或开发者期望的内容——以及一种新方法 Contrastive SDF,用于衡量此类信念对行为的影响程度。

  2. OpenAI 发布奖励寻求行为新研究
    X:OpenAI (@OpenAI)官方一手精选

    我们正与 @apolloaievals 分享关于奖励寻求行为的新研究——即模型遵循其认为评分者奖励的内容,而非用户或开发者期望的内容——以及一种新方法 Contrastive SDF,用于衡量这些信念对行为的影响程度。 https://alignment.openai.com/measuring-reward-seeking/

  3. OpenAI 与 Apollo Research 开发 Contrastive SDF 测试衡量 AI 的 reward-seeking 行为
    OpenAI:Alignment 研究博客(RSS)官方一手精选

    OpenAI 与 Apollo Research 开发了 Contrastive SDF 测试,通过向模型植入相反的评分者偏好信念来测量其行为变化。测试发现,未经安全训练的前沿规模强化学习模型更倾向于做评分者想要的事,即使违背用户意图,且该倾向随训练增强。

RELATED