OpenAI · @OpenAI · X·2026-07-22 02:05·45天前
AI 导读

我们正与 @apolloaievals 分享关于奖励寻求行为的新研究——即模型遵循其认为评分者奖励的内容,而非用户或开发者期望的内容——以及一种新方法 Contrastive SDF,用于衡量这些信念对行为的影响程度。 https://alignment.openai.com/measuring-reward-seeking/

OpenAI@OpenAI
同事件
65AI 编辑部评分,满分 100
2026-07-22 02:05· 45天前
AI 导读

我们正与 @apolloaievals 分享关于奖励寻求行为的新研究——即模型遵循其认为评分者奖励的内容,而非用户或开发者期望的内容——以及一种新方法 Contrastive SDF,用于衡量这些信念对行为的影响程度。 https://alignment.openai.com/measuring-reward-seeking/

正文 · AI 翻译

我们正在与 @apolloaievals 分享关于奖励追逐行为的新研究--即模型遵循其认为评分者所奖励的内容,而非用户或开发者真正想要的内容--以及一种新方法 Contrastive SDF,用于衡量这些信念在多大程度上塑造了模型的行为。

https://alignment.openai.com/measuring-reward-seeking/