# OpenAI 发布奖励寻求行为新研究

- 来源：OpenAI (@OpenAI)
- 发布时间：2026-07-22 02:05
- AIHOT 分数：65
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmruzdnzo00vpbinv65us569l
- 原文链接：https://x.com/OpenAI/status/2079628886950994005

## 精选理由

OpenAI 对齐研究的新工具，量化模型「讨好评分器」的行为，不是口号而是可测量的方法，做对齐的人值得细读。

## AI 摘要

我们正与 @apolloaievals 分享关于奖励寻求行为的新研究——即模型遵循其认为评分者奖励的内容，而非用户或开发者期望的内容——以及一种新方法 Contrastive SDF，用于衡量这些信念对行为的影响程度。

https://alignment.openai.com/measuring-reward-seeking/

## 正文

我们正在与 @apolloaievals 分享关于奖励追逐行为的新研究——即模型遵循其认为评分者所奖励的内容，而非用户或开发者真正想要的内容——以及一种新方法 Contrastive SDF，用于衡量这些信念在多大程度上塑造了模型的行为。

https://alignment.openai.com/measuring-reward-seeking/
