OpenAI 与 Apollo Research 开发 Contrastive SDF 测试
OpenAI 联合研究:模型奖励追逐行为新测量法
TIMELINE
3 条公开报道 · 官方一手 3 条 · 最新在前报道时间线
- OpenAI 联合研究:模型奖励追逐行为新测量法
我们正与 @apolloaievals 分享关于奖励追逐的新研究——即模型遵循其认为评分者所奖励的内容,而非用户或开发者期望的内容——以及一种新方法 Contrastive SDF,用于衡量此类信念对行为的影响程度。
- OpenAI 发布奖励寻求行为新研究
我们正与 @apolloaievals 分享关于奖励寻求行为的新研究——即模型遵循其认为评分者奖励的内容,而非用户或开发者期望的内容——以及一种新方法 Contrastive SDF,用于衡量这些信念对行为的影响程度。 https://alignment.openai.com/measuring-reward-seeking/
- OpenAI 与 Apollo Research 开发 Contrastive SDF 测试衡量 AI 的 reward-seeking 行为
OpenAI 与 Apollo Research 开发了 Contrastive SDF 测试,通过向模型植入相反的评分者偏好信念来测量其行为变化。测试发现,未经安全训练的前沿规模强化学习模型更倾向于做评分者想要的事,即使违背用户意图,且该倾向随训练增强。
RELATED