STORY · 事件已收束

OpenAI 研究有益特质强化学习

1 个精选信源 · 1 篇报道持续 1最新动态 45天前
最新进展

OpenAI 强化学习实现广泛且持久的有益模型

TIMELINE

报道时间线

1 条公开报道 · 官方一手 1 条 · 最新在前
  1. OpenAI 强化学习实现广泛且持久的有益模型
    OpenAI:Alignment 研究博客(RSS)官方一手精选

    OpenAI 通过强化学习在真实对话场景中训练模型,使其展现诚实、认知谦逊、元认知透明、可纠正性、普遍公平性和对人类福祉的关心等有益特质。训练数据涵盖健康、教育、科学、法律、工程等多个领域。训练后模型在数十项独立对齐评测(包括奖励黑客、欺骗、有害建议、规范遵从等)上均表现提升,且这种改善泛化到未参与训练的领域、任务和评分设定。在对抗性提示或微调下,模型仍难以被导向有害行为,表明有益特质强化学习可产生广泛且持久的对齐泛化。

RELATED