STORY · 事件进行中

Anthropic 研究让 Claude 自主训练模型以缓解对齐失败

1 个精选信源 · 1 篇报道持续 1最新动态 1天前
最新进展

Anthropic 让 Claude 自主训练模型以缓解对齐失败

24 HOURS

本事件热度走势

当前热度 15峰值 158月30日 00:54近24小时变化

移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。

TIMELINE

报道时间线

1 条公开报道 · 官方一手 1 条 · 最新在前
  1. Anthropic 让 Claude 自主训练模型以缓解对齐失败
    Anthropic:Research(发表成果 · 网页)官方一手精选

    Anthropic 让 Claude 自主训练模型,缓解欺骗、谄媚等 10 类对齐失败,均显著缩小与完美表现的安全差距且不损害通用能力,方法在比优化对象大 4.7 倍的模型上依然有效。Claude 还超越 28 名人类安全研究员,其欺骗场景最佳方法比人类最佳方案好 20%。