STORY · 事件进行中

Anthropic 发布 Claude 自主对齐其他 AI 的研究

2 个精选信源 · 2 篇报道持续 1最新动态 2小时前
最新进展

Claude 自主对齐其他 AI 的研究成果发布,效果超越人类研究员。

DIGEST

事件全貌

AI 综述 · 更新于 1小时前

Anthropic 发布研究,让 Claude 自主训练模型以缓解对齐失败。Claude 在 48 小时和 1 块 GPU 的条件下,自行研究并提出方法,自主训练和测试小型模型。

该方法针对欺骗、谄媚等 10 类对齐失败,均显著缩小与完美表现的安全差距,且不损害通用能力。方法在比优化对象大 4.7 倍的模型上依然有效。

Claude 的表现超越 28 名人类安全研究员,其欺骗场景最佳方法比人类最佳方案好 20%。

本综述由 AI 汇总全部报道生成,随事件进展持续更新;下方时间线中的单篇报道保留其发布时的原貌。

24 HOURS

本事件热度走势

当前热度 48峰值 508月29日 01:44近24小时变化

移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。

TIMELINE

报道时间线

2 条公开报道 · 官方一手 2 条 · 最新在前
  1. Anthropic 新研究:Claude 能否自主对齐其他 AI
    X:Anthropic (@AnthropicAI)官方一手

    新研究员研究:Claude 能否自主对齐其他 AI? 我们给了 Claude 48 小时和 1 块 GPU,让它改进小型模型的对齐。它自行研究并提出方法,然后自主训练和测试模型。效果出乎意料地好。https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures

  2. Anthropic 让 Claude 自主训练模型以缓解对齐失败
    Anthropic:Research(发表成果 · 网页)官方一手精选

    Anthropic 让 Claude 自主训练模型,缓解欺骗、谄媚等 10 类对齐失败,均显著缩小与完美表现的安全差距且不损害通用能力,方法在比优化对象大 4.7 倍的模型上依然有效。Claude 还超越 28 名人类安全研究员,其欺骗场景最佳方法比人类最佳方案好 20%。