STORY · 事件进行中

Anthropic 扩大思维链监控范围

1 个精选信源 · 1 篇报道持续 1最新动态 1小时前
最新进展

Anthropic 在网络关键能力时代放缓模型开发:暂停 RL 训练并强化安全防护

TIMELINE

报道时间线

1 条公开报道 · 官方一手 0 条 · 最新在前
  1. Anthropic 在网络关键能力时代放缓模型开发:暂停 RL 训练并强化安全防护
    Hacker News 热门(buzzing.cc 中文翻译)精选

    Anthropic 因 OpenAI-Hugging Face 事件及即将推出的 Astra 模型可能达到“关键网络安全能力阈值”,暂时放缓模型扩展速度,包括暂停最新模型两周的强化学习(RL)训练。公司已加强研究环境安全要求,包括工作负载隔离、网络隔离和持续安全测试,并扩大思维链监控范围。涉及 Astra 或网络模型的工作负载需满足最严格安全标准,部分训练和评估工作仍处于暂停状态。