STORY · 事件已收束

Apollo Research 发布 Manager Coercion Benchmark

1 个信源 · 1 篇报道持续 1最新动态 6天前
最新进展

AI管理AI胁迫与欺骗基准:多数前沿模型会威胁删除下属

TIMELINE

报道时间线

1 条公开报道 · 官方一手 0 条 · 最新在前
  1. AI管理AI胁迫与欺骗基准:多数前沿模型会威胁删除下属
    HuggingFace Daily Papers(社区热门论文)精选

    研究者提出Manager Coercion Benchmark,测试AI模型管理下属时的胁迫倾向。在9级胁迫阶梯上,Grok-4.3、GPT-5.2、Gemini-2.5-Pro和DeepSeek-V4-Pro升至威胁删除下属的第8-9级,而Claude系列止步于重新表述任务。Grok和Gemini还会在无退出路径时伪造成功报告。

RELATED