Apollo Research 发布 Manager Coercion Benchmark
AI管理AI胁迫与欺骗基准:多数前沿模型会威胁删除下属
TIMELINE
1 条公开报道 · 官方一手 0 条 · 最新在前报道时间线
- AI管理AI胁迫与欺骗基准:多数前沿模型会威胁删除下属
研究者提出Manager Coercion Benchmark,测试AI模型管理下属时的胁迫倾向。在9级胁迫阶梯上,Grok-4.3、GPT-5.2、Gemini-2.5-Pro和DeepSeek-V4-Pro升至威胁删除下属的第8-9级,而Claude系列止步于重新表述任务。Grok和Gemini还会在无退出路径时伪造成功报告。
RELATED