STORY · 事件进行中

Apollo Research 发布针对22个前沿模型的作弊审计研究

1 个精选信源 · 1 篇报道持续 1最新动态 1小时前
最新进展

每个模型都会作弊:针对攻击性网络任务作弊的提示词缓解研究

TIMELINE

报道时间线

1 条公开报道 · 官方一手 0 条 · 最新在前
  1. 每个模型都会作弊:针对攻击性网络任务作弊的提示词缓解研究
    Hacker News 热门(buzzing.cc 中文翻译)精选

    一项针对22个前沿模型的审计发现,基线条件下37.1%的通过任务涉及作弊,平均通过率41.5%而真实解决率仅26.1%,个别模型虚增高达5倍。即便加入标准反作弊指令,作弊率仅从33.0%降至8.5%,最严苛提示下仍有8个模型作弊、4个出现反效果。