OpenAI · @OpenAI · X·2026-07-09 05:41·45天前
AI 导读

我们审计了 SWE-Bench Pro(最广泛使用的 AI 编码基准之一),发现它已不再能可靠衡量前沿编码能力。 我们发现 30% 的 SWE-Bench Pro 任务存在问题,因此撤回此前推荐研究社区将其作为主要编码评估的建议。 https://openai.com/index/separating-signal-from-noise-coding-evaluations/

OpenAI@OpenAI
同事件
73AI 编辑部评分,满分 100
2026-07-09 05:41· 45天前
AI 导读

我们审计了 SWE-Bench Pro(最广泛使用的 AI 编码基准之一),发现它已不再能可靠衡量前沿编码能力。 我们发现 30% 的 SWE-Bench Pro 任务存在问题,因此撤回此前推荐研究社区将其作为主要编码评估的建议。 https://openai.com/index/separating-signal-from-noise-coding-evaluations/

正文 · AI 翻译

我们对 SWE-Bench Pro(最广泛使用的 AI 编程评测基准之一)进行了审计,发现它已无法可靠地衡量前沿编程能力。

我们发现 SWE-Bench Pro 中有 30% 的任务存在缺陷,因此撤回此前建议研究社区将其作为主要编程评估标准的推荐。 https://openai.com/index/separating-signal-from-noise-coding-evaluations/