研究揭示 LLM 代码编辑中的删除回避缺陷
删除回避:LLM 代码编辑中的系统性缺陷与缓解之道
TIMELINE
1 条公开报道 · 官方一手 0 条 · 最新在前报道时间线
- 删除回避:LLM 代码编辑中的系统性缺陷与缓解之道
研究发现,领先模型在 SWE-bench Verified 上对开发者补丁的删除召回率最高仅 71.7%,29.0% 的通过补丁采用 Guard-and-Go 模式保留目标代码。新基准 CanItDelete 含 200 个纯删除任务,最佳模型仍失败 19.5%。在 7B 模型后训练中加入 12.8k 删除示例(占 0.7% token)可将删除回避降低 13.9 个百分点。