OpenAI 只打开两个 API 设置
GPT-5.6 Sol 在 ARC-AGI-3 的分数从 13.3% 涨到 38.3%
- OpenAl复盘了一次自家模型「考砸」的经历:同一个 GPT-5.6 Sol、同一套评测题,只把两个 API设置打开,ARC-AGI-3公开题库的分数从13.3% 涨到 38.3%。
- 问题出在跑模型那套程序(业内叫 harness)上:每走完一步,模型写给自己看的私有思考被整段丢掉,下一步只能从零重新理解这个游戏。
- 第二个问题是上下文塞满就删掉最早的消息,连过去按了哪些键都在被挤出去,模型等于没有「过去」。
- 修法就两个开关:用 Responses API 把上一次响应ID 传回去,推理自动留住;再开 compaction,上下文到了阈值就压成一份浓缩摘要接着跑,不删开头。
- 省钱比涨分更夸张:最高档下每局输出 token 从 290 万降到 49 万;新程序在「高」档就拿到了旧程序拼到「最高」档的同样分数,token 差约12倍。