小互@xiaohu
47AI 编辑部评分,满分 100
2026-07-30 12:12· 8小时前
跳到正文
AI 摘要

OpenAI 复盘发现,同一 GPT-5.6 Sol 模型在 ARC-AGI-3 公开题库的分数从 13.3% 涨至 38.3%,仅因打开两个 API 设置。此前评测程序(harness)会丢弃模型的私有推理链并截断上下文,导致模型“失忆”。修复后,最高档每局输出 token 从 290 万降至 49 万,且“高”档即可达到旧程序“最高”档的分数,token 消耗相差约 12 倍。

OpenAI 只打开两个 API 设置

GPT-5.6 Sol 在 ARC-AGI-3 的分数从 13.3% 涨到 38.3%

  • OpenAl复盘了一次自家模型「考砸」的经历:同一个 GPT-5.6 Sol、同一套评测题,只把两个 API设置打开,ARC-AGI-3公开题库的分数从13.3% 涨到 38.3%。
  • 问题出在跑模型那套程序(业内叫 harness)上:每走完一步,模型写给自己看的私有思考被整段丢掉,下一步只能从零重新理解这个游戏。
  • 第二个问题是上下文塞满就删掉最早的消息,连过去按了哪些键都在被挤出去,模型等于没有「过去」。
  • 修法就两个开关:用 Responses API 把上一次响应ID 传回去,推理自动留住;再开 compaction,上下文到了阈值就压成一份浓缩摘要接着跑,不删开头。
  • 省钱比涨分更夸张:最高档下每局输出 token 从 290 万降到 49 万;新程序在「高」档就拿到了旧程序拼到「最高」档的同样分数,token 差约12倍。

https://best.xiaohu.ai/article/openai-arc-agi-3-harness/

小互 · @xiaohu · X·2026-07-30 12:12·8小时前
在 X 看原推· x.com
AI 摘要

OpenAI 复盘发现,同一 GPT-5.6 Sol 模型在 ARC-AGI-3 公开题库的分数从 13.3% 涨至 38.3%,仅因打开两个 API 设置。此前评测程序(harness)会丢弃模型的私有推理链并截断上下文,导致模型“失忆”。修复后,最高档每局输出 token 从 290 万降至 49 万,且“高”档即可达到旧程序“最高”档的分数,token 消耗相差约 12 倍。

OpenAI 只打开两个 API 设置

GPT-5.6 Sol 在 ARC-AGI-3 的分数从 13.3% 涨到 38.3%

  • OpenAl复盘了一次自家模型「考砸」的经历:同一个 GPT-5.6 Sol、同一套评测题,只把两个 API设置打开,ARC-AGI-3公开题库的分数从13.3% 涨到 38.3%。
  • 问题出在跑模型那套程序(业内叫 harness)上:每走完一步,模型写给自己看的私有思考被整段丢掉,下一步只能从零重新理解这个游戏。
  • 第二个问题是上下文塞满就删掉最早的消息,连过去按了哪些键都在被挤出去,模型等于没有「过去」。
  • 修法就两个开关:用 Responses API 把上一次响应ID 传回去,推理自动留住;再开 compaction,上下文到了阈值就压成一份浓缩摘要接着跑,不删开头。
  • 省钱比涨分更夸张:最高档下每局输出 token 从 290 万降到 49 万;新程序在「高」档就拿到了旧程序拼到「最高」档的同样分数,token 差约12倍。

https://best.xiaohu.ai/article/openai-arc-agi-3-harness/

在 X 查看原推x.com