# OpenAI 修复评测程序，GPT-5.6 Sol 分数暴涨近三倍

- 来源：小互 (@xiaohu)
- 发布时间：2026-07-30 12:12
- AIHOT 分数：47
- AIHOT 链接：https://aihot.virxact.com/items/cms70i5180772rouqa9mdxz6f
- 原文链接：https://x.com/xiaohu/status/2082680583097065774

## AI 摘要

OpenAI 复盘发现，同一 GPT-5.6 Sol 模型在 ARC-AGI-3 公开题库的分数从 13.3% 涨至 38.3%，仅因打开两个 API 设置。此前评测程序（harness）会丢弃模型的私有推理链并截断上下文，导致模型“失忆”。修复后，最高档每局输出 token 从 290 万降至 49 万，且“高”档即可达到旧程序“最高”档的分数，token 消耗相差约 12 倍。

## 正文

OpenAI 只打开两个 API 设置

GPT-5.6 Sol 在 ARC-AGI-3 的分数从 13.3% 涨到 38.3%

- OpenAl复盘了一次自家模型「考砸」的经历：同一个 GPT-5.6 Sol、同一套评测题，只把两个 API设置打开，ARC-AGI-3公开题库的分数从13.3% 涨到 38.3%。

- 问题出在跑模型那套程序（业内叫 harness）上：每走完一步，模型写给自己看的私有思考被整段丢掉，下一步只能从零重新理解这个游戏。

- 第二个问题是上下文塞满就删掉最早的消息，连过去按了哪些键都在被挤出去，模型等于没有「过去」。

- 修法就两个开关：用 Responses API 把上一次响应ID 传回去，推理自动留住；再开 compaction，上下文到了阈值就压成一份浓缩摘要接着跑，不删开头。

- 省钱比涨分更夸张：最高档下每局输出 token 从 290 万降到 49 万；新程序在「高」档就拿到了旧程序拼到「最高」档的同样分数，token 差约12倍。

https://best.xiaohu.ai/article/openai-arc-agi-3-harness/
