# OpenAI 两项改进让 GPT-5.6 Sol 在 ARC-AGI-3 提分 188%

- 来源：IT之家（RSS）
- 发布时间：2026-07-31 15:35
- AIHOT 分数：53
- AIHOT 链接：https://aihot.virxact.com/items/cms8nqyvb023orof1yc41oofh
- 原文链接：https://www.ithome.com/0/984/208.htm

## AI 摘要

OpenAI 通过改进测试框架，让 GPT-5.6 Sol 在 ARC-AGI-3 交互式推理基准中的得分从 13.3% 提升至 38.3%，增长 188.42%，同时输出 token 数量降至六分之一。改进包括推理保留和上下文压缩，分别解决私有推理被丢弃和滚动截断窗口丢失早期记忆的问题。

## 正文

IT之家 7 月 31 日消息，OpenAI 公司今天（7 月 31 日）发布公告，宣布通过改进框架，让 GPT-5.6 Sol 模型的 ARC-AGI-3 提高了 188%。

IT之家注：ARC-AGI-3 由 ARC Prize 团队推出的全新交互式推理基准测试，是目前全球公认衡量 AI 通用智能（AGI）最严苛、最顶尖的交互式推理评测基准。

该基准完全打破了传统 AI“做题”和知识问答的静态测试模式，将 AI 直接扔进一个完全陌生的“游戏环境”中，来评估其是否具备像人类一样的实时探索、学习与自适应能力。

在未调整优化前，GPT-5.6 Sol 在 ARC-AGI-3 基准测试中的得分为 7.8%，而 GPT-5.5 模型的得分只有 0.4%。

OpenAI 公司在复盘后发现，GPT-5.6 系列模型官方框架存在 2 个影响 GPT-5.6 Sol 表现的机制：

第一，每次游戏动作后，私有推理都会被丢弃。这意味着 GPT-5.6 Sol 每执行 1 次动作后，都需要重新理解游戏。模型仍可看到过去动作记录和简短备注，但看不到促成这些动作的计划、洞察和思考过程。

第二，官方框架采用滚动截断窗口。随着历史变长，较早动作会从上下文中消失。也就是说，GPT-5.6 Sol 不仅无法保留过去思考，也会丢失过去动作记忆。

针对上述问题，OpenAI 提出了推理保留（inference preservation）和上下文压缩（context compression）两个解决方案。

推理保留方面，OpenAI 使用 Responses API 重新实现 ARC-AGI-3 测试框架，对于 GPT-5.6，只需传入前一次 response ID，即可在工具调用和多轮交互中自动保留推理。

OpenAI 表示在启用推理保留后，GPT-5.6 不必每轮重新解释游戏，从而减少每次动作前花在思考上的时间，模型保留过去想法后，更善于随时间学习，并采用更连贯的策略。

在上下文压缩方面，官方 ARC-AGI-3 框架在对话上下文超过 175000 个字符后，会丢弃最早消息。OpenAI 称，滚动截断有 2 个缺点：模型会丢失早期观察和动作；模型在任务的大部分时间里会带着更满的上下文窗口运行，这可能轻微损害表现。

启用上下文压缩后，GPT-5.6 Sol 在较长任务中更能保留对每个游戏的已学信息，并以更少输出 token 获得更高得分。

而在使用官方 harness 后，GPT-5.6 Sol 在 ARC-AGI-3 的得分为 13.3%；在启用推理保留（inference preservation）和上下文压缩（context compression）后，GPT-5.6 Sol 在 Token 输出数量降低至六分之一的同时，得分达到 38.3%，成绩增长 188.42%。

harness（常被称为驭缰工程）是指包在大模型外部、为其提供运行环境、工具集成、规则约束与反馈机制的整套系统架构。

如果把强大的 AI 模型比作一匹充满力量但容易失控的烈马，那么 harness 就是它的缰绳、马鞍与骑手路线，不改变模型本身的架构，而是决定模型如何被安全、可靠地驾驭并真正完成复杂工作。
