阿里智能体记忆新法:上下文当编程任务

elvis · @omarsar0 · X·2026-08-25 23:35·23小时前
AI 导读

阿里提出将智能体上下文管理视为编程任务的新方法:以追加式事件日志和沙盒持久 Python 内核为基座,工具输出与检索历史绑定为类型化变量,由模型编写代码检索和转换状态。配合逐出索引实现精确回溯,Qwen3.8-Max 在 LongMemEval_S 达 94.8%,BEAM_10M 达 73.1%(超最佳系统 5.1 分),LOCA_256K 达 86.7%。

elvis@omarsar0
37AI 编辑部评分,满分 100

阿里智能体记忆新法:上下文当编程任务

2026-08-25 23:35· 23小时前
AI 导读

阿里提出将智能体上下文管理视为编程任务的新方法:以追加式事件日志和沙盒持久 Python 内核为基座,工具输出与检索历史绑定为类型化变量,由模型编写代码检索和转换状态。配合逐出索引实现精确回溯,Qwen3.8-Max 在 LongMemEval_S 达 94.8%,BEAM_10M 达 73.1%(超最佳系统 5.1 分),LOCA_256K 达 86.7%。

Impressive work from Alibaba.

(bookmark it)

If you build long-running agents and keep rewriting your memory schema, take a look at this approach.

It basically treats agent context management as a programming task.

Here is how it works:

It backs each agent session with an append-only event log and a sandboxed, persistent Python kernel.

Tool outputs, retrieved history, and derived state bind to typed variables across model calls instead of being serialized into the prompt every turn.

Model-written code searches and transforms that state, and only explicitly printed projections enter the working view.

The event log keeps lossless ground truth, so nothing has to be committed to a compressed form before you know what will matter later.

When the working view nears its budget, stale spans are evicted but stay recoverable. An eviction index keeps compact landmarks tied to exact event-log addresses, so the agent navigates straight back to a region instead of searching the whole log.

Results: with Qwen3.8-Max, 94.8% on LongMemEval_S, 73.1% on BEAM_10M (5.1 points over the best published memory system), and 86.7% on LOCA_256K.

Treating context management as a programming task means it inherits every future improvement in model coding ability.

Paper: https://arxiv.org/abs/2608.21690

Track more trending AI papers in our academy: https://academy.dair.ai/