# Sessa：选择性状态空间注意力

- 来源：HuggingFace Daily Papers（社区热门论文）
- 发布时间：2026-04-21 08:00
- AIHOT 分数：71
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmogoshcb03pwsl5rd37yb6v8
- 原文链接：https://arxiv.org/abs/2604.18580

## 精选理由

这篇论文在理论上证明了Sessa架构的长上下文记忆衰减比Transformer和Mamba更慢，并在实验中兑现了这一优势。对于关注下一代序列模型架构的研究者和开发者，这是个值得深挖的扎实信号。

## AI 摘要

现代序列建模主要依赖Transformer和结构化状态空间模型，但两者在长上下文处理中均存在局限。Sessa提出一种新解码器架构，将注意力机制置于循环反馈路径内，从而构建多条基于注意力的历史信息传递路径。理论分析表明，在匹配条件下，Sessa可实现幂律记忆衰减O(ℓ^{-β})（0<β<1），其衰减速度慢于对应的Transformer与Mamba基线，并能实现灵活的选择性信息检索，包括影响力不随距离衰减的模式。实验证明，Sessa在长上下文基准测试中取得最强性能，同时在短上下文语言建模任务上保持竞争力。

## 正文

现代序列建模主要由两大范式主导：一类是 Transformer 架构，其自注意力机制能够访问可见序列中的任意元素；另一类是结构化状态空间模型，通过显式的循环状态传播信息。这两种机制在处理长上下文时面临不同限制：当注意力分布较为分散时，单个 token 的影响力会在有效支撑范围内被稀释；而循环状态传播则可能丧失长距离敏感性，除非信息被主动保留。因此，这两种机制在长上下文中保留并选择性检索信息时均面临挑战。我们提出 Sessa 解码器，该架构将注意力置于循环反馈路径内部。这创建了多条基于注意力的路径，使过去的 token 能够通过这些路径影响未来状态，而非仅依赖单次注意力读取或单条循环链。我们证明，在明确假设与匹配条件下，Sessa 可实现幂律记忆尾分布 $O(\ell^{-β})$（其中 $0 < β< 1$），其衰减速度慢于对应的 Transformer 和 Mamba 风格基线模型。我们进一步给出了实现该幂律速率的显式构造方法。在相同假设下，Sessa 是所考虑模型类别中唯一能够实现灵活选择性检索的模型，包括影响力不随距离衰减的检索模式。与这一理论优势一致，在匹配实验中，Sessa 在长上下文基准测试中取得了最强性能，同时在短上下文语言建模中与 Transformer 和 Mamba 风格基线模型保持竞争力。
