现代序列建模主要由两大范式主导:一类是 Transformer 架构,其自注意力机制能够访问可见序列中的任意元素;另一类是结构化状态空间模型,通过显式的循环状态传播信息。这两种机制在处理长上下文时面临不同限制:当注意力分布较为分散时,单个 token 的影响力会在有效支撑范围内被稀释;而循环状态传播则可能丧失长距离敏感性,除非信息被主动保留。因此,这两种机制在长上下文中保留并选择性检索信息时均面临挑战。我们提出 Sessa 解码器,该架构将注意力置于循环反馈路径内部。这创建了多条基于注意力的路径,使过去的 token 能够通过这些路径影响未来状态,而非仅依赖单次注意力读取或单条循环链。我们证明,在明确假设与匹配条件下,Sessa 可实现幂律记忆尾分布 $O(\ell^{-β})$(其中 $0 < β< 1$),其衰减速度慢于对应的 Transformer 和 Mamba 风格基线模型。我们进一步给出了实现该幂律速率的显式构造方法。在相同假设下,Sessa 是所考虑模型类别中唯一能够实现灵活选择性检索的模型,包括影响力不随距离衰减的检索模式。与这一理论优势一致,在匹配实验中,Sessa 在长上下文基准测试中取得了最强性能,同时在短上下文语言建模中与 Transformer 和 Mamba 风格基线模型保持竞争力。
Sessa:选择性状态空间注意力
现代序列建模主要依赖Transformer和结构化状态空间模型,但两者在长上下文处理中均存在局限。Sessa提出一种新解码器架构,将注意力机制置于循环反馈路径内,从而构建多条基于注意力的历史信息传递路径。理论分析表明,在匹配条件下,Sessa可实现幂律记忆衰减O(ℓ^{-β})(0<β<1),其衰减速度慢于对应的Transformer与Mamba基线,并能实现灵活的选择性信息检索,包括影响力不随距离衰减的模式。实验证明,Sessa在长上下文基准测试中取得最强性能,同时在短上下文语言建模任务上保持竞争力。
现代序列建模主要由两大范式主导:一类是 Transformer 架构,其自注意力机制能够访问可见序列中的任意元素;另一类是结构化状态空间模型,通过显式的循环状态传播信息。这两种机制在处理长上下文时面临不同限制:当注意力分布较为分散时,单个 token 的影响力会在有效支撑范围内被稀释;而循环状态传播则可能丧失长距离敏感性,除非信息被主动保留。因此,这两种机制在长上下文中保留并选择性检索信息时均面临挑战。我们提出 Sessa 解码器,该架构将注意力置于循环反馈路径内部。这创建了多条基于注意力的路径,使过去的 token 能够通过这些路径影响未来状态,而非仅依赖单次注意力读取或单条循环链。我们证明,在明确假设与匹配条件下,Sessa 可实现幂律记忆尾分布 $O(\ell^{-β})$(其中 $0 < β< 1$),其衰减速度慢于对应的 Transformer 和 Mamba 风格基线模型。我们进一步给出了实现该幂律速率的显式构造方法。在相同假设下,Sessa 是所考虑模型类别中唯一能够实现灵活选择性检索的模型,包括影响力不随距离衰减的检索模式。与这一理论优势一致,在匹配实验中,Sessa 在长上下文基准测试中取得了最强性能,同时在短上下文语言建模中与 Transformer 和 Mamba 风格基线模型保持竞争力。
来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org