STORY · 事件已收束

MiniMax 发布块状稀疏注意力 MSA

1 个精选信源 · 1 篇报道持续 1最新动态 58天前
最新进展

MiniMax Sparse Attention(MSA)块状稀疏注意力

TIMELINE

报道时间线

1 条公开报道 · 官方一手 0 条 · 最新在前
  1. MiniMax Sparse Attention(MSA)块状稀疏注意力
    HuggingFace Daily Papers(社区热门论文)精选

    MiniMax 提出块状稀疏注意力 MSA,基于 GQA 构建。轻量级 Index Branch 为每个 GQA 组独立选择 Top‑k KV 块,Main Branch 仅对选中块执行精确块稀疏注意力。在 109B 参数多模态模型上,MSA 与 GQA 性能持平,1M 上下文下每 token 注意力计算减少 28.4 倍。配合协同设计的 GPU 内核,H800 上实现 14.2 倍 prefill 和 7.6 倍 decoding 端到端加速。推理内核与基于 MSA 的多模态模型已公开发布。

RELATED