# Kimi Linear：一种表现力强且高效的注意力架构

- 来源：Hacker News 热门（buzzing.cc 中文翻译）
- 作者：ronfriedhaber
- 发布时间：2026-07-28 23:21
- AIHOT 分数：76
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cms4t5zra01o1roa10b19hmbh
- 原文链接：https://arxiv.org/abs/2510.26692

## 精选理由

Kimi Linear首次在公平对比中证明了线性注意力可以全面超越full attention，KV缓存降低75%，解码吞吐量提升6倍，所有做长上下文和RL团队的必读论文。

## AI 摘要

月之暗面推出 Kimi Linear，一种混合线性注意力架构，首次在短上下文、长上下文和强化学习场景下全面超越全注意力机制。其 3B 激活参数模型在所有评估任务上显著优于全 MLA，同时将 KV cache 使用量降低最多 75%，并在 1M 上下文下实现最高 6 倍解码吞吐量。月之暗面已开源 KDA 内核、vLLM 实现及模型权重。

## 正文

我们推出 Kimi Linear，这是一种混合线性注意力架构，首次在公平对比下，于多种场景——包括短上下文、长上下文以及强化学习（RL）扩展机制——中全面超越全注意力机制。其核心在于 Kimi Delta Attention（KDA），这是一个富有表现力的线性注意力模块，通过更细粒度的门控机制扩展了 Gated DeltaNet，从而更有效地利用有限的有限状态 RNN 记忆。我们定制的分块算法通过对角加低秩（DPLR）转移矩阵的一种专门变体实现了高硬件效率，与通用的 DPLR 公式相比大幅减少了计算量，同时与经典的 delta 规则保持更高的一致性。我们基于 KDA 与多头潜在注意力（MLA）的逐层混合方式，预训练了一个具有 30 亿激活参数和 480 亿总参数的 Kimi Linear 模型。实验表明，在相同的训练方案下，Kimi Linear 在所有评估任务上均以显著优势超越纯 MLA，同时将 KV 缓存使用量降低高达 75%，并在 100 万上下文中实现高达 6 倍的解码吞吐量。这些结果证明，Kimi Linear 可以作为全注意力架构的直接替代方案，在包括更长输入和输出长度的任务中，兼具更优的性能与效率。为支持进一步研究，我们开源了 KDA 内核和 vLLM 实现，并发布了预训练和指令微调的模型检查点。
