# Kimi K3 发布：2.8T 参数开源混合专家模型

- 来源：HuggingFace Daily Papers（社区热门论文）
- 发布时间：2026-07-27 08:00
- AIHOT 分数：81
- AIHOT 链接：https://aihot.virxact.com/items/cms44cyp005y2ro82uyfb20wc
- 原文链接：https://arxiv.org/abs/2607.24653

## AI 摘要

月之暗面发布 Kimi K3，一个 2.8T 参数（104B 激活参数）的混合专家模型，支持原生视觉和百万 token 上下文窗口。该模型在长程编码、智能体、知识、推理和视觉任务上达到前沿水平，整体性能优于其他开源及闭源模型，但落后于 Claude Fable 5 和 GPT-5.6 Sol。Kimi K3 的完整模型权重已开源。

## 正文

我们推出 Kimi K3，这是一个 2.8T 参数的混合专家模型，拥有 1040 亿激活参数、原生视觉能力以及 100 万 token 的上下文窗口。Kimi K3 基于 Kimi Delta Attention 和 Attention Residuals 构建，这两项技术改善了跨序列长度和模型深度的信息流动。结合 Stable LatentMoE（该技术有效激活每个 token 的 896 个路由专家中的 16 个）以及经过优化的训练和数据方案，这些进步使得整体扩展效率相比 Kimi K2 提升了约 2.5 倍。后训练阶段重点包括在通用、智能体和编程领域的强化学习，以及多个推理努力层级，从而实现了组合泛化和稳健的长周期执行。在 2.8T 规模下，Kimi K3 得到了多个领域基础设施进步的支持：面向 KDA 的算法-系统协同设计、具有高效内存管理的完美平衡专家并行训练、支持持久化回滚和沙盒状态的百万 token 智能体强化学习，以及部署创新。广泛的评估表明，Kimi K3 在长周期编程、智能体、知识、推理和视觉任务上均达到了前沿水平。尽管其整体性能仍落后于最强大的专有模型，即 Claude Fable 5 和 GPT-5.6 Sol，但 Kimi K3 在我们的评估套件中持续优于其他开源和专有模型。我们发布完整的 Kimi K3 模型权重，以促进未来研究并加速前沿智能的更广泛部署和应用。
