我们推出 Kimi K3,这是一个 2.8T 参数的混合专家模型,拥有 1040 亿激活参数、原生视觉能力以及 100 万 token 的上下文窗口。Kimi K3 基于 Kimi Delta Attention 和 Attention Residuals 构建,这两项技术改善了跨序列长度和模型深度的信息流动。结合 Stable LatentMoE(该技术有效激活每个 token 的 896 个路由专家中的 16 个)以及经过优化的训练和数据方案,这些进步使得整体扩展效率相比 Kimi K2 提升了约 2.5 倍。后训练阶段重点包括在通用、智能体和编程领域的强化学习,以及多个推理努力层级,从而实现了组合泛化和稳健的长周期执行。在 2.8T 规模下,Kimi K3 得到了多个领域基础设施进步的支持:面向 KDA 的算法-系统协同设计、具有高效内存管理的完美平衡专家并行训练、支持持久化回滚和沙盒状态的百万 token 智能体强化学习,以及部署创新。广泛的评估表明,Kimi K3 在长周期编程、智能体、知识、推理和视觉任务上均达到了前沿水平。尽管其整体性能仍落后于最强大的专有模型,即 Claude Fable 5 和 GPT-5.6 Sol,但 Kimi K3 在我们的评估套件中持续优于其他开源和专有模型。我们发布完整的 Kimi K3 模型权重,以促进未来研究并加速前沿智能的更广泛部署和应用。
Kimi K3 发布:2.8T 参数开源混合专家模型
阅读原文· arxiv.orgKimi K3 是首个真正把 2.8T MoE 完整开源的前沿模型,虽然综合能力还没追上 Fable 和 Sol,但 104B 激活加 1M 上下文,是做 long-horizon agent 的免费基础设施级发行。
月之暗面发布 Kimi K3,一个 2.8T 参数(104B 激活参数)的混合专家模型,支持原生视觉和百万 token 上下文窗口。该模型在长程编码、智能体、知识、推理和视觉任务上达到前沿水平,整体性能优于其他开源及闭源模型,但落后于 Claude Fable 5 和 GPT-5.6 Sol。Kimi K3 的完整模型权重已开源。
我们推出 Kimi K3,这是一个 2.8T 参数的混合专家模型,拥有 1040 亿激活参数、原生视觉能力以及 100 万 token 的上下文窗口。Kimi K3 基于 Kimi Delta Attention 和 Attention Residuals 构建,这两项技术改善了跨序列长度和模型深度的信息流动。结合 Stable LatentMoE(该技术有效激活每个 token 的 896 个路由专家中的 16 个)以及经过优化的训练和数据方案,这些进步使得整体扩展效率相比 Kimi K2 提升了约 2.5 倍。后训练阶段重点包括在通用、智能体和编程领域的强化学习,以及多个推理努力层级,从而实现了组合泛化和稳健的长周期执行。在 2.8T 规模下,Kimi K3 得到了多个领域基础设施进步的支持:面向 KDA 的算法-系统协同设计、具有高效内存管理的完美平衡专家并行训练、支持持久化回滚和沙盒状态的百万 token 智能体强化学习,以及部署创新。广泛的评估表明,Kimi K3 在长周期编程、智能体、知识、推理和视觉任务上均达到了前沿水平。尽管其整体性能仍落后于最强大的专有模型,即 Claude Fable 5 和 GPT-5.6 Sol,但 Kimi K3 在我们的评估套件中持续优于其他开源和专有模型。我们发布完整的 Kimi K3 模型权重,以促进未来研究并加速前沿智能的更广泛部署和应用。