# 摩尔线程完成Kimi K3适配：MTT S5000国产GPU支撑2.8万亿参数大模型

- 来源：IT之家（RSS）
- 发布时间：2026-07-29 11:00
- AIHOT 分数：35
- AIHOT 链接：https://aihot.virxact.com/items/cms5i4t1c0026rodm5bg0coih
- 原文链接：https://www.ithome.com/0/982/959.htm

## AI 摘要

摩尔线程基于MTT S5000智算卡及MUSA软件栈，完成对月之暗面开源模型Kimi K3的Day-0支持。Kimi K3总参数达2.8万亿，是全球首个开源的3万亿级别模型，原生支持视觉理解并拥有100万token上下文窗口。

## 正文

IT之家 7 月 29 日消息，月之暗面 7 月 28 日正式开源 2.8 万亿参数模型 Kimi K3 并发布模型权重与技术报告。

同日，摩尔线程基于 AI 训推一体智算卡 MTT S5000 及 MUSA 软件栈，宣布完成 Kimi K3 的 Day-0 支持。

Kimi K3 是全球首个开源的 3 万亿级别模型，总参数达 2.8 万亿，基于 KDA 混合线性注意力机制（Kimi Delta Attention）和注意力残差（Attention Residuals）技术构建，采用 Gated MLA 与 Stable Latent MoE 等架构创新，原生支持视觉理解，并拥有 100 万 token 上下文窗口。

与传统 Transformer 模型不同，Kimi K3 的 69 层 KDA 与 24 层 Gated MLA 构成混合注意力主干，Stable Latent MoE 以 896 个专家、每个 token 激活 16 个专家的方式提升模型容量。

面对新架构对 AI 芯片软件栈提出的系统性挑战，摩尔线程在模型开源后第一时间完成了模型结构解析、权重加载、核心算子、缓存管理与分布式运行链路的适配。针对 KDA 核心创新，团队分别完成了 Prefill 与 Decode 阶段的关键路径适配，并以 Triton MUSA 正确性实现作为稳定基线。SGLang-MUSA 同步适配了 Hybrid State Pool，用于管理 KDA 递归状态与卷积状态，覆盖 Prefix Cache、分块 Prefill 及 PD 分离场景所需的状态生命周期。

针对 Stable Latent MoE 的 896 专家、TopK 16 激活规模，摩尔线程快速完成了 DeepEP 适配，打通 token dispatch、combine 与跨卡 All-to-All 通信链路。MUSA 软件栈进一步完成模型路由、专家映射和分布式执行链路适配，通过 MCCL、DeepEP 与 MTSHMEM 协同承载张量并行、专家并行和低时延通信。面对 Kimi K3 官方 MXFP4 checkpoint，摩尔线程设计了加载期在线逐层量化方案，无需离线转换即可快速拉起推理。

IT之家查询获悉，MTT S5000 是摩尔线程基于第四代“平湖”芯片架构打造的 AI 训推一体智算卡，单卡 AI 稠密算力最高可达 1000TFLOPS，配备 80GB 显存，显存带宽达 1.6TB/s，卡间互联带宽为 784GB/s，完整支持从 FP8 到 FP64 的全精度计算。

《Day0 适配：阿里云灵骏真武 M890 超节点实例现已支持月之暗面 Kimi K3 大模型》

《月之暗面开源 Kimi K3 模型，2.8 万亿参数》
