Kimi K3 发布:2.8T 参数开源模型,具备原生视觉与百万 token 上下文窗口

Moonshot AI:Kimi Blog·2026-07-14 00:00·50天前·Kimi
AI 导读

月之暗面发布 Kimi K3,一个 2.8T 参数的开源模型,采用 Kimi Delta Attention 和 Attention Residuals 架构,支持原生视觉能力与 100 万 token 上下文窗口。

Moonshot AI:Kimi Blog
精选
81AI 编辑部评分,满分 100

Kimi K3 发布:2.8T 参数开源模型,具备原生视觉与百万 token 上下文窗口

2026-07-14 00:00· 50天前· Kimi
AI 导读

月之暗面发布 Kimi K3,一个 2.8T 参数的开源模型,采用 Kimi Delta Attention 和 Attention Residuals 架构,支持原生视觉能力与 100 万 token 上下文窗口。

推荐理由

首个开源 3T 级模型,架构上有 KDA 和 AttnRes 创新,在超长程编码和知识工作上比肩闭源。权重两周后放出,所有做 agent 的都该盯紧。

正文 · AI 翻译

今天,我们正式推出 Kimi K3——这是我们迄今为止能力最强的模型。Kimi K3 是一个基于 Kimi Delta Attention 和 Attention Residuals 架构构建的 2.8T 参数模型,具备原生视觉能力,并拥有 100 万 token 的上下文窗口。它是全球首个开源的 3T 级模型,专为长周期编程、知识工作和推理等前沿智能场景而设计。

尽管其整体性能仍落后于最强大的闭源模型 Claude Fable 5 和 GPT 5.6 Sol,但 Kimi K3 在我们的评估套件中展现出了前沿水平的表现,持续优于其他参与测试的模型。

Kimi K3 即日起在 Kimi.com、Kimi Work、Kimi Code 以及 Kimi API 上可用。上线初期,Kimi K3 默认使用最大思考力度,低力度和高力度模式将在后续更新中引入。我们目前正与推理合作伙伴及开源维护者紧密合作,以对齐技术细节,确保在整个生态系统中实现可靠的部署。完整的模型权重将于 2026 年 7 月 27 日前发布。关于架构、训练和评估的更多细节,将与 Kimi K3 技术报告一同发布。

一个开源的 3T 级模型

Kimi K3 是首个达到 2.8 万亿参数的开源模型。这标志着 Kimi 在规模扩展前沿持续推动的最新一步:在过去十二个月中,有九个月,Kimi 模型都设定了开源模型规模的上限。

Kimi K3 基于 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)构建,这两项架构更新旨在改善信息在序列长度和模型深度上的流动方式。我们还扩展了混合专家模型(MoE)的稀疏性,在与 Stable LatentMoE 框架配合使用时,可有效激活 896 个专家中的 16 个。结合优化的训练方法和数据配方,这些结构性变化使得整体扩展效率相比 Kimi K2 提升了约 2.5 倍,使模型能够更有效地将算力转化为智能。

编程

Kimi K3 在长周期编程方面表现强劲。在极少人工干预的情况下,它能够维持长时间的工程会话,浏览大型代码仓库,并编排终端工具。

Kimi K3 在融合软件工程与视觉推理的任务中也表现出色——它利用截图和视觉信息来优化游戏开发、前端和 CAD 工作。

下面的案例研究展示了 Kimi K3 的编码能力如何转化为开放式的软件创作和科学研究。

内核优化

我们测试了这些模型优化 GPU 内核的能力。每个模型在相同的沙盒环境中独立工作,拥有最多 24 小时的时间来对四个任务进行性能分析、重写和基准测试,这些任务涵盖 AttnRes、KDA 以及一个 512 头维度的 MLA 内核,测试平台包括 NVIDIA H200 和另一家供应商的 GPGPU。Kimi K3 的表现与 Fable 5(含回退机制)不相上下,并大幅优于 Opus 4.8、GPT 5.6 Sol 和 GPT 5.5。

Claude Fable 5 由第三方进行评估,其结果可能包含回退行为。在大多数模型中,部分运行轨迹包含微小且可接受的精度取舍,这些取舍在我们的数值容差范围内。GPGPU 指用于图形渲染之外的计算任务的通用 GPU。

在 Kimi K3 开发的后期阶段,一个早期版本的 Kimi K3 承担了团队大部分的内核优化工作。

GPU 编译器开发

我们进一步测试了 Kimi K3 是否能够从头构建一个 GPU 编程系统。Kimi K3 开发了 MiniTriton,这是一个紧凑的类 Triton 编译器,拥有基于 MLIR 的独立 tile 级 IR 层、优化通道以及 PTX 代码生成流水线。在支持的屋顶线基准测试中,MiniTriton 的性能与 Triton 和 torch.compile 相当或更优——在某些工作负载上超越了 Triton。除了微基准测试,MiniTriton 还能支持端到端的 nanoGPT 训练,并实现稳定的收敛,其损失曲线与参考曲线紧密贴合,仅有微小偏差——这在一个真实的工作负载上验证了完整的流水线。这些结果表明,Kimi K3 能够构建一个连贯的端到端编译器——从 DSL 前端和 IR 通道到 PTX 代码生成和运行时——而非孤立的单个内核;其从头构建的 Tensor Core 路径已经能与 Triton 高度优化的技术栈相媲美。

游戏开发与数字创作

Kimi K3 融合了强大的 3D 推理、编程和视觉能力,能够将概念、图像和视频转化为完全可玩的交互式体验。Kimi K3 通过在代码与实时截图之间无缝迭代——即时查看并优化输出——实现了真正的“视觉闭环”。

芯片设计

作为早期概念验证,Kimi K3 设计了一款芯片,用于运行基于自身架构构建的纳米模型。在单次 48 小时的自主运行中,K3 使用基于 Nangate 45nm 库的开源 EDA 工具,构建、优化并验证了该芯片。在 4 mm² 的面积内,该芯片在 100 MHz 频率下满足时序收敛,并在仿真中维持超过 8,700 tokens/s 的解码吞吐量,集成了 146 万个标准单元、0.277 MB 的 SRAM 以及一个带有融合反量化的 INT4 MAC 阵列。一个由模型为模型构建的芯片,体现了 K3 的长期智能体能力。

科研编程

Kimi K3 连接了科学文献与可执行代码,能够自主实现、验证并分析复杂的计算研究工作流。

在一个案例中,Kimi K3 在大约两小时内完成了通常需要经验丰富的研究人员一到两周工作量才能完成的任务。为了复现计算天体物理学中的 I–Love–Q 普适关系,它审阅并交叉验证了 20 多篇论文,实现了完整的数值计算流程,评估了 300 多种状态方程,识别了已发表公式中的不一致之处,生成了 3,000 多行 Python 代码,并制作了一个用于探索结果的交互式 HTML 仪表板。

知识工作

Kimi K3 推动了端到端知识工作的进步。除了公开基准测试之外,Kimi K3(max)在我们基于真实用户-智能体工作流中反复出现的模式和挑战而设计的内部评估中,也展现出持续的性能提升。这些在不同面向生产的工作流中体现出的持续优势,反映了 Kimi K3 智能体知识工作能力的全面增强。

交互式可视化研究

以下是 Kimi K3 在 Kimi 工作台(Kimi Work)中能够在金融咨询和科学研究领域产出的一些示例:

案例 1:交互式 42 年 AI ASIC 行业研究网站

一份可深入探索的交互式研究报告:ASIC 行业 42 年发展历程,通过 120 多轮递归自我改进生成。Kimi K3 将证据转化为定制图表、动画示意图和交互式视觉叙事。它通过 2800 多次网络搜索/抓取和 1100 多次终端数据拉取,从跨越 87 份季度报告和 99 份原始 PDF 的 11000 多页中提取数据。

案例二:聚变行业研究

一份咨询风格的行业报告,包含交互式可视化——包括时间线、漏斗图、区间条形图、甘特图以及达到出版质量的幻灯片。

案例三:GWTC-5 引力波分析

使用 20 多个并发子智能体对 391 个引力波事件进行分析,生成了 7 个科学可视化图表、2 个表格,以及基于 10 多篇论文的文献综述。

Kimi K3 在制作信息图风格演示文稿方面也特别高效,例如下方展示的完全可编辑热力图和年度报告:

组件与仪表盘

在 Kimi 工作区中,我们引入了两个新功能——组件与仪表盘——它们使与 Kimi K3 的交互更具可视化且更持久。组件让你能在聊天中直接生成交互式组件,并可连接本地数据或外部插件以实现持续更新。仪表盘则把你最关心的组件整合到一个围绕某个主题、项目或目标组织的、持久且个性化的视图中。

视频编辑

Kimi K3 在动态设计、动画和视频编辑方面表现出色,因为其原生多模态架构能在同一个模型中理解文本、图像和视频。

在一个示例中,K3 制作了一个 3Blue1Brown 风格的动态图形讲解视频来解释其自身架构,将技术概念转化为动画图表和转场。

在另一个示例中,Kimi K3 从 56 个原始片段中剪辑了自己的预告片,处理了片段选择、运动匹配剪辑、帧级精确节拍同步、音频处理以及多轮修改。像这样高密度的短视频,通常需要经验丰富的剪辑师一到两个工作日,或者新手三到五天才能完成。

架构与基础设施

Kimi K3 基于 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)构建。KDA 为注意力机制的扩展提供了高效基础,而 AttnRes 则选择性地跨深度检索表征,而非均匀地累积它们。两者共同构成了该模型架构的支柱,使其能够轻松扩展至万亿参数规模以上。

Kimi K3 采用 Stable LatentMoE,有效激活了 896 个专家中的 16 个。在此稀疏度下,路由和优化成为首要挑战。Quantile Balancing 直接从路由器分数的分位数推导出专家分配,消除了启发式更新和一个敏感的平衡超参数;而 Per-Head Muon 则通过独立优化注意力头来扩展 Muon,从而在大规模训练中实现更具适应性的学习。Sigmoid Tanh Unit(SiTU)和 Gated MLA 分别改善了激活控制和注意力选择性。这些进步共同使得在 2.8 万亿参数规模下实现稳定高效的训练成为可能。

Kimi K3 从 SFT 阶段开始就应用了量化感知训练,使用 MXFP4 权重和 MXFP8 激活以实现广泛的硬件兼容性。为防止专家不平衡在大型专家并行规模下降低吞吐量,我们引入了一种完全平衡的专家并行训练方法,该方法采用静态形状,并且在关键路径上无需主机同步。由于更大的高带宽通信域同样有利于推理效率,我们建议在包含 64 个或更多加速器的超级节点配置上部署 Kimi K3。最后,由于 KDA 对传统的提示词前缀缓存提出了新的挑战,我们已向 vLLM 社区贡献了相应的实现,该实现将与模型一同发布。结合预填充缓存的 KDA,使我们能够以极具竞争力的 token 价格提供 Kimi K3 服务,尽管其规模庞大且上下文很长。

更多技术细节将在我们即将发布的报告中提供。

可用性

  • Kimi K3 智能体:从您的移动应用商店下载或更新至最新的 Kimi 应用,适用于 iOS、Android 和 HarmonyOS,或访问 kimi.com。
  • 使用 Kimi K3:下载最新的 Kimi Work 桌面应用,版本 3.1.0 或更高,适用于 Windows 和 Apple silicon Mac。
  • 用 Kimi K3 编写代码:在终端中运行 Kimi Code,并通过 `/model` 命令选择 Kimi K3。
  • 通过 Kimi API 构建:访问 Kimi API 平台,选择 kimi-k3。定价为:缓存命中输入每百万 token 0.30 美元,缓存未命中输入每百万 token 3.00 美元,输出每百万 token 15.00 美元。基于 Mooncake 的解耦推理架构,官方 Kimi API 在编码工作负载中实现了超过 90% 的缓存命中率。
  • 将 Kimi 引入您的组织:Kimi 企业版提供企业级数据隐私和成员管理,个人账户与组织账户完全分离。访问定价页面,选择“获取 Kimi 企业版”为您的团队订阅。

完整基准测试表

脚注

以下报告的所有 Kimi K3 结果均在推理努力度设置为“最大”、温度参数设为 1.0、top-p 设为 1.0 的条件下获得。根据基准测试的不同,每个模型均在三种智能体框架之一(KimiCode、Claude Code 或 Codex)下进行评估,具体如下文注释所示。

编码基准测试

  1. DeepSWE。Kimi K3 使用 KimiCode 框架进行评估。GLM-5.2 的分数取自 GLM-5.2 发布博客(https://z.ai/blog/glm-5.2);其余所有分数均来自官方 DeepSWE 排行榜(https://deepswe.datacurve.ai/),在该排行榜中,Kimi K3 使用 mini-SWE-agent 框架取得了 67.3 分。我们报告的是 DeepSWE v1.1 任务的结果。
  2. Terminal-Bench 2.1。Kimi K3 使用 KimiCode 框架进行评估。对于所有其他模型,我们报告其在各框架下的最佳分数:GLM-5.2 使用 Claude Code(https://z.ai/blog/glm-5.2);Claude Opus 4.8 和 Claude Fable 5 使用 Terminus 2(https://artificialanalysis.ai/evaluations/terminalbench-v2-1);GPT 5.5 和 GPT 5.6 Sol 使用 Codex(https://openai.com/index/previewing-gpt-5-6-sol/)。
  3. Program Bench。Kimi K3 使用 KimiCode 框架进行评估。GLM-5.2 的分数来自 https://z.ai/blog/glm-5.2;所有其他分数来自 https://www.vals.ai/benchmarks/programbench。
  4. SWE Marathon。Kimi K3、Claude Opus 4.8 和 Claude Fable 5 使用 Claude Code 测试框架进行评估;GPT-5.6 Sol 使用 Codex 测试框架进行评估。GLM-5.2 的得分来自 https://z.ai/blog/glm-5.2。我们的评估基于官方 v1.1 任务(https://www.swe-marathon.org/)的一个 H20 校准分支:GPU 任务的 Docker 镜像、性能门限和参考预言已针对 H20 重新校准,而正确性和反作弊验证器保持不变。此外,Claude Fable 5 在我们的评估中有 35% 的任务触发了回退机制,这可能对其测量性能产生了负面影响。
  5. FrontierSWE。Kimi K3 使用 KimiCode 测试框架进行评估,GPT-5.6 Sol 使用 Codex 测试框架进行评估;所有其他结果来自 https://www.frontierswe.com/。优势得分是使用官方评估脚本根据原始得分重新计算的,数据截至 2026 年 7 月 16 日。
  6. PostTrain Bench。GLM-5.2、GPT-5.5 和 Claude Opus 4.8 的得分采用自官方 PostTrainBench(https://posttrainbench.com/)的结果。Kimi K3、Claude Fable 5 和 GPT-5.6 Sol 使用官方 Harbor 实现,在最大推理努力下进行评估,在 H20 GPU(而非官方设置中的 H100)上取三次运行的平均值——Kimi K3 和 Claude Fable 5 使用 Claude Code 测试框架,GPT-5.6 Sol 使用 Codex 测试框架。
  7. MLS Bench Lite。Kimi K3 使用 KimiCode 测试框架进行评估;GLM-5.2 和 Claude 系列模型使用 Claude Code 测试框架进行评估;GPT-5.5 和 GPT-5.6 Sol 使用 Codex 测试框架进行评估。
  8. KCB 2.0。Kimi K3 同时使用 KimiCode 和 Claude Code 测试框架进行评估;GLM-5.2、Claude Opus 4.8 和 Claude Fable 5 使用 Claude Code 测试框架进行评估;GPT-5.5 和 GPT-5.6 Sol 使用 Codex 测试框架进行评估。所有模型均在最大推理努力下进行评估,但 GPT-5.5 使用“xhigh”设置除外。我们还注意到,在这个内部基准测试中,有 10% 的任务进入了 GPT-5.6 Sol 的网络防护机制。

生产力与智能体基准测试

  1. 对于 OfficeQA Pro,每个测试用例向智能体提供完整的 PDF 语料库,所有 PDF 均以图像形式呈现,且没有机器可读的文本可用。
  2. OfficeQA Pro 和 SpreadsheetBench 2。Kimi K3、GLM-5.2、Claude Opus 4.8 和 Claude Fable 5 使用 Claude Code 测试框架进行评估;GPT 5.5 和 GPT 5.6 Sol 使用 Codex 测试框架进行评估。
  3. MCP Atlas。所有模型均在包含 500 个任务的公开子集上评估,限制 100 轮交互,使用 Gemini 3.1 Pro 作为评判模型。
  4. AutomationBench。所有模型均在包含 600 个任务的公开子集上评估,其他方面均遵循官方 GitHub 设置。
  5. BrowseComp。我们采用了 Claude 模型卡中使用的上下文压缩策略,该策略在达到 30 万 token 时触发。当使用 100 万 token 上下文窗口且不进行上下文管理时,Kimi K3 的得分为 90.4。Claude Fable 5、Claude Opus 4.8、GPT 5.6 Sol 和 GPT 5.5 的结果引自 https://www.anthropic.com/news/claude-fable-5-mythos-5 和 https://openai.com/index/gpt-5-6/。
  6. GDPval-AA v2 和 AA-Briefcase 的得分引自 https://artificialanalysis.ai/。

多模态基准测试

  1. 除 ZeroBench 遵循官方设置并运行五次外,所有多模态得分均为三次运行的平均值。MMMU-Pro 按照官方协议进行评估,保留原始输入顺序,并将图像前置到文本输入之前。
  2. PerceptionBench。PerceptionBench 是一个内部基准测试,专注于原子级视觉感知能力。

局限性

  1. 对思考历史的敏感性。K3 是在保留思考历史的模式下训练的。如果智能体测试框架未能按要求传回所有历史思考内容,或者将与其他模型进行中的会话切换到 K3,生成质量可能会变得非常不稳定。我们建议使用经过兼容性验证的测试框架(例如 Kimi Code),并避免在会话中途切换到 K3。
  2. 过度主动。K3 的训练特别强调长周期、高难度的任务。因此,当它在执行任务时遇到小问题或用户意图不明确的情况,可能会替用户做出意料之外的决策。如果你的应用要求智能体在明确定义的边界内运行,并避免过度即兴发挥,请在系统提示词或 AGENTS.md 中对 K3 施加更明确的行为约束。
  3. 尽管 K3 整体上是一个极具竞争力的模型,但在用户体验方面,它与 Claude Fable 5 和 GPT 5.6 Sol 相比仍存在明显差距。

来源:Moonshot AI:Kimi Blog· kimi.com