# Kimi K2.6：推动开源编程发展

- 来源：Hacker News 热门（buzzing.cc 中文翻译）
- 作者：meetpateltech
- 发布时间：2026-04-21 00:46
- AIHOT 分数：81
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmo7g7qyi00x9slmlravypqnk
- 原文链接：https://www.kimi.com/blog/kimi-k2-6

## 精选理由

Kimi K2.6 把长程编程和 Agent Swarm 能力带到了开源模型里，那几个 12 小时自主优化、13 小时重构旧代码库的工程案例比基准表更有说服力，做 Agent 的可以认真看看。

## AI 摘要

Kimi发布K2.6版本，专注提升开源编程能力。新版本在代码生成与理解方面实现优化，发布后在Hacker News获得132个点赞。此次更新强化了Kimi在开发者工具领域的布局，通过改进编程辅助功能，为开源社区提供更高效的代码编写支持。

## 正文

Kimi K2.6：推进开源编程能力

试用 Kimi K2.6

我们正在开源最新模型 Kimi K2.6，该模型具备最先进的编程、长周期执行和智能体集群能力。Kimi K2.6 现已通过 Kimi.com、Kimi App、API 以及 Kimi Code 提供。

长周期编程

Kimi K2.6 在长周期编程任务上展现出显著提升，能够在多种编程语言（如 Rust、Go 和 Python）和任务类型（如前端开发、运维和性能优化）中实现可靠的泛化能力。在我们涵盖多种复杂端到端任务的内部编程基准测试 Kimi Code Bench 上，Kimi K2.6 相比 Kimi K2.5 取得了显著改进。

Kimi K2.6 在复杂工程任务中展现出强大的长周期编程能力：

Kimi K2.6 成功在 Mac 上本地下载并部署了 Qwen3.5-0.8B 模型。通过使用高度小众的编程语言 Zig 实现并优化模型推理，它展现了卓越的分布外泛化能力。在超过 4000 次工具调用、连续执行 12 小时以上、历经 14 次迭代的过程中，Kimi K2.6 将吞吐量从约 15 tokens/秒大幅提升至约 193 tokens/秒，最终速度比 LM Studio 快约 20%。

Kimi K2.6 自主改造了 exchange-core——一个已有 8 年历史的开源金融撮合引擎。在长达 13 小时的执行过程中，该模型迭代了 12 种优化策略，发起了超过 1000 次工具调用，精确修改了 4000 多行代码。作为专家级系统架构师，Kimi K2.6 分析了 CPU 和内存分配火焰图，精准定位隐藏瓶颈，并大胆重构了核心线程拓扑结构（从 4ME+2RE 改为 2ME+1RE）。尽管该引擎已接近其性能极限，Kimi K2.6 仍实现了 185% 的中等吞吐量跃升（从 0.43 MT/s 提升至 1.24 MT/s），以及 133% 的性能吞吐量提升（从 1.23 MT/s 飙升至 2.86 MT/s）。

在 Beta 测试中，K2.6 在企业评估的长周期编程任务上表现良好（以下顺序随机排列）：

在无代码环境中，AI 必须处理每一个边界情况。当某些功能未按预期运行时，没有开发者可以介入。K2.6 在处理微妙的 API 行为以及在出现故障时进行恢复方面，明显比 K2.5 更有效，并且它能在遇到瓶颈之前执行更长时间跨度的任务。与 K2.5 相比，我们确实看到了在帮助用户从想法到部署方面的实质性改进。

K2.6 最让我们印象深刻的是它在大型代码库中的精准度。当初始路径受阻时，它能够智能地转向：遵循现有的架构模式，发现隐藏的相关变更，并将修复范围限定在真正的问题上。这种专注的适应性帮助 Augment Code 减少无效循环，为企业级工程工作提供更快、更具成本效益的智能体编码。

Kimi K2.6 的进化令人印象深刻。它在编码任务上的表现与领先的闭源模型相当，并且由于对第三方框架的深刻理解，提供了强大的工具调用质量。Kimi K2.6 出色的可靠性使其成为复杂且长周期工程任务的绝佳选择。

Kimi K2.6 为开源模型树立了新标杆，尤其是在长周期、智能体式的编码工作流中。它能够处理复杂的多步骤任务，指令遵循能力更强，代码质量始终如一。我们观察到，它能以卓越的稳定性维持长时间的编码会话，远超普通模型。它还能发现深层次、不易察觉的 bug，而这些 bug 通常需要开发者花费大量时间才能找出。总体而言，K2.6 为可靠的编码设立了新标准。

根据 CodeBuddy 的内部评估，Kimi K2.6 相比 K2.5 有显著提升：代码生成准确率提高了 12%，长上下文稳定性提升了 18%，工具调用成功率达到了 96.60%。其更强的推理能力和更一致的输出质量为在 CodeBuddy WorkBuddy 中确保可靠的用户体验提供了有力支持。

K2.6 在我们的两项基准测试（+15%）以及并排对比中，都明显优于 K2.5。它在指令遵循、更深入的探索和推理方面表现更好，并且更不容易出现编码错误或使用取巧手段。

我们很高兴看到，随着 Kimi K2.6 的发布，开源模型又实现了一次飞跃，这标志着高风险、智能体工作流取得了重大进展。最显著的改进在于其长程可靠性和指令遵循能力。K2.6 擅长在长时间的编码会话中保持架构完整性，使其成为自主智能体流水线（例如所有“爪子”类应用）的稳定基础。在长上下文任务中，它相比 K2.5 实现了可衡量的飞跃，在复杂推理方面达到了业界顶尖水平。

我们提前体验了 K2.6，并在 Hermes Agent 上进行了测试。工具调用和智能体循环感觉明显更紧凑，编码能力显著提升，其创意范围也让我们感到惊讶。我们非常期待与 Kimi 合作举办一场关于创造力的黑客马拉松。Kimi 团队持续超越预期！

K2.6 以极低的成本提供了业界顶尖的性能。它在处理整个代码库的长上下文任务，以及支持像 KiloClaw 这样始终在线的智能体所需的日常工作中，表现极其出色。

Kimi K2.6 提升了开源模型的标准。它在编码方面表现出色，尤其适用于像 OpenClaw 和 Hermes 这样的智能体工具。在早期测试中，它能以令人印象深刻的稳定性维持长时间的多步骤会话。它可以开箱即用地支持 Ollama 的所有集成，我们很期待看到开发者用它构建什么。

在 OpenCode 中，Kimi K2.6 被证明异常可靠。它在任务分解和工具调用方面的方法既稳定又一致。凭借对任务需求更精准的把握以及更精简的多步骤操作，它有效减少了重复性开销，从而带来更流畅、更值得信赖的端到端体验。

Kimi K2.6 在 Qoder 的内部评估中表现出色，相较 K2.5 取得了显著进步。具体而言，工具调用和模型调用的频率有了明显提升，这反映出模型在执行任务时的主动性和智能性得到了大幅增强。这种工具调用主动性的提高，使模型能够更积极地理解开发者意图并自动补全上下文，从而最大限度地减少对用户的打断和等待时间。

K2.6 在我们开发者最关心的能力上，相比 K2.5 实现了重大提升：我们在 Next.js 基准测试上的改进幅度超过 50%，使其跻身该平台表现最佳的模型之列。结合其性价比，它通过 AI Gateway 进行智能体编码和前端生成时是一个极具吸引力的选择。我们很高兴能将其提供给我们的开发者社区。

01

/

07

编码驱动设计

基于强大的编码能力，Kimi K2.6 可以将简单的提示词转化为完整的前端界面，生成结构化的布局，并融入精心设计的美学元素，例如美观的 Hero 区域，以及交互式组件和丰富的动画效果（包括滚动触发特效）。凭借对图像和视频生成工具的熟练运用，Kimi K2.6 支持生成视觉上连贯一致的素材，有助于打造更高质量、更引人注目的 Hero 区域。

此外，Kimi K2.6 的能力已从静态前端开发扩展到简单的全栈工作流——涵盖从身份验证、用户交互到数据库操作，适用于交易日志记录或会话管理等轻量级用例。

我们建立了一个内部 Kimi 设计基准（Kimi Design Bench），分为四个类别：视觉输入任务、落地页构建、全栈应用开发和通用创意编程。与 Google AI Studio 相比，Kimi K2.6 在这些类别中均展现出令人鼓舞的结果和良好的表现。

以下是 K2.6 智能体根据单个提示词生成的示例，使用了预配置的测试框架和工具：

智能体集群，全面升级

横向扩展，而非仅仅纵向扩展。智能体集群将任务动态分解为异构子任务，由自主创建的领域专用智能体并发执行。

基于 K2.5 智能体集群研究预览版，Kimi K2.6 智能体集群在智能体集群体验上实现了质的飞跃。它无缝协调异构智能体，组合互补技能：将广泛搜索与深度研究分层结合，将大规模文档分析与长文写作融合，并并行执行多格式内容生成。这种组合式智能使得集群能够在单次自主运行中交付端到端输出——涵盖文档、网站、幻灯片和电子表格。

该架构可横向扩展至 300 个子智能体，在 4000 个协调步骤上同步执行，相比 K2.5 的 100 个子智能体和 1500 个步骤有了大幅扩展。这种大规模并行化从根本上降低了端到端延迟，同时显著提升了输出质量，并拓展了智能体集群的运行边界。

它还能将任何高质量文件（如 PDF、电子表格、幻灯片和 Word 文档）转化为技能。Kimi K2.6 能够捕捉并保留文档的结构和风格特征，使您能够在未来任务中复现相同的质量和格式。

以下是一些示例：

主动型智能体

K2.6 在 OpenClaw 和 Hermes 等自主、主动型智能体上表现出色，这些智能体可在多个应用中持续运行，实现 7x24 小时不间断执行。

与简单的聊天式交互不同，这些工作流要求 AI 作为持久的后台智能体，主动管理日程、执行代码并编排跨平台操作。

我们的强化学习基础设施团队使用了一个基于 K2.6 的智能体，该智能体自主运行了 5 天，负责管理监控、事件响应和系统运维，展现了持续的上下文记忆、多线程任务处理以及从告警到解决的完整执行周期。以下是 K2.6 的工作日志（已匿名化处理以去除敏感信息）：

Kimi K2.6 在实际可靠性方面带来了可衡量的改进：更精准的 API 解析、更稳定的长时间运行表现，以及在长周期研究任务中增强的安全意识。

性能提升通过我们内部的 Claw Bench 进行量化，该评测套件涵盖五个领域：编程任务、IM 生态集成、信息调研与分析、定时任务管理以及记忆利用。在所有指标上，Kimi K2.6 在任务完成率和工具调用准确率方面均显著优于 Kimi K2.5——尤其是在需要持续自主运行、无需人工干预的工作流程中。

自带智能体

基于 Kimi K2.6 强大的编排能力，Kimi K2.6 将你的主动智能体扩展至 Claw Groups（研究预览版）——这是智能体群体架构的一种新实例。

Claw Groups 拥抱开放、异构的生态系统：多个智能体与人类作为真正的协作者共同工作。用户可以从任何设备接入智能体，运行任意模型，每个智能体都携带自己专属的工具包、技能和持久化记忆上下文。无论是部署在本地笔记本、移动设备还是云实例上，这些多样化的智能体都能无缝集成到一个共享的操作空间中。

在这个群体中心，Kimi K2.6 充当自适应协调器。它根据智能体特定的技能画像和可用工具，动态地将任务匹配给合适的智能体，以优化能力适配。当某个智能体遇到故障或停滞时，协调器会检测到中断，自动重新分配任务或重新生成子任务，并主动管理交付物的完整生命周期——从启动到验证，直至完成。

我们还要感谢 Claw Groups 中由 K2.6 驱动的智能体——我们一直在通过实践优化人机协作工作流，对自家智能体营销团队进行内部测试。使用 Claw Groups，我们运行端到端的内容生产和发布活动，由 Demo 制作智能体、基准测试制作智能体、社交媒体智能体和视频制作智能体等专业智能体协同工作。K2.6 协调整个过程，使智能体能够共享中间结果，将创意转化为一致、完整的打包交付物。

我们正在超越单纯向 AI 提问或指派任务的阶段，进入人类与 AI 作为真正伙伴协作的新时代——结合各自优势共同解决问题。Claw Groups 标志着我们迈向未来的最新努力，在这个未来中，“我的智能体”、“你的智能体”和“我们的团队”之间的界限将无缝融合成一个协作系统。

基准测试表

要复现官方 Kimi-K2.6 基准测试结果，我们建议使用官方 API。对于第三方提供商，请参考 Kimi 供应商验证器（KVV）选择高精度服务。详情：https://www.kimi.com/blog/kimi-vendor-verifier

脚注

1. 通用测试细节

我们报告了启用思考模式的 Kimi K2.6 和 Kimi K2.5、最大努力模式的 Claude Opus 4.6、极高推理强度的 GPT-5.4 以及高思考水平的 Gemini 3.1 Pro 的结果。

除非另有说明，所有 Kimi K2.6 实验均在 temperature = 1.0、top-p = 1.0 且上下文长度为 262,144 个 token 的条件下进行。

没有公开分数的基准测试在与 Kimi K2.6 相同的条件下重新评估，并用星号（*）标记。除星号标注外，所有其他结果均引自官方报告。

2. 推理基准测试

GPT-5.4 和 Claude 4.6 的 IMO-AnswerBench 分数来自 https://z.ai/blog/glm-5.1。

Humanity's Last Exam（HLE）及其他推理任务的最大生成长度为 98,304 个 token。默认情况下，我们报告 HLE 完整集的结果。对于纯文本子集，Kimi K2.6 在无工具情况下达到 36.4% 的准确率，使用工具时达到 55.5%。

3. 工具增强 / 智能体任务

Kimi K2.6 在 HLE 使用工具、BrowseComp、DeepSearchQA 和 WideSearch 任务中配备了搜索、代码解释器和网页浏览工具。

对于使用工具的 HLE-Full，最大生成长度为 262,144 个 token，每步限制为 49,152 个 token。我们采用简单的上下文管理策略：一旦上下文窗口超过阈值，仅保留最近一轮与工具相关的消息。

对于 BrowseComp，我们报告了使用与 Kimi K2.5 和 DeepSeek-V3.2 相同的全部丢弃策略进行上下文管理所获得的分数。

对于 DeepSearchQA，Kimi K2.6 测试未应用上下文管理，超出支持上下文长度的任务直接计为失败。Claude Opus 4.6、GPT-5.4 和 Gemini 3.1 Pro 在 DeepSearchQA 上的得分引自 Claude Opus 4.7 系统卡。

对于 WideSearch，我们在“隐藏工具结果”上下文管理设置下报告结果。一旦上下文窗口超过阈值，仅保留最近一轮与工具相关的消息。

测试系统提示词与 Kimi K2.5 技术报告中使用的完全相同。

Claw Eval 使用 1.1 版本进行，每步最大 token 数为 16384。

对于 APEX-Agents，我们按照 Artificial Analysis 的做法，从公开的 480 个任务中评估了 452 个任务（排除了投资银行世界 244 和 246，这两个任务有外部运行时依赖）。

4. 编程任务

Terminal-Bench 2.0 得分使用默认智能体框架（Terminus-2）和提供的 JSON 解析器获得，运行在保留思考模式。

对于 SWE-Bench 系列评估（包括 Verified、Multilingual 和 Pro），我们使用了基于 SWE-agent 改编的内部评估框架。该框架包含一套最小工具集——bash 工具、createfile 工具、insert 工具、view 工具、strreplace 工具和 submit 工具。

所有报告的编程任务得分均为 10 次独立运行的平均值。

5. 视觉基准测试

最大 token 数 = 98,304，取三次运行的平均值（avg@3）。

使用 Python 工具的设置中，每步最大 token 数为 65,536，最大步数为 50，用于多步推理。

MMMU-Pro 遵循官方协议，保留输入顺序并在前面添加图像。
