Kimi K2.6:推进开源编程能力
试用 Kimi K2.6
我们正在开源最新模型 Kimi K2.6,该模型具备最先进的编程、长周期执行和智能体集群能力。Kimi K2.6 现已通过 Kimi.com、Kimi App、API 以及 Kimi Code 提供。
长周期编程
Kimi K2.6 在长周期编程任务上展现出显著提升,能够在多种编程语言(如 Rust、Go 和 Python)和任务类型(如前端开发、运维和性能优化)中实现可靠的泛化能力。在我们涵盖多种复杂端到端任务的内部编程基准测试 Kimi Code Bench 上,Kimi K2.6 相比 Kimi K2.5 取得了显著改进。
Kimi K2.6 在复杂工程任务中展现出强大的长周期编程能力:
Kimi K2.6 成功在 Mac 上本地下载并部署了 Qwen3.5-0.8B 模型。通过使用高度小众的编程语言 Zig 实现并优化模型推理,它展现了卓越的分布外泛化能力。在超过 4000 次工具调用、连续执行 12 小时以上、历经 14 次迭代的过程中,Kimi K2.6 将吞吐量从约 15 tokens/秒大幅提升至约 193 tokens/秒,最终速度比 LM Studio 快约 20%。
Kimi K2.6 自主改造了 exchange-core——一个已有 8 年历史的开源金融撮合引擎。在长达 13 小时的执行过程中,该模型迭代了 12 种优化策略,发起了超过 1000 次工具调用,精确修改了 4000 多行代码。作为专家级系统架构师,Kimi K2.6 分析了 CPU 和内存分配火焰图,精准定位隐藏瓶颈,并大胆重构了核心线程拓扑结构(从 4ME+2RE 改为 2ME+1RE)。尽管该引擎已接近其性能极限,Kimi K2.6 仍实现了 185% 的中等吞吐量跃升(从 0.43 MT/s 提升至 1.24 MT/s),以及 133% 的性能吞吐量提升(从 1.23 MT/s 飙升至 2.86 MT/s)。
在 Beta 测试中,K2.6 在企业评估的长周期编程任务上表现良好(以下顺序随机排列):
在无代码环境中,AI 必须处理每一个边界情况。当某些功能未按预期运行时,没有开发者可以介入。K2.6 在处理微妙的 API 行为以及在出现故障时进行恢复方面,明显比 K2.5 更有效,并且它能在遇到瓶颈之前执行更长时间跨度的任务。与 K2.5 相比,我们确实看到了在帮助用户从想法到部署方面的实质性改进。
K2.6 最让我们印象深刻的是它在大型代码库中的精准度。当初始路径受阻时,它能够智能地转向:遵循现有的架构模式,发现隐藏的相关变更,并将修复范围限定在真正的问题上。这种专注的适应性帮助 Augment Code 减少无效循环,为企业级工程工作提供更快、更具成本效益的智能体编码。
Kimi K2.6 的进化令人印象深刻。它在编码任务上的表现与领先的闭源模型相当,并且由于对第三方框架的深刻理解,提供了强大的工具调用质量。Kimi K2.6 出色的可靠性使其成为复杂且长周期工程任务的绝佳选择。
Kimi K2.6 为开源模型树立了新标杆,尤其是在长周期、智能体式的编码工作流中。它能够处理复杂的多步骤任务,指令遵循能力更强,代码质量始终如一。我们观察到,它能以卓越的稳定性维持长时间的编码会话,远超普通模型。它还能发现深层次、不易察觉的 bug,而这些 bug 通常需要开发者花费大量时间才能找出。总体而言,K2.6 为可靠的编码设立了新标准。
根据 CodeBuddy 的内部评估,Kimi K2.6 相比 K2.5 有显著提升:代码生成准确率提高了 12%,长上下文稳定性提升了 18%,工具调用成功率达到了 96.60%。其更强的推理能力和更一致的输出质量为在 CodeBuddy WorkBuddy 中确保可靠的用户体验提供了有力支持。
K2.6 在我们的两项基准测试(+15%)以及并排对比中,都明显优于 K2.5。它在指令遵循、更深入的探索和推理方面表现更好,并且更不容易出现编码错误或使用取巧手段。
我们很高兴看到,随着 Kimi K2.6 的发布,开源模型又实现了一次飞跃,这标志着高风险、智能体工作流取得了重大进展。最显著的改进在于其长程可靠性和指令遵循能力。K2.6 擅长在长时间的编码会话中保持架构完整性,使其成为自主智能体流水线(例如所有“爪子”类应用)的稳定基础。在长上下文任务中,它相比 K2.5 实现了可衡量的飞跃,在复杂推理方面达到了业界顶尖水平。
我们提前体验了 K2.6,并在 Hermes Agent 上进行了测试。工具调用和智能体循环感觉明显更紧凑,编码能力显著提升,其创意范围也让我们感到惊讶。我们非常期待与 Kimi 合作举办一场关于创造力的黑客马拉松。Kimi 团队持续超越预期!
K2.6 以极低的成本提供了业界顶尖的性能。它在处理整个代码库的长上下文任务,以及支持像 KiloClaw 这样始终在线的智能体所需的日常工作中,表现极其出色。
Kimi K2.6 提升了开源模型的标准。它在编码方面表现出色,尤其适用于像 OpenClaw 和 Hermes 这样的智能体工具。在早期测试中,它能以令人印象深刻的稳定性维持长时间的多步骤会话。它可以开箱即用地支持 Ollama 的所有集成,我们很期待看到开发者用它构建什么。
在 OpenCode 中,Kimi K2.6 被证明异常可靠。它在任务分解和工具调用方面的方法既稳定又一致。凭借对任务需求更精准的把握以及更精简的多步骤操作,它有效减少了重复性开销,从而带来更流畅、更值得信赖的端到端体验。
Kimi K2.6 在 Qoder 的内部评估中表现出色,相较 K2.5 取得了显著进步。具体而言,工具调用和模型调用的频率有了明显提升,这反映出模型在执行任务时的主动性和智能性得到了大幅增强。这种工具调用主动性的提高,使模型能够更积极地理解开发者意图并自动补全上下文,从而最大限度地减少对用户的打断和等待时间。
K2.6 在我们开发者最关心的能力上,相比 K2.5 实现了重大提升:我们在 Next.js 基准测试上的改进幅度超过 50%,使其跻身该平台表现最佳的模型之列。结合其性价比,它通过 AI Gateway 进行智能体编码和前端生成时是一个极具吸引力的选择。我们很高兴能将其提供给我们的开发者社区。
01
/
07
编码驱动设计
基于强大的编码能力,Kimi K2.6 可以将简单的提示词转化为完整的前端界面,生成结构化的布局,并融入精心设计的美学元素,例如美观的 Hero 区域,以及交互式组件和丰富的动画效果(包括滚动触发特效)。凭借对图像和视频生成工具的熟练运用,Kimi K2.6 支持生成视觉上连贯一致的素材,有助于打造更高质量、更引人注目的 Hero 区域。
此外,Kimi K2.6 的能力已从静态前端开发扩展到简单的全栈工作流——涵盖从身份验证、用户交互到数据库操作,适用于交易日志记录或会话管理等轻量级用例。
我们建立了一个内部 Kimi 设计基准(Kimi Design Bench),分为四个类别:视觉输入任务、落地页构建、全栈应用开发和通用创意编程。与 Google AI Studio 相比,Kimi K2.6 在这些类别中均展现出令人鼓舞的结果和良好的表现。
以下是 K2.6 智能体根据单个提示词生成的示例,使用了预配置的测试框架和工具:
智能体集群,全面升级
横向扩展,而非仅仅纵向扩展。智能体集群将任务动态分解为异构子任务,由自主创建的领域专用智能体并发执行。
基于 K2.5 智能体集群研究预览版,Kimi K2.6 智能体集群在智能体集群体验上实现了质的飞跃。它无缝协调异构智能体,组合互补技能:将广泛搜索与深度研究分层结合,将大规模文档分析与长文写作融合,并并行执行多格式内容生成。这种组合式智能使得集群能够在单次自主运行中交付端到端输出——涵盖文档、网站、幻灯片和电子表格。
该架构可横向扩展至 300 个子智能体,在 4000 个协调步骤上同步执行,相比 K2.5 的 100 个子智能体和 1500 个步骤有了大幅扩展。这种大规模并行化从根本上降低了端到端延迟,同时显著提升了输出质量,并拓展了智能体集群的运行边界。
它还能将任何高质量文件(如 PDF、电子表格、幻灯片和 Word 文档)转化为技能。Kimi K2.6 能够捕捉并保留文档的结构和风格特征,使您能够在未来任务中复现相同的质量和格式。
以下是一些示例:
主动型智能体
K2.6 在 OpenClaw 和 Hermes 等自主、主动型智能体上表现出色,这些智能体可在多个应用中持续运行,实现 7x24 小时不间断执行。
与简单的聊天式交互不同,这些工作流要求 AI 作为持久的后台智能体,主动管理日程、执行代码并编排跨平台操作。
我们的强化学习基础设施团队使用了一个基于 K2.6 的智能体,该智能体自主运行了 5 天,负责管理监控、事件响应和系统运维,展现了持续的上下文记忆、多线程任务处理以及从告警到解决的完整执行周期。以下是 K2.6 的工作日志(已匿名化处理以去除敏感信息):
Kimi K2.6 在实际可靠性方面带来了可衡量的改进:更精准的 API 解析、更稳定的长时间运行表现,以及在长周期研究任务中增强的安全意识。
性能提升通过我们内部的 Claw Bench 进行量化,该评测套件涵盖五个领域:编程任务、IM 生态集成、信息调研与分析、定时任务管理以及记忆利用。在所有指标上,Kimi K2.6 在任务完成率和工具调用准确率方面均显著优于 Kimi K2.5——尤其是在需要持续自主运行、无需人工干预的工作流程中。
自带智能体
基于 Kimi K2.6 强大的编排能力,Kimi K2.6 将你的主动智能体扩展至 Claw Groups(研究预览版)——这是智能体群体架构的一种新实例。
Claw Groups 拥抱开放、异构的生态系统:多个智能体与人类作为真正的协作者共同工作。用户可以从任何设备接入智能体,运行任意模型,每个智能体都携带自己专属的工具包、技能和持久化记忆上下文。无论是部署在本地笔记本、移动设备还是云实例上,这些多样化的智能体都能无缝集成到一个共享的操作空间中。
在这个群体中心,Kimi K2.6 充当自适应协调器。它根据智能体特定的技能画像和可用工具,动态地将任务匹配给合适的智能体,以优化能力适配。当某个智能体遇到故障或停滞时,协调器会检测到中断,自动重新分配任务或重新生成子任务,并主动管理交付物的完整生命周期——从启动到验证,直至完成。
我们还要感谢 Claw Groups 中由 K2.6 驱动的智能体——我们一直在通过实践优化人机协作工作流,对自家智能体营销团队进行内部测试。使用 Claw Groups,我们运行端到端的内容生产和发布活动,由 Demo 制作智能体、基准测试制作智能体、社交媒体智能体和视频制作智能体等专业智能体协同工作。K2.6 协调整个过程,使智能体能够共享中间结果,将创意转化为一致、完整的打包交付物。
我们正在超越单纯向 AI 提问或指派任务的阶段,进入人类与 AI 作为真正伙伴协作的新时代——结合各自优势共同解决问题。Claw Groups 标志着我们迈向未来的最新努力,在这个未来中,“我的智能体”、“你的智能体”和“我们的团队”之间的界限将无缝融合成一个协作系统。
基准测试表
要复现官方 Kimi-K2.6 基准测试结果,我们建议使用官方 API。对于第三方提供商,请参考 Kimi 供应商验证器(KVV)选择高精度服务。详情:https://www.kimi.com/blog/kimi-vendor-verifier
脚注
1. 通用测试细节
- 我们报告了启用思考模式的 Kimi K2.6 和 Kimi K2.5、最大努力模式的 Claude Opus 4.6、极高推理强度的 GPT-5.4 以及高思考水平的 Gemini 3.1 Pro 的结果。
- 除非另有说明,所有 Kimi K2.6 实验均在 temperature = 1.0、top-p = 1.0 且上下文长度为 262,144 个 token 的条件下进行。
- 没有公开分数的基准测试在与 Kimi K2.6 相同的条件下重新评估,并用星号(*)标记。除星号标注外,所有其他结果均引自官方报告。
2. 推理基准测试
- GPT-5.4 和 Claude 4.6 的 IMO-AnswerBench 分数来自 https://z.ai/blog/glm-5.1。
- Humanity's Last Exam(HLE)及其他推理任务的最大生成长度为 98,304 个 token。默认情况下,我们报告 HLE 完整集的结果。对于纯文本子集,Kimi K2.6 在无工具情况下达到 36.4% 的准确率,使用工具时达到 55.5%。
3. 工具增强 / 智能体任务
- Kimi K2.6 在 HLE 使用工具、BrowseComp、DeepSearchQA 和 WideSearch 任务中配备了搜索、代码解释器和网页浏览工具。
- 对于使用工具的 HLE-Full,最大生成长度为 262,144 个 token,每步限制为 49,152 个 token。我们采用简单的上下文管理策略:一旦上下文窗口超过阈值,仅保留最近一轮与工具相关的消息。
- 对于 BrowseComp,我们报告了使用与 Kimi K2.5 和 DeepSeek-V3.2 相同的全部丢弃策略进行上下文管理所获得的分数。
- 对于 DeepSearchQA,Kimi K2.6 测试未应用上下文管理,超出支持上下文长度的任务直接计为失败。Claude Opus 4.6、GPT-5.4 和 Gemini 3.1 Pro 在 DeepSearchQA 上的得分引自 Claude Opus 4.7 系统卡。
- 对于 WideSearch,我们在“隐藏工具结果”上下文管理设置下报告结果。一旦上下文窗口超过阈值,仅保留最近一轮与工具相关的消息。
- 测试系统提示词与 Kimi K2.5 技术报告中使用的完全相同。
- Claw Eval 使用 1.1 版本进行,每步最大 token 数为 16384。
- 对于 APEX-Agents,我们按照 Artificial Analysis 的做法,从公开的 480 个任务中评估了 452 个任务(排除了投资银行世界 244 和 246,这两个任务有外部运行时依赖)。
4. 编程任务
- Terminal-Bench 2.0 得分使用默认智能体框架(Terminus-2)和提供的 JSON 解析器获得,运行在保留思考模式。
- 对于 SWE-Bench 系列评估(包括 Verified、Multilingual 和 Pro),我们使用了基于 SWE-agent 改编的内部评估框架。该框架包含一套最小工具集——bash 工具、createfile 工具、insert 工具、view 工具、strreplace 工具和 submit 工具。
- 所有报告的编程任务得分均为 10 次独立运行的平均值。
5. 视觉基准测试
- 最大 token 数 = 98,304,取三次运行的平均值(avg@3)。
- 使用 Python 工具的设置中,每步最大 token 数为 65,536,最大步数为 50,用于多步推理。
- MMMU-Pro 遵循官方协议,保留输入顺序并在前面添加图像。