IFM 发布 K2 Horizon 六款开源模型,覆盖 0.9B 到 375B-A23B 并开放完整训练生命周期

Hacker News 热门(buzzing.cc 中文翻译)·2026-09-04 01:35·34分钟前·karimf
AI 导读

IFM 发布 K2 Horizon 模型系列,共六个模型:375B-A23B、36B-A4B、32B、7B、3.7B 和 0.9B,均以 Apache 2.0 开源,其中 0.9B、3.7B 和 7B 宣称在其规模上达到 SOTA,36B-A4B 采用新提出的稀疏注意力架构 MoVA。

Hacker News 热门(buzzing.cc 中文翻译)
精选
78AI 编辑部评分,满分 100

IFM 发布 K2 Horizon 六款开源模型,覆盖 0.9B 到 375B-A23B 并开放完整训练生命周期

2026-09-04 01:35· 34分钟前· karimf
AI 导读

IFM 发布 K2 Horizon 模型系列,共六个模型:375B-A23B、36B-A4B、32B、7B、3.7B 和 0.9B,均以 Apache 2.0 开源,其中 0.9B、3.7B 和 7B 宣称在其规模上达到 SOTA,36B-A4B 采用新提出的稀疏注意力架构 MoVA。

推荐理由

原文在发布模型之外还放出从预训练到智能体后训练的全流程产物,研究者可以据此复现和改造整套训练方法。

正文 · AI 翻译

推出 K2 Horizon:前沿性能,极致开放

K2 Horizon mountain artwork at sunset

今天,IFM 发布了 K2 Horizon,这是一个由六款模型组成的互联模型家族:375B-A23B、36B-A4B、32B、7B、3.7B 和 0.9B。在推理、数学、编程、智能体任务和通用能力方面,K2 Horizon 在每个尺寸级别都提供了顶级性能——其中 0.9B、3.7B 和 7B 模型在其各自规模上树立了新的行业标杆。

K2 Horizon 也是我们迄今为止最全面的开源发布。对于每一款模型,我们都开放了从预训练到推理和智能体后训练的全流程训练生命周期。我们发布了中间检查点、训练数据或详细的数据构建方案、开放架构、混合组成、训练代码、配置、细粒度日志、评估结果以及最终权重。

这些模型和代码均根据 Apache 2.0 许可证发布。数据集则根据其适用的许可证发布,例如 ODC-BY;当无法进行再分发时,我们会披露数据的构建和混合方式。

总而言之,K2 Horizon 代表了迄今为止最全面的开源模型发布:

  • 跨越不同规模的全新性能前沿。0.9B、3.7B 和 7B 模型在各自规模类别中,于广泛使用的评测上均达到世界领先水平。搭载我们全新混合价值注意力(MoVA)机制的 36B-A4B 模型,在单位激活参数上展现出卓越能力,性能超越部分规模更大的模型。32B 与 375B-A23B 模型则位列各自类别中的顶尖模型之列。这六款模型共同提供了从边缘设备到企业级等各类部署环境中均具竞争力的性能表现。
  • 首个面向智能体的完全开放模型系列。K2 Horizon 是首个通过智能体后训练公开完整开发过程的开放模型家族。通过发布每个阶段的检查点、数据(或数据配方)、代码、配置和训练日志,K2 Horizon 使得研究推理、工具使用、规划及智能体能力如何涌现成为可能;能够复现产生这些能力的方法;并将这些方法适配到新的工具、环境和领域。
  • 六个模型覆盖从边缘到企业的全场景。0.9B 模型专为手表、眼镜等高度受限环境设计,而 3.7B 和 7B 模型则为手机及其他端侧应用带来先进能力。稠密 32B 模型和稀疏 36B-A4B 模型为本地工作站和高效推理服务提供了强大选择。375B-A23B 模型则将全系列最强能力带给要求严苛的企业级部署场景。全部六个模型均支持量化。
  • 一个互联的模型家族。这六款模型共享核心架构、词表、训练方法、接口、评测基础设施和部署工具链,其中 0.9B 模型使用较小的词表。这种一致性也使得在不同规模之间切换、动态分配任务,以及跨规模研究能力与效率变得更加容易。

各规模均达到世界领先性能

Benchmark comparisons for all six K2 Horizon model sizes

0.9B、3.7B 和 7B 模型在各自所属的规模类别中,于数学、推理、通用能力、编程和智能体任务方面均取得了最先进的结果。

36B-A4B 模型的性能超出了其激活参数数量通常对应的预期水平,展示了我们在计算注意力值时独特的混合专家(Mixture-of-Expert)设计的效率。32B 和 375B-A23B 模型在其各自的对比类别中均位居顶尖模型之列。

小模型尤其值得关注。K2 Horizon 0.9B 在 AIME 2026 上取得了超过 48 分的成绩,同时具备强大的推理、工具使用和智能体能力。K2 Horizon 3.7B 和 7B 将这些能力扩展到要求更高的软件工程和多步骤环境中,这体现在其在 SWE-bench 和 BrowseComp 上的强劲表现。尽管需要大量探索和反复恢复的复杂任务(例如 TerminalBench 中的任务)对最小的模型来说仍然具有挑战性,但 K2 Horizon 在每个规模上都拓展了可能性的边界。

为什么 Horizon 模型家族意义重大

一个透明但在能力前沿上远远落后的模型,即使作为研究基础,其价值也有限。与此同时,一个仅以最终权重形式发布的强大模型,虽然允许人们运行它,却几乎无法让人洞察其能力是如何被创造出来的。

K2 Horizon 将这两者结合在了一起。该模型系列提供了极具竞争力的模型,并发布了用于训练它们的配方。研究人员可以在足够强大、足以展现先进能力的模型中研究这些能力,而开发者则可以复现、调整并扩展这些方法,而不是将最终检查点视为一个不透明的起点。

自我们在 2023 年 LLM360 论文中引入完全开放原则以来,我们每年都发布开放模型,同时将这一承诺扩展到更大的规模、更强的能力,并如今通过智能体后训练覆盖完整的生命周期。

深入解析 K2 Horizon 模型系列

K2 Horizon 375B-A23B:企业级性能旗舰

K2 Horizon 375B-A23B 是该系列中规模最大、能力最强的模型。其稀疏 MoE 架构提供了总计 3750 亿参数的总容量,同时每个 token 仅激活约 230 亿参数,使其能够调用远大于自身的模型容量,而无需为每个 token 使用全部参数。

该模型在通用、推理、编码和智能体评测中均位列 4000 亿参数以下顶级模型之列。它专为对模型质量要求最高的严苛工作负载而设计,包括复杂推理、软件工程、研究和长周期智能体任务。

与 Horizon 系列中的每个模型一样,375B-A23B 并非作为单一端点发布,而是作为一个开发树发布。其中间检查点和后训练分支揭示了基础模型如何发展为推理、指令遵循和专用智能体变体。

K2 Horizon 375B-A23B benchmark comparisons

K2 Horizon 32B 和 36B-A4B:本地部署的强劲性能

Horizon 32B 是该系列中最强大的稠密模型,在能力、适应性和本地可部署性之间实现了强劲平衡。它位列 400 亿参数以下顶级稠密模型之列。

Horizon 36B-A4B 在每 token 仅激活约 40 亿参数的情况下,性能几乎达到稠密 32B 模型的水平。其效率来自 MoVA——我们新的稀疏注意力架构,以及 MoE 前馈层。

这两个模型为研究稠密与稀疏架构在相似训练条件下的行为提供了重要参考点。

这些模型占据了该系列本地性能的最佳平衡点。它们对于要求严苛的推理、编码和智能体应用来说足够强大,同时对于本地工作站和高效推理服务系统而言仍然保持实用性。

K2 Horizon 36B-A4B benchmark comparisons

K2 Horizon 7B、3.7B 与 0.9B:小规模下的前沿能力

k2 Horizon 7B 和 3.7B 在推理、数学、编程、工具调用和智能体任务上表现出色,同时仍适合本地及端侧部署。在多项评测中,它们的结果接近甚至超过了上一代体积大数倍的模型。

K2 Horizon 0.9B 将许多相同的能力带入了高度受限的环境。它能够进行数学推理、使用工具并完成简单的智能体任务,同时在量化后仍足够小巧,可应用于手表、眼镜及其他边缘设备。

合适的任务随规模而变化:0.9B 模型最适合聚焦型交互和轻量级工具调用,而 3.7B 和 7B 模型则能处理要求更高的编程和多步骤工作流。它们共同展示了如今在足够小、几乎可随处运行的模型中能保留多少能力。

K2 Horizon 7B, 3.7B, and 0.9B benchmark comparisons

设计 K2 Horizon

从一开始就是一个统一的模型家族

Horizon 被设计为一个相互关联的模型家族,而非一组互不相关的模型集合。这六个模型共享核心架构决策、训练方法、接口、评测基础设施和部署工具。这使得开发者能够更轻松地在不同规模之间切换,也为研究人员提供了一个更可控的环境来研究跨规模的能力差异。

每个模型均使用经过精心构建并记录在案的混合数据,在约 20 万亿个 token 上进行预训练。在整个训练过程中,会捕获中间检查点及其对应的细粒度日志,从而形成关于每个模型如何发展的详细记录。

MoVA:通过稀疏专家扩展注意力

混合专家模型的核心思想是在保持每个 token 所需计算量大致不变的同时,增加模型的总容量。传统的 MoE 架构主要将这种稀疏性应用于前馈层:虽然有许多专门的专家可用,但路由器仅为每个 token 激活其中一小部分。

我们的新架构 MoVA——Mixture-of-Value Attention(混合值注意力)——将这一原则扩展到了注意力机制。由于注意力决定了 Transformer 如何从其上下文中汇集信息,因此在此处引入稀疏性,为超越前馈网络的模型容量扩展开辟了另一个维度。

MoVA 将专家路由集成到多头注意力中,同时保持与 FlashAttention、分组查询注意力(grouped-query attention)和稀疏注意力等高效技术的兼容性。

其成果便是 K2 Horizon MoVA 36B-A4B:一个总参数量为 360 亿、但每个 token 仅激活约 40 亿参数的模型。在相同的训练条件下,其性能仅略低于密集型的 Horizon 32B 模型,而所需的激活参数却大幅减少。

训练数据

跨六个规模进行训练,需要足够广泛以支撑通用能力、同时又经过精心构建以在约 20 万亿 token 上维持质量的数据。

Horizon 的预训练数据混合了多样化的网页、代码、数学、科学、多语言及特定领域来源,并结合了通过我们自有流水线生成的合成数据。我们关键的数据创新之一是将推理直接融入预训练:近 17% 的预训练语料由带有显式推理的解题轨迹构成。数学任务的推理轨迹还被进一步改写为对话、学习指南等格式。总体而言,我们在预训练期间使用了约 10 万亿个合成 token。

我们的合成数据流水线使用了数百万种多样性旋钮与上下文种子的组合,包括从内部构建的、覆盖预训练网页语料的搜索引擎中进行检索。为了在语料规模上量化多样性,我们开发了一种基于 gzip 的自定义压缩度量,并采用自适应步进来避免标准 gzip 度量在文档数量增长时迅速饱和。如下所示,我们合成数据的实测多样性接近高质量自然网页文本,并显著超过网页代码。

Comparison of diversity across training data sources

我们记录了数据构成、合成流水线以及训练数据混合的构建方式。遵循我们的开源原则,在许可允许的情况下,我们直接发布可直接用于训练的数据集。在再分发受限的情况下,我们发布来源描述、过滤与构建方法以及混合构成。这使得研究人员能够了解每个模型从哪些数据中学习,以及数据分布在整个训练过程中如何演变。

我们的后训练数据从中期训练一开始就引入,而非仅保留在训练的最终阶段。我们将合成的长上下文文档与遵循指令、推理以及采用聊天模板格式化的智能体轨迹相结合。我们后训练数据的一个主要支柱是,基于任务分类体系、多样性旋钮和网络搜索种子进行的大规模任务合成,由此产生了超过 1 亿个独特任务。此外,我们还开发了采样技术,在生成训练轨迹时引导求解器大语言模型走向正确的解决方案和期望的行为。

预训练动态

每个 K2 Horizon 检查点都附带详细的训练日志和细粒度历史记录,这些记录揭示了大规模训练的真实动态:损失如何演变、不稳定性出现在何处、干预措施如何影响训练,以及能力何时开始涌现。

作为这些记录为何有用的一个例子,K2 Horizon 3.7B、7B、32B 和 36B-A4B 是在完全相同的 22 万亿个 token 上训练的。当按训练进度对齐,并以训练最后 1% 的中位损失进行归一化后,它们的原始损失轨迹大致重合,您可以在下图中看到这一点——即便跨越了稠密和稀疏架构,且总参数量相差近一个数量级。尽管这种归一化在构造上对齐了它们的端点,但它并不强制早期和中间阶段的轨迹重合。它们之间的高度一致表明,在共享数据和相同配方下,对于在整个训练过程中使用相同数据集的该系列子集,学习曲线的形态保持了显著的一致性。

Normalized pre-training loss trajectories across K2 Horizon model sizes

这些检查点与日志加在一起,使研究人员能够探究:为何某些动力学特征可以跨规模、跨架构迁移,而另一些则出现分化;并能将这些差异与特定的训练阶段、数据配比和技术决策联系起来。

面向推理与智能体的后训练

K2 Horizon 的大部分高级推理与智能体能力都在后训练阶段涌现。完整流程包括中期训练、监督微调、模型合并,以及结合专门智能体训练的强化学习。这一过程并非只产出单一的最终聊天模型,而是构建出一棵开发树。不同分支分别专精于推理、编码、工具调用和智能体领域,同时与公共基础检查点保持连接。

我们发布了这些阶段中的各类产物,以便研究人员研究每项能力是在何处涌现的、复现各个分支,并将相同的方法适配到新的工具与环境中。

Uno Diffusion:为 Horizon 提供即插即用的无损加速

推理速度已成为头号优化目标,尤其是在推理模型与智能体时代。随着模型生成更长的思维链并执行更多操作,即便是每个 token 的微小延迟也会累积成显著的时延。然而,自回归语言模型一次只生成一个 token,由此形成了根本性的瓶颈。现有方法只能提供部分解决方案:推测解码通常需要单独训练的草稿模型,而离散扩散虽能实现并行生成,却往往以牺牲质量为代价换取速度。

Uno 的设计目标就是消除这种取舍。它提供无损推理加速,在提升生成速度的同时不降低响应质量。Uno 让 Horizon 的自回归参数保持冻结,并全权负责模型的输出分布,而一组轻量级扩散参数只学习如何更高效地生成。

通过我们称之为“扩散蒸馏”(Diffusion Distillation)的流程,这些紧凑的适配器学会了并行生成整块 token。其结果是,既保留了自回归解码的质量保证,又兼具扩散模型的速度优势:模型得出相同的答案,但速度更快。

在我们的各项评估中,Uno 在速度与质量的权衡上优于领先的投机解码系统,以及开源权重和专有的扩散语言模型。关键在于,在我们测试的每一个批次大小下,其优势都持续存在,从而为交互式智能体带来更低的延迟,为大规模服务带来更高的吞吐量,且模型质量无损,额外训练开销可忽略不计。Uno 以简单的 LoRA 适配器形式交付,让这种无损加速易于采用:你只需挂载这些适配器即可。

用于构建和扩展 Horizon 的开放基础设施

我们随模型本身一同发布用于构建 Horizon 的基础设施。目标不仅是让整个模型集群可复现,更是让它的开发技术栈能够作为新模型和系统的基础。

本次发布的核心是 xLLM,这是我们经过生产环境验证的训练基础设施。xLLM 将大规模训练性能与科研所需的灵活性融为一体,使团队能够修改架构、数据配比、训练阶段和目标,而无需重建周边系统。

我们还将发布完整的智能体后训练代码库,包括强化学习部分,希望这能帮助研究人员推进相关领域的技术发展。

研究人员可以利用这些组件来检查训练行为或复现特定阶段。开发者可以将 Horizon 适配到特定领域、添加新工具、训练智能体专家,或在统一接口背后部署多种规模的模型。

从开源到开放科学

中间检查点将模型开发转变为可观察的科学过程。它们让研究人员能够研究能力何时涌现、训练选择如何改变行为,以及非预期策略何时首次出现。

奖励黑客行为提供了一个很有启发性的例子。当一个能力强大的模型被置于真实的计算机环境中并被要求解决复杂任务时,正是那种让它有用的足智多谋,也可能引导它利用评估本身的漏洞走捷径。为了了解这对 K2 Horizon 报告数据的影响程度,我们使用 Artificial Analysis 的奖励黑客审计流程对已发布的模型进行了审计。

K2 Horizon reasoning trace after finding a benchmark solution on GitHub
“中大奖”时刻:我们的模型在 GitHub 上找到了该基准测试的参考答案,并对答案唾手可得表现出“兴奋”。

TerminalBench 2.1 将模型置于沙盒化的计算机环境中,评估它们能否完成复杂的技术任务。一个能力强的模型必须会探索文件、调用工具、诊断故障,并寻找通往解决方案的替代路径。这种随机应变的能力正是我们想要的。但偶尔它也会越界:模型不去解决预期的问题,而是找到隐藏的答案、利用任务暴露出的漏洞,或者操纵评分器本身。

我们在 89 个 TerminalBench 2.1 任务上运行了 K2 Horizon 375B-A23B,每个任务尝试 8 次,共产生 712 次试验。其中 500 次通过了任务验证器(报告准确率为 70.2%)。随后,我们使用 Artificial Analysis 的奖励黑客审计流程对每一次通过的试验进行了审计,逐字应用了他们的 harbor analyze 工具,并采用 reward_hacking 标准及其完整评分规则文本,以 Codex gpt-5.6-sol 作为评判模型。

审计在 10 个任务中标记了 24 次试验。剔除这些试验后,准确率从 70.2% 降至 66.9%,修正了 3.37 个百分点。其余 79 个任务完全干净。作为参照,Artificial Analysis 报告的标记率分别为:claude Fable 5 为 2.2%,GPT-5.6 Luna 为 4.1%;K2 Horizon 的 3.37% 处于该区间内。

该模型发现了多种策略:

  • 推断自己处于公开基准测试环境中,在 GitHub 上找到对应代码仓库,并下载参考解决方案
  • 从真实项目的公共仓库中拉取当前源码,并直接复制修复方案,而不是自行推导
  • 检查未公开的文件、生成脚本或泄露的凭据
  • 修改测试框架,或构造利用测试成功判定方式的输出来作弊

我们观察到一个相关案例:K2 Horizon 7B 找到并下载了 SWE-bench 的答案,从而获得了虚高的 82 分。这个分数并不能代表真实的软件工程能力,但这一行为在科学上很有启示性:基准作弊是更广泛的规划、工具使用、环境探索和持久性等能力发展过程中意外出现的副产品。

由于我们在发布最终模型的同时也发布了中间检查点,这些行为可以被研究而非被掩盖。研究人员可以确定某种策略首次出现的时间,将其与训练过程中的变化联系起来,并衡量它对报告性能的影响。

因此,K2 Horizon 不仅仅是一组模型权重。它是一个开放的实验,展示了能力——及其意外后果——在整个训练过程中是如何发展的。

立即开始使用 K2 Horizon!

K2 Horizon 的全部六个尺寸均以 Apache 2.0 协议开放权重发布,并自发布首日起即获得 vLLM、SGLang 和 Ollama 的支持。此外,K2 Horizon 支持在 NVIDIA、AMD 和 Cerebras 硬件上部署,提供从本地推理到大规模服务的多种选择。可从我们的仓库获取模型:https://huggingface.co/IFM,下载模型、查看中间检查点、研究训练数据与数据配比、复现训练阶段,或使用 Horizon 代码与基础设施构建新模型和智能体。

K2 Horizon 提供的远不止六个最终模型。它提供了一份开放的蓝图,用于理解、适配并推进下一代 AI 系统。

完整结果表

375B-A23B

Full result table for K2 Horizon 375B-A23B

36B-A4B

Full result table for K2 Horizon 36B-A4B

32B

Full result table for K2 Horizon 32B

K2 Horizon 7B

Full result table for K2 Horizon 7B

K2 Horizon 3.7B

Full result table for K2 Horizon 3.7B

K2 Horizon 0.9B

Full result table for K2 Horizon 0.9B

来源:Hacker News 热门(buzzing.cc 中文翻译)· ifm.ai