Hugging Face:Blog(RSS)
精选
71AI 编辑部评分,满分 100

JetBrains 发布 Mellum2:12B 参数混合专家模型

2026-06-01 23:45· 68天前
AI 导读

Mellum2 是 JetBrains 从头训练的 12B 参数混合专家(MoE)模型,专注于自然语言与代码。每个 token 仅激活 2.5B 参数,推理速度可达同类模型的 2 倍以上,适合高吞吐、低延迟场景。该模型支持路由、RAG、摘要、子智能体及私有部署,以 Apache 2.0 许可证开源。在代码生成、推理、科学和数学基准测试中,Mellum2 与同等规模的开放模型竞争力相当。

推荐理由

JetBrains 开源了 Mellum2,一个激活参数仅 2.5B 的 12B MoE 模型,专为代码和问答管道设计的快模型。做实时 RAG 或子代理时,终于不用硬扛大模型了。

正文 · AI 翻译
  • Mellum2 是一个 120 亿参数的混合专家模型,基于自然语言和代码从零开始训练。
  • 该模型每个 token 仅激活 25 亿参数,因此在高吞吐、低延迟推理场景中效率极高。Mellum2 可用于路由、RAG、摘要、子智能体、高吞吐代码功能以及私有化部署。
  • 它基于 Apache 2.0 许可证发布。
  • 与同类规模的模型相比,Mellum2 在提供具有竞争力的基准性能的同时,推理速度提升超过 2 倍。
  • 在 Hugging Face 下载模型:https://huggingface.co/collections/JetBrains/mellum-2
  • 有关架构细节、训练设置、基准测试和评估方法,请阅读完整技术报告:https://arxiv.org/pdf/2605.31268

今天,我们发布了 Mellum2,这是一个针对低延迟文本与代码工作负载优化的开源混合专家模型。Mellum 最初是一个代码补全模型。在 Mellum2 中,我们将这一基础扩展到更广泛的自然语言和软件工程任务,同时保持模型专注于高效推理和可部署性。现代 AI 系统越来越依赖多次模型调用:路由、检索、摘要、规划、验证和工具使用。其中许多操作对延迟敏感,且不需要使用最大的可用模型。Mellum2 正是针对这些工作负载而设计。

基准测试亮点

在我们的技术报告中,我们在代码生成、推理、科学和数学基准测试上对 Mellum2 进行了评估。Mellum2 与同等规模的开源模型相比具有竞争力,同时推理速度提升超过 2 倍,使其适用于高吞吐的生产工作负载。模型架构 Mellum2 是一个混合专家模型:

模型 总参数量 每个 token 的激活参数量 模态 许可证
Mellum2 120 亿 25 亿 文本和代码 Apache 2.0

MoE 架构在保持模型总容量较高的同时,仅为每个 token 激活一部分参数。这使得推理更高效,并有助于降低实时工作负载的部署成本。Mellum2 有意专注于文本和代码,而非多模态任务。这种专业化设计使模型保持紧凑,并针对软件工程工作负载进行了优化。

关键用例

路由与编排

Mellum2 在多模型系统中作为轻量级路由与编排模型表现出色,涵盖提示词分类、工具选择以及中间控制流步骤。

RAG 流水线

该模型非常适合对延迟敏感的检索流水线,包括上下文压缩、摘要生成以及检索后处理。

子智能体

Mellum2 可用于智能体子任务,例如规划、验证、转换和上下文准备,从而减少在中间操作中调用更大模型的需求。

私有化部署

由于 Mellum2 是开放且高效的模型,它可以部署在涉及专有代码或内部数据的自托管环境中。

为什么范围明确的模型很重要

随着 AI 系统日趋成熟,最高效的架构正变得不再那么单一。单个前沿模型固然强大,但生产系统通常需要多个专业化组件协同工作:检索器、路由器、代码感知模型、验证器、工具调用器以及更大的推理模型。我们将 Mellum2 视为一个“焦点”模型:一个快速、范围明确、针对大型 AI 系统内高频任务进行优化的模型。其目标并非取代系统中的每一个模型,而是让整个系统更快、更便宜、更易于控制。

Mellum2 入门指南

如果你正在为软件工程构建 AI 系统——无论是在 IDE 内部、RAG 流水线中、作为智能体工作流的一部分,还是在私有基础设施上——Mellum2 都值得一试。

来源:Hugging Face:Blog(RSS) · huggingface.co

JetBrains 发布 Mellum2:12B 参数混合专家模型

Hugging Face:Blog(RSS)·2026-06-01 23:45·68天前
AI 导读

Mellum2 是 JetBrains 从头训练的 12B 参数混合专家(MoE)模型,专注于自然语言与代码。每个 token 仅激活 2.5B 参数,推理速度可达同类模型的 2 倍以上,适合高吞吐、低延迟场景。该模型支持路由、RAG、摘要、子智能体及私有部署,以 Apache 2.0 许可证开源。在代码生成、推理、科学和数学基准测试中,Mellum2 与同等规模的开放模型竞争力相当。

正文 · AI 翻译
  • Mellum2 是一个 120 亿参数的混合专家模型,基于自然语言和代码从零开始训练。
  • 该模型每个 token 仅激活 25 亿参数,因此在高吞吐、低延迟推理场景中效率极高。Mellum2 可用于路由、RAG、摘要、子智能体、高吞吐代码功能以及私有化部署。
  • 它基于 Apache 2.0 许可证发布。
  • 与同类规模的模型相比,Mellum2 在提供具有竞争力的基准性能的同时,推理速度提升超过 2 倍。
  • 在 Hugging Face 下载模型:https://huggingface.co/collections/JetBrains/mellum-2
  • 有关架构细节、训练设置、基准测试和评估方法,请阅读完整技术报告:https://arxiv.org/pdf/2605.31268

今天,我们发布了 Mellum2,这是一个针对低延迟文本与代码工作负载优化的开源混合专家模型。Mellum 最初是一个代码补全模型。在 Mellum2 中,我们将这一基础扩展到更广泛的自然语言和软件工程任务,同时保持模型专注于高效推理和可部署性。现代 AI 系统越来越依赖多次模型调用:路由、检索、摘要、规划、验证和工具使用。其中许多操作对延迟敏感,且不需要使用最大的可用模型。Mellum2 正是针对这些工作负载而设计。

基准测试亮点

在我们的技术报告中,我们在代码生成、推理、科学和数学基准测试上对 Mellum2 进行了评估。Mellum2 与同等规模的开源模型相比具有竞争力,同时推理速度提升超过 2 倍,使其适用于高吞吐的生产工作负载。模型架构 Mellum2 是一个混合专家模型:

模型 总参数量 每个 token 的激活参数量 模态 许可证
Mellum2 120 亿 25 亿 文本和代码 Apache 2.0

MoE 架构在保持模型总容量较高的同时,仅为每个 token 激活一部分参数。这使得推理更高效,并有助于降低实时工作负载的部署成本。Mellum2 有意专注于文本和代码,而非多模态任务。这种专业化设计使模型保持紧凑,并针对软件工程工作负载进行了优化。

关键用例

路由与编排

Mellum2 在多模型系统中作为轻量级路由与编排模型表现出色,涵盖提示词分类、工具选择以及中间控制流步骤。

RAG 流水线

该模型非常适合对延迟敏感的检索流水线,包括上下文压缩、摘要生成以及检索后处理。

子智能体

Mellum2 可用于智能体子任务,例如规划、验证、转换和上下文准备,从而减少在中间操作中调用更大模型的需求。

私有化部署

由于 Mellum2 是开放且高效的模型,它可以部署在涉及专有代码或内部数据的自托管环境中。

为什么范围明确的模型很重要

随着 AI 系统日趋成熟,最高效的架构正变得不再那么单一。单个前沿模型固然强大,但生产系统通常需要多个专业化组件协同工作:检索器、路由器、代码感知模型、验证器、工具调用器以及更大的推理模型。我们将 Mellum2 视为一个“焦点”模型:一个快速、范围明确、针对大型 AI 系统内高频任务进行优化的模型。其目标并非取代系统中的每一个模型,而是让整个系统更快、更便宜、更易于控制。

Mellum2 入门指南

如果你正在为软件工程构建 AI 系统——无论是在 IDE 内部、RAG 流水线中、作为智能体工作流的一部分,还是在私有基础设施上——Mellum2 都值得一试。

来源:Hugging Face:Blog(RSS)· huggingface.co