Nathan Lambert:Interconnects(RSS)
精选
60AI 编辑部评分,满分 100

Artifacts 22:Zyphra、Cohere 和 Poolside 正在扩展生态系统广度

2026-06-29 01:03· 46天前· Florian Brand
AI 导读

开源模型生态正变得更多元,参与者从少数中国公司扩展到全球各类组织。纯模型制造商包括 DeepSeek、智谱、MiniMax、Poolside、Arcee、Zyphra 及主权 AI 玩家 Cohere、Sovereign、Mistral、Trillion Labs;科技巨头如阿里 Qwen、Google Gemma 和 NVIDIA 各有不同动机;产品公司如 JetBrains、Zed、Krea、Photoroom 则训练高度专业的小模型。NVIDIA 发布 Nemotron-3-Ultra-550B-A55B-BF16,采用 LatentMoE 架构并改用 OpenMDW 许可证。Cohere 以 Apache 2.0 开源其旗舰模型 Command A+(05-2026-bf16),这是一款 218B-A25B MoE 模型,具备多模态、多语言和智能体能力。

推荐理由

这篇文章把开源模型玩家拆成三类,清晰解释了不同动机,Cohere 转向 Apache 2.0 和 NVIDIA 采用 OpenMDW 是许可层面的重要信号,关注开源的值得一读。

正文 · AI 翻译

对开放生态及模型发布背后动机的评估

弗洛里安·布兰德

内森·兰伯特

2026年6月28日

∙ 付费内容

我们在开放模型发布中持续观察到的一个趋势是,生态系统正变得更加多元化,越来越多的组织发布了种类繁多的模型。一年前,开放成果乃至更广泛的开放模型领域主要由少数几家(中国)厂商主导。如今这一格局已经转变,我们越来越多地看到世界各地的小众公司涌现出来。

虽然很难确切了解这些公司自身的动机,但我们可以大致观察到以下几类:

  • “纯粹”模型制造商:这类公司公开宣称的目标是训练出处于前沿或至少接近前沿水平的模型。这包括许多中国公司,如深度求索、智谱和MiniMax,也包括西方公司,如Poolside、Arcee和Zyphra。此外,主权AI参与者也在不断增加,例如Cohere、Sovereign、Mistral和Trillion Labs。最近的“神话”事件唤醒了一些政策制定者,这可能会引发对主权模型训练日益增长的兴趣。

  • 大型科技公司:对于大型科技公司,包括阿里巴巴的通义千问、谷歌的Gemma,以及某种程度上英伟达而言,其动机更加多样化。阿里巴巴通过发布模型来推广其闭源模型的高端版本,而英伟达则受益于繁荣的开放模型生态系统,因为这提升了对其GPU的兴趣和使用量。这种既得利益与西方开放模型的Llama时代不同,当时开放发布的动机不太明确(并且最终未能持续)。

  • 产品公司:一些公司,例如JetBrains、Zed、Krea和Photoroom,主要销售以AI为核心组成部分的产品。由于它们不希望被切断访问闭源模型的途径,或者希望提供独特的功能,它们可以训练高度专业化的小型模型来满足自身产品需求。因此,将这些模型权重开源并不会损害它们的盈利能力。

这种制造商和模型的多样性符合我们的假设:将有更多公司开发出长尾分布的模型,而追逐绝对开放前沿模型的公司数量将会减少。

并非每一次模型发布都能完全归入上述某一类别,但更广泛的观点是,开放模型的开发并非由单一类型的参与者或动机所驱动。这种多样性是开放生态系统的优势之一,这一点可以从模型发布的技术报告中看出,这些报告会复用其他开放模型发布中的训练方法、架构选择和数据。

试图减缓或禁止这一生态系统不仅是徒劳的——正如技术相关禁令的历史所表明的那样——而且也是不安全且反自由的。此类限制会将人工智能的开发和使用集中在少数人手中,最终会危及局外人自由采用我们这一代人最重要的技术之一的能力。

我们的精选

  • NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16 by nvidia:Nemotron 系列的大版本,它使用 LatentMoE 架构,速度甚至比同类模型更快。与其他 Nemotron 模型一样,其绝大部分数据都是开源的。最棒的是:NVIDIA 承诺使用 OpenMDW 许可证,该许可证是专门为模型权重(和数据)量身定制的,并放弃了其自定义许可证。虽然 MIT 和 Apache 许可证与 OpenMDW 精神一致,但只有后者真正涵盖了模型权重,而前者是并不真正适用于模型权重的软件许可证。

  • command-a-plus-05-2026-bf16 by CohereLabs:Cohere(最近越来越频繁地成为 Artifacts 的常客)在 Apache 2.0 许可证下发布了其旗舰模型 Command A+。该系列之前的版本是在非商业许可证下发布的,因此这一变化非常受欢迎!Command A+ 结合了多模态、多语言和智能体能力,是一个 218B-A25B 的 MoE 模型,使其可以在单个 B200(使用 4-bit 时)上运行。

  • GLM-5.2 by zai-org:本次 Artifacts 中最大的新闻是 GLM-5.2,我们也在另一篇博客中进行了报道。该模型继续令人印象深刻,并且确实可用于日常工作,与目前最好的闭源模型相比没有太大的退步。有趣的是,自发布以来的原始下载量与其他模型发布情况更为一致,GLM-5.2 的下载量与发布后的 GLM-5 大致持平。

  • Zyphra 发布的 ZAYA1-74B-preview:Zyphra 这家公司使用 AMD GPU 进行训练,因其技术报告中包含有趣的架构选择,在研究社区中被视为某种内部消息来源。他们发布了一些新模型,其中 74B-A4B MoE 和 8B-A0.6B MoE(技术报告)是当前的主打产品。

  • poolside 发布的 Laguna-M.1:我们在上一期 Artifacts 中报道过的 poolside,也以 Apache 2.0 协议发布了他们的旗舰模型!他们还承诺未来将继续进行开放发布:

    开放权重现在已成为我们的默认选择。我们将继续朝着前沿方向努力,并持续公开发布能力越来越强的模型。

模型

通用型

  • 月之暗面(moonshotai)发布的 Kimi-K2.7-Code:Kimi 的一次更新,重点提升了模型 token 效率。

  • 阶跃星辰(stepfun-ai)发布的 Step-3.7-Flash:Step-Flash 的一次更新,尤其在数学方面表现非常强劲。

  • 英伟达(nvidia)发布的 Nemotron-Labs-Diffusion-14B:一个实验性模型,可以在三种不同模式下使用:自回归模式、扩散模式和自推测模式。每种模式都适用于不同的使用场景。

    An illustration of Tri-Mode LMs

本文仅供付费订阅用户阅读

已经是付费订阅用户?

来源:Nathan Lambert:Interconnects(RSS) · interconnects.ai

Artifacts 22:Zyphra、Cohere 和 Poolside 正在扩展生态系统广度

Nathan Lambert:Interconnects(RSS)·2026-06-29 01:03·46天前·Florian Brand
AI 导读

开源模型生态正变得更多元,参与者从少数中国公司扩展到全球各类组织。纯模型制造商包括 DeepSeek、智谱、MiniMax、Poolside、Arcee、Zyphra 及主权 AI 玩家 Cohere、Sovereign、Mistral、Trillion Labs;科技巨头如阿里 Qwen、Google Gemma 和 NVIDIA 各有不同动机;产品公司如 JetBrains、Zed、Krea、Photoroom 则训练高度专业的小模型。NVIDIA 发布 Nemotron-3-Ultra-550B-A55B-BF16,采用 LatentMoE 架构并改用 OpenMDW 许可证。Cohere 以 Apache 2.0 开源其旗舰模型 Command A+(05-2026-bf16),这是一款 218B-A25B MoE 模型,具备多模态、多语言和智能体能力。

正文 · AI 翻译

对开放生态及模型发布背后动机的评估

弗洛里安·布兰德

内森·兰伯特

2026年6月28日

∙ 付费内容

我们在开放模型发布中持续观察到的一个趋势是,生态系统正变得更加多元化,越来越多的组织发布了种类繁多的模型。一年前,开放成果乃至更广泛的开放模型领域主要由少数几家(中国)厂商主导。如今这一格局已经转变,我们越来越多地看到世界各地的小众公司涌现出来。

虽然很难确切了解这些公司自身的动机,但我们可以大致观察到以下几类:

  • “纯粹”模型制造商:这类公司公开宣称的目标是训练出处于前沿或至少接近前沿水平的模型。这包括许多中国公司,如深度求索、智谱和MiniMax,也包括西方公司,如Poolside、Arcee和Zyphra。此外,主权AI参与者也在不断增加,例如Cohere、Sovereign、Mistral和Trillion Labs。最近的“神话”事件唤醒了一些政策制定者,这可能会引发对主权模型训练日益增长的兴趣。

  • 大型科技公司:对于大型科技公司,包括阿里巴巴的通义千问、谷歌的Gemma,以及某种程度上英伟达而言,其动机更加多样化。阿里巴巴通过发布模型来推广其闭源模型的高端版本,而英伟达则受益于繁荣的开放模型生态系统,因为这提升了对其GPU的兴趣和使用量。这种既得利益与西方开放模型的Llama时代不同,当时开放发布的动机不太明确(并且最终未能持续)。

  • 产品公司:一些公司,例如JetBrains、Zed、Krea和Photoroom,主要销售以AI为核心组成部分的产品。由于它们不希望被切断访问闭源模型的途径,或者希望提供独特的功能,它们可以训练高度专业化的小型模型来满足自身产品需求。因此,将这些模型权重开源并不会损害它们的盈利能力。

这种制造商和模型的多样性符合我们的假设:将有更多公司开发出长尾分布的模型,而追逐绝对开放前沿模型的公司数量将会减少。

并非每一次模型发布都能完全归入上述某一类别,但更广泛的观点是,开放模型的开发并非由单一类型的参与者或动机所驱动。这种多样性是开放生态系统的优势之一,这一点可以从模型发布的技术报告中看出,这些报告会复用其他开放模型发布中的训练方法、架构选择和数据。

试图减缓或禁止这一生态系统不仅是徒劳的——正如技术相关禁令的历史所表明的那样——而且也是不安全且反自由的。此类限制会将人工智能的开发和使用集中在少数人手中,最终会危及局外人自由采用我们这一代人最重要的技术之一的能力。

我们的精选

  • NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16 by nvidia:Nemotron 系列的大版本,它使用 LatentMoE 架构,速度甚至比同类模型更快。与其他 Nemotron 模型一样,其绝大部分数据都是开源的。最棒的是:NVIDIA 承诺使用 OpenMDW 许可证,该许可证是专门为模型权重(和数据)量身定制的,并放弃了其自定义许可证。虽然 MIT 和 Apache 许可证与 OpenMDW 精神一致,但只有后者真正涵盖了模型权重,而前者是并不真正适用于模型权重的软件许可证。

  • command-a-plus-05-2026-bf16 by CohereLabs:Cohere(最近越来越频繁地成为 Artifacts 的常客)在 Apache 2.0 许可证下发布了其旗舰模型 Command A+。该系列之前的版本是在非商业许可证下发布的,因此这一变化非常受欢迎!Command A+ 结合了多模态、多语言和智能体能力,是一个 218B-A25B 的 MoE 模型,使其可以在单个 B200(使用 4-bit 时)上运行。

  • GLM-5.2 by zai-org:本次 Artifacts 中最大的新闻是 GLM-5.2,我们也在另一篇博客中进行了报道。该模型继续令人印象深刻,并且确实可用于日常工作,与目前最好的闭源模型相比没有太大的退步。有趣的是,自发布以来的原始下载量与其他模型发布情况更为一致,GLM-5.2 的下载量与发布后的 GLM-5 大致持平。

  • Zyphra 发布的 ZAYA1-74B-preview:Zyphra 这家公司使用 AMD GPU 进行训练,因其技术报告中包含有趣的架构选择,在研究社区中被视为某种内部消息来源。他们发布了一些新模型,其中 74B-A4B MoE 和 8B-A0.6B MoE(技术报告)是当前的主打产品。

  • poolside 发布的 Laguna-M.1:我们在上一期 Artifacts 中报道过的 poolside,也以 Apache 2.0 协议发布了他们的旗舰模型!他们还承诺未来将继续进行开放发布:

    开放权重现在已成为我们的默认选择。我们将继续朝着前沿方向努力,并持续公开发布能力越来越强的模型。

模型

通用型

  • 月之暗面(moonshotai)发布的 Kimi-K2.7-Code:Kimi 的一次更新,重点提升了模型 token 效率。

  • 阶跃星辰(stepfun-ai)发布的 Step-3.7-Flash:Step-Flash 的一次更新,尤其在数学方面表现非常强劲。

  • 英伟达(nvidia)发布的 Nemotron-Labs-Diffusion-14B:一个实验性模型,可以在三种不同模式下使用:自回归模式、扩散模式和自推测模式。每种模式都适用于不同的使用场景。

    An illustration of Tri-Mode LMs

本文仅供付费订阅用户阅读

已经是付费订阅用户?

来源:Nathan Lambert:Interconnects(RSS)· interconnects.ai