Artificial Analysis@ArtificialAnlys
精选
78AI 编辑部评分,满分 100
2026-08-11 04:42· 11分钟前
AI 导读

Meta 发布开源模型 Muse Glimmer,这是其自 Llama 4 以来首个开源权重模型,30B 参数,在 Artificial Analysis 智能指数上得分 35,也是 Meta 首个采用 Apache 2.0 许可的模型。

推荐理由

Apache 2.0 许可和单 GPU 可运行的设计,使团队能在自有硬件上运行与更大模型接近的性能,部署成本与合规风险同时下降。

正文 · AI 翻译

Meta 回归开源权重:Muse Glimmer 是自 Llama 4 以来 Meta 首个开源权重发布,在 Artificial Analysis 智能指数上得分 35。这是一个 30B 参数模型,也是 Meta 首个以 Apache 2.0 协议发布的模型。

Muse Glimmer (high) 在 Llama 4 发布 16 个月后问世,得分比 Meta 上一个开源权重发布 Llama 4 Maverick(14 分)高出 21 分。它与 Kimi K2.5(推理型,36 分)并驾齐驱,仅落后于 Qwen3.6 27B(推理型,38 分)和 Ling 3.0 Flash(38 分),并与专有旗舰模型 Muse Spark 1.2(xhigh,57 分)共同构成 Meta 的双层产品线。

@AIatMeta 在公开发布前与我们共享了访问权限用于基准测试。祝贺 @AIatMeta、@finkd 和 @alexandr_wang 完成此次发布!

核心要点:

➤ Meta 的开源权重产品线回归,且采用了其迄今最宽松的许可证。Meta 此前所有开源发布均采用 Llama 许可证;Muse Glimmer 使用 Apache 2.0,对商业使用或衍生作品几乎不设限制。

➤ 在同等参数量下展现出强劲的智能水平。Muse Glimmer 拥有 30B 参数,得分比同尺寸的 Gemma 4 31B(推理型,30 分)高出 5 分,并以少 33 倍的参数量实际追平了总参数达 1T 的 Kimi K2.5(推理型,36 分)。Qwen3.6 27B(推理型,38 分)在智能 vs 参数量前沿上仍以略小的尺寸保持领先。

➤ 模型足够小,可在单张 GPU 上自托管,即使在完整上下文长度下也能运行。Muse Glimmer 是一个 30B 稠密模型(包含约 1.8B 视觉编码器),BF16 精度下权重约 60 GB,4-bit 量化下约 18 GB。它采用混合注意力机制,每层全局层配有三层滑动窗口层,在扩展前的 128K 上下文下将 KV 缓存内存占用控制在约 1.8 GB(最低)。这意味着该模型可以在单张 H100 上以 BF16 精度运行完整上下文,或在更高配置的 MacBook 或 RTX 5090 上以 4-bit 精度运行;如果不需要视觉编码器,还能获得更多余量。

➤ 智能体知识工作是其相对于同尺寸级别的短板。Muse Glimmer 在 GDPval-AA v2 上取得 953 Elo 分,低于 1000 分的人类基线,也落后于同智能水平的其他模型,包括尺寸相近的 Qwen3.6 27B(推理型,1141 分)和 Gemini 3.5 Flash-Lite(1141 分)。知识校准也呈现同样的模式:其 AA-Omniscience 指数为 -33,相对于其智能水平偏低,这主要源于 82% 的模型幻觉率(Qwen3.6 27B 为 49%),而非准确率--准确率方面它与同类模型相当。智能体工具使用则是个例外,Muse Glimmer 在 Tau3-Banking 上取得 24% 的成绩,领先于 Gemini 3.5 Flash-Lite(18%)和 Qwen3.6 27B(17%),属于同级别中表现最好的之一。

其他模型详情:

➤ 参数量:30B 稠密 ➤ 上下文窗口:128K token,支持扩展 ➤ 许可证:Apache 2.0 ➤ 开放度指数:44,表明与其他主要开放权重模型相比,其开放度/透明度相对较高 ➤ 定价与输出速度:发布时,Meta 未在其 API 上提供该模型;定价和服务速度取决于第三方提供商,待定。

来源:Artificial Analysis · x.com

同一事件 · 2
Artificial Analysis · @ArtificialAnlys · X·2026-08-11 04:42·11分钟前
AI 导读

Meta 发布开源模型 Muse Glimmer,这是其自 Llama 4 以来首个开源权重模型,30B 参数,在 Artificial Analysis 智能指数上得分 35,也是 Meta 首个采用 Apache 2.0 许可的模型。

正文 · AI 翻译

Meta 回归开源权重:Muse Glimmer 是自 Llama 4 以来 Meta 首个开源权重发布,在 Artificial Analysis 智能指数上得分 35。这是一个 30B 参数模型,也是 Meta 首个以 Apache 2.0 协议发布的模型。

Muse Glimmer (high) 在 Llama 4 发布 16 个月后问世,得分比 Meta 上一个开源权重发布 Llama 4 Maverick(14 分)高出 21 分。它与 Kimi K2.5(推理型,36 分)并驾齐驱,仅落后于 Qwen3.6 27B(推理型,38 分)和 Ling 3.0 Flash(38 分),并与专有旗舰模型 Muse Spark 1.2(xhigh,57 分)共同构成 Meta 的双层产品线。

@AIatMeta 在公开发布前与我们共享了访问权限用于基准测试。祝贺 @AIatMeta、@finkd 和 @alexandr_wang 完成此次发布!

核心要点:

➤ Meta 的开源权重产品线回归,且采用了其迄今最宽松的许可证。Meta 此前所有开源发布均采用 Llama 许可证;Muse Glimmer 使用 Apache 2.0,对商业使用或衍生作品几乎不设限制。

➤ 在同等参数量下展现出强劲的智能水平。Muse Glimmer 拥有 30B 参数,得分比同尺寸的 Gemma 4 31B(推理型,30 分)高出 5 分,并以少 33 倍的参数量实际追平了总参数达 1T 的 Kimi K2.5(推理型,36 分)。Qwen3.6 27B(推理型,38 分)在智能 vs 参数量前沿上仍以略小的尺寸保持领先。

➤ 模型足够小,可在单张 GPU 上自托管,即使在完整上下文长度下也能运行。Muse Glimmer 是一个 30B 稠密模型(包含约 1.8B 视觉编码器),BF16 精度下权重约 60 GB,4-bit 量化下约 18 GB。它采用混合注意力机制,每层全局层配有三层滑动窗口层,在扩展前的 128K 上下文下将 KV 缓存内存占用控制在约 1.8 GB(最低)。这意味着该模型可以在单张 H100 上以 BF16 精度运行完整上下文,或在更高配置的 MacBook 或 RTX 5090 上以 4-bit 精度运行;如果不需要视觉编码器,还能获得更多余量。

➤ 智能体知识工作是其相对于同尺寸级别的短板。Muse Glimmer 在 GDPval-AA v2 上取得 953 Elo 分,低于 1000 分的人类基线,也落后于同智能水平的其他模型,包括尺寸相近的 Qwen3.6 27B(推理型,1141 分)和 Gemini 3.5 Flash-Lite(1141 分)。知识校准也呈现同样的模式:其 AA-Omniscience 指数为 -33,相对于其智能水平偏低,这主要源于 82% 的模型幻觉率(Qwen3.6 27B 为 49%),而非准确率--准确率方面它与同类模型相当。智能体工具使用则是个例外,Muse Glimmer 在 Tau3-Banking 上取得 24% 的成绩,领先于 Gemini 3.5 Flash-Lite(18%)和 Qwen3.6 27B(17%),属于同级别中表现最好的之一。

其他模型详情:

➤ 参数量:30B 稠密 ➤ 上下文窗口:128K token,支持扩展 ➤ 许可证:Apache 2.0 ➤ 开放度指数:44,表明与其他主要开放权重模型相比,其开放度/透明度相对较高 ➤ 定价与输出速度:发布时,Meta 未在其 API 上提供该模型;定价和服务速度取决于第三方提供商,待定。

来源:Artificial Analysis· x.com

同一事件 · 2