# SGLang 为 Muse Glimmer 提供 Day-0 支持，针对本地智能体工作流优化推理

- 来源：LMSYS：Blog（Chatbot Arena 团队）
- 作者：Meta Superintelligence Labs and the SGLang Team
- 发布时间：2026-08-10 19:51
- AIHOT 分数：72
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmsn68brx03q2ron5vwp3pwta
- 原文链接：https://www.lmsys.org/blog/2026-08-10-meta-muse-glimmer

## 精选理由

SGLang对Muse Glimmer的优化使30B多模态模型在RTX 5090上达到236 tok/s用户速度，本地智能体工作流不再受限于云端延迟。

## AI 摘要

SGLang 与 Meta Superintelligence Labs 合作，为 30B 参数多模态模型 Muse Glimmer 提供 Day-0 支持，该模型拥有 128k+ token 上下文窗口。

## 正文

我们很高兴宣布与 Meta Superintelligence Labs 合作，为 SGLang 带来 Muse Glimmer 的 Day-0 支持，并针对本地硬件上的智能体工作流高性能推理进行了专门优化。

亮点

模型：Muse Glimmer 是一个 30B 参数的多模态密集模型，拥有 128k+ token 的上下文窗口，可在本地硬件上为端到端智能体工作流提供具有竞争力的性能。

性能：借助针对 SGLang SM120 后端的专门优化，SGLang 在 NVIDIA GeForce RTX 5090 上可实现高达 1,452 tok/s 的总输出吞吐量和 236 tok/s 的每用户解码速度（NVFP4 配合 DFlash）。

特性：SGLang 为 Muse Glimmer 提供广泛的原生特性支持，包括 DFlash 投机解码、RadixAttention 前缀缓存和可中断 CUDA graphs。

硬件：开发者可在多种消费级和工作站硬件上部署 Muse Glimmer——通过 SM120 后端支持 NVIDIA GeForce RTX 5090、RTX PRO 6000 和 DGX Spark，通过 MLX 后端支持 Apple Silicon。

Muse Glimmer 模型架构

Muse Glimmer 是一个 30B 模型，由 27.9B 的密集文本解码器、1.9B 的 ViT 和基于 GELU 的多模态投影器组成。文本解码器包含 52 个 Transformer 层。每一层都包含分组查询注意力（32 个查询头和 2 个键值头），后接 SwiGLU 前馈网络。

滑动窗口注意力

解码器采用混合注意力模式，将三个 2,048-token 的滑动窗口层与每第四步一个的全序列层交错排列，以提高效率。将局部窗口上的 RoPE 与全注意力层上的 NoPE 相结合，使模型能够将其上下文长度扩展到训练限制之外。

特性支持

对本地 AI 硬件的广泛后端支持

Muse Glimmer 可通过 SGLang 部署在开发者本地构建和运行 AI 智能体时常用的各类硬件上，包括 Apple Silicon 设备（Mac mini 和 M 系列 MacBook Pro）、NVIDIA GeForce RTX 5090 GPU 以及 NVIDIA DGX Spark。在 NVIDIA SM120 平台上，SGLang 利用其优化的 GEMM 和 FlashInfer 后端实现高吞吐推理，而 Apple Silicon 设备则使用原生 MLX 后端，提供高性能本地服务。

使用 DFlash 进行投机解码

为实现低延迟推理，请使用 SGLang 对 DFlash 的实现：

--speculative-algorithm DFLASH

SGLang 原生优化

Muse Glimmer 兼容 SGLang 的众多原生优化，包括低开销调度器、RadixAttention 前缀缓存以及可中断 CUDA graphs。我们还将其中多项优化（包括前缀缓存）引入 SGLang MLX 后端，使 Apple Silicon 在智能体工作负载上也能具备有竞争力的性能。

BF16、NVFP4、GGUF 和 MLX 4-bit 检查点

我们提供多种格式的 Muse Glimmer 检查点，以满足不同硬件、保真度和系统性能需求用户的需要。

需要最高模型保真度的开发者可在单块 H100 GPU 上运行原生 BF16 检查点。SM120 路径包含约 19.5 GB 的 NVFP4+MXFP8 混合量化方案。一个 18 GB 的 NVFP4 检查点搭配一个 5 GB 的 BF16 DFlash 投机模型，可轻松放入单块 RTX 5090，从而在 NVIDIA GeForce RTX 5090 加速器和 DGX Spark 上实现高性能部署。

我们还提供两个 GGUF 检查点。其中较小的一个采用 Q4KM 格式，组大小为 128。该检查点可实现更快的推理速度，并可在内存约束更严格的硬件上部署。Q4K-Dynamic 则提供更好的模型质量。对于在 Apple Silicon 设备上工作的开发者，我们以 MLX 格式提供前述 GGUF 检查点。

性能结果

我们在七个平台上使用 SGLang 对 Muse Glimmer 进行了测量，扫描了 1 到 8 的批大小。下面报告的是批大小为 1 时的交互性（tok/s/user）和批大小为 8 时的聚合输出吞吐量（tok/s）。

平台精度解码tok/s/user（批大小 1）输出 tok/s（批大小 8）

NVIDIA B300bf16标准91.7721

NVIDIA B300bf16DFlash308.51261

NVIDIA B300nvfp4标准83.9841

NVIDIA B300nvfp4DFlash290.01295

NVIDIA RTX PRO 6000bf16标准25.7200

NVIDIA RTX PRO 6000bf16DFlash108.0833

NVIDIA RTX PRO 6000nvfp4标准58.0451

NVIDIA RTX PRO 6000nvfp4DFlash214.11403

NVIDIA DGX Sparkbf16标准4.435

NVIDIA DGX Sparkbf16DFlash19.1134

NVIDIA DGX Sparknvfp4标准12.192

NVIDIA DGX Sparknvfp4DFlash36.4301

NVIDIA RTX 5090nvfp4标准63.9501

NVIDIA RTX 5090nvfp4DFlash236.41452

NVIDIA RTX 5090q4_k_m标准72.6230

NVIDIA RTX 5090q4_k_mDFlash140.7332

Apple M5 Proq4_k_m标准15.352.6

Apple M5 Proq4标准17.656.9

Apple M5 Proq4k-dynamic标准12.649.1

DFlash 将 batch-1 交互性提升了 1.9–4.3 倍，具体取决于平台和精度：除 RTX 5090 上的 GGUF 路径（提升 1.9 倍）外，所有配置均达到 3.0 倍或更高。batch-8 的提升较小且波动更大，范围在 1.4 倍到 4.2 倍之间。MLX 后端不支持投机解码。

致谢

我们感谢 Meta Superintelligence Labs 团队和 SGLang 社区的合作，使 Muse Glimmer 能够在 SGLang 中获得 Day-0 支持。
