我们很高兴宣布与 Meta Superintelligence Labs 合作,为 SGLang 带来 Muse Glimmer 的 Day-0 支持,并针对本地硬件上的智能体工作流高性能推理进行了专门优化。
亮点
- 模型:Muse Glimmer 是一个 30B 参数的多模态密集模型,拥有 128k+ token 的上下文窗口,可在本地硬件上为端到端智能体工作流提供具有竞争力的性能。
- 性能:借助针对 SGLang SM120 后端的专门优化,SGLang 在 NVIDIA GeForce RTX 5090 上可实现高达 1,452 tok/s 的总输出吞吐量和 236 tok/s 的每用户解码速度(NVFP4 配合 DFlash)。
- 特性:SGLang 为 Muse Glimmer 提供广泛的原生特性支持,包括 DFlash 投机解码、RadixAttention 前缀缓存和可中断 CUDA graphs。
- 硬件:开发者可在多种消费级和工作站硬件上部署 Muse Glimmer——通过 SM120 后端支持 NVIDIA GeForce RTX 5090、RTX PRO 6000 和 DGX Spark,通过 MLX 后端支持 Apple Silicon。
Muse Glimmer 模型架构
Muse Glimmer 是一个 30B 模型,由 27.9B 的密集文本解码器、1.9B 的 ViT 和基于 GELU 的多模态投影器组成。文本解码器包含 52 个 Transformer 层。每一层都包含分组查询注意力(32 个查询头和 2 个键值头),后接 SwiGLU 前馈网络。
滑动窗口注意力
解码器采用混合注意力模式,将三个 2,048-token 的滑动窗口层与每第四步一个的全序列层交错排列,以提高效率。将局部窗口上的 RoPE 与全注意力层上的 NoPE 相结合,使模型能够将其上下文长度扩展到训练限制之外。
特性支持
对本地 AI 硬件的广泛后端支持
Muse Glimmer 可通过 SGLang 部署在开发者本地构建和运行 AI 智能体时常用的各类硬件上,包括 Apple Silicon 设备(Mac mini 和 M 系列 MacBook Pro)、NVIDIA GeForce RTX 5090 GPU 以及 NVIDIA DGX Spark。在 NVIDIA SM120 平台上,SGLang 利用其优化的 GEMM 和 FlashInfer 后端实现高吞吐推理,而 Apple Silicon 设备则使用原生 MLX 后端,提供高性能本地服务。
使用 DFlash 进行投机解码
为实现低延迟推理,请使用 SGLang 对 DFlash 的实现:
--speculative-algorithm DFLASH
SGLang 原生优化
Muse Glimmer 兼容 SGLang 的众多原生优化,包括低开销调度器、RadixAttention 前缀缓存以及可中断 CUDA graphs。我们还将其中多项优化(包括前缀缓存)引入 SGLang MLX 后端,使 Apple Silicon 在智能体工作负载上也能具备有竞争力的性能。
BF16、NVFP4、GGUF 和 MLX 4-bit 检查点
我们提供多种格式的 Muse Glimmer 检查点,以满足不同硬件、保真度和系统性能需求用户的需要。
需要最高模型保真度的开发者可在单块 H100 GPU 上运行原生 BF16 检查点。SM120 路径包含约 19.5 GB 的 NVFP4+MXFP8 混合量化方案。一个 18 GB 的 NVFP4 检查点搭配一个 5 GB 的 BF16 DFlash 投机模型,可轻松放入单块 RTX 5090,从而在 NVIDIA GeForce RTX 5090 加速器和 DGX Spark 上实现高性能部署。
我们还提供两个 GGUF 检查点。其中较小的一个采用 Q4KM 格式,组大小为 128。该检查点可实现更快的推理速度,并可在内存约束更严格的硬件上部署。Q4K-Dynamic 则提供更好的模型质量。对于在 Apple Silicon 设备上工作的开发者,我们以 MLX 格式提供前述 GGUF 检查点。
性能结果
我们在七个平台上使用 SGLang 对 Muse Glimmer 进行了测量,扫描了 1 到 8 的批大小。下面报告的是批大小为 1 时的交互性(tok/s/user)和批大小为 8 时的聚合输出吞吐量(tok/s)。
| 平台 | 精度 | 解码 | tok/s/user(批大小 1) | 输出 tok/s(批大小 8) |
|---|---|---|---|---|
| NVIDIA B300 | bf16 | 标准 | 91.77 | 21 |
| NVIDIA B300 | bf16 | DFlash | 308.51 | 261 |
| NVIDIA B300 | nvfp4 | 标准 | 83.98 | 41 |
| NVIDIA B300 | nvfp4 | DFlash | 290.01 | 295 |
| NVIDIA RTX PRO 6000 | bf16 | 标准 | 25.7 | 200 |
| NVIDIA RTX PRO 6000 | bf16 | DFlash | 108.08 | 33 |
| NVIDIA RTX PRO 6000 | nvfp4 | 标准 | 58.04 | 51 |
| NVIDIA RTX PRO 6000 | nvfp4 | DFlash | 214.11 | 403 |
| NVIDIA DGX Spark | bf16 | 标准 | 4.4 | 35 |
| NVIDIA DGX Spark | bf16 | DFlash | 19.1 | 134 |
| NVIDIA DGX Spark | nvfp4 | 标准 | 12.1 | 92 |
| NVIDIA DGX Spark | nvfp4 | DFlash | 36.4 | 301 |
| NVIDIA RTX 5090 | nvfp4 | 标准 | 63.9 | 501 |
| NVIDIA RTX 5090 | nvfp4 | DFlash | 236.4 | 1452 |
| NVIDIA RTX 5090 | q4_k_m | 标准 | 72.6 | 230 |
| NVIDIA RTX 5090 | q4_k_m | DFlash | 140.7 | 332 |
| Apple M5 Pro | q4_k_m | 标准 | 15.3 | 52.6 |
| Apple M5 Pro | q4 | 标准 | 17.6 | 56.9 |
| Apple M5 Pro | q4k-dynamic | 标准 | 12.6 | 49.1 |
DFlash 将 batch-1 交互性提升了 1.9–4.3 倍,具体取决于平台和精度:除 RTX 5090 上的 GGUF 路径(提升 1.9 倍)外,所有配置均达到 3.0 倍或更高。batch-8 的提升较小且波动更大,范围在 1.4 倍到 4.2 倍之间。MLX 后端不支持投机解码。
致谢
我们感谢 Meta Superintelligence Labs 团队和 SGLang 社区的合作,使 Muse Glimmer 能够在 SGLang 中获得 Day-0 支持。