LMSYS:Blog(Chatbot Arena 团队)
精选
74AI 编辑部评分,满分 100

SGLang 宣布 Day-0 支持 NVIDIA Nemotron 3.5 Lightning

2026-08-11 21:51· 4分钟前· NVIDIA Nemotron Team and SGLang Team
AI 导读

SGLang 宣布对 NVIDIA Nemotron 3.5 Lightning 提供 Day-0 支持,该开源模型为 30B 总参数、3B 激活参数的混合专家架构,支持最长 1M token 上下文,可从 Hugging Face 下载 BF16 和 NVFP4 权重。模型支持 MTP、DFlash、DSpark 三种投机解码技术,并可通过 OpenAI 兼容 API 接入智能体工作流。

推荐理由

Nemotron 3.5 Lightning以3B活跃参数提供前沿agent能力,SGLang的即刻支持让开发者能用单命令启动高性能推理,将agent部署成本大幅压缩。

正文 · AI 翻译

SGLang 很高兴地宣布,即日起(Day-0)支持 NVIDIA Nemotron 3.5 Lightning。这是一款可定制的开放模型,旨在为本地系统、边缘、数据中心和云端的常驻智能体提供动力。

常驻智能体能够收集上下文、进行推理、使用工具,并在多步骤工作流中灵活适应。前沿模型负责处理复杂的编排任务,而较小的模型则高效地处理高容量、专业化的任务。

Nemotron 3.5 Lightning 正是为处理这些高容量任务而构建。它由 NVIDIA Nemotron 3 Ultra 蒸馏而来,并与 Nemotron Coalition 合作开发,在一个 300 亿参数的混合专家模型中,融合了强大的编码、工具调用、指令遵循和多轮对话能力,且每次仅激活 30 亿参数。

Nemotron 3.5 Lightning 可为本地个人助理提供支持,自动化金融和风险工作流,支持网络安全调查,优化电信运营,并改善零售体验。组织可以根据自身的特定术语、政策、工具和工作流对其进行后训练和部署。

借助 SGLang,开发者可以通过一个高性能、兼容 OpenAI 的推理栈来服务该模型,并将其连接到智能体框架、本地助手和特定的企业工作流中。

摘要:NVIDIA Nemotron 3.5 Lightning

  • 架构:混合专家架构
  • 模型规模:总参数 300 亿,激活参数 30 亿
  • 上下文长度:最高可达 100 万 token
  • 投机解码:多 token 预测、DFlash 和 DSpark
  • 模态:文本输入和文本输出
  • 训练:由 NVIDIA Nemotron 3 Ultra 蒸馏而来,并针对主流智能体框架进行训练
  • 定制化:使用开放数据集训练的开放模型,支持针对特定工作流进行后训练
  • 部署目标:NVIDIA DGX Spark、DGX Station、RTX PRO、RTX、NVIDIA Jetson、H100、H200、A100、L40S、B200/GB200 和 B300/GB300
  • 发布时可用格式:BF16、NVFP4
  • Get started:
    • 从 Hugging Face 下载模型权重:BF16 和 NVFP4
    • 使用 SGLang 的入门 cookbook 运行 Nemotron 3.5 Lightning

使用 SGLang 进行安装和快速入门

SGLang 提供了高性能的推理服务运行时、连续批处理、前缀缓存、投机解码,以及兼容 OpenAI 的 API。以下基线命令使用 BF16 检查点:

docker run --rm -it \
  --gpus all \
  --cap-add SYS_NICE \
  --ipc=host \
  --network=host \
  --entrypoint /bin/bash \
  lmsysorg/sglang:dev-nemotron3-5-lightning
sglang serve \
    --model-path nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16 \
    --mamba-backend flashinfer \
    --mamba-radix-cache-strategy extra_buffer \
    --reasoning-parser nemotron_3 \
    --tool-call-parser qwen3_coder

服务器启动后,使用任何兼容 OpenAI 的客户端发送请求:

from openai import OpenAI

client = OpenAI(
    base_url="http://127.0.0.1:30000/v1",
    api_key="EMPTY",
)

response = client.chat.completions.create(
    model="nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16",
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {"role": "user", "content": "Briefly explain: what is SGLang?"},
    ],
    temperature=1.0,
    top_p=0.95,
    max_tokens=1024,
)
choice = response.choices[0]
print("Reasoning:", choice.message.reasoning_content)
print("Content:", choice.message.content)

使用投机解码进行优化推理

Nemotron 3.5 Lightning 支持三种投机解码技术——多 token 预测(MTP)、DFlash 和 DSpark——在保持目标模型输出质量的同时加速 token 生成。

MTP 使用轻量级、模型集成的预测头来提出多个未来 token;DFlash 使用基于扩散模型的草稿模型并行生成整个候选块;DSpark 则增加了置信度感知的半自回归草稿机制,在速度与 token 接受质量之间取得平衡。三者结合,让团队能够为其推理工作负载选择最佳的延迟、吞吐量和部署权衡方案。

对于低延迟服务,可在 H100、H200 和 DGX Spark 上使用 DSpark;若追求当前最大吞吐量,我们建议在不启用投机解码的情况下运行。

使用 MTP 运行 Nemotron 3.5 Lightning

Nemotron 3.5 Lightning 内置多 token 预测功能。SGLang 通过其投机解码路径暴露 MTP 能力,即模型内置的预测头草拟未来 token,再由目标模型进行验证。

标准的 SGLang MTP 接口使用 EAGLE 投机算法。具体每种硬件对应的命令请参阅 cookbook。

使用 DFlash 运行 Nemotron 3.5 Lightning

DFlash 使用专门的扩散草稿模型来提出一个线性 token 块,由目标模型并行验证。在 SGLang 中,DFlash 需要兼容的草稿检查点,并且与 MTP 分开启用。

SGLang 的 DFlash 实现不支持数据并行注意力,且要求流水线并行规模为 1。当前参数参考请参阅 SGLang 投机解码指南。

使用 DSpark 运行 Nemotron 3.5 Lightning

DSpark 是一种混合投机器,结合了自回归与并行扩散式草稿生成,介于 MTP 的完全自回归方法和 DFlash 的完全扩散方法之间,在 DGX Spark 上三者中表现最佳。

每个智能体步骤的推理控制

Nemotron 3.5 Lightning 支持开启或关闭推理模式,使路由器或智能体编排框架能够对困难步骤使用更深度的推理,而对常规工作直接给出答案。

推理默认开启。如需请求不带推理轨迹的直接回答,请通过 chat_template_kwargs 传入 enable_thinking: false:

response = client.chat.completions.create(
    model="nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16",
    messages=[{"role": "user", "content": "Classify this ticket: billing or technical?"}],
    extra_body={"chat_template_kwargs": {"enable_thinking": False}},
)

对于启用推理的请求,可以省略 chat_template_kwargs(推理默认开启),也可以显式设置:

response = client.chat.completions.create(
    model="nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16",
    messages=[{"role": "user", "content": "Plan the steps to migrate this service."}],
    extra_body={"chat_template_kwargs": {"enable_thinking": True}},
)

该模型还支持推理 token 预算。可将 thinking_budget(通过 custom_params)与 enable_thinking 配合使用,按请求调整推理深度和响应时间:

response = client.chat.completions.create(
    model="nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16",
    messages=[{"role": "user", "content": "Debug why this build is failing."}],
    extra_body={
        "chat_template_kwargs": {"enable_thinking": True},
        "custom_params": {"thinking_budget": 512},
    },
)

推理控制在多模型系统中尤为有用:编排器可以为规划、编码和模糊决策分配更大的预算,同时对信息提取、分类和结构化转换使用推理关闭模式或较小的预算。

优化 Nemotron 3.5 Lightning 的推理性能

除权重和投机解码栈外,Nemotron 3.5 Lightning 在架构上与 Nemotron 3 完全相同,因此大部分性能优化工作都集中在运行时本身。以下是我们向上游 SGLang 贡献的内容:

  • DSpark 集成。我们将 DSpark——一种融合自回归与扩散式草拟的混合投机解码器——接入 SGLang 和 Nemotron 模型定义中,使你在 MTP 和 DFlash 之外还有三种投机解码器可供选择。
  • 量化 DSpark 草拟头。将草拟头量化至 W4A16 可削减其内存占用和每步延迟,同时不影响接受率,这在 DGX Spark 等内存受限场景中尤为重要。
  • 移除同步并启用异步调度。我们消除了草拟-验证循环中的主机-设备同步,并启用了异步调度,使当前批次仍在执行时即可准备下一批次。

Nemotron 3.5 Lightning 为专用 AI 提供领先的准确性和效率

Nemotron 3.5 Lightning 结合了混合 MoE 架构——每个 token 仅激活其 30B 参数中的 3B——以及多 token 预测,以减少计算量并加速生成。这些优化使其吞吐量比同等规模的开源模型最高提升 4 倍,帮助智能体更快完成专业化任务。

Nemotron 3.5 Lightning 从 NVIDIA Nemotron 3 Ultra 蒸馏而来,并在主流智能体框架上进行了训练,将前沿的智能体能力迁移到紧凑高效的模型中。它在智能体生产力、编程、工具使用、指令遵循和长上下文推理等基准测试中均表现出色。

如图 1 所示,更高的推理吞吐量和 token 效率使 Nemotron 3.5 Lightning 处于效率前沿,帮助常驻智能体更快完成大批量工作。

Line chart comparing PinchBench accuracy with time to complete 10,000 tasks. Nemotron 3.5 Lightning reaches similar accuracy as Qwen3.6-35B roughly 30% faster and sits well ahead of Gemma 4 26B.

图 1:Nemotron 3.5 Lightning 以相当精度将智能体任务完成速度最高提升 30%,引领效率前沿。

摘要

NVIDIA Nemotron 3.5 Lightning 为本地系统、边缘设备、数据中心和云端带来快速、可定制的智能体智能。凭借 SGLang Day-0 支持,开发者可以通过高性能、兼容 OpenAI 的栈来部署该模型;按智能体步骤控制推理;管理 DGX Spark 等本地部署的内存;并通过多 token 预测、DFlash 或 DSpark 加速生成。

对于跨多个模型路由工作的系统,Nemotron 3.5 Lightning 为开发者提供了一个极具吸引力的选择,适用于对准确性、速度、开放性和部署控制都有要求的大批量专业化任务。

  • 从 Hugging Face 下载模型权重:BF16 和 NVFP4
  • 使用 cookbook 通过 SGLang 运行 Nemotron 3.5 Lightning

订阅 NVIDIA 新闻并在 LinkedIn、X、YouTube 上关注 NVIDIA AI,以及 Discord 上的 Nemotron 频道,以随时了解 NVIDIA Nemotron 的最新动态。

致谢

感谢所有为将 NVIDIA Nemotron 3.5 Lightning 引入 SGLang 做出贡献的人。

NVIDIA:Nirmal Kumar Juluru、Anusha Pant、Amir Klein、Faradawn Yang、Nave Assaf、Ryan Stewart、Alex Steiner、Bita Rouhani、Seong Hee Lee

SGLang 团队

常见问题解答

与 Nemotron 3 Nano 相比有什么新变化?

Nemotron 3 Nano 采用了高效的混合 Mamba-Transformer MoE 设计,总参数量为 30B,激活参数量为 3B,支持 100 万 token 的上下文窗口,并具备可控推理能力。Nemotron 3.5 Lightning 在以下三个重要方面基于这一基础进行了升级:

  • 前沿模型蒸馏:Nemotron 3.5 Lightning 由 Nemotron 3 Ultra 蒸馏而来,将 NVIDIA 前沿智能体模型的能力迁移到体积小得多的部署形态中。
  • 智能体框架优化:Nemotron 3.5 Lightning 针对主流智能体框架和多轮工作流进行了训练,重点优化了编码、工具使用、指令遵循以及专项任务完成能力。
  • 投机解码:Nemotron 3.5 Lightning 支持多 token 预测(MTP)、DFlash 和 DSpark,通过并行草拟和验证多个 token 来加速生成。

最终成果是一款能够在更短时间内更准确地完成更多智能体任务的模型。

来源:LMSYS:Blog(Chatbot Arena 团队) · lmsys.org

SGLang 宣布 Day-0 支持 NVIDIA Nemotron 3.5 Lightning

LMSYS:Blog(Chatbot Arena 团队)·2026-08-11 21:51·4分钟前·NVIDIA Nemotron Team and SGLang Team
AI 导读

SGLang 宣布对 NVIDIA Nemotron 3.5 Lightning 提供 Day-0 支持,该开源模型为 30B 总参数、3B 激活参数的混合专家架构,支持最长 1M token 上下文,可从 Hugging Face 下载 BF16 和 NVFP4 权重。模型支持 MTP、DFlash、DSpark 三种投机解码技术,并可通过 OpenAI 兼容 API 接入智能体工作流。

正文 · AI 翻译

SGLang 很高兴地宣布,即日起(Day-0)支持 NVIDIA Nemotron 3.5 Lightning。这是一款可定制的开放模型,旨在为本地系统、边缘、数据中心和云端的常驻智能体提供动力。

常驻智能体能够收集上下文、进行推理、使用工具,并在多步骤工作流中灵活适应。前沿模型负责处理复杂的编排任务,而较小的模型则高效地处理高容量、专业化的任务。

Nemotron 3.5 Lightning 正是为处理这些高容量任务而构建。它由 NVIDIA Nemotron 3 Ultra 蒸馏而来,并与 Nemotron Coalition 合作开发,在一个 300 亿参数的混合专家模型中,融合了强大的编码、工具调用、指令遵循和多轮对话能力,且每次仅激活 30 亿参数。

Nemotron 3.5 Lightning 可为本地个人助理提供支持,自动化金融和风险工作流,支持网络安全调查,优化电信运营,并改善零售体验。组织可以根据自身的特定术语、政策、工具和工作流对其进行后训练和部署。

借助 SGLang,开发者可以通过一个高性能、兼容 OpenAI 的推理栈来服务该模型,并将其连接到智能体框架、本地助手和特定的企业工作流中。

摘要:NVIDIA Nemotron 3.5 Lightning

  • 架构:混合专家架构
  • 模型规模:总参数 300 亿,激活参数 30 亿
  • 上下文长度:最高可达 100 万 token
  • 投机解码:多 token 预测、DFlash 和 DSpark
  • 模态:文本输入和文本输出
  • 训练:由 NVIDIA Nemotron 3 Ultra 蒸馏而来,并针对主流智能体框架进行训练
  • 定制化:使用开放数据集训练的开放模型,支持针对特定工作流进行后训练
  • 部署目标:NVIDIA DGX Spark、DGX Station、RTX PRO、RTX、NVIDIA Jetson、H100、H200、A100、L40S、B200/GB200 和 B300/GB300
  • 发布时可用格式:BF16、NVFP4
  • Get started:
    • 从 Hugging Face 下载模型权重:BF16 和 NVFP4
    • 使用 SGLang 的入门 cookbook 运行 Nemotron 3.5 Lightning

使用 SGLang 进行安装和快速入门

SGLang 提供了高性能的推理服务运行时、连续批处理、前缀缓存、投机解码,以及兼容 OpenAI 的 API。以下基线命令使用 BF16 检查点:

docker run --rm -it \
  --gpus all \
  --cap-add SYS_NICE \
  --ipc=host \
  --network=host \
  --entrypoint /bin/bash \
  lmsysorg/sglang:dev-nemotron3-5-lightning
sglang serve \
    --model-path nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16 \
    --mamba-backend flashinfer \
    --mamba-radix-cache-strategy extra_buffer \
    --reasoning-parser nemotron_3 \
    --tool-call-parser qwen3_coder

服务器启动后,使用任何兼容 OpenAI 的客户端发送请求:

from openai import OpenAI

client = OpenAI(
    base_url="http://127.0.0.1:30000/v1",
    api_key="EMPTY",
)

response = client.chat.completions.create(
    model="nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16",
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {"role": "user", "content": "Briefly explain: what is SGLang?"},
    ],
    temperature=1.0,
    top_p=0.95,
    max_tokens=1024,
)
choice = response.choices[0]
print("Reasoning:", choice.message.reasoning_content)
print("Content:", choice.message.content)

使用投机解码进行优化推理

Nemotron 3.5 Lightning 支持三种投机解码技术——多 token 预测(MTP)、DFlash 和 DSpark——在保持目标模型输出质量的同时加速 token 生成。

MTP 使用轻量级、模型集成的预测头来提出多个未来 token;DFlash 使用基于扩散模型的草稿模型并行生成整个候选块;DSpark 则增加了置信度感知的半自回归草稿机制,在速度与 token 接受质量之间取得平衡。三者结合,让团队能够为其推理工作负载选择最佳的延迟、吞吐量和部署权衡方案。

对于低延迟服务,可在 H100、H200 和 DGX Spark 上使用 DSpark;若追求当前最大吞吐量,我们建议在不启用投机解码的情况下运行。

使用 MTP 运行 Nemotron 3.5 Lightning

Nemotron 3.5 Lightning 内置多 token 预测功能。SGLang 通过其投机解码路径暴露 MTP 能力,即模型内置的预测头草拟未来 token,再由目标模型进行验证。

标准的 SGLang MTP 接口使用 EAGLE 投机算法。具体每种硬件对应的命令请参阅 cookbook。

使用 DFlash 运行 Nemotron 3.5 Lightning

DFlash 使用专门的扩散草稿模型来提出一个线性 token 块,由目标模型并行验证。在 SGLang 中,DFlash 需要兼容的草稿检查点,并且与 MTP 分开启用。

SGLang 的 DFlash 实现不支持数据并行注意力,且要求流水线并行规模为 1。当前参数参考请参阅 SGLang 投机解码指南。

使用 DSpark 运行 Nemotron 3.5 Lightning

DSpark 是一种混合投机器,结合了自回归与并行扩散式草稿生成,介于 MTP 的完全自回归方法和 DFlash 的完全扩散方法之间,在 DGX Spark 上三者中表现最佳。

每个智能体步骤的推理控制

Nemotron 3.5 Lightning 支持开启或关闭推理模式,使路由器或智能体编排框架能够对困难步骤使用更深度的推理,而对常规工作直接给出答案。

推理默认开启。如需请求不带推理轨迹的直接回答,请通过 chat_template_kwargs 传入 enable_thinking: false:

response = client.chat.completions.create(
    model="nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16",
    messages=[{"role": "user", "content": "Classify this ticket: billing or technical?"}],
    extra_body={"chat_template_kwargs": {"enable_thinking": False}},
)

对于启用推理的请求,可以省略 chat_template_kwargs(推理默认开启),也可以显式设置:

response = client.chat.completions.create(
    model="nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16",
    messages=[{"role": "user", "content": "Plan the steps to migrate this service."}],
    extra_body={"chat_template_kwargs": {"enable_thinking": True}},
)

该模型还支持推理 token 预算。可将 thinking_budget(通过 custom_params)与 enable_thinking 配合使用,按请求调整推理深度和响应时间:

response = client.chat.completions.create(
    model="nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16",
    messages=[{"role": "user", "content": "Debug why this build is failing."}],
    extra_body={
        "chat_template_kwargs": {"enable_thinking": True},
        "custom_params": {"thinking_budget": 512},
    },
)

推理控制在多模型系统中尤为有用:编排器可以为规划、编码和模糊决策分配更大的预算,同时对信息提取、分类和结构化转换使用推理关闭模式或较小的预算。

优化 Nemotron 3.5 Lightning 的推理性能

除权重和投机解码栈外,Nemotron 3.5 Lightning 在架构上与 Nemotron 3 完全相同,因此大部分性能优化工作都集中在运行时本身。以下是我们向上游 SGLang 贡献的内容:

  • DSpark 集成。我们将 DSpark——一种融合自回归与扩散式草拟的混合投机解码器——接入 SGLang 和 Nemotron 模型定义中,使你在 MTP 和 DFlash 之外还有三种投机解码器可供选择。
  • 量化 DSpark 草拟头。将草拟头量化至 W4A16 可削减其内存占用和每步延迟,同时不影响接受率,这在 DGX Spark 等内存受限场景中尤为重要。
  • 移除同步并启用异步调度。我们消除了草拟-验证循环中的主机-设备同步,并启用了异步调度,使当前批次仍在执行时即可准备下一批次。

Nemotron 3.5 Lightning 为专用 AI 提供领先的准确性和效率

Nemotron 3.5 Lightning 结合了混合 MoE 架构——每个 token 仅激活其 30B 参数中的 3B——以及多 token 预测,以减少计算量并加速生成。这些优化使其吞吐量比同等规模的开源模型最高提升 4 倍,帮助智能体更快完成专业化任务。

Nemotron 3.5 Lightning 从 NVIDIA Nemotron 3 Ultra 蒸馏而来,并在主流智能体框架上进行了训练,将前沿的智能体能力迁移到紧凑高效的模型中。它在智能体生产力、编程、工具使用、指令遵循和长上下文推理等基准测试中均表现出色。

如图 1 所示,更高的推理吞吐量和 token 效率使 Nemotron 3.5 Lightning 处于效率前沿,帮助常驻智能体更快完成大批量工作。

Line chart comparing PinchBench accuracy with time to complete 10,000 tasks. Nemotron 3.5 Lightning reaches similar accuracy as Qwen3.6-35B roughly 30% faster and sits well ahead of Gemma 4 26B.

图 1:Nemotron 3.5 Lightning 以相当精度将智能体任务完成速度最高提升 30%,引领效率前沿。

摘要

NVIDIA Nemotron 3.5 Lightning 为本地系统、边缘设备、数据中心和云端带来快速、可定制的智能体智能。凭借 SGLang Day-0 支持,开发者可以通过高性能、兼容 OpenAI 的栈来部署该模型;按智能体步骤控制推理;管理 DGX Spark 等本地部署的内存;并通过多 token 预测、DFlash 或 DSpark 加速生成。

对于跨多个模型路由工作的系统,Nemotron 3.5 Lightning 为开发者提供了一个极具吸引力的选择,适用于对准确性、速度、开放性和部署控制都有要求的大批量专业化任务。

  • 从 Hugging Face 下载模型权重:BF16 和 NVFP4
  • 使用 cookbook 通过 SGLang 运行 Nemotron 3.5 Lightning

订阅 NVIDIA 新闻并在 LinkedIn、X、YouTube 上关注 NVIDIA AI,以及 Discord 上的 Nemotron 频道,以随时了解 NVIDIA Nemotron 的最新动态。

致谢

感谢所有为将 NVIDIA Nemotron 3.5 Lightning 引入 SGLang 做出贡献的人。

NVIDIA:Nirmal Kumar Juluru、Anusha Pant、Amir Klein、Faradawn Yang、Nave Assaf、Ryan Stewart、Alex Steiner、Bita Rouhani、Seong Hee Lee

SGLang 团队

常见问题解答

与 Nemotron 3 Nano 相比有什么新变化?

Nemotron 3 Nano 采用了高效的混合 Mamba-Transformer MoE 设计,总参数量为 30B,激活参数量为 3B,支持 100 万 token 的上下文窗口,并具备可控推理能力。Nemotron 3.5 Lightning 在以下三个重要方面基于这一基础进行了升级:

  • 前沿模型蒸馏:Nemotron 3.5 Lightning 由 Nemotron 3 Ultra 蒸馏而来,将 NVIDIA 前沿智能体模型的能力迁移到体积小得多的部署形态中。
  • 智能体框架优化:Nemotron 3.5 Lightning 针对主流智能体框架和多轮工作流进行了训练,重点优化了编码、工具使用、指令遵循以及专项任务完成能力。
  • 投机解码:Nemotron 3.5 Lightning 支持多 token 预测(MTP)、DFlash 和 DSpark,通过并行草拟和验证多个 token 来加速生成。

最终成果是一款能够在更短时间内更准确地完成更多智能体任务的模型。

来源:LMSYS:Blog(Chatbot Arena 团队)· lmsys.org