# NVIDIA 发布 Nemotron 3.5 Lightning：30B 开源 MoE 模型与 NeMo Switchyard 模型路由器

- 来源：MarkTechPost（RSS）
- 作者：Asif Razzaq
- 发布时间：2026-08-12 14:59
- AIHOT 分数：75
- AIHOT 链接：https://aihot.virxact.com/items/cmsprc8tc01rhro4hs7q435l3
- 原文链接：https://www.marktechpost.com/2026/08/11/nvidia-ai-releases-nemotron-3-5-lightning-and-nemo-switchyard

## AI 摘要

NVIDIA 推出 Nemotron 3.5 Lightning，一款 30B 参数、3B 活跃参数的混合 Mamba-2 + MoE + Attention 架构开源模型，上下文窗口达 1M token，采用 OpenMDW-1.1 许可，允许商用。

## 正文

NVIDIA 推出了用于构建始终在线的 AI 智能体的开放技术，这些智能体由多个专用模型组成的系统驱动。此次发布包含两项配套成果。Nemotron 3.5 Lightning 是一个轻量级、可定制的开放模型，专为高吞吐量的智能体任务而设计；NeMo Switchyard 则是一个开源路由库，可将智能体工作流的每一步引导至当前最强大且最高效的模型。这两项技术共同解决的是一个结构性问题：长时间运行的智能体将大部分时间花在工具调用、结果验证和子智能体委派上，而将其中每一步都交给前沿推理模型会带来额外的成本和延迟。Lightning 是一个 300 亿参数的混合专家（MoE）模型，其中 30 亿参数为激活参数，基于混合 Mamba-2 + MoE + Attention 架构构建，支持 100 万 token 的上下文窗口。NVIDIA 报告称，其输出速度比同类规模的模型快 4 倍，在完成 10,000 个 PinchBench 任务时，比 Qwen3.6 35B 快 30%，且准确率相当。CrowdStrike、Harvey、CodeRabbit、Fastino Labs 和 Lila Sciences 等众多行业参与者已在针对网络安全、法律、编程、金融和医疗健康等工作负载对其进行定制。

它可以部署吗？

可以。Nemotron 3.5 Lightning 已在宽松的 OpenMDW-1.1 许可证下全面开放，提供开放权重、训练数据和训练配方。NVIDIA 表示该模型已可用于商业用途。

哪些公司可以使用：任何拥有单块现代 GPU 的公司。NVIDIA 列出了在 1x DGX Spark (GB10) 或 1x H100 上的单 GPU 部署方案。这使得独立开发者和种子轮初创公司能够与企业站在同一起跑线上。中型市场团队可以通过 Baseten、Together AI 或 Nebius 进行托管服务；受监管的企业则可以完全在本地部署。

行业：网络安全、法律服务、软件工程、金融服务、医疗健康和生命科学均出现在 NVIDIA 公布的客户名单中。

应用场景：工具调用、结果验证、子智能体委派、代码审查路由、日志分类、合同解析，以及跨 100 万 token 窗口的长上下文检索。

执行层，而非规划层。

长时间运行的智能体大部分时间都花在高吞吐量的执行环节上。工具调用、结果验证和子智能体委派占据了绝大部分 token 预算。如果把这些步骤中的每一步都交给前沿推理模型来处理，就会增加成本和延迟。

Nemotron 3.5 Lightning 正是针对这一执行层而设计的。它是一个 30B 参数的混合专家模型，激活参数为 3B，基于混合 Mamba-2 + MoE + Attention 架构构建。上下文长度可达 1M token。预训练使用了 NVFP4 方案，覆盖了超过 20 万亿个 token。

该模型是 Nemotron 3 系列中规模最小的成员。像 Nemotron 3 Ultra 这样的前沿模型负责编排和规划，而 Lightning 则负责处理其下的常规调用。

速度从何而来

两大机制：

第一，投机解码：多 token 预测在专门的预训练阶段就已内置，随后通过 MTP 增强阶段进一步优化。NVIDIA 还提供了两个外部草稿模型：DSpark，一个半自回归草稿模型，推荐用于 DGX Spark 和低并发数据中心工作负载；以及 DFlash，它使用轻量级块扩散模型。

第二，量化：与 BF16 一同发布的还有 NVFP4 检查点。同一检查点原生支持 Blackwell 和 Hopper 架构，并通过 W4A16 内核扩展到 Ampere 架构。

NVIDIA 报告称，与同等规模的模型相比，其输出速度最高可提升 4 倍。在 PinchBench 上，它报告了 86% 的准确率，同时在完成 10,000 个任务时，比 Qwen3.6 35B 在同等准确率下快 30%。

已发布的模型卡结果（BF16 / NVFP4）：MMLU Pro 81.94 / 81.62，GPQA Diamond 75.44 / 75.57，SWE-bench Verified 51.56 / 52.80，Terminal-Bench 2.1 24.58 / 23.46，AA-LCR 52.00 / 49.19。推荐的采样参数为 temperature 1.0 和 top_p 0.95。

NeMo Switchyard

NeMo Switchyard 是一个开源库，可将智能体工作流的每一步路由到当前可用且最具能力、最高效的模型上。

它提供了免调优路由器，包括一个具有会话亲和性的大语言模型分类器、一个读取近期工具活动的阶段路由器，以及一个从低成本起步并在持续困难时升级的升级路由器。一个可调优的预填充路由器从模型的残差流中学习，以预测哪个候选模型会成功。该参考服务器接受 OpenAI、Anthropic 和 Responses API 请求。

两项已发布的结果：LangChain 对 145 个多轮智能体任务进行了基准测试。在 Lightning 和 Claude Opus 4.8 之间使用升级路由器进行路由，与仅使用前沿模型的基线相比，成本降低了 74%，仅将 7% 的调用发送给前沿模型，准确率损失约 6 个百分点。Cognition 在 Devin Desktop 中实现了分阶段路由。在 FrontierCode Main 上，在 Opus 5 和 Kimi K2.7 之间进行路由，达到了 50.6% 的准确率，平均成本为 3.11 美元，与 Opus 5 的准确率相差 2.8 个百分点以内，平均成本降低约 28%。

交互式讲解

关键要点

300 亿参数开源 MoE 模型，30 亿激活参数，100 万上下文，采用 OpenMDW-1.1 许可证，允许商业使用。

输出速度最高提升 4 倍；PinchBench 10,000 个任务的完成速度比 Qwen3.6 35B 快 30%。

速度来自多 token 预测以及 DSpark 和 DFlash 草稿模型，以及 NVFP4 检查点。

可在 1 块 DGX Spark 或 1 块 H100 上运行，也可通过 Ollama、LM Studio、llama.cpp 和 Unsloth 在本地运行。

在 LangChain 的 145 任务基准测试中，NeMo Switchyard 以约 6 个百分点的准确率权衡，将成本降低了 74%。

可在 build.nvidia.com 或 OpenRouter 上试用，并从 Hugging Face 或 ModelScope 下载权重。另外，欢迎在 Twitter 上关注我们，别忘了加入我们的 150k+ ML SubReddit 并订阅我们的通讯。等等！你在用 Telegram 吗？现在你也可以在 Telegram 上加入我们。
