NVIDIA 推出了用于构建始终在线的 AI 智能体的开放技术,这些智能体由多个专用模型组成的系统驱动。此次发布包含两项配套成果。Nemotron 3.5 Lightning 是一个轻量级、可定制的开放模型,专为高吞吐量的智能体任务而设计;NeMo Switchyard 则是一个开源路由库,可将智能体工作流的每一步引导至当前最强大且最高效的模型。这两项技术共同解决的是一个结构性问题:长时间运行的智能体将大部分时间花在工具调用、结果验证和子智能体委派上,而将其中每一步都交给前沿推理模型会带来额外的成本和延迟。Lightning 是一个 300 亿参数的混合专家(MoE)模型,其中 30 亿参数为激活参数,基于混合 Mamba-2 + MoE + Attention 架构构建,支持 100 万 token 的上下文窗口。NVIDIA 报告称,其输出速度比同类规模的模型快 4 倍,在完成 10,000 个 PinchBench 任务时,比 Qwen3.6 35B 快 30%,且准确率相当。CrowdStrike、Harvey、CodeRabbit、Fastino Labs 和 Lila Sciences 等众多行业参与者已在针对网络安全、法律、编程、金融和医疗健康等工作负载对其进行定制。
它可以部署吗?
可以。Nemotron 3.5 Lightning 已在宽松的 OpenMDW-1.1 许可证下全面开放,提供开放权重、训练数据和训练配方。NVIDIA 表示该模型已可用于商业用途。
- 哪些公司可以使用:任何拥有单块现代 GPU 的公司。NVIDIA 列出了在 1x DGX Spark (GB10) 或 1x H100 上的单 GPU 部署方案。这使得独立开发者和种子轮初创公司能够与企业站在同一起跑线上。中型市场团队可以通过 Baseten、Together AI 或 Nebius 进行托管服务;受监管的企业则可以完全在本地部署。
- 行业:网络安全、法律服务、软件工程、金融服务、医疗健康和生命科学均出现在 NVIDIA 公布的客户名单中。
- 应用场景:工具调用、结果验证、子智能体委派、代码审查路由、日志分类、合同解析,以及跨 100 万 token 窗口的长上下文检索。
执行层,而非规划层。
长时间运行的智能体大部分时间都花在高吞吐量的执行环节上。工具调用、结果验证和子智能体委派占据了绝大部分 token 预算。如果把这些步骤中的每一步都交给前沿推理模型来处理,就会增加成本和延迟。
Nemotron 3.5 Lightning 正是针对这一执行层而设计的。它是一个 30B 参数的混合专家模型,激活参数为 3B,基于混合 Mamba-2 + MoE + Attention 架构构建。上下文长度可达 1M token。预训练使用了 NVFP4 方案,覆盖了超过 20 万亿个 token。
该模型是 Nemotron 3 系列中规模最小的成员。像 Nemotron 3 Ultra 这样的前沿模型负责编排和规划,而 Lightning 则负责处理其下的常规调用。
速度从何而来
两大机制:
- 第一,投机解码:多 token 预测在专门的预训练阶段就已内置,随后通过 MTP 增强阶段进一步优化。NVIDIA 还提供了两个外部草稿模型:DSpark,一个半自回归草稿模型,推荐用于 DGX Spark 和低并发数据中心工作负载;以及 DFlash,它使用轻量级块扩散模型。
- 第二,量化:与 BF16 一同发布的还有 NVFP4 检查点。同一检查点原生支持 Blackwell 和 Hopper 架构,并通过 W4A16 内核扩展到 Ampere 架构。
NVIDIA 报告称,与同等规模的模型相比,其输出速度最高可提升 4 倍。在 PinchBench 上,它报告了 86% 的准确率,同时在完成 10,000 个任务时,比 Qwen3.6 35B 在同等准确率下快 30%。
已发布的模型卡结果(BF16 / NVFP4):MMLU Pro 81.94 / 81.62,GPQA Diamond 75.44 / 75.57,SWE-bench Verified 51.56 / 52.80,Terminal-Bench 2.1 24.58 / 23.46,AA-LCR 52.00 / 49.19。推荐的采样参数为 temperature 1.0 和 top_p 0.95。
NeMo Switchyard
NeMo Switchyard 是一个开源库,可将智能体工作流的每一步路由到当前可用且最具能力、最高效的模型上。
它提供了免调优路由器,包括一个具有会话亲和性的大语言模型分类器、一个读取近期工具活动的阶段路由器,以及一个从低成本起步并在持续困难时升级的升级路由器。一个可调优的预填充路由器从模型的残差流中学习,以预测哪个候选模型会成功。该参考服务器接受 OpenAI、Anthropic 和 Responses API 请求。
两项已发布的结果:LangChain 对 145 个多轮智能体任务进行了基准测试。在 Lightning 和 Claude Opus 4.8 之间使用升级路由器进行路由,与仅使用前沿模型的基线相比,成本降低了 74%,仅将 7% 的调用发送给前沿模型,准确率损失约 6 个百分点。Cognition 在 Devin Desktop 中实现了分阶段路由。在 FrontierCode Main 上,在 Opus 5 和 Kimi K2.7 之间进行路由,达到了 50.6% 的准确率,平均成本为 3.11 美元,与 Opus 5 的准确率相差 2.8 个百分点以内,平均成本降低约 28%。
交互式讲解
关键要点
- 300 亿参数开源 MoE 模型,30 亿激活参数,100 万上下文,采用 OpenMDW-1.1 许可证,允许商业使用。
- 输出速度最高提升 4 倍;PinchBench 10,000 个任务的完成速度比 Qwen3.6 35B 快 30%。
- 速度来自多 token 预测以及 DSpark 和 DFlash 草稿模型,以及 NVFP4 检查点。
- 可在 1 块 DGX Spark 或 1 块 H100 上运行,也可通过 Ollama、LM Studio、llama.cpp 和 Unsloth 在本地运行。
- 在 LangChain 的 145 任务基准测试中,NeMo Switchyard 以约 6 个百分点的准确率权衡,将成本降低了 74%。
可在 build.nvidia.com 或 OpenRouter 上试用,并从 Hugging Face 或 ModelScope 下载权重。另外,欢迎在 Twitter 上关注我们,别忘了加入我们的 150k+ ML SubReddit 并订阅我们的通讯。等等!你在用 Telegram 吗?现在你也可以在 Telegram 上加入我们。