过去两年间,NVIDIA 的内容安全堆栈已从一个专注的英文文本分类器发展成一个由多个专用模型组成的家族——每个模型都将覆盖范围扩展至新的模态、语言和推理模式。2026 年 3 月发布的 Nemotron 3 Content Safety,首次将多模态和多语言能力整合到一个 4B 参数的单一模型中。今天,我们发布 Nemotron 3.5 Content Safety,它完成了这一演进弧线:一个单一的模型,将多模态输入、多语言覆盖、自定义企业策略执行和可审计推理统一到一次推理调用中。本文涵盖 3.5 版本的变化、每项新功能背后的设计决策,以及如何将该模型集成到生产级安全流程中。
Nemotron 3.5 Content Safety 的新特性
1. 统一的多模态评估
Nemotron 3 引入了图像理解能力;Nemotron 3.5 则深化了多模态集成。该模型将用户提示词、可选图像和可选的助手回复作为一个单一的上下文窗口进行处理,并对组合输入产生一致的安全判定。将三者一起评估——而非分别打分——弥补了多模态安全场景中一个众所周知的漏洞:那些仅从文本与图像交互、或请求与回复交互中才出现的策略违规行为,现在只需一次处理即可捕获。
2. 全球语言覆盖
Nemotron 3.5 保留了其前代产品明确训练的 12 种语言——英语、法语、西班牙语、德语、中文、日语、韩语、阿拉伯语、印地语、俄语、葡萄牙语和意大利语——同时继承了基于 Gemma 3 基础模型的、覆盖约 140 种语言的强大零样本泛化能力。这意味着,在训练数据稀疏的市场(例如东南亚语言、斯堪的纳维亚语言、资源较少的非洲语言)进行部署时,可以受益于基础模型的多语言迁移能力,而无需进行单独的微调。
3. 自定义策略执行
这是 Nemotron 3 以来 3.5 版本中最重要的架构新增内容。生产环境部署很少在单一通用安全分类体系下运行。医疗平台的风险画像与金融服务聊天机器人、开发者工具 IDE 或儿童教育应用截然不同。Nemotron 3.5 在接收输入的同时,还接受自定义策略规范。模型在生成判定结果时,会依据该策略进行推理,而非完全依赖内置分类体系。这扩展了最初在 Nemotron Content Safety Reasoning 4B 中引入的工作,使其适用于完整的多模态、多语言场景。
4. 推理轨迹(THINK 模式)
Nemotron 3.5 中的每项安全判定,均可通过可选的 think 模式附带可审计的推理轨迹。启用该模式后,模型会先输出其逐步推理过程,再给出最终的安全/不安全标签,并可选择性地输出违反的类别。
<think>
The user prompt asks for guidance on acquiring a controlled substance without a prescription.
The assistant response provides specific sourcing steps and references an online marketplace.
This interaction violates the Criminal Planning/Confessions and Controlled Substances categories.
The image (a pharmacy exterior) provides locational context but does not alter the verdict.
</think>
User Safety: unsafe
Response Safety: unsafe
Safety Categories: Criminal Planning/Confessions, Controlled Substances
当延迟是主要约束条件时,可以禁用 THINK 模式,以恢复到与 Nemotron 3 相同的低延迟二元判定结果。
5. 安全数据集
伴随 Nemotron 3.5,我们发布了我们的安全数据集。这是一个重要的里程碑,因为大多数开源安全模型通常不提供训练集或评估集。在多模态领域,这个问题更为严重,因为图像或视频等素材通常来自具有限制性许可条款的资源。Nemotron 3.5 内容安全数据集是多模态、多语言的,并包含用于训练模型的安全推理轨迹。这些推理轨迹通过两步法生成,使其简洁明了,类似于 Nemotron Content Safety Reasoning 4B 模型。
模型架构
Nemotron 3.5 Content Safety 基于 Google Gemma 3 4B IT(40 亿参数)构建,提供 128K 上下文窗口、强大的视觉-语言推理能力以及广泛的多语言覆盖。NVIDIA 使用 LoRA 适配器对该基础模型进行微调,该适配器植入了目标性的安全分类行为,同时保持模型足够紧凑,以便在 8GB 以上显存的 GPU 上进行实时部署。
推理接口支持三种输出模式:
模式 1 — 低延迟二元判定:
User Safety: safe
Response Safety: unsafe
模式 2 — 带类别的二元判定:
User Safety: safe
Response Safety: unsafe
Safety Categories: Violence, Criminal Planning/Confessions
模式 3——思考模式(推理 + 判定):
<think>
[step-by-step reasoning trace]
</think>
User Safety: unsafe
Response Safety: unsafe
Safety Categories: [categories]
安全分类体系遵循 Aegis 2.0 框架:包含 13 个与 MLCommons 安全分类体系对齐的核心类别,外加 10 个细粒度子类别。这种对齐方式使得该体系能够与在 Aegis 分类数据集上评测的其他开源及闭源护栏系统进行直接比较。
推理
推理是内容安全分类的强力加速器,因为它为生产级 AI 系统(尤其是在企业和监管环境中)提供了所需的上下文、定制化能力和可问责性。
支持自定义和上下文相关的策略执行
推理使内容安全模型能够在推理时动态解释并执行以自然语言定义的自定义领域特定策略。这是必要的,因为生产环境部署很少在单一、通用的安全分类体系下运行。金融服务的聊天机器人与儿童教育应用具有不同的风险特征,后者对不雅语言的容忍度可能更低。此能力支持:
- 类别抑制:禁用不相关的类别,例如,当 DevOps 工具处理“终止进程”这一表述时,阻止触发“暴力”类别。
- 自定义类别注入:定义特定于组织监管或产品策略的专有风险类别。
提供可审计且有文档记录的判定依据
推理轨迹展示了模型在得出最终安全或不安全判定之前的逐步逻辑。这种有文档记录的判定依据有以下几个用途:
- 合规性与审计日志:受监管行业通常要求对内容审核决策提供有文档记录的判定依据。
- 人工审核:审核人员可以审计得出某个判定的原因,以识别系统性的模型错误。
- 策略迭代:推理轨迹揭示了模型如何解读边缘案例,使团队能够迭代地优化和改进自定义策略语言。
延迟
尽管推理过程可能引入延迟,但 Nemotron 模型通过将推理链压缩为简洁摘要来限制模型 token 输出并提升效率,从而解决了这一问题。这一过程分两步完成,与其前代模型 Nemotron-Content-Safety-Reasoning-4B 的做法类似。第一步,我们使用更大型、更强大的模型(如 Qwen 397B),基于提供的提示词、图像和响应来生成思维链推理轨迹。我们还提供了样本的真实标签,以避免任何可能混入推理轨迹的错误分类。第二步,我们使用另一个大型模型(如 Qwen 80B)来精简这些推理轨迹。我们专门指示该模型对原始轨迹(来自第一步)进行改写,使其不超过 3 句话。根据我们的实验,生成的绝大多数推理轨迹都在 3 句话以内。
高效的推理轨迹优化使得低延迟的自定义策略执行成为可能。此外,推理轨迹还提供了宝贵的训练信号,可用于训练专门的审核模型。开发者可以选择双模式运行:在通用任务中禁用推理以实现最低延迟,或在处理复杂策略时启用推理。
训练数据
驱动 Nemotron 3.5 的数据集是 Nemotron 3 所使用的多模态、多语言混合数据的演进版本,并新增了针对推理和自定义策略能力的数据。我们使用了以下数据来源:
- 来自 Nemotron Safety Guard Dataset v3 的多语言文本安全数据,从具有文化细微差别的子集中采样,并在安全类别以及安全/不安全分类中按比例进行代表性分配。
- 由 NVIDIA 以英语收集的人工标注多模态数据,已翻译成 12 种语言。关键在于,99% 的训练图像是真实照片——而非合成生成物。这直接解决了多模态安全基准领域的一个已知弱点:现有数据集(如 VLGuard 和 MM-SafetyBench)严重依赖 SDXL 生成的图像,这些图像缺乏生产内容所具有的文化纹理和对抗性复杂度。尽管由于许可限制,并非所有这些真实图像都能发布,我们仍能发布来自 Wikimedia 和合成生成的部分图像子集。
- 来自 Nemotron VLM 数据集 v2 的安全多模态数据,涵盖扫描文档、图表、论文和示意图及其相关查询——确保模型不会过度标记良性的专业内容。
- 由更大的教师模型(Qwen 397B)生成的思维链输出中提取的推理轨迹,随后使用 Qwen 80B 进行精简,用于教导模型如何进行推理。
- 来自 CantTalkAboutThis 数据集的主题跟随数据,包含一系列企业部署场景(医疗、金融、银行、教育等)中的策略规范/判定对。
- 合成数据约占总体训练数据量的 10%,主要用于多样化越狱模式、生成罕见的策略违规示例以及产生多模态对抗性案例。
基准测试
Nemotron 3.5 Content Safety 在多项多语言、多模态和自定义策略安全基准上进行了评估,包括 VLGuard、MM-SafetyBench、PolyGuard、RTP-LX、Aya Redteaming、XSafety、MultiJail、Aegis、Dynaguardrail 和 CoSA。这些评估反映了企业安全的核心生产挑战:在全球语言、文本和图像输入以及特定领域策略之间应用一致的防护栏,同时不增加显著延迟。
Nemotron 3 在多模态有害内容测试中取得了 84% 的平均准确率,奠定了坚实基础,其延迟约为 LlamaGuard-4-12B 的一半。Nemotron 3.5 在保持紧凑的 4B 效率的同时,增加了自定义策略支持和推理轨迹。
在多语言和多模态安全基准测试中,Nemotron 3.5 在保持紧凑模型规模的同时,实现了强大的有害内容分类准确率。这一点至关重要,因为许多安全模型仍然以英语优先、仅支持文本,或者在生产流程中反复运行的成本过高。Nemotron 3.5 的设计目标是将多语言覆盖、多模态分类、自定义策略支持和低延迟部署整合到单一模型中。
图 1. Nemotron 3.5 内容安全模型在多语言和多模态安全基准测试中均展现出强大的有害内容分类准确率,在评估的基准测试集上平均准确率约为 85%。
语言层面的结果凸显了多语言安全对于全球企业级 AI 的重要性。在 Multilingual Aegis 基准上,Nemotron 3.5 在 12 种语言中的有害内容分类平均准确率达到 96.5%。在 RTP-LX 基准上,其平均准确率为 88.8%,综合 Aegis 和 RTP-LX 的平均准确率为 92.7%。这种一致性有助于团队在面向客户、员工和合作伙伴的工作流程中应用统一的安全策略,而不是依赖仅支持英语的内容审核或各自独立的区域性安全模型。
图 2. Nemotron 3.5 内容安全模型在 Multilingual Aegis Cultural + Adapted(提示词分类)(harmful-f1)基准上,跨 12 种语言的有害内容分类平均准确率达到 97%。
图 3. Nemotron 3.5 内容安全模型在 RTPLX(提示词分类)(harmful-f1)基准上,跨 12 种语言的有害内容分类平均准确率达到 89%。
对于生产环境的安全护栏而言,仅有准确率是不够的。安全模型还必须足够高效,以便在内容被处理、返回或路由到下游之前运行。Nemotron 3.5 内容安全模型紧凑的 4B 设计有助于降低反复进行安全检查的成本和延迟,使多语言和多模态安全护栏在实际 AI 应用中变得可行。
延迟
在默认(无 THINK)模式下,延迟特性与 Nemotron 3 保持一致。THINK 模式增加的推理时间与追踪长度成正比,但这种开销是可预测的,并且可以与同步审核循环分开进行预算——例如,在默认模式处理实时决策的同时,将 THINK 模式评估作为审计管道的一部分异步运行。
图 4. 与另一种多模态安全模型相比,Nemotron 3.5 内容安全模型在多模态基准测试上的端到端延迟降低了 3 倍。
与另一种推理安全模型相比,我们的模型在启用推理时生成的 token 数量最多减少 50%,从而在成本和延迟方面更具效率。
解决基准测试差距
多模态安全研究中一个反复出现的主题是现有评估基础设施中存在的差距。Nemotron 3.5 的开发过程中遇到了更广泛文献中记载的相同差距:
- 纯文本覆盖:最广泛引用的安全基准测试(WildGuard、XSTest、HarmBench)都是纯文本的。多模态性能无法从文本基准测试结果中推断出来。
- 合成图像质量:现有的大多数多模态基准测试使用 AI 生成的图像(通常是 SDXL),而非真实照片,这低估了真实生产内容的难度。
- 真实图像许可:图库照片许可禁止在 AI 数据集中重新分发,这在研究条件和生产条件之间造成了结构性差距。
NVIDIA 的多模态训练数据——包含真实图像和具有文化细微差别的多语言提示词——旨在填补模型训练中的部分此类差距。评估方面的基准测试差距对于更广泛的安全研究社区来说仍然是一个悬而未决的问题。
入门指南
Nemotron 3.5 内容安全模型及其训练数据集已在 Hugging Face 上以 NVIDIA 开放模型许可证发布,可用于研究和商业用途。该模型支持 transformers、vLLM 和 SGLang,并且作为生产级 NVIDIA NIM 微服务在 build.nvidia.com 上提供,适用于需要预封装、GPU 优化推理微服务的团队。
开发者还可以通过推理平台访问该模型,包括 Baseten、Eigen AI、DeepInfra、OpenRouter 和 Vultr。
对于自定义策略工作流,NVIDIA 提供了一个与 Claude 和 Codex 兼容的技能,用于生成自定义策略,同时还提供了展示如何使用该模型的示例手册。自定义策略和推理轨迹有助于团队根据特定领域的规则调整安全行为,同时保持决策的可审计性。