Hugging Face:Blog(RSS)
精选
68AI 编辑部评分,满分 100

Nemotron 预训练的任务种子合成问答生成

2026-06-04 19:24· 73天前
AI 导读

在 Nemotron-3 Nano 模型的 100B token 续训练实验中,任务种子合成数据生成(Task-Seeded SDG)使 MMLU-Pro 提升 1.8 分,平均代码提升 1.9 分,常识理解提升 1.6 分,GPQA 提升 11.1 分,数学成绩保持稳定。该流程利用 lm-eval-harness 中约 70 个公开任务(约 700 子任务)的训练集作为种子,生成新示例并补充推理和上下文,经过格式校验、去重和答案验证后得到精选合成数据集,用于 Nemotron Ultra 和 Super 训练。

推荐理由

NVIDIA 公开了 Nemotron 训练中造合成数据的详细方法论,用 70 个公开任务训练集做种子生成新题目,100B token 实验把 GPQA 拉高 11 个点,做预训练的人值得看看他们怎么造的数据。

正文 · AI 翻译

作者:Dan Su 在大规模大语言模型开发中,问题不再仅仅是模型看到了多少数据,还包括数据是否包含足够的结构化学习信号。通用网页、代码、数学、多语言和领域数据提供了广泛的基础。任务种子合成问答通过添加紧凑的、具有任务结构的示例来补充这些数据,这些示例具有明确的信息需求、受限的响应空间以及将证据与答案联系起来的解释。在 Nemotron-3 Nano 模型上进行的 100B token 续训练实验中,任务种子 SDG 使 MMLU-Pro 提升了 +1.8,平均代码能力提升了 +1.9,常识理解提升了 +1.6,GPQA 提升了 +11.1,同时平均数学能力保持稳定。

本文描述了一种为 Nemotron 系列训练(包括 Ultra 和 Super 训练运行)开发的任务种子合成问答生成工作流程。该工作流程将来自广泛公共任务族的训练集拆分作为能力种子,生成新的任务对齐示例,通过推理和相关知识丰富这些示例,并将其过滤成精选的合成数据集。保留的评估和测试数据被排除在生成过程之外。下游的训练方案随后可以决定如何将这些数据集与更广泛的语料库混合。

图 1. 任务种子 SDG 流程以精选的生成数据结束。训练混合方案设计和报告的评估结果发生在下游。

摘要

  • 我们使用公共任务训练集拆分作为能力种子,而不是作为需要记忆的示例。
  • 我们通过跨任务族的迁移学习来构建数据:模型可以从广泛的种子任务中学习可复用的行为,然后将其应用于相关的应用和评估。
  • 该流程生成相似的问题和带有推理及任务相关上下文的答案增强示例。
  • 多项选择任务更容易验证;开放式生成任务需要特定于任务的提取和过滤。
  • 在 Nemotron-3 Nano 模型上进行的 100B token 续训练实验中,任务种子 SDG 使 MMLU-Pro 提升了 +1.8,平均代码能力提升了 +1.9,常识理解提升了 +1.6,GPQA 提升了 +11.1,同时平均数学能力保持稳定。

概览

要素 数值
种子来源 通过 lm-eval-harness 可用的公共任务训练集拆分
规模 约 70 个任务和约 700 个子任务
数据类型 相似问题、答案增强样本、推理/上下文轨迹
验证 模式检查、格式检查、去重、多数投票答案检查
训练用途 Nemotron 系列后期训练,包括 Ultra/Super 工作流
主要结果 在 100B token 的 Nemotron-3 Nano 持续训练中,MMLU-Pro、代码、常识推理和 GPQA 均获得提升

生成流水线

生成工作流是一个紧凑的循环:收集训练集种子、标准化异构任务记录、生成新样本、增强答案,并对结果数据进行过滤。在内部流水线中,我们使用了来自 lm-eval-harness 的大约 70 个公开任务数据集,涵盖约 700 个子任务。对于每个任务,我们仅使用合适的训练集划分作为 SDG 种子;保留的测试数据不用于生成,没有合适训练数据的任务则从种子收集中排除。

种子池同时覆盖了知识密集型任务和推理密集型任务:

种子分组 大致覆盖范围 目的
知识密集型任务 39 个任务,约 300 个子任务,约 300 万条种子样本 改善事实性、科学性、多语言和特定领域的问答行为
推理密集型任务 34 个任务,约 400 个子任务,约 150 万条种子样本 改善分析推理、逻辑推理、数学、代码和常识推理

对于 Nemotron Ultra 和 Super 预训练,我们使用了生成数据中适合商业模型训练的许可兼容子集。

端到端流程包含五个阶段:

  1. 收集种子任务。枚举可用的 lm-eval-harness 任务,按输出类型分组,仅保留具有合适训练集划分的任务。
  2. 标准化记录。由于每个 lm-eval-harness 任务在 YAML 中定义了各自的字段和格式,我们将任务记录转换为统一的 JSONL 风格模式。对于多项选择任务,标准化记录包含问题和候选选项。对于生成式任务,则包含问题或提示词,以及任务提供的上下文(如有)。
  3. 生成相似样本。给定一条种子样本,生成器会创建一个新问题,在保留底层能力的同时改变内容。
  4. 丰富答案。生成器解答所生成的问题,并添加最终答案以及相关的推理、知识或上下文。
  5. 过滤与打包。该流程会尽可能执行模式检查、格式检查、去重以及特定任务的答案验证。选择题数据更容易直接验证;生成式数据则需要更谨慎的特定任务处理。

一种实用的格式选择是,尽可能存储语义化的答案文本,而不仅仅是选项标签。例如,将答案写成“指甲缝里卡住的污垢”,比只写“B”能为模型提供更清晰的训练信号。

为什么采用任务种子数据?

公开任务数据集并不完美,但它们的训练集部分包含了信息如何被请求、约束和解决的紧凑示例。它们捕捉了任务框架、领域知识、推理深度、候选答案和最终回答形式之间的有用关联。模型在预训练期间可能见过大量原始文本,但仍然可以从那些使这些关联变得明确的合成数据中受益。

任务种子合成数据通过将公开任务训练集转化为数据生成模板,来解决这一差距。仅使用来自广泛任务族中合适的训练集部分,我们生成新的示例,这些示例保留了源交互的有用属性:

  • 任务框架,例如该示例要求的是选择、生成、分类还是解释;
  • 答案结构,例如多选题选项、简短答案、自由形式的回答或格式受限的输出;
  • 领域与上下文,例如科学、常识、事实知识、数学、代码、多语言问答或阅读理解;
  • 难度与推理深度,例如该示例是需要直接事实、在备选项之间进行比较,还是需要多个推理步骤;
  • 解释性信号,例如有助于将问题与答案联系起来的任务相关知识、推理或上下文。

这使我们能够向模型展示跨任务族的可复用推理和知识运用模式,而不必将数据集局限于单一数据源的表面格式。

为什么使用更广泛的种子任务?

理解这一流程的一个有效方式,是将其视为跨任务族群的迁移学习。许多改进并非来自学习单个任务的表层格式,而是来自强化那些在多个任务中反复出现的可复用行为:识别信息需求、应用相关领域知识、区分合理备选项、遵循回答约束、进行多步推理,以及在正确上下文中锚定最终答案。

正因如此,我们并非从狭窄的任务格式集合中生成数据。相反,我们从 lm-eval-harness 中收集了更广泛的训练集种子样本,用以覆盖众多相邻的能力区域。一个科学问答种子样本有助于常识性物理推理;一个逻辑推理种子样本有助于细致的选项比较;一个数学或代码种子样本则有助于多步规划,即使最终应用并非完全相同的任务。其目标是实现跨任务族群的正向迁移学习,同时降低模型仅仅学习单一数据源特有模式的风险。

这一动机也与 Nemotron Nano 预训练中的早期证据相符。我们发现,使用 AGIEval 训练数据能够提升 MMLU-Pro 的表现,这表明来自一个任务族群的结构化问答数据可以改善原始族群之外的行为。此处采用的更广泛的种子样本集合扩展了这一思路:它不再依赖单一任务源,而是使用多个训练集任务族群,从而让可迁移的推理、知识运用和答案选择行为有更多机会涌现。

为何要添加上下文和推理过程?

仅凭答案本身往往是一个薄弱的训练信号,尤其是在科学、常识和多步推理示例中。添加与任务相关的知识或推理轨迹,能为模型提供从问题到答案的路径,并帮助它理解为何看似合理的干扰项是错误的。

图 2 中的 PIQA 风格示例在紧凑的设定中展示了这一区别。生成的题目仅凭正确选项即可回答,但答案生成的变体则添加了定义、历史背景和干扰项分析,从而使该记录成为一个更强的学习信号。

图 2. 一个具体的 SDG 转换示例:一个 PIQA 风格的种子会生成一系列相似的新问题,其中一个生成的问题会被扩展为两条包含答案的增强记录。

在一项内部的有上下文与无上下文消融实验中,经过上下文增强的版本在多个侧重知识与推理的评测上取得了更强的数据:

评测 无上下文 有上下文 变化
ARC-Challenge 91.89 92.24 +0.35
CommonsenseQA 80.02 80.26 +0.24
PIQA 82.86 84.44 +1.58
WinoGrande 79.87 80.51 +0.64
AGIEval-en CoT 63.16 69.32 +6.16
GPQA-Diamond CoT n-shot 34.85 45.96 +11.11
MMLU-Pro 5-shot 64.45 66.89 +2.44
MBPP+ sampled 73.77 74.82 +1.05

训练用途

基于任务种子的合成数据被混合到 Nemotron 系列模型的后期训练中。在一个针对 Nemotron-3 Nano 模型的 1000 亿 token 持续训练实验中,加入新合成的基于任务种子的数据提升了多个能力组的表现:

指标组 之前 之后 变化
MMLU-Pro 64.8 66.6 +1.8
代码平均 73.2 75.1 +1.9
数学平均 87.6 87.9 +0.3
常识理解 72.9 74.5 +1.6
GPQA 30.8 41.9 +11.1

这些结果之所以令人鼓舞,有两个原因。首先,改进并不局限于最直接的目标。MMLU-Pro、代码、常识理解和 GPQA 均有提升,而数学保持稳定。其次,GPQA 的大幅提升表明,用相关知识和推理进行增强的示例可以帮助模型处理更困难的科学推理问题。

这种模式与上文讨论的迁移学习解释一致:提升出现在多个能力组,而非仅出现在一个密切相关的评测中。

该结果还揭示了一个有用的权衡:有针对性的基于任务种子的数据必须谨慎混合。某一项评测上的提升,应与广泛的通用知识保持情况一并检查,而不能孤立看待。

我们的收获

有几项实践发现值得注意:

  • 广泛的种子覆盖范围能提升泛化能力。使用多种任务族可以降低对单一评测风格过拟合的风险。
  • 上下文有帮助。推理和任务相关知识使合成答案比仅有标签更有用。
  • 输出格式是训练信号的一部分。看似微小的选择,例如使用答案字母还是答案文本,都可能影响下游行为。
  • 多项选择题任务比开放式生成任务更容易验证。生成任务需要针对特定任务进行答案提取,并可能需要单独处理。
  • 混合设计很重要。自然样本数量分布可能会使大型任务权重过高,因此重要的任务族可能需要明确的采样控制。
  • 基准测试的改进应结合广泛能力的保持情况进行检查。当数学、代码、常识和通用知识保持稳定时,MMLU-Pro 或 GPQA 的提升才更有意义。

结论

任务种子合成数据为模型构建者提供了一种实用方法,可以在后期训练阶段精准定位重要的技能。通过收集广泛的训练集任务种子、生成新示例、用推理和知识丰富答案,并仔细过滤生成的数据,我们可以在保持广泛能力的同时,提升模型在困难推理和知识任务上的表现。

对于 Nemotron Ultra 和 Super 的预训练,这个工作流程提供了一种可扩展的方案,使合成数据更具目的性。关键不仅在于生成更多数据,更在于生成具有正确结构、正确解释信号以及足够元数据以支持下游混合决策的数据。

来源:Hugging Face:Blog(RSS) · huggingface.co

Nemotron 预训练的任务种子合成问答生成

Hugging Face:Blog(RSS)·2026-06-04 19:24·73天前
AI 导读

在 Nemotron-3 Nano 模型的 100B token 续训练实验中,任务种子合成数据生成(Task-Seeded SDG)使 MMLU-Pro 提升 1.8 分,平均代码提升 1.9 分,常识理解提升 1.6 分,GPQA 提升 11.1 分,数学成绩保持稳定。该流程利用 lm-eval-harness 中约 70 个公开任务(约 700 子任务)的训练集作为种子,生成新示例并补充推理和上下文,经过格式校验、去重和答案验证后得到精选合成数据集,用于 Nemotron Ultra 和 Super 训练。

正文 · AI 翻译

作者:Dan Su 在大规模大语言模型开发中,问题不再仅仅是模型看到了多少数据,还包括数据是否包含足够的结构化学习信号。通用网页、代码、数学、多语言和领域数据提供了广泛的基础。任务种子合成问答通过添加紧凑的、具有任务结构的示例来补充这些数据,这些示例具有明确的信息需求、受限的响应空间以及将证据与答案联系起来的解释。在 Nemotron-3 Nano 模型上进行的 100B token 续训练实验中,任务种子 SDG 使 MMLU-Pro 提升了 +1.8,平均代码能力提升了 +1.9,常识理解提升了 +1.6,GPQA 提升了 +11.1,同时平均数学能力保持稳定。

本文描述了一种为 Nemotron 系列训练(包括 Ultra 和 Super 训练运行)开发的任务种子合成问答生成工作流程。该工作流程将来自广泛公共任务族的训练集拆分作为能力种子,生成新的任务对齐示例,通过推理和相关知识丰富这些示例,并将其过滤成精选的合成数据集。保留的评估和测试数据被排除在生成过程之外。下游的训练方案随后可以决定如何将这些数据集与更广泛的语料库混合。

图 1. 任务种子 SDG 流程以精选的生成数据结束。训练混合方案设计和报告的评估结果发生在下游。

摘要

  • 我们使用公共任务训练集拆分作为能力种子,而不是作为需要记忆的示例。
  • 我们通过跨任务族的迁移学习来构建数据:模型可以从广泛的种子任务中学习可复用的行为,然后将其应用于相关的应用和评估。
  • 该流程生成相似的问题和带有推理及任务相关上下文的答案增强示例。
  • 多项选择任务更容易验证;开放式生成任务需要特定于任务的提取和过滤。
  • 在 Nemotron-3 Nano 模型上进行的 100B token 续训练实验中,任务种子 SDG 使 MMLU-Pro 提升了 +1.8,平均代码能力提升了 +1.9,常识理解提升了 +1.6,GPQA 提升了 +11.1,同时平均数学能力保持稳定。

概览

要素 数值
种子来源 通过 lm-eval-harness 可用的公共任务训练集拆分
规模 约 70 个任务和约 700 个子任务
数据类型 相似问题、答案增强样本、推理/上下文轨迹
验证 模式检查、格式检查、去重、多数投票答案检查
训练用途 Nemotron 系列后期训练,包括 Ultra/Super 工作流
主要结果 在 100B token 的 Nemotron-3 Nano 持续训练中,MMLU-Pro、代码、常识推理和 GPQA 均获得提升

生成流水线

生成工作流是一个紧凑的循环:收集训练集种子、标准化异构任务记录、生成新样本、增强答案,并对结果数据进行过滤。在内部流水线中,我们使用了来自 lm-eval-harness 的大约 70 个公开任务数据集,涵盖约 700 个子任务。对于每个任务,我们仅使用合适的训练集划分作为 SDG 种子;保留的测试数据不用于生成,没有合适训练数据的任务则从种子收集中排除。

种子池同时覆盖了知识密集型任务和推理密集型任务:

种子分组 大致覆盖范围 目的
知识密集型任务 39 个任务,约 300 个子任务,约 300 万条种子样本 改善事实性、科学性、多语言和特定领域的问答行为
推理密集型任务 34 个任务,约 400 个子任务,约 150 万条种子样本 改善分析推理、逻辑推理、数学、代码和常识推理

对于 Nemotron Ultra 和 Super 预训练,我们使用了生成数据中适合商业模型训练的许可兼容子集。

端到端流程包含五个阶段:

  1. 收集种子任务。枚举可用的 lm-eval-harness 任务,按输出类型分组,仅保留具有合适训练集划分的任务。
  2. 标准化记录。由于每个 lm-eval-harness 任务在 YAML 中定义了各自的字段和格式,我们将任务记录转换为统一的 JSONL 风格模式。对于多项选择任务,标准化记录包含问题和候选选项。对于生成式任务,则包含问题或提示词,以及任务提供的上下文(如有)。
  3. 生成相似样本。给定一条种子样本,生成器会创建一个新问题,在保留底层能力的同时改变内容。
  4. 丰富答案。生成器解答所生成的问题,并添加最终答案以及相关的推理、知识或上下文。
  5. 过滤与打包。该流程会尽可能执行模式检查、格式检查、去重以及特定任务的答案验证。选择题数据更容易直接验证;生成式数据则需要更谨慎的特定任务处理。

一种实用的格式选择是,尽可能存储语义化的答案文本,而不仅仅是选项标签。例如,将答案写成“指甲缝里卡住的污垢”,比只写“B”能为模型提供更清晰的训练信号。

为什么采用任务种子数据?

公开任务数据集并不完美,但它们的训练集部分包含了信息如何被请求、约束和解决的紧凑示例。它们捕捉了任务框架、领域知识、推理深度、候选答案和最终回答形式之间的有用关联。模型在预训练期间可能见过大量原始文本,但仍然可以从那些使这些关联变得明确的合成数据中受益。

任务种子合成数据通过将公开任务训练集转化为数据生成模板,来解决这一差距。仅使用来自广泛任务族中合适的训练集部分,我们生成新的示例,这些示例保留了源交互的有用属性:

  • 任务框架,例如该示例要求的是选择、生成、分类还是解释;
  • 答案结构,例如多选题选项、简短答案、自由形式的回答或格式受限的输出;
  • 领域与上下文,例如科学、常识、事实知识、数学、代码、多语言问答或阅读理解;
  • 难度与推理深度,例如该示例是需要直接事实、在备选项之间进行比较,还是需要多个推理步骤;
  • 解释性信号,例如有助于将问题与答案联系起来的任务相关知识、推理或上下文。

这使我们能够向模型展示跨任务族的可复用推理和知识运用模式,而不必将数据集局限于单一数据源的表面格式。

为什么使用更广泛的种子任务?

理解这一流程的一个有效方式,是将其视为跨任务族群的迁移学习。许多改进并非来自学习单个任务的表层格式,而是来自强化那些在多个任务中反复出现的可复用行为:识别信息需求、应用相关领域知识、区分合理备选项、遵循回答约束、进行多步推理,以及在正确上下文中锚定最终答案。

正因如此,我们并非从狭窄的任务格式集合中生成数据。相反,我们从 lm-eval-harness 中收集了更广泛的训练集种子样本,用以覆盖众多相邻的能力区域。一个科学问答种子样本有助于常识性物理推理;一个逻辑推理种子样本有助于细致的选项比较;一个数学或代码种子样本则有助于多步规划,即使最终应用并非完全相同的任务。其目标是实现跨任务族群的正向迁移学习,同时降低模型仅仅学习单一数据源特有模式的风险。

这一动机也与 Nemotron Nano 预训练中的早期证据相符。我们发现,使用 AGIEval 训练数据能够提升 MMLU-Pro 的表现,这表明来自一个任务族群的结构化问答数据可以改善原始族群之外的行为。此处采用的更广泛的种子样本集合扩展了这一思路:它不再依赖单一任务源,而是使用多个训练集任务族群,从而让可迁移的推理、知识运用和答案选择行为有更多机会涌现。

为何要添加上下文和推理过程?

仅凭答案本身往往是一个薄弱的训练信号,尤其是在科学、常识和多步推理示例中。添加与任务相关的知识或推理轨迹,能为模型提供从问题到答案的路径,并帮助它理解为何看似合理的干扰项是错误的。

图 2 中的 PIQA 风格示例在紧凑的设定中展示了这一区别。生成的题目仅凭正确选项即可回答,但答案生成的变体则添加了定义、历史背景和干扰项分析,从而使该记录成为一个更强的学习信号。

图 2. 一个具体的 SDG 转换示例:一个 PIQA 风格的种子会生成一系列相似的新问题,其中一个生成的问题会被扩展为两条包含答案的增强记录。

在一项内部的有上下文与无上下文消融实验中,经过上下文增强的版本在多个侧重知识与推理的评测上取得了更强的数据:

评测 无上下文 有上下文 变化
ARC-Challenge 91.89 92.24 +0.35
CommonsenseQA 80.02 80.26 +0.24
PIQA 82.86 84.44 +1.58
WinoGrande 79.87 80.51 +0.64
AGIEval-en CoT 63.16 69.32 +6.16
GPQA-Diamond CoT n-shot 34.85 45.96 +11.11
MMLU-Pro 5-shot 64.45 66.89 +2.44
MBPP+ sampled 73.77 74.82 +1.05

训练用途

基于任务种子的合成数据被混合到 Nemotron 系列模型的后期训练中。在一个针对 Nemotron-3 Nano 模型的 1000 亿 token 持续训练实验中,加入新合成的基于任务种子的数据提升了多个能力组的表现:

指标组 之前 之后 变化
MMLU-Pro 64.8 66.6 +1.8
代码平均 73.2 75.1 +1.9
数学平均 87.6 87.9 +0.3
常识理解 72.9 74.5 +1.6
GPQA 30.8 41.9 +11.1

这些结果之所以令人鼓舞,有两个原因。首先,改进并不局限于最直接的目标。MMLU-Pro、代码、常识理解和 GPQA 均有提升,而数学保持稳定。其次,GPQA 的大幅提升表明,用相关知识和推理进行增强的示例可以帮助模型处理更困难的科学推理问题。

这种模式与上文讨论的迁移学习解释一致:提升出现在多个能力组,而非仅出现在一个密切相关的评测中。

该结果还揭示了一个有用的权衡:有针对性的基于任务种子的数据必须谨慎混合。某一项评测上的提升,应与广泛的通用知识保持情况一并检查,而不能孤立看待。

我们的收获

有几项实践发现值得注意:

  • 广泛的种子覆盖范围能提升泛化能力。使用多种任务族可以降低对单一评测风格过拟合的风险。
  • 上下文有帮助。推理和任务相关知识使合成答案比仅有标签更有用。
  • 输出格式是训练信号的一部分。看似微小的选择,例如使用答案字母还是答案文本,都可能影响下游行为。
  • 多项选择题任务比开放式生成任务更容易验证。生成任务需要针对特定任务进行答案提取,并可能需要单独处理。
  • 混合设计很重要。自然样本数量分布可能会使大型任务权重过高,因此重要的任务族可能需要明确的采样控制。
  • 基准测试的改进应结合广泛能力的保持情况进行检查。当数学、代码、常识和通用知识保持稳定时,MMLU-Pro 或 GPQA 的提升才更有意义。

结论

任务种子合成数据为模型构建者提供了一种实用方法,可以在后期训练阶段精准定位重要的技能。通过收集广泛的训练集任务种子、生成新示例、用推理和知识丰富答案,并仔细过滤生成的数据,我们可以在保持广泛能力的同时,提升模型在困难推理和知识任务上的表现。

对于 Nemotron Ultra 和 Super 的预训练,这个工作流程提供了一种可扩展的方案,使合成数据更具目的性。关键不仅在于生成更多数据,更在于生成具有正确结构、正确解释信号以及足够元数据以支持下游混合决策的数据。

来源:Hugging Face:Blog(RSS)· huggingface.co