在大语言模型后训练阶段扩展可执行智能体训练数据,其瓶颈在于受限于特定基底的方法——这些方法将任务生成与预定义工具、代码仓库或技能图谱绑定:扩大覆盖范围需要手动进行基底工程,每个新领域都需要定制化的流水线,且最终的任务分布往往反映的是基底偏差而非真实需求。我们提出 NexForge,这是一个需求驱动的框架,它以高层次能力需求为输入,为监督微调合成多样化、可执行的智能体任务及专家轨迹。NexForge 首先调研真实需求以构建代表性场景和任务画像,随后执行分布感知的编译以生成任务指令。针对每条指令,NexForge 自动检索或构建所需的文件、依赖项和运行时配置,最终合成专家执行路径并生成训练轨迹。在无需领域特定基础设施的情况下,NexForge 生成了 3.6K 个终端任务和 2K 个办公任务,将 Qwen3.5-35B-A3B Base 在 Terminal-Bench 2.0 上的成绩从 22.5% 提升至 52.0%,在 GDPval 上的 Elo 评分从 813 提升至 1338;进一步扩展至 43.2K 个终端任务后,成绩达到 58.4%,与配备 Claude Code 的 Claude Opus 4.6 持平。经过进一步扩展,NexForge 合成的数据还用于训练 Nex-N2——一个公开可用的智能体模型系列,该系列将 Qwen3.5-35B-A3B 在 Terminal-Bench 2.1 上的成绩提升至 75.3%,在 GDPval 上的 Elo 评分提升至 1585——实现了开源模型的最优性能,并超越了数个前沿闭源系统。Nex-N2 模型可在 https://nex.sii.edu.cn/ 获取。
NexForge:通过需求驱动任务合成扩展LLM智能体能力
阅读原文· arxiv.orgNexForge 抛弃了靠人工造工具和仓库的老路,从需求出发自动合成训练数据,让 Qwen 基座在终端任务上逼近 Claude Opus,还开源了模型,做 agent 训练的值得细看数据生成思路。
NexForge提出需求驱动框架,无需领域特定基础设施即可自动合成多样化可执行智能体任务与专家轨迹。该框架生成3.6K终端和2K办公任务,将Qwen3.5-35B-A3B Base在Terminal-Bench 2.0上从22.5%提升至52.0%,GDPval Elo从813提升至1338。
在大语言模型后训练阶段扩展可执行智能体训练数据,其瓶颈在于受限于特定基底的方法——这些方法将任务生成与预定义工具、代码仓库或技能图谱绑定:扩大覆盖范围需要手动进行基底工程,每个新领域都需要定制化的流水线,且最终的任务分布往往反映的是基底偏差而非真实需求。我们提出 NexForge,这是一个需求驱动的框架,它以高层次能力需求为输入,为监督微调合成多样化、可执行的智能体任务及专家轨迹。NexForge 首先调研真实需求以构建代表性场景和任务画像,随后执行分布感知的编译以生成任务指令。针对每条指令,NexForge 自动检索或构建所需的文件、依赖项和运行时配置,最终合成专家执行路径并生成训练轨迹。在无需领域特定基础设施的情况下,NexForge 生成了 3.6K 个终端任务和 2K 个办公任务,将 Qwen3.5-35B-A3B Base 在 Terminal-Bench 2.0 上的成绩从 22.5% 提升至 52.0%,在 GDPval 上的 Elo 评分从 813 提升至 1338;进一步扩展至 43.2K 个终端任务后,成绩达到 58.4%,与配备 Claude Code 的 Claude Opus 4.6 持平。经过进一步扩展,NexForge 合成的数据还用于训练 Nex-N2——一个公开可用的智能体模型系列,该系列将 Qwen3.5-35B-A3B 在 Terminal-Bench 2.1 上的成绩提升至 75.3%,在 GDPval 上的 Elo 评分提升至 1585——实现了开源模型的最优性能,并超越了数个前沿闭源系统。Nex-N2 模型可在 https://nex.sii.edu.cn/ 获取。