Ling-2.6-1T-base 是 Ling-2.6-1T 和 Ring-2.6-1T 背后的基础检查点。它是一个万亿参数的混合专家语言模型,基于 Ling-2.0-1T-base 改造而来,采用了混合线性注意力设计、继续预训练以及长上下文中期训练。
本次发布面向研究、继续预训练、知识蒸馏以及基于监督或偏好的微调。它不是一个经过对话对齐的助手模型。如果你想要一个开箱即用的指令或推理模型,请改用相应的 Ling-2.6 或 Ring-2.6 后训练检查点。
- 模型概述
Ling-2.6-1T-base 旨在保留 Ling-2.0 万亿级骨干网络的能力,同时显著提升长上下文训练和推理的效率。核心升级在于一种混合注意力改造,它以 7:1 的比例结合了 Lightning Attention 与 MLA,并附带一套从原始基于 GQA 的架构平滑迁移的流程。
根据技术报告,该模型在迁移预训练、继续预训练和中期训练阶段共经历了约 9.6T 个 token 的训练,并分阶段将上下文长度从 4K 扩展到 256K。同一个基础检查点随后被专门化为:
Ling-2.6,用于即时、token 高效的响应
Ring-2.6,用于更深层次的推理和长周期智能体工作流
- 关键特性
混合线性注意力架构,以 7:1 的比例结合 Lightning Attention 与 MLA
万亿参数 MoE 骨干网络,基于 Ling-2.0-1T-base 升级而来,而非从头重新训练
长上下文训练流程,在中期训练阶段将上下文窗口扩展至 256K
继续预训练数据混合,涵盖智能体数据、长上下文数据、知识丰富的网络数据、数学、代码以及多语言语料库
在知识、数学、代码、推理和长上下文理解等基准测试中展现出强大的基础模型质量
- 模型总结
项目 数值 架构 细粒度 MoE 结合混合线性注意力 参数量 总计约 1T,激活约 63B Transformer 层数 80 注意力头数 64 隐藏层大小 8192 每 MoE 层路由专家数 256 每 MoE 层共享专家数 1 每 token 激活路由专家数 8 稠密 FFN 层 前 4 个 Transformer 块 专家中间层大小 2048 稠密中间层大小 18432 词表大小 157,184 位置编码 部分 RoPE 注意力设计 Lightning Attention + MLA,比例 7:1 训练方案 迁移预训练 + 继续预训练 + 中期训练 总训练 token 数 约 9.6T 上下文训练计划 4K -> 32K -> 256K
- 训练亮点
架构迁移
该模型从 Ling-2.0-1T-base 出发,通过包含以下步骤的多阶段迁移流水线转换为 Ling-2.6-1T 架构:
Lightning Attention 转换
线性预热
MLA 转换
MLA 预热
完整继续预训练
这种改造旨在保留预训练能力,同时降低长上下文计算成本和 KV 缓存压力。
数据混合
继续预训练和中期训练阶段包括:
基于工具使用和编码环境构建的智能体语料
涵盖数学、网页解析、摘要、检索和多跳推理的长上下文语料
通用网络知识数据,并针对 STEM 和事实性内容进行定向增强
数学和代码语料
涵盖 21 种语言的多语言数据
- 基座模型评估
以下数据选自技术报告,反映的是基座模型评估结果,而非经过对话对齐或指令微调后的性能。
基准 Ling-2.0-1T-base Ling-2.6-1T-base MMLU 86.03 86.82 MMLU-Pro 67.91 67.79 GPQA 41.92 45.45 SimpleQA 20.87 38.26 C-SimpleQA 64.53 76.83 MMMLU 68.68 71.53 GSM8K 89.31 93.93 OmniMath 33.60 38.70 HumanEval-Plus 83.54 85.98 LiveCodeBench 40.09 44.27 BIRD-SQL 42.70 44.59 BBH 86.88 89.73 AutoLogic 65.76 67.43 LEval 72.30 76.21 LongBenchv2 30.02 43.54
在技术报告中,Ling-2.6-1T-base 相较于 Ling-2.0-1T-base 展现出广泛的性能提升,尤其在事实性知识、多语言知识覆盖、长上下文理解以及面向推理的评估方面表现突出,同时保持或增强了强大的数学与代码能力。在此选定的子集中,一个值得注意的例外是 MMLU-Pro 基准测试,Ling-2.0-1T-base 在该项上仍略占优势。
- 预期用途