# 蚂蚁 inclusionAI 开源万亿参数 MoE 基座模型 Ling-2.6-1T-base

- 来源：蚂蚁 inclusionAI：HuggingFace 新模型
- 发布时间：2026-06-02 19:34
- AIHOT 分数：61
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmqg2a9rm02wlslsplna4jnm6
- 原文链接：https://huggingface.co/inclusionAI/Ling-2.6-1T-base

## 精选理由

Ling-2.6 用混合线性注意力把万亿 MoE 基座模型的上下文能力推到了 256K，对于研究长上下文和 MoE 的团队是个有价值的基座，但它是未对齐的预训练模型，不能直接当对话助手用。

## AI 摘要

Ling-2.6-1T-base 是蚂蚁 inclusionAI 开源的万亿参数 MoE 基座模型（总参约 1T，激活 63B）。它由 Ling-2.0-1T-base 升级而来，采用 Lightning Attention 与 MLA 以 7:1 混合的线性注意力架构，经约 9.6T token 的迁移预训练、持续预训练和中训练，上下文窗口从 4K 分阶段扩展至 256K。在 MMLU（86.82）、SimpleQA、LongBenchv2（43.54）等基准上超越前代。该模型仅供研究（继续预训练、微调、蒸馏等），不直接提供对话功能。

## 正文

Ling-2.6-1T-base 是 Ling-2.6-1T 和 Ring-2.6-1T 背后的基础检查点。它是一个万亿参数的混合专家语言模型，基于 Ling-2.0-1T-base 改造而来，采用了混合线性注意力设计、继续预训练以及长上下文中期训练。

本次发布面向研究、继续预训练、知识蒸馏以及基于监督或偏好的微调。它不是一个经过对话对齐的助手模型。如果你想要一个开箱即用的指令或推理模型，请改用相应的 Ling-2.6 或 Ring-2.6 后训练检查点。

模型概述

Ling-2.6-1T-base 旨在保留 Ling-2.0 万亿级骨干网络的能力，同时显著提升长上下文训练和推理的效率。核心升级在于一种混合注意力改造，它以 7:1 的比例结合了 Lightning Attention 与 MLA，并附带一套从原始基于 GQA 的架构平滑迁移的流程。

根据技术报告，该模型在迁移预训练、继续预训练和中期训练阶段共经历了约 9.6T 个 token 的训练，并分阶段将上下文长度从 4K 扩展到 256K。同一个基础检查点随后被专门化为：

Ling-2.6，用于即时、token 高效的响应

Ring-2.6，用于更深层次的推理和长周期智能体工作流

关键特性

混合线性注意力架构，以 7:1 的比例结合 Lightning Attention 与 MLA

万亿参数 MoE 骨干网络，基于 Ling-2.0-1T-base 升级而来，而非从头重新训练

长上下文训练流程，在中期训练阶段将上下文窗口扩展至 256K

继续预训练数据混合，涵盖智能体数据、长上下文数据、知识丰富的网络数据、数学、代码以及多语言语料库

在知识、数学、代码、推理和长上下文理解等基准测试中展现出强大的基础模型质量

模型总结

项目 数值 架构 细粒度 MoE 结合混合线性注意力 参数量 总计约 1T，激活约 63B Transformer 层数 80 注意力头数 64 隐藏层大小 8192 每 MoE 层路由专家数 256 每 MoE 层共享专家数 1 每 token 激活路由专家数 8 稠密 FFN 层 前 4 个 Transformer 块 专家中间层大小 2048 稠密中间层大小 18432 词表大小 157,184 位置编码 部分 RoPE 注意力设计 Lightning Attention + MLA，比例 7:1 训练方案 迁移预训练 + 继续预训练 + 中期训练 总训练 token 数 约 9.6T 上下文训练计划 4K -> 32K -> 256K

训练亮点

架构迁移

该模型从 Ling-2.0-1T-base 出发，通过包含以下步骤的多阶段迁移流水线转换为 Ling-2.6-1T 架构：

Lightning Attention 转换

线性预热

MLA 转换

MLA 预热

完整继续预训练

这种改造旨在保留预训练能力，同时降低长上下文计算成本和 KV 缓存压力。

数据混合

继续预训练和中期训练阶段包括：

基于工具使用和编码环境构建的智能体语料

涵盖数学、网页解析、摘要、检索和多跳推理的长上下文语料

通用网络知识数据，并针对 STEM 和事实性内容进行定向增强

数学和代码语料

涵盖 21 种语言的多语言数据

基座模型评估

以下数据选自技术报告，反映的是基座模型评估结果，而非经过对话对齐或指令微调后的性能。

基准 Ling-2.0-1T-base Ling-2.6-1T-base MMLU 86.03 86.82 MMLU-Pro 67.91 67.79 GPQA 41.92 45.45 SimpleQA 20.87 38.26 C-SimpleQA 64.53 76.83 MMMLU 68.68 71.53 GSM8K 89.31 93.93 OmniMath 33.60 38.70 HumanEval-Plus 83.54 85.98 LiveCodeBench 40.09 44.27 BIRD-SQL 42.70 44.59 BBH 86.88 89.73 AutoLogic 65.76 67.43 LEval 72.30 76.21 LongBenchv2 30.02 43.54

在技术报告中，Ling-2.6-1T-base 相较于 Ling-2.0-1T-base 展现出广泛的性能提升，尤其在事实性知识、多语言知识覆盖、长上下文理解以及面向推理的评估方面表现突出，同时保持或增强了强大的数学与代码能力。在此选定的子集中，一个值得注意的例外是 MMLU-Pro 基准测试，Ling-2.0-1T-base 在该项上仍略占优势。

预期用途
