蚂蚁 inclusionAI 开源 Ling-3.0 系列高效语言基座模型

蚂蚁 inclusionAI:HuggingFace 新模型·2026-08-11 20:11·8天前
AI 导读

蚂蚁 inclusionAI 开源 Ling-3.0 系列语言基座模型,采用高度稀疏(1/64)MoE 架构,含 512 个路由专家,每个 token 仅激活 8 个路由专家和 1 个共享专家,激活参数仅 5.1B(Non-emb)。

蚂蚁 inclusionAI:HuggingFace 新模型
同事件
64AI 编辑部评分,满分 100

蚂蚁 inclusionAI 开源 Ling-3.0 系列高效语言基座模型

2026-08-11 20:11· 8天前
AI 导读

蚂蚁 inclusionAI 开源 Ling-3.0 系列语言基座模型,采用高度稀疏(1/64)MoE 架构,含 512 个路由专家,每个 token 仅激活 8 个路由专家和 1 个共享专家,激活参数仅 5.1B(Non-emb)。

正文 · AI 翻译

我们已开源 Ling-3.0 系列,这是我们迄今为止最高效的语言基础模型家族。为支持研究及社区驱动的创新,我们发布了训练过程中的一系列检查点,具体如下:

模型 预训练 中期训练 合并(即 WSM)
Ling-3.0-tiny Ling-3.0-tiny-base-30T Ling-3.0-tiny-base-midtrain Ling-3.0-tiny-base
Ling-3.0-flash Ling-3.0-flash-base-30T Ling-3.0-flash-base-midtrain Ling-3.0-flash-base

这些检查点对应训练过程的不同阶段:

预训练检查点已完成大规模预训练,但尚未进行中期训练、WSM 合并(或学习率衰减)或后训练。中期训练检查点已完成中期训练,但尚未进行 WSM 合并(或学习率衰减)或后训练。合并检查点基于中期训练检查点进行了 WSM 合并(或学习率衰减),但尚未进行后训练。

发布这些检查点旨在支持继续预训练、微调及进一步研究。关于后训练模型,请参阅 Ling-3.0-tiny 和 Ling-3.0-flash。

高度稀疏(1/64)MoE 架构:512 个路由专家,每个 token 仅激活 8 个路由专家和 1 个共享专家。这使得模型在每次 token 仅激活 5.1B(非嵌入)参数的情况下仍具备广泛能力;原生混合线性注意力:Ling-3.0 系列从预训练一开始就采用原生混合线性注意力架构,将 KDA 与 Gated MLA 相结合,以实现长上下文输入的高效处理。Warmup-Stable 与合并:我们用加权检查点合并取代了传统的学习率衰减。通过消除衰减阶段,我们的基础模型更适合持续预训练和动态数据扩展,同时支持离线探索不同的衰减方案,而无需为每种策略重复运行昂贵的实验。无缝扩展:Ling-3.0-tiny-base 和 Ling-3.0-flash-base 共享相同的训练方案,使社区能够先在 Ling-3.0-tiny-base 上进行实验,然后将验证过的训练策略扩展到更大的 Ling-3.0-flash-base。

模型类型 基础版(WSM 合并的最终检查点)
架构 混合线性 MoE
参数量级 总计 124B,激活 5.1B(不含嵌入层)
Transformer 层数 35 层 KDA + 7 层门控 MLA(5:1)
稠密层数量 2
路由专家数量 512
共享专家数量 1
激活专家数量 8
注意力头数 32
隐藏层大小 2560
专家中间层大小 768
稠密中间层大小 6144
词表大小 157,184

为系统评估基础模型的能力,我们使用了一套全面的评测基准,涵盖数学、编程、推理、多语言理解以及长上下文理解等多个关键领域。预训练基础检查点(即 Ling-3.0-flash-base)的性能对比如下:

推荐使用场景:

继续预训练、中期训练、面向领域适配的监督微调、偏好优化与 RL 后训练、知识蒸馏研究、长上下文与 MoE 系统研究

不建议直接用于:

直接面向终端用户的聊天部署、未经额外对齐与评估的安全关键型应用、未经后训练及任务特定验证的生产环境使用

使用方法

微调示例请参阅我们的 ling-cookbook。

常见问题

如有任何疑问,欢迎在讨论区留言。

许可证

本模型基于 MIT 许可证发布。

127B 参数

集合,包含 inclusionAI/Ling-3.0-flash-base

Ling 3.0 •13 个项目•更新于 17 分钟前• 15

inclusionAI/Ling-3.0-flash-base 相关论文

论文 • 2507.17634 •发布于 2025 年 7 月 23 日• 2