# 蚂蚁 inclusionAI 开源 Ling-3.0 系列语言基础模型

- 来源：蚂蚁 inclusionAI：HuggingFace 新模型
- 发布时间：2026-08-11 20:11
- AIHOT 分数：65
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmt0aa8b416ywrodpq8czlstx
- 原文链接：https://huggingface.co/inclusionAI/Ling-3.0-tiny-base

## 精选理由

用加权检查点合并替代学习率衰减，让基座模型更适合持续预训练，也为验证不同衰减曲线省去重复实验。

## AI 摘要

蚂蚁 inclusionAI 开源 Ling-3.0 系列语言基础模型，含 tiny 与 flash 两个尺寸及预训练、中期训练、合并（WSM）等阶段检查点。该系列采用混合线性注意力与稀疏 MoE 架构，总参数 7.9B，每 token 仅激活 1.3B 参数（128 个路由专家中激活 8 个）。

## 正文

我们已开源 Ling-3.0 系列，这是迄今为止我们最高效的语言基础模型家族。为支持研究和社区驱动的创新，我们发布了训练过程中的一系列检查点，具体如下：

模型 预训练 中期训练 合并（即 WSM）

Ling-3.0-tiny Ling-3.0-tiny-base-30T Ling-3.0-tiny-base-midtrain Ling-3.0-tiny-base

Ling-3.0-flash Ling-3.0-flash-base-30T Ling-3.0-flash-base-midtrain Ling-3.0-flash-base

这些检查点对应训练过程的不同阶段：

预训练检查点已完成大规模预训练，但尚未经过中期训练、WSM 合并（或学习率衰减）或后训练。中期训练检查点已完成中期训练，但尚未经过 WSM 合并（或学习率衰减）或后训练。合并检查点是在中期训练检查点的基础上进行了 WSM 合并（或学习率衰减），但尚未经过后训练。

发布这些检查点是为了支持继续预训练、微调和进一步研究。关于后训练模型，请参阅 Ling-3.0-tiny 和 Ling-3.0-flash。

稀疏 MoE 架构：128 个路由专家，每个 token 仅激活 8 个路由专家和 1 个共享专家。这使得模型在每次 token 仅激活 1.3B 参数的情况下仍具备广泛的能力；原生混合线性注意力：Ling-3.0 系列从预训练一开始就采用原生混合线性注意力架构，将 KDA 与 Gated MLA 相结合，以实现长上下文输入的高效处理。Warmup-Stable 与合并：我们用加权检查点合并取代了传统的学习率衰减。通过消除衰减阶段，我们的基础模型更适合持续预训练和动态数据扩展，同时支持离线探索不同的衰减配置，而无需为每种策略重新运行昂贵的实验。无缝扩展：Ling-3.0-tiny-base 和 Ling-3.0-flash-base 共享相同的训练方案，使社区能够先在 Ling-3.0-tiny-base 上进行实验，然后将验证过的训练策略扩展到更大的 Ling-3.0-flash-base。

模型类型 基础（WSM 合并的最终检查点）

架构 混合线性 MoE

参数量规模 总参数量 7.9B，激活参数量 1.3B

Transformer 层数 18 层 KDA + 6 层 Gated MLA（3:1）

稠密层数量 1

路由专家数量 128

共享专家数量 1

激活专家数量 8

注意力头数 16

隐藏层大小 1536

专家中间层大小 512

稠密层中间大小 4608

词表大小 157,184

为系统评估基础模型的能力，我们使用了一套全面的评测基准，覆盖知识、编程、数学、推理、多语言理解以及长上下文理解等多个关键领域。预训练基础检查点（即 Ling-3.0-tiny-base）的性能对比如下：

推荐使用场景：

继续预训练、中期训练、面向领域适配的监督微调、偏好优化与 RL 后训练、知识蒸馏研究、长上下文与 MoE 系统研究

不建议直接用于：

面向终端用户的直接聊天部署、未经额外对齐与评估的安全关键型应用、未经后训练与任务特定验证的生产环境使用

使用方法

微调示例请参阅我们的 ling-cookbook。

常见问题

如有任何疑问，欢迎发起讨论。

许可证

本模型基于 MIT 许可证发布。

该模型尚未由任何推理服务提供商部署。🙋请求提供商支持%20to%20be%20supported%20by%20Inference%20Providers.%0A%0A(optional)%20Which%20providers%20are%20you%20interested%20in%3F%20(Novita%2C%20Hyperbolic%2C%20Together%E2%80%A6)%0A)

包含 inclusionAI/Ling-3.0-tiny-base 的模型合集

Ling 3.0 •13 个项目•17 分钟前更新• 15

inclusionAI/Ling-3.0-tiny-base 相关论文

论文 • 2507.17634 •发布于 2025 年 7 月 23 日• 2
