# 蚂蚁集团百灵开源 Ling-3.0-flash：124B 总参数、5.1B 激活参数的混合推理模型

- 来源：IT之家（RSS）
- 发布时间：2026-08-08 07:49
- AIHOT 分数：68
- AIHOT 链接：https://aihot.virxact.com/items/cmsjmbkmc0dqkroo5tdrvs8dy
- 原文链接：https://www.ithome.com/0/987/231.htm

## AI 摘要

蚂蚁集团旗下百灵大模型正式开源新一代原生混合推理模型 Ling-3.0-flash，采用 124B 总参数、5.1B 激活参数的 MoE 架构，并提供 FP8、FP4、INT4 等多个版本。

## 正文

IT之家 8 月 8 日消息，蚂蚁集团旗下百灵大模型官方昨日宣布，新一代原生混合推理模型 Ling-3.0-flash 现已正式开源。

Ling-3.0-flash 采用 124B 总参数、5.1B 激活参数的 MoE 架构。官方同步提供基础版本以及 FP8、FP4、INT4 等多个版本，提供三种不同的落地选择：

API 调用：面向希望快速接入、无需自建推理服务的开发者，Ling-3.0-flash 可通过云端 API 直接调用；

单机私有化：面向数据不能出域的企业和团队，MXFP4 与 INT4 版本可在单台 NVIDIA DGX Spark 上完成端到端推理；

高性能部署：面向单请求时延敏感的高性能服务，在指定 GPU 测试配置下，平均输出速率突破 1100 tokens/s。

对于希望快速验证产品、上线 Agent 应用的开发者和产品团队，API 是门槛最低的接入方式。在 Artificial Analysis 榜单中，Ling-3.0-flash 输出速度达到 353 tokens/s。

在 AA Intelligence Index 榜单中，Ling-3.0-flash 每项任务的加权平均调用成本约为 0.04 美元（现汇率约合 0.27 元人民币），加权平均解码时间约为 1.4 分钟，同时进入“智能水平 — 任务成本”和“智能水平 — 任务耗时”的优势区域。

官方表示，2026 年 8 月 7 日 00:00 至 8 月 31 日 24:00，Ling-3.0-flash 在 Ling Studio 限时享受 2.5 折优惠；自 9 月 1 日 00:00 起恢复原价。

IT之家附开源链接：

Hugging Face：https://huggingface.co/inclusionAI/Ling-3.0-flash

ModelScope：https://modelscope.cn/models/inclusionAI/Ling-3.0-flash
