# inclusionAI 发布 Ling-3.0-flash 的 DSpark 投机解码模型 Ling3-DSpark

- 来源：蚂蚁 inclusionAI：HuggingFace 新模型
- 发布时间：2026-08-09 20:32
- AIHOT 分数：60
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmt333krj0fv5ro6tjw6bmtb2
- 原文链接：https://huggingface.co/inclusionAI/Ling-3.0-flash-dspark

## 精选理由

该模型把投机解码的接受长度按工作负载分开报告，数学与代码任务明显高于对话类，部署时可据此对不同场景的加速收益有更实际预期。

## AI 摘要

inclusionAI 推出 Ling3-DSpark，一个为 Ling-3.0-flash 设计的 DSpark 投机解码模型，参数量 1.36B，通过置信度头动态选择草稿 token 数量。在 GSM8K 等九项基准上平均接受长度为 5.29，其中 GSM8K 达 6.40。模型经 SpecForge 训练，可通过 SGLang 部署。

## 正文

Ling3-DSpark

面向 Ling3 的 DSpark 投机解码器。DSpark 在 DFlash 基础上扩展了目标模型辅助特征，并引入了一个置信度头，可动态选择草稿 token 的数量。该模型使用 SpecForge 训练，并通过 SGLang 提供服务。

模型规格

目标模型：Ling-3.0-flash

草稿参数量：1,363,707,905（1.36B）

草稿权重数据类型：BF16

隐藏层大小：2,560

Transformer 层数：5 个全注意力层

注意力机制：MHA，32 个查询头，32 个键/值头

目标辅助特征层：1、11、23、29、35

置信度头：vanilla Markov 头，秩为 256

DSpark 块大小：8 个草稿 token（验证宽度为 9，包含目标奖励 token）

最大位置嵌入：262,144

接受长度

接受长度是指每次投机验证步骤中平均被接受的 token 数量，包含目标奖励 token。

工作负载 接受长度

GSM8K 6.40

MATH-500 6.29

AIME 2025 5.56

HumanEval 6.57

MBPP 6.34

LiveCodeBench 5.33

MT-Bench 3.92

Alpaca 3.51

Arena-Hard-v2 3.72

九个工作负载均值的宏观平均值为 5.29。

使用 SGLang 提供服务

使用支持 DSPARK 的 SGLang 版本。将模型路径和张量并行大小替换为适合您部署环境的值：

sglang serve \ --trust-remote-code \ --model-path <LING3_MODEL_PATH> \ --tp-size <TP_SIZE> \ --speculative-algorithm DSPARK \ --speculative-draft-model-path <LING3_DSPARK_MODEL_PATH> \ ......

1B 参数
