inclusionAI 发布 Ling-3.0-flash 的 DSpark 投机解码模型 Ling3-DSpark

蚂蚁 inclusionAI:HuggingFace 新模型·2026-08-09 20:32·12天前
AI 导读

inclusionAI 推出 Ling3-DSpark,一个为 Ling-3.0-flash 设计的 DSpark 投机解码模型,参数量 1.36B,通过置信度头动态选择草稿 token 数量。在 GSM8K 等九项基准上平均接受长度为 5.29,其中 GSM8K 达 6.40。模型经 SpecForge 训练,可通过 SGLang 部署。

蚂蚁 inclusionAI:HuggingFace 新模型
精选
60AI 编辑部评分,满分 100

inclusionAI 发布 Ling-3.0-flash 的 DSpark 投机解码模型 Ling3-DSpark

2026-08-09 20:32· 12天前
AI 导读

inclusionAI 推出 Ling3-DSpark,一个为 Ling-3.0-flash 设计的 DSpark 投机解码模型,参数量 1.36B,通过置信度头动态选择草稿 token 数量。在 GSM8K 等九项基准上平均接受长度为 5.29,其中 GSM8K 达 6.40。模型经 SpecForge 训练,可通过 SGLang 部署。

推荐理由

该模型把投机解码的接受长度按工作负载分开报告,数学与代码任务明显高于对话类,部署时可据此对不同场景的加速收益有更实际预期。

正文 · AI 翻译

Ling3-DSpark

面向 Ling3 的 DSpark 投机解码器。DSpark 在 DFlash 基础上扩展了目标模型辅助特征,并引入了一个置信度头,可动态选择草稿 token 的数量。该模型使用 SpecForge 训练,并通过 SGLang 提供服务。

模型规格

  • 目标模型:Ling-3.0-flash
  • 草稿参数量:1,363,707,905(1.36B)
  • 草稿权重数据类型:BF16
  • 隐藏层大小:2,560
  • Transformer 层数:5 个全注意力层
  • 注意力机制:MHA,32 个查询头,32 个键/值头
  • 目标辅助特征层:1、11、23、29、35
  • 置信度头:vanilla Markov 头,秩为 256
  • DSpark 块大小:8 个草稿 token(验证宽度为 9,包含目标奖励 token)
  • 最大位置嵌入:262,144

接受长度

接受长度是指每次投机验证步骤中平均被接受的 token 数量,包含目标奖励 token。

工作负载 接受长度
GSM8K 6.40
MATH-500 6.29
AIME 2025 5.56
HumanEval 6.57
MBPP 6.34
LiveCodeBench 5.33
MT-Bench 3.92
Alpaca 3.51
Arena-Hard-v2 3.72

九个工作负载均值的宏观平均值为 5.29。

使用 SGLang 提供服务

使用支持 DSPARK 的 SGLang 版本。将模型路径和张量并行大小替换为适合您部署环境的值:

sglang serve \
  --trust-remote-code \
  --model-path <LING3_MODEL_PATH> \
  --tp-size <TP_SIZE> \
  --speculative-algorithm DSPARK \
  --speculative-draft-model-path <LING3_DSPARK_MODEL_PATH> \
  ......

1B 参数

来源:蚂蚁 inclusionAI:HuggingFace 新模型· huggingface.co