STORY · 事件进行中

蚂蚁 Ling Infra 与 RadixArk SGLang 优化 Ling-3.0-flash 解码性能

1 个精选信源 · 1 篇报道持续 1最新动态 5小时前
最新进展

Ling-3.0-flash 在 4 块 Blackwell GPU 上如何将批处理 1 解码延迟降低 54%

TIMELINE

报道时间线

1 条公开报道 · 官方一手 1 条 · 最新在前
  1. Ling-3.0-flash 在 4 块 Blackwell GPU 上如何将批处理 1 解码延迟降低 54%
    LMSYS:Blog(Chatbot Arena 团队)官方一手精选

    蚂蚁 Ling Infra 团队与 RadixArk SGLang 团队将 Ling-3.0-flash 混合线性注意力 MoE 模型的单请求解码速度从 288 tok/s 提升至 606 tok/s,平均 TPOT 从 3.33 ms 降至 1.53 ms。