# GLM-5.1高速版发布：400 tokens/s，旗舰级能力跑出全球最快API速度

- 来源：公众号：智谱（GLM）
- 作者：智谱
- 发布时间：2026-05-22 09:41
- AIHOT 分数：64
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmsdu107700tzrofzz8996w79
- 原文链接：https://mp.weixin.qq.com/s?__biz=MzkyMzI3NzQ0Mg%3D%3D&mid=2247493927&idx=1&sn=3a85cdfcaa82cbd9cafc02d6d8af713e

## 精选理由

在旗舰模型上实现400 tokens/s，打破了高速必为轻量模型的惯例，对编码智能体等实时交互场景提供了不牺牲能力的低延迟方案。

## AI 摘要

智谱面向部分企业客户推出GLM-5.1高速版API“GLM-5.1-highspeed”，输出速度达400 tokens/s，刷新全球大模型厂商API速度上限。该版本首次在国产大模型中实现旗舰级能力与极致低延迟并存，由GLM团队与TileRT团队联合打造，通过AOT静态编排、Tile级微任务及8卡NVL拓扑特化等系统级优化，确保400 TPS为稳定可用的生产级能力。

## 正文

公众号正文需在微信内阅读，站内仅提供摘要。

> 站内仅提供摘要，全文见原文。
