返回
精选AI 评分 64/100

GLM-5.1高速版发布:400 tokens/s,旗舰级能力跑出全球最快API速度

公众号:智谱(GLM)·2026-05-22 09:41·96天前·智谱
AI 导读

智谱面向部分企业客户推出GLM-5.1高速版API“GLM-5.1-highspeed”,输出速度达400 tokens/s,刷新全球大模型厂商API速度上限。该版本首次在国产大模型中实现旗舰级能力与极致低延迟并存,由GLM团队与TileRT团队联合打造,通过AOT静态编排、Tile级微任务及8卡NVL拓扑特化等系统级优化,确保400 TPS为稳定可用的生产级能力。

公众号:智谱(GLM)
精选
64AI 编辑部评分,满分 100

GLM-5.1高速版发布:400 tokens/s,旗舰级能力跑出全球最快API速度

2026-05-22 09:41· 96天前· 智谱
AI 导读

智谱面向部分企业客户推出GLM-5.1高速版API“GLM-5.1-highspeed”,输出速度达400 tokens/s,刷新全球大模型厂商API速度上限。该版本首次在国产大模型中实现旗舰级能力与极致低延迟并存,由GLM团队与TileRT团队联合打造,通过AOT静态编排、Tile级微任务及8卡NVL拓扑特化等系统级优化,确保400 TPS为稳定可用的生产级能力。

推荐理由

在旗舰模型上实现400 tokens/s,打破了高速必为轻量模型的惯例,对编码智能体等实时交互场景提供了不牺牲能力的低延迟方案。

公众号正文需在微信内阅读,站内仅提供摘要。

在微信中打开原文(在新标签页打开)

来源:公众号:智谱(GLM)· mp.weixin.qq.com