公众号正文需在微信内阅读,站内仅提供摘要。
在微信中打开原文(在新标签页打开)GLM-5.1高速版发布:400 tokens/s,旗舰级能力跑出全球最快API速度
AI 导读
智谱面向部分企业客户推出GLM-5.1高速版API“GLM-5.1-highspeed”,输出速度达400 tokens/s,刷新全球大模型厂商API速度上限。该版本首次在国产大模型中实现旗舰级能力与极致低延迟并存,由GLM团队与TileRT团队联合打造,通过AOT静态编排、Tile级微任务及8卡NVL拓扑特化等系统级优化,确保400 TPS为稳定可用的生产级能力。
公众号:智谱(GLM)
精选
64
AI 编辑部评分,满分 100GLM-5.1高速版发布:400 tokens/s,旗舰级能力跑出全球最快API速度
智谱面向部分企业客户推出GLM-5.1高速版API“GLM-5.1-highspeed”,输出速度达400 tokens/s,刷新全球大模型厂商API速度上限。该版本首次在国产大模型中实现旗舰级能力与极致低延迟并存,由GLM团队与TileRT团队联合打造,通过AOT静态编排、Tile级微任务及8卡NVL拓扑特化等系统级优化,确保400 TPS为稳定可用的生产级能力。
推荐理由
在旗舰模型上实现400 tokens/s,打破了高速必为轻量模型的惯例,对编码智能体等实时交互场景提供了不牺牲能力的低延迟方案。
来源:公众号:智谱(GLM)· mp.weixin.qq.com