公众号正文需在微信内阅读,站内仅提供摘要。
在微信中打开原文(在新标签页打开)智谱联合驭驯网络与清华提出ZCube组网架构,破解大模型推理网络瓶颈
AI 导读
智谱、驭驯网络与清华大学联合提出并落地ZCube组网架构,以扁平化拓扑替代传统Clos/ROFT架构,从结构层面消除PD分离推理中的可避免拥塞。在GLM-5.1 coding生产环境千卡集群实测中,ZCube相比ROFT将GPU平均推理吞吐提升15%以上,TTFT P99降低40.6%,同时减少约三分之一的交换机与光模块成本。
公众号:智谱(GLM)
精选
76
AI 编辑部评分,满分 100智谱联合驭驯网络与清华提出ZCube组网架构,破解大模型推理网络瓶颈
智谱、驭驯网络与清华大学联合提出并落地ZCube组网架构,以扁平化拓扑替代传统Clos/ROFT架构,从结构层面消除PD分离推理中的可避免拥塞。在GLM-5.1 coding生产环境千卡集群实测中,ZCube相比ROFT将GPU平均推理吞吐提升15%以上,TTFT P99降低40.6%,同时减少约三分之一的交换机与光模块成本。
推荐理由
架构创新不只是省钱,ZCube 在 GLM-5.1 集群里用三分之一交换机成本换来 15% 吞吐提升和 40% 尾时延改善,为 PD 分离推理提供了一条可复用的组网路径。
来源:公众号:智谱(GLM)· mp.weixin.qq.com