智谱发布 GLM-4.5 系列模型并原生支持 SGLang

LMSYS:Blog(Chatbot Arena 团队)·2025-07-31 00:00·391天前·GLM Team
AI 导读

智谱发布旗舰模型 GLM-4.5(355B/32B 激活)与 GLM-4.5-Air(106B/12B 激活),含 FP8 量化版本,即日起原生支持 SGLang 框架。采用 MoE 架构与 128k 上下文,在 12 项基准测试中分列第 3 与第 6。GLM-4.5 在 BrowseComp 网页浏览任务中以 26.4% 准确率超越 Claude 4 Opus,工具调用成功率达 90.6%,编程与数学推理能力突出。

LMSYS:Blog(Chatbot Arena 团队)
精选

智谱发布 GLM-4.5 系列模型并原生支持 SGLang

2025-07-31 00:00· 391天前· GLM Team
AI 导读

智谱发布旗舰模型 GLM-4.5(355B/32B 激活)与 GLM-4.5-Air(106B/12B 激活),含 FP8 量化版本,即日起原生支持 SGLang 框架。采用 MoE 架构与 128k 上下文,在 12 项基准测试中分列第 3 与第 6。GLM-4.5 在 BrowseComp 网页浏览任务中以 26.4% 准确率超越 Claude 4 Opus,工具调用成功率达 90.6%,编程与数学推理能力突出。

推荐理由

国产大模型Agent与编码能力跻身第一梯队,为开发者提供Claude/GPT之外的高性价比替代方案

正文 · AI 翻译

今天,我们很高兴地推出最新旗舰模型 GLM-4.5 和 GLM-4.5-Air,以及它们的 FP8 变体。所有模型现已上线,并在发布首日即获得 SGLang 支持。GLM-4.5 和 GLM-4.5-Air 均为功能强大的模型,旨在统一推理、编码和智能体能力,参数量分别为 355B(32B 激活)和 106B(12B 激活)。

使用 SGLang 部署 GLM-4.5

我们建议使用 SGLang 部署 GLM-4.5 系列模型以获得最佳性能。通过与 SGLang 社区的紧密合作,所有 GLM-4.5 模型从发布首日起即获得 SGLang 的全面支持。

基本用法

安装 SGLang

pip install --upgrade pip
pip install "sglang[all]>=0.4.9.post6"

355B 模型

python3 -m sglang.launch_server --model zai-org/GLM-4.5 --tp 8

106B 模型

python3 -m sglang.launch_server --model zai-org/GLM-4.5-Air --tp 8

355B FP8 量化模型

python3 -m sglang.launch_server --model zai-org/GLM-4.5-FP8 --tp 8

106B FP8 量化模型

python3 -m sglang.launch_server --model zai-org/GLM-4.5-Air-FP8 --tp 4

工具调用

在命令后附加以下参数:

--tool-call-parser glm45 

推理解析器

在命令后附加以下参数:

--reasoning-parser glm45

基于 MTP 的推测解码

在命令后附加以下参数:

--speculative-algorithm EAGLE \
--speculative-num-steps [number of steps] \
--speculative-eagle-topk [top k] \
--speculative-num-draft-tokens [number of draft tokens]

GLM 4.5 模型架构与亮点

GLM-4.5 采用 MoE 架构,结合无损失均衡路由和 Sigmoid 门控,提升了计算效率。与 DeepSeek-V3 和 Kimi K2 等模型相比,我们更注重深度而非宽度——专家数量更少、隐藏维度更小,但层数更多——从而带来更优的推理性能。

关键架构设计与亮点:

  • 分组查询注意力与部分 RoPE
  • 针对 5120 隐藏维度设置 96 个注意力头(是常规方案的 2.5 倍),在相似训练损失下提升了 MMLU/BBH 上的推理能力
  • QK-Norm 用于稳定注意力 logits
  • Muon 优化器,实现更快的收敛速度和更大的批处理规模
  • MTP(多 token 预测)头用于推测解码
  • RL 训练由开源框架 slime 驱动,该框架由 THUDM 此前开源。

性能表现

我们在涵盖智能体(3 项)、推理(7 项)和编码(2 项)的 12 个基准测试上,将 GLM-4.5 与 OpenAI、Anthropic、Google DeepMind、xAI、阿里巴巴、月之暗面和 DeepSeek 的多种模型进行了对比。总体来看,GLM-4.5 排名第三,GLM-4.5 Air 排名第六。

智能体能力 GLM-4.5 支持 128k 上下文窗口和原生函数调用。在 -bench 和 BFCL-v3 两项基准上,它均与 Claude 4 Sonnet 持平;在 BrowseComp 网页浏览基准上,它超越了 Claude 4 Opus(26.4% 对比 18.8%),并接近 GPT o4-mini-high(28.3%)。其高达 90.6% 的工具调用成功率,凸显了它在基于智能体的工作流程中的可靠性。

推理能力 GLM-4.5 在数学和逻辑推理方面表现出色。它在 MMLU Pro(84.6)、AIME-24(91.0)和 MATH500(98.2)上取得了具有竞争力的分数,并在 GPQA、LCB 和 AA-Index 等基准测试中展现出强大的泛化能力。

编程能力 GLM-4.5 展现了全面的全栈开发能力,在 SWE-bench Verified(64.2)和 Terminal-Bench(37.5)上位列顶级模型。在直接对比评估中,它对 Kimi K2 的胜率达到 53.9%,对 Qwen3-Coder 的胜率达到 80.8%。其高智能体可靠性、多轮编程任务表现以及视觉界面质量,证明了它作为自主编程助手的强大实力。

结论

GLM-4.5 系列代表了新一代大语言模型,在长上下文推理、智能体工作流程和编程任务方面表现出色。其混合 MoE 架构——通过分组查询注意力、MTP 和 RL 训练等技术得到增强——兼具高效性和强大能力。

SGLang 提供了一个生产就绪的高性能推理栈,通过先进的内存管理和请求批处理实现无缝部署。

总之,GLM-4.5 和 SGLang 共同为下一代 AI 奠定了坚实基础——为代码、文档和智能体领域提供智能、可扩展的解决方案。

致谢

我们衷心感谢以下团队和合作者对本 PR 的贡献:

  • GLM 团队:张宇轩、张晨辉、吕鑫、朱子林及各位同事。
  • SGLang 团队及社区:何彪、黄立夫、江彬尧、朱明磊、万程、苏畅、童新源及众多其他贡献者。

来源:LMSYS:Blog(Chatbot Arena 团队)· lmsys.org