# 智谱发布 GLM-4.5 系列模型并原生支持 SGLang

- 来源：LMSYS：Blog（Chatbot Arena 团队）
- 作者：GLM Team
- 发布时间：2025-07-31 00:00
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmnxbjke6007gsln04l4bcy5n
- 原文链接：https://www.lmsys.org/blog/2025-07-31-glm4-5

## 精选理由

国产大模型Agent与编码能力跻身第一梯队，为开发者提供Claude/GPT之外的高性价比替代方案

## AI 摘要

智谱发布旗舰模型 GLM-4.5（355B/32B 激活）与 GLM-4.5-Air（106B/12B 激活），含 FP8 量化版本，即日起原生支持 SGLang 框架。采用 MoE 架构与 128k 上下文，在 12 项基准测试中分列第 3 与第 6。GLM-4.5 在 BrowseComp 网页浏览任务中以 26.4% 准确率超越 Claude 4 Opus，工具调用成功率达 90.6%，编程与数学推理能力突出。

## 正文

今天，我们很高兴地推出最新旗舰模型 GLM-4.5 和 GLM-4.5-Air，以及它们的 FP8 变体。所有模型现已上线，并在发布首日即获得 SGLang 支持。GLM-4.5 和 GLM-4.5-Air 均为功能强大的模型，旨在统一推理、编码和智能体能力，参数量分别为 355B（32B 激活）和 106B（12B 激活）。

使用 SGLang 部署 GLM-4.5

我们建议使用 SGLang 部署 GLM-4.5 系列模型以获得最佳性能。通过与 SGLang 社区的紧密合作，所有 GLM-4.5 模型从发布首日起即获得 SGLang 的全面支持。

基本用法

安装 SGLang

pip install --upgrade pip pip install "sglang[all]>=0.4.9.post6"

355B 模型

python3 -m sglang.launch_server --model zai-org/GLM-4.5 --tp 8

106B 模型

python3 -m sglang.launch_server --model zai-org/GLM-4.5-Air --tp 8

355B FP8 量化模型

python3 -m sglang.launch_server --model zai-org/GLM-4.5-FP8 --tp 8

106B FP8 量化模型

python3 -m sglang.launch_server --model zai-org/GLM-4.5-Air-FP8 --tp 4

工具调用

在命令后附加以下参数：

--tool-call-parser glm45

推理解析器

在命令后附加以下参数：

--reasoning-parser glm45

基于 MTP 的推测解码

在命令后附加以下参数：

--speculative-algorithm EAGLE \ --speculative-num-steps [number of steps] \ --speculative-eagle-topk [top k] \ --speculative-num-draft-tokens [number of draft tokens]

GLM 4.5 模型架构与亮点

GLM-4.5 采用 MoE 架构，结合无损失均衡路由和 Sigmoid 门控，提升了计算效率。与 DeepSeek-V3 和 Kimi K2 等模型相比，我们更注重深度而非宽度——专家数量更少、隐藏维度更小，但层数更多——从而带来更优的推理性能。

关键架构设计与亮点：

分组查询注意力与部分 RoPE

针对 5120 隐藏维度设置 96 个注意力头（是常规方案的 2.5 倍），在相似训练损失下提升了 MMLU/BBH 上的推理能力

QK-Norm 用于稳定注意力 logits

Muon 优化器，实现更快的收敛速度和更大的批处理规模

MTP（多 token 预测）头用于推测解码

RL 训练由开源框架 slime 驱动，该框架由 THUDM 此前开源。

性能表现

我们在涵盖智能体（3 项）、推理（7 项）和编码（2 项）的 12 个基准测试上，将 GLM-4.5 与 OpenAI、Anthropic、Google DeepMind、xAI、阿里巴巴、月之暗面和 DeepSeek 的多种模型进行了对比。总体来看，GLM-4.5 排名第三，GLM-4.5 Air 排名第六。

智能体能力 GLM-4.5 支持 128k 上下文窗口和原生函数调用。在 -bench 和 BFCL-v3 两项基准上，它均与 Claude 4 Sonnet 持平；在 BrowseComp 网页浏览基准上，它超越了 Claude 4 Opus（26.4% 对比 18.8%），并接近 GPT o4-mini-high（28.3%）。其高达 90.6% 的工具调用成功率，凸显了它在基于智能体的工作流程中的可靠性。

推理能力 GLM-4.5 在数学和逻辑推理方面表现出色。它在 MMLU Pro（84.6）、AIME-24（91.0）和 MATH500（98.2）上取得了具有竞争力的分数，并在 GPQA、LCB 和 AA-Index 等基准测试中展现出强大的泛化能力。

编程能力 GLM-4.5 展现了全面的全栈开发能力，在 SWE-bench Verified（64.2）和 Terminal-Bench（37.5）上位列顶级模型。在直接对比评估中，它对 Kimi K2 的胜率达到 53.9%，对 Qwen3-Coder 的胜率达到 80.8%。其高智能体可靠性、多轮编程任务表现以及视觉界面质量，证明了它作为自主编程助手的强大实力。

结论

GLM-4.5 系列代表了新一代大语言模型，在长上下文推理、智能体工作流程和编程任务方面表现出色。其混合 MoE 架构——通过分组查询注意力、MTP 和 RL 训练等技术得到增强——兼具高效性和强大能力。

SGLang 提供了一个生产就绪的高性能推理栈，通过先进的内存管理和请求批处理实现无缝部署。

总之，GLM-4.5 和 SGLang 共同为下一代 AI 奠定了坚实基础——为代码、文档和智能体领域提供智能、可扩展的解决方案。

致谢

我们衷心感谢以下团队和合作者对本 PR 的贡献：

GLM 团队：张宇轩、张晨辉、吕鑫、朱子林及各位同事。

SGLang 团队及社区：何彪、黄立夫、江彬尧、朱明磊、万程、苏畅、童新源及众多其他贡献者。
