Hacker News 热门(buzzing.cc 中文翻译)
同事件
84AI 编辑部评分,满分 100

GLM-5.2 开源模型发布:744B 参数,1M 上下文,可本地运行

2026-06-23 07:56· 54天前· TechTechTech
AI 导读

Z.ai 发布 GLM-5.2,开源 744B 参数(40B 活跃),1M 上下文窗口,性能与 Claude 4.8 Opus、GPT-5.5、Gemini 3.1 Pro 持平。通过 Unsloth 动态量化,2-bit GGUF 版本内存需求降至 239GB(-84%),1-bit 版降至 217GB(-86%),可运行于 256GB 统一内存 Mac 或 1×24GB GPU+256GB RAM。提供非思考、高、最大三种思考模式。评测显示动态 1-bit 准确率约 76.2%,2-bit 约 82%。

正文 · AI 翻译

GLM-5.2 是 Z.ai 推出的全新开源模型,在长程编程、推理和智能体任务上均达到 SOTA 性能。该模型拥有 744B 参数、40B 激活参数以及 1M 上下文窗口,目前已可使用 Unsloth Dynamic GGUFs 在本地运行。GLM-5.2 是迄今为止最强的开源模型,在 Artificial Analysis 及众多其他基准测试中,性能与 Claude 4.8 Opus、GPT-5.5 和 Gemini 3.1 Pro 相当。

动态 1-bit 量化在体积缩小 86% 的情况下,top-1 准确率达到约 76.2%。动态 2-bit 量化在体积缩小 84% 的情况下,准确率达到约 82%。这意味着模型并非因体积缩小 84% 而性能下降 82%——实际上,其准确率仅比完整的 1.5TB 模型低约 18%。感谢 Z.ai 让 Unsloth 获得零日访问权限。GLM-5.2-GGUF

⚙️ 使用指南

2-bit 动态量化版本 UD-IQ2_M 占用 239GB 磁盘空间——这可以直接放入一台 256GB 统一内存的 Mac 中运行,并且在配备 1 块 24GB GPU 和 256GB RAM 的机器上,通过 MoE 卸载也能良好运行。

1-bit 量化版本可放入 223GB RAM 中运行,而 8-bit 版本则需要 810GB RAM。右侧展示了 1-bit GGUF 的实际运行效果:

表格:推理硬件需求(单位 = 总内存:RAM + VRAM,或统一内存)

1-bit

2-bit

3-bit

4-bit

5-bit

8-bit

223 GB

245 GB

290-360 GB

372-475 GB

570 GB

810 GB

为获得最佳性能,请确保您的总可用内存(包括 VRAM 和系统 RAM)比量化后的模型文件大小有充足的余量。

来源:Hacker News 热门(buzzing.cc 中文翻译) · unsloth.ai

同一事件 · 2

GLM-5.2 开源模型发布:744B 参数,1M 上下文,可本地运行

Hacker News 热门(buzzing.cc 中文翻译)·2026-06-23 07:56·54天前·TechTechTech
AI 导读

Z.ai 发布 GLM-5.2,开源 744B 参数(40B 活跃),1M 上下文窗口,性能与 Claude 4.8 Opus、GPT-5.5、Gemini 3.1 Pro 持平。通过 Unsloth 动态量化,2-bit GGUF 版本内存需求降至 239GB(-84%),1-bit 版降至 217GB(-86%),可运行于 256GB 统一内存 Mac 或 1×24GB GPU+256GB RAM。提供非思考、高、最大三种思考模式。评测显示动态 1-bit 准确率约 76.2%,2-bit 约 82%。

正文 · AI 翻译

GLM-5.2 是 Z.ai 推出的全新开源模型,在长程编程、推理和智能体任务上均达到 SOTA 性能。该模型拥有 744B 参数、40B 激活参数以及 1M 上下文窗口,目前已可使用 Unsloth Dynamic GGUFs 在本地运行。GLM-5.2 是迄今为止最强的开源模型,在 Artificial Analysis 及众多其他基准测试中,性能与 Claude 4.8 Opus、GPT-5.5 和 Gemini 3.1 Pro 相当。

动态 1-bit 量化在体积缩小 86% 的情况下,top-1 准确率达到约 76.2%。动态 2-bit 量化在体积缩小 84% 的情况下,准确率达到约 82%。这意味着模型并非因体积缩小 84% 而性能下降 82%——实际上,其准确率仅比完整的 1.5TB 模型低约 18%。感谢 Z.ai 让 Unsloth 获得零日访问权限。GLM-5.2-GGUF

⚙️ 使用指南

2-bit 动态量化版本 UD-IQ2_M 占用 239GB 磁盘空间——这可以直接放入一台 256GB 统一内存的 Mac 中运行,并且在配备 1 块 24GB GPU 和 256GB RAM 的机器上,通过 MoE 卸载也能良好运行。

1-bit 量化版本可放入 223GB RAM 中运行,而 8-bit 版本则需要 810GB RAM。右侧展示了 1-bit GGUF 的实际运行效果:

表格:推理硬件需求(单位 = 总内存:RAM + VRAM,或统一内存)

1-bit

2-bit

3-bit

4-bit

5-bit

8-bit

223 GB

245 GB

290-360 GB

372-475 GB

570 GB

810 GB

为获得最佳性能,请确保您的总可用内存(包括 VRAM 和系统 RAM)比量化后的模型文件大小有充足的余量。

来源:Hacker News 热门(buzzing.cc 中文翻译)· unsloth.ai

同一事件 · 2