GLM-5.2 是 Z.ai 推出的全新开源模型,在长程编程、推理和智能体任务上均达到 SOTA 性能。该模型拥有 744B 参数、40B 激活参数以及 1M 上下文窗口,目前已可使用 Unsloth Dynamic GGUFs 在本地运行。GLM-5.2 是迄今为止最强的开源模型,在 Artificial Analysis 及众多其他基准测试中,性能与 Claude 4.8 Opus、GPT-5.5 和 Gemini 3.1 Pro 相当。
动态 1-bit 量化在体积缩小 86% 的情况下,top-1 准确率达到约 76.2%。动态 2-bit 量化在体积缩小 84% 的情况下,准确率达到约 82%。这意味着模型并非因体积缩小 84% 而性能下降 82%——实际上,其准确率仅比完整的 1.5TB 模型低约 18%。感谢 Z.ai 让 Unsloth 获得零日访问权限。GLM-5.2-GGUF
⚙️ 使用指南
2-bit 动态量化版本 UD-IQ2_M 占用 239GB 磁盘空间——这可以直接放入一台 256GB 统一内存的 Mac 中运行,并且在配备 1 块 24GB GPU 和 256GB RAM 的机器上,通过 MoE 卸载也能良好运行。
1-bit 量化版本可放入 223GB RAM 中运行,而 8-bit 版本则需要 810GB RAM。右侧展示了 1-bit GGUF 的实际运行效果:
表格:推理硬件需求(单位 = 总内存:RAM + VRAM,或统一内存)
1-bit
2-bit
3-bit
4-bit
5-bit
8-bit
223 GB
245 GB
290-360 GB
372-475 GB
570 GB
810 GB
为获得最佳性能,请确保您的总可用内存(包括 VRAM 和系统 RAM)比量化后的模型文件大小有充足的余量。