我们正式推出 GLM-5.2,这是我们在长周期任务领域的最新旗舰模型。与上一代 GLM-5.1 相比,它在长周期任务能力上实现了质的飞跃,并且首次将这一能力稳固地建立在 100 万模型 token 的上下文窗口之上。GLM-5.2 的新能力包括:
稳固的 100 万上下文:一个稳定的 100 万模型 token 上下文,能够持续支撑长周期工作 高级编码与灵活算力调配:更强的编码能力,配合多种思考算力等级,可在性能与延迟之间取得平衡 改进的架构:我们提出了 IndexShare,该方法在每四个稀疏注意力层之间复用同一个索引器,在 100 万上下文长度下将每个模型 token 的 FLOPs 降低了 2.9 倍。我们还改进了 GLM-5.2 的 MTP 层以用于推测解码,使接受长度最多提升 20% 纯粹开源:采用 MIT 开源许可证--无地域限制,技术访问无国界 支撑长周期任务,首先要让长上下文在工程上可用:模型不仅需要能接受更多模型 token,更要在混乱、冗长的编码智能体轨迹中保持质量。宣称拥有 100 万上下文很容易,但在真实的工程压力下保持可靠则困难得多。为此,我们大幅扩展了针对编码智能体场景的 100 万上下文训练,覆盖大规模实现、自动化研究、性能优化和复杂调试。最终打造出的长上下文系统,不仅范围宽广,而且执行稳固:为持续的工程工作提供了切实可行的基础。
这一能力体现在 GLM-5.2 在三个长周期编程基准测试上的表现。FrontierSWE 衡量智能体能否完成跨度数小时到数十小时的开放式技术项目,涵盖系统优化、大规模代码构建和应用机器学习研究。在该基准上,GLM-5.2 仅落后 Opus 4.8 1%,同时领先 GPT-5.5 1% 和 Opus 4.7 11%。在 PostTrainBench 上,每个智能体配备一块 H100 GPU,根据其通过后训练提升小模型的能力进行评估,GLM-5.2 的表现优于 Opus 4.7 和 GPT-5.5,仅次于 Opus 4.8。在 SWE-Marathon 这一超长周期软件工程基准测试中,任务涵盖构建编译器、优化内核以及开发生产级服务,GLM-5.2 仍有提升空间,落后 Opus 4.8 13%,但仅次于 Opus 系列。在这三个基准测试中,GLM-5.2 是排名最高的开源模型,表明其 1M 上下文窗口已转化为实际的长周期交付能力。