IT之家(RSS)
69AI 编辑部评分,满分 100

智谱正式发布 GLM-5.3:编程能力最强开源模型,较 GLM-5.2 提升 50%

2026-08-14 13:36· 53分钟前
AI 导读

智谱今日发布 GLM-5.3,基于与 GLM-5.2 相同的基座模型,通过后训练 Scaling 将编程能力提升 50%,在 Terminal Bench 3.0、Agents' Last Exam (CLI) 等公开基准中取得开源第一。

IT之家 8 月 14 日消息,智谱今日正式发布 GLM-5.3,与 GLM-5.2 相比,基座模型没变,但通过后训练 Scaling 大大提高了模型的智能上界:数十倍的长程任务环境、更丰富多样的环境类型、超长的后训练时间。

相比前代,GLM-5.3 的新能力包括:

  • 更强的编程能力。GLM-5.3 是编程能力最强的开源模型,在内部自建体感评测中较 GLM-5.2 提升 50%,在包括 Terminal Bench 3.0、Agents' Last Exam (CLI) 在内的公开基准测试中取得开源第一。

  • 网络安全能力。在白盒代码审查与漏洞发现等安全任务中,GLM-5.3 的表现持平 Mythos 5,展现出面向网络安全防御场景的强大潜力。

  • 后训练 Scaling。上述全部提升都来自后训练。基于 IndexShare、SAO、以及持续演进的新一代 Slime 框架,智谱在与 GLM-5.2 完全相同基座上高效推进强化学习,可能智谱还远未开发出这个基座的智能上界。

  • 开源。智谱将在发布两周后开放模型权重,此前完成安全评估与模型加固。

智谱表示,在多项主流基准测试中 GLM-5.3 是当前排名最高的开源模型,编程与智能体能力接近 Claude Fable 5,编程体感超过其他国产模型。

  • 在衡量模型于真实终端环境中完成复杂任务的 Terminal-Bench 3.0 上,GLM-5.3 得分从 4.6 提升至 28.3;

  • 在聚焦长程软件工程与持续代码修改能力的 DeepSWE v1.1 上,得分从 46.2 提升至 66.9;

  • 在覆盖多类真实专业场景、强调跨工具协作与长程任务的 Agents' Last Exam 上,得分从 23.8 提升至 28.5;

  • 在覆盖 44 种职业、考察真实高价值知识工作的 GDPval-AA v2 中得分 1,769,展现基于编程能力涌现的专业任务执行能力。

图片

智谱自研的 Z.ai Code Bench 评估模型在真实编程场景中的综合体感。模型会被置于复杂的本地开发环境,并在不同思考档位下执行端到端任务,更接近开发者实际使用 Coding Agent 时的体验。

测试结果显示,GLM-5.3 在效果和 Token 利用率之间取得了更好的平衡。在 High 档位下,GLM-5.3 达到 31.4% 的准确率,超过 Claude Opus 4.8 最高档位的 29.5%,每项任务平均输出约 5 万 tokens,而 Opus 4.8 需要约 12 万 tokens,意味着 GLM-5.3 可以用更短的执行路径完成任务。

图片

即日起上线智谱官方编程工具 ZCode、效率工具 AutoClaw,上线 GLM Coding Plan 全量用户及开放订阅。

TraeWork / TraeCode / 扣子、WorkBuddy / CodeBuddy、Qoder / QwenWork、CatPaw、JoyCode、OpenCode 等编码平台开放抢先体验。

API 很快上线,完整模型权重将在两周内开源,此前需完成必要的安全加固,尽可能限制其潜在攻击能力,保留其防御价值。

IT之家从智谱公告获悉,今天 13:00,GLM Coding Plan 全员额度重置,所有用户后台「用量统计」可见使用额度回满。

来源:IT之家(RSS) · ithome.com

同一事件 · 1

智谱正式发布 GLM-5.3:编程能力最强开源模型,较 GLM-5.2 提升 50%

IT之家(RSS)·2026-08-14 13:36·53分钟前
AI 导读

智谱今日发布 GLM-5.3,基于与 GLM-5.2 相同的基座模型,通过后训练 Scaling 将编程能力提升 50%,在 Terminal Bench 3.0、Agents' Last Exam (CLI) 等公开基准中取得开源第一。

IT之家 8 月 14 日消息,智谱今日正式发布 GLM-5.3,与 GLM-5.2 相比,基座模型没变,但通过后训练 Scaling 大大提高了模型的智能上界:数十倍的长程任务环境、更丰富多样的环境类型、超长的后训练时间。

相比前代,GLM-5.3 的新能力包括:

  • 更强的编程能力。GLM-5.3 是编程能力最强的开源模型,在内部自建体感评测中较 GLM-5.2 提升 50%,在包括 Terminal Bench 3.0、Agents' Last Exam (CLI) 在内的公开基准测试中取得开源第一。

  • 网络安全能力。在白盒代码审查与漏洞发现等安全任务中,GLM-5.3 的表现持平 Mythos 5,展现出面向网络安全防御场景的强大潜力。

  • 后训练 Scaling。上述全部提升都来自后训练。基于 IndexShare、SAO、以及持续演进的新一代 Slime 框架,智谱在与 GLM-5.2 完全相同基座上高效推进强化学习,可能智谱还远未开发出这个基座的智能上界。

  • 开源。智谱将在发布两周后开放模型权重,此前完成安全评估与模型加固。

智谱表示,在多项主流基准测试中 GLM-5.3 是当前排名最高的开源模型,编程与智能体能力接近 Claude Fable 5,编程体感超过其他国产模型。

  • 在衡量模型于真实终端环境中完成复杂任务的 Terminal-Bench 3.0 上,GLM-5.3 得分从 4.6 提升至 28.3;

  • 在聚焦长程软件工程与持续代码修改能力的 DeepSWE v1.1 上,得分从 46.2 提升至 66.9;

  • 在覆盖多类真实专业场景、强调跨工具协作与长程任务的 Agents' Last Exam 上,得分从 23.8 提升至 28.5;

  • 在覆盖 44 种职业、考察真实高价值知识工作的 GDPval-AA v2 中得分 1,769,展现基于编程能力涌现的专业任务执行能力。

图片

智谱自研的 Z.ai Code Bench 评估模型在真实编程场景中的综合体感。模型会被置于复杂的本地开发环境,并在不同思考档位下执行端到端任务,更接近开发者实际使用 Coding Agent 时的体验。

测试结果显示,GLM-5.3 在效果和 Token 利用率之间取得了更好的平衡。在 High 档位下,GLM-5.3 达到 31.4% 的准确率,超过 Claude Opus 4.8 最高档位的 29.5%,每项任务平均输出约 5 万 tokens,而 Opus 4.8 需要约 12 万 tokens,意味着 GLM-5.3 可以用更短的执行路径完成任务。

图片

即日起上线智谱官方编程工具 ZCode、效率工具 AutoClaw,上线 GLM Coding Plan 全量用户及开放订阅。

TraeWork / TraeCode / 扣子、WorkBuddy / CodeBuddy、Qoder / QwenWork、CatPaw、JoyCode、OpenCode 等编码平台开放抢先体验。

API 很快上线,完整模型权重将在两周内开源,此前需完成必要的安全加固,尽可能限制其潜在攻击能力,保留其防御价值。

IT之家从智谱公告获悉,今天 13:00,GLM Coding Plan 全员额度重置,所有用户后台「用量统计」可见使用额度回满。

来源:IT之家(RSS)· ithome.com

同一事件 · 1