STORY · 事件进行中

GLM-5.3在Terminal Bench 3.0取得开源第一

2 个精选信源 · 2 篇报道持续 1最新动态 1小时前
最新进展

GLM-5.3在CyberGym得分84.5,超过GPT-5.6 Sol。

DIGEST

事件全貌

AI 综述 · 更新于 1小时前

智谱发布GLM-5.3,基于与GLM-5.2相同的基座,通过极致的后训练Scaling提升智能上界,编程能力较前代提升50%,在Terminal Bench 3.0等公开基准中取得开源第一,并接近Claude Fable 5。模型在白盒代码审查等安全任务中表现持平Mythos 5,在CyberGym测试中得分84.5%。模型权重将在两周后开源,即日起上线ZCode、AutoClaw等工具。

Testing Catalog报道称,GLM-5.3在CyberGym上获得84.5分,高于Mythos 5和GPT-5.6 Sol,并指出该模型基于743B基础模型训练,专为网络防御和编程任务打造,API访问和开放权重将在严格安全评估后分阶段发布。

本综述由 AI 汇总全部报道生成,随事件进展持续更新;下方时间线中的单篇报道保留其发布时的原貌。

TIMELINE

报道时间线

2 条公开报道 · 官方一手 1 条 · 最新在前
  1. 智谱发布GLM-5.3,CyberGym得分超GPT-5.6
    X:Testing Catalog (@testingcatalog)

    智谱AI在ZCode上发布了GLM-5.3,在CyberGym上获得84.5分,高于Mythos 5和GPT-5.6 Sol! > 基于743B基础模型训练。 > 专为网络防御和编程任务打造。 > “API访问和开放权重将在严格安全评估后分阶段发布。”

  2. GLM-5.3 发布:编程能力开源第一,并涌现网络安全能力
    公众号:智谱(GLM)官方一手精选

    智谱发布GLM-5.3,基于与GLM-5.2相同的基座,通过极致的后训练Scaling提升智能上界,编程能力较前代提升50%,在Terminal Bench 3.0等公开基准中取得开源第一,并接近Claude Fable 5。模型在白盒代码审查等安全任务中表现持平Mythos 5,在CyberGym测试中得分84.5%。模型权重将在两周后开源,即日起上线ZCode、AutoClaw等工具。