colibrì v1.0 引擎以纯 C 实现、零运行时依赖,可在约 25 GB RAM 的消费级电脑上运行 744B 参数的 GLM-5.2 MoE 模型。模型经 int4 量化后磁盘占用约 370 GB,常驻内存仅 9.9 GB,通过流式加载磁盘专家实现推理。冷解码速度约
另有 1 家信源报道X:karminski (@karminski3)智谱 GLM
智谱的 GLM 系列模型动态:旗舰开源发布、代码与推理能力迭代、商业化与生态进展的追踪。
7月10日
7月2日
6月17日
GLM-5.2 发布,支持 1M token 上下文,采用 IndexShare 架构——每 4 个稀疏注意力层共用一个轻量索引器,将 1M 上下文下每 token FLOPs 降低 2.9 倍;MTP 层改进使推测解码接受长度提升 20%。长周期编码基准上,FrontierSWE 落后 Opus 4.8 仅 1%、领先 GPT-5.5 1%;PostTrainBench 仅次于 Opus 4.8;SWE-Marathon 落后 Opus 4.8 13% 但排名第二。标准编码测试 Terminal-Bench 2.1 获 81.0 分(GLM-5.1 为 63.5),接近 Opus 4.8 的 85.0。模型引入努力级别控制以平衡性能与延迟。MIT 开源许可,无地域限制。
另有 10 家信源报道智谱:研究(网页内嵌数据)Hacker News 热门(buzzing.cc 中文翻译)公众号:智谱(GLM)Simon Willison 博客IT之家(RSS)X:Kim (@kimmonismus)The Decoder:AI News(RSS)X:Testing Catalog (@testingcatalog)X:智谱 Z.ai (@Zai_org)X:硅基流动 SiliconFlow (@SiliconFlowAI)智谱今日开源 GLM-5.2,在 Artificial Analysis 综合评测中以 51 分排名全球前三、开源模型第一,与 Claude Opus 4.8 持平。该模型在 Code Arena 前端代码生成中获 1,595 分排名第二,在 DesignArena 设计编码场景中以 1,360 分夺冠,并在软件工程基准 FrontierSWE 中位列第三。
另有 2 家信源报道Hacker News 热门(buzzing.cc 中文翻译)Nathan Lambert:Interconnects(RSS)智谱上线并开源GLM-5.2,在Code Arena盲测中取得全球可用模型第一。该模型实现1M无损上下文,在FrontierSWE上仅比Opus 4.8低1%,在Terminal-Bench 2.1上相比GLM-5.1提升17.5%。模型已通过Hugging Face与ModelScope开源,采用MIT协议,API同步上线。
智谱发布 GLM-5.2,首次在 1M token 上下文中实现稳定长程任务能力。其 IndexShare 架构将每四个稀疏注意力层共享同一索引器,使 1M 上下文下每 token FLOPs 降低 2.9 倍。模型采用 MIT 开源协议,无区域限制。
另有 1 家信源报道X:唐杰(@jietang)6月14日
GLM-5.2 is Fully Open, Frontier Intelligence Belongs to Everyone Today, the sudden restriction of certain frontier model...
另有 10 家信源报道智谱:研究(网页内嵌数据)Hacker News 热门(buzzing.cc 中文翻译)公众号:智谱(GLM)Simon Willison 博客IT之家(RSS)X:Kim (@kimmonismus)The Decoder:AI News(RSS)X:Testing Catalog (@testingcatalog)X:智谱 Z.ai (@Zai_org)X:硅基流动 SiliconFlow (@SiliconFlowAI)6月13日
GLM-5.2 是智谱迄今能力最强的开源模型,支持真正可用的 1M 上下文,在长程任务中继续保持领先,并被智谱称为最强的国产 Coding 模型。今晚 5:21 起面向 GLM Coding Plan 全量用户开放(覆盖 Lite、Pro、Max、团队版)。API 将于下周上线,模型下周正式开源,遵循 MIT 协议。
另有 10 家信源报道智谱:研究(网页内嵌数据)Hacker News 热门(buzzing.cc 中文翻译)公众号:智谱(GLM)Simon Willison 博客IT之家(RSS)X:Kim (@kimmonismus)The Decoder:AI News(RSS)X:Testing Catalog (@testingcatalog)X:智谱 Z.ai (@Zai_org)X:硅基流动 SiliconFlow (@SiliconFlowAI)智谱发布迄今能力最强的开源模型 GLM-5.2,支持真正可用的 1M 上下文,并在长程任务中继续保持领先,同时也是其最强的国产 Coding 模型。今晚 5:21,GLM-5.2 将面向 GLM Coding Plan 全量用户开放,覆盖 Lite / Pro / Max / 团队版。GLM-5.2 API 将于下周上线,模型下周正式开源,遵循 MIT 协议。
6月2日
智谱计划向中国监管机构申请发行A股并在科创板上市。发行股份数量占发行完成后总股本的2%至8%,预计全部为新股,原股东不发售。本次发行募集资金净额将投资于人工智能通用基座大模型、大模型MaaS一站式服务平台及补充流动资金。此外,公司拟将英文名称由“Knowledge Atlas Technology Joint Stock Company Limited”变更为“Z.AI Co., Ltd.”。
5月22日
5月22日,智谱向部分企业客户推出了旗舰大模型GLM-5.1的高速版API“GLM-5.1-highspeed”。该版本输出速度达400 tokens/s,刷新了全球大模型API速度上限。关键突破在于,它首次在国产大模型中实现了旗舰级能力与低延迟的结合,打破了“高速模型即轻量模型”的传统。该版本由智谱GLM团队与TileRT团队合作,通过系统级优化确保了速度的生产级稳定性,适用于AI编程、实时语音交互等场景。
智谱面向部分企业客户推出GLM-5.1高速版API“GLM-5.1-highspeed”,输出速度达400 tokens/s,刷新全球大模型厂商API速度上限。该版本首次在国产大模型中实现旗舰级能力与极致低延迟并存,由GLM团队与TileRT团队联合打造,通过AOT静态编排、Tile级微任务及8卡NVL拓扑特化等系统级优化,确保400 TPS为稳定可用的生产级能力。
智谱发布GLM-5.1高速版,推理速度达400 tokens/s,在顶尖模型中生成速度最快。
5月21日
智谱、驭驯网络与清华大学联合提出并落地ZCube组网架构,以扁平化拓扑替代传统Clos/ROFT架构,从结构层面消除PD分离推理中的可避免拥塞。在GLM-5.1 coding生产环境千卡集群实测中,ZCube相比ROFT将GPU平均推理吞吐提升15%以上,TTFT P99降低40.6%,同时减少约三分之一的交换机与光模块成本。
5月12日
全球权威评测机构Artificial Analysis发布全新Coding Agent Index,包含SWE-Bench-Pro-Hard-AA、Terminal-Bench v2和SWE-Atlas-QnA三项基准,用于衡量模型与Agent harness组合的真实编程能力。闭源模型Opus 4.7(在Cursor CLI中运行)全球第一,智谱GLM-5.1(在Claude Code中运行)获开源第一,代表国产大模型在实际编程Agent场景达到SOTA水平。
5月8日
4月17日
AutoClaw(澳龙)正式上线自进化机制与Skill商店,每轮对话后扫描用户纠正、新教方法或踩坑经验,经用户审批后写入永久记忆,支持关键词触发和自动检测两种方式,并保持每周1-3次高质量进化。
4月8日
智谱推出开源模型GLM-5.1,支持独立工作长达8小时。模型可直接部署使用,无需人工频繁干预,适用于长周期自动化任务场景。
4月2日
智谱发布GLM-5V-Turbo多模态Coding基座模型,原生支持图像、视频、设计稿理解及画框、截图、读网页等工具调用,上下文窗口达200k。采用新一代CogViT视觉编码器与30+任务协同强化学习,在保持纯文本编程能力的同时强化GUI Agent能力。与Claude Code、AutoClaw等框架深度协同,支持"图像即代码"前端复刻及GUI自主探索,提供开箱即用的官方Skills。
3月16日
智谱发布GLM-5-Turbo基座模型,代号"龙虾",强化工具调用、复杂指令拆解、定时任务与高吞吐长链路执行能力,推出ZClawBench基准测试。支持通过BigModel.cn、Z.ai及AutoClaw客户端接入,Coding Plan Max将于本月内支持Pro版。
2月22日
GLM-5参数规模达7440亿,训练Token 28.5万亿。核心创新包括DSA稀疏注意力机制降低算力开销,异步RL基础设施与异步Agent RL算法提升长周期交互与自主决策能力。全面原生适配华为昇腾、寒武纪等七大国产芯片平台,通过W4A8混合精度量化与定制融合算子实现高效部署。模型支持复杂软件工程、终端操作、PPT生成等长程Agent任务,提供交错思考、保留思考等多种推理模式。
2月12日
GLM-5 开源,参数规模达 744B(激活 40B),预训练数据 28.5T,集成 DeepSeek Sparse Attention 降低部署成本。Coding 能力对齐 Claude Opus 4.5,Agent 能力支持 SOTA 级长程任务执行,兼容国产芯片。同步推出 OpenClaw、AutoGLM、Z Code 及 Excel 插件等工具链,覆盖端到端开发、办公自动化等场景。
1月20日
GLM-4.7-Flash 开源并免费开放 API,支持通过 Hugging Face 和魔搭社区部署。上一代 GLM-4.5-Flash 将于 2026 年 1 月 30 日下线,届时相关请求将自动路由至新版。
1月14日
智谱联合华为开源多模态生成模型GLM-Image,为首款基于国产昇腾芯片与MindSpore框架全流程训练的SOTA模型。采用9B自回归与7B扩散解码器混合架构,在CVTG-2K复杂视觉文字生成和LongText-Bench长文本渲染榜单均位列开源第一,支持1024×1024至2048×2048多分辨率生成。API调用成本0.1元/张,代码已开源至GitHub、Hugging Face及魔搭社区。
12月22日
GLM-4.7 发布,编程能力显著提升。SWE-bench 达 73.8%(+5.8%),Terminal Bench 2.0 达 41%(+16.5%),支持 Claude Code 等主流智能体框架。新增交错式思考、保留式思考和轮级思考功能,可控制推理过程以降低延迟或提高准确性。同步改进 UI 生成、工具调用和数学推理能力,可通过 API 或本地部署使用。
12月8日
智谱开源GLM-4.6V系列多模态模型,含106B-A12B基础版与9B轻量版Flash,支持128k tokens上下文。首次原生集成Function Call能力,支持图像、截图直接作为工具参数,并能理解工具返回的视觉内容。具备复杂文档理解、视觉网页搜索、前端代码生成及交互式编辑能力,适用于构建多模态Agent。已上架GitHub、Hugging Face及魔搭社区。
7月31日
智谱发布旗舰模型 GLM-4.5(355B/32B 激活)与 GLM-4.5-Air(106B/12B 激活),含 FP8 量化版本,即日起原生支持 SGLang 框架。采用 MoE 架构与 128k 上下文,在 12 项基准测试中分列第 3 与第 6。GLM-4.5 在 BrowseComp 网页浏览任务中以 26.4% 准确率超越 Claude 4 Opus,工具调用成功率达 90.6%,编程与数学推理能力突出。