为 GLM-5.3 开源发布做准备:一条负责任的网络防御之路
当 GLM-5.2 协助 Hugging Face 调查一起 AI 自主绕过自身安全防护的事件时,这凸显了一个更广泛的转变。AI 正在同时成为网络攻击与网络防御的一部分。
随着强大的网络能力变得越来越易获取,强大的防御能力不能仅限于少数资源充足的组织。开源维护者、独立研究者、开发者以及规模较小的安全团队同样需要能够帮助他们在漏洞被利用之前发现并修复漏洞的工具。
一个开放的世界不能只有开放的攻击面。它还必须拥有开放的盾牌。
GLM-5.3 是我们迄今为止在网络安全任务上能力最强的模型。它在漏洞发现、漏洞利用分析和复杂多步安全任务方面带来了显著提升。这些能力可以帮助防御者更早识别弱点、验证风险并加速修复。
这些能力同时也带来了明显的双重用途风险。因此,我们采取分阶段发布的策略。选定的安全合作伙伴将首先在受控环境中评估 GLM-5.3。随后将开放更广泛的访问权限和 API 服务。一旦必要的安全评估和发布准备工作完成,我们将发布 GLM-5.3 的完整模型权重。
负责任的开放并不意味着将每一项能力都视为无害。它意味着透明地评估风险、在发布前加强安全防护、协调已确认漏洞的披露,并以与风险相称的方式扩大先进防御能力的获取范围。
从漏洞发现到多步安全分析
作为后训练的一部分,我们将漏洞发现数据和授权安全环境引入训练数据组合中。我们预期这将提升模型发现和分析漏洞的能力。
随着训练规模的扩大,改进不再局限于孤立的缺陷。GLM-5.3 在连接漏洞条件、程序行为、验证路径以及跨多个分析阶段的潜在影响方面变得更加高效。
我们通过三个基准来评估这些能力:
• CyberGym 从白盒源代码开始,测试模型是否能够通过触发故障来识别和验证漏洞。GLM-5.3 得分 84.5%,而 GLM-5.2 为 77.2%。
• ExploitBench 要求对真实漏洞及其利用方式进行更深入的推理。GLM-5.3 达到了 54.4%,是 GLM-5.2 的 24.4% 的两倍多。
• ExploitGym 在归一化评估预算下衡量完成的利用任务。GLM-5.3 在两小时内完成 105 项任务,在六小时内完成 130 项,而 GLM-5.2 分别只完成了 29 项和 39 项。
这一规律是一致的。随着任务从孤立的漏洞发现转向多步骤利用,GLM-5.3 相对于 GLM-5.2 的提升最为显著。结果也显示了哪些方面还需要进一步改进,尤其是在最复杂的端到端任务上。
从基准测试到真实软件
我们还与高校和专业安全团队合作,在授权环境中对 GLM 模型在真实代码库上的表现进行了评估。
在这些工作中,GLM 系列在 269 个项目中产生了 2,436 项漏洞发现,其中 1,097 项被归类为中高危严重性。这些发现涵盖系统软件、操作系统、浏览器引擎、开源基础设施、Web 应用、网络协议和智能设备。其中一些底层问题甚至数十年来都未被察觉。
在这些评估中,安全专家确定授权范围、审查模型输出、调查潜在风险,并与相关方进行协调。GLM 模型可以帮助研究人员重构复杂的程序逻辑、缩小大量候选路径的范围,并在多个组件之间串联证据。
目的不仅仅是产生更多发现,而是帮助防御者更早识别有意义的风险,缩短从发现到修复的时间。
发现之后必须进行负责任的信息披露
漏洞在发现的那一刻并不算被安全处理。它必须经过审查、在适当情况下进行复现、通过适当渠道报告,并与受影响的维护者进行协调。
我们安全工作中的发现通过既定的披露流程提交。只有在符合相关披露和修复流程的情况下,我们才会发布技术细节。对于仍在协调中的问题,我们不会发布可能不必要地增加风险或识别受影响项目的信息。
为了让这项工作更加透明,我们创建了 Z.ai 安全披露台账。
账本在发现项流转于披露流程期间记录其状态。对于已公开披露的问题,账本可能包含受影响项目、严重性等级、可获取的 CVE 或其他标识符,以及该问题在代码库中存在时长的相关信息。
对于仍处于协同披露流程中的漏洞,账本可以发布加密哈希。这样可以在不提前泄露运营细节的情况下,于日后对发现项进行验证。
开源模型与披露漏洞是两个独立的决策。更广泛地开放模型并不意味着必须在维护者获得适当机会进行调查和响应之前就公布漏洞细节。
安全与分阶段发布
网络安全对 AI 安全而言是一个尤为困难的领域。攻击性任务与防御性任务往往涉及相同的术语、代码和技术方法。
分析漏洞的请求可能来自正在准备补丁的维护者、正在解 CTF 挑战题的学生、正在开展授权评估的研究人员,也可能来自针对真实系统的攻击者。仅凭关键词无法可靠地区分这些情况。意图、授权、上下文、目标和潜在影响都至关重要。
对于 GLM-5.3,我们采用纵深防御的方法,包含三个互补的层级。
外部分类器
在我们的托管服务中,外部分类器会识别高风险请求,并帮助阻止明显有害的活动。
推理监控器
推理监控器在任务执行期间评估风险。它旨在检测可能在多个步骤中浮现的有害目标,而非仅依赖初始请求的措辞。
深度安全对齐
模型本身经过训练,能够区分合法的安全工作与高风险的攻击性活动,并拒绝越过该界限的请求。
深度安全对齐对于开源权重发布尤为重要。托管分类器和监控器适用于我们的服务,但它们不会自动随模型进入每一次本地部署。模型层面的对齐是随发布检查点一同包含的安全层。
为开发这些系统,我们构建了差异化训练数据,这些数据既反映了授权安全研究与恶意活动之间的相似性,也体现了二者之间的差异。我们还构建了对抗性数据,涵盖越狱变体、伪装意图以及其他试图规避安全审查的手段。
我们的评估覆盖一系列网络安全任务,包括:
• 安全教育与知识;
• 蓝队防御;
• CTF 挑战赛;
• 漏洞发现与修复;
• 授权渗透测试;
• 漏洞利用开发;
• 未授权入侵及其他明显恶意行为。
目标是降低高风险滥用,同时不广泛拒绝合法的防御、教育和研究类任务。
在更广泛发布之前,专业安全团队将进行安全评估和红队测试。这些评估既考察模型是否可能被操纵以支持有害活动,也考察其安全防护是否干扰合法的安全工作。
没有任何安全系统能消除所有双重用途风险。一旦模型权重公开,没有任何开发者能保证对每一次下游修改或使用保持控制。模型层面的安全防护可以提高滥用的门槛,但无法提供绝对控制。
因此,我们的发布流程聚焦于能够实现有意义风险降低的阶段:训练、发布前评估、受控合作伙伴测试、托管服务防护、负责任披露,以及持续对抗性测试。
启动 OpenVuln 计划
全球大部分数字基础设施依赖于开源软件。许多关键项目由小型团队或个人维护者管理,没有专门的安全资源。
与此同时,AI 正在让复杂的网络任务更容易实现自动化。如果先进的防御能力仍集中在少数组织手中,那么资源最少的项目可能恰恰要保护软件供应链中一些最重要的部分。
为帮助解决这一失衡问题,我们随 GLM-5.3 一同启动 OpenVuln 计划。
持续支持开源安全
我们将与维护者合作,审计重要的开源项目,识别潜在漏洞,并支持负责任披露与修复。
维护者可以使用 OpenVuln 提交项目进行安全审查,并了解更多相关流程。
开放世界的护盾
GLM-5.3 表明,开放模型在漏洞发现、漏洞利用分析和复杂安全推理方面可以变得显著更强。这一进步既具有真实的防御价值,也带来真实的双重用途风险。
我们的责任是引导这些能力,用于更早地发现漏洞、支持负责任的修复,并加固每个人都依赖的开源系统。
在完成分阶段评估并扩大 API 访问范围之后,我们计划将 GLM-5.3 作为开放权重模型发布。我们将继续改进模型级安全防护、测试对抗性使用场景,并在整个过程中支持协同披露。
开放世界必须拥有自己的盾牌。通过 GLM-5.3 和 OpenVuln 计划,我们旨在让这面盾牌更广泛地可用,并以审慎的方式将其发布。