Z.ai 在网络安全安全审查后发布 GLM-5.3 权重
GLM-5.3 在后训练后于 CyberGym 上获得厂商报告的 84.5%,促使 Z.ai 为进行安全测试而延后发布其可下载权重。
文章目录 · 11
Z.ai 在额外进行安全评估和加固而将 GLM-5.3 的可下载权重暂缓两周后,现已发布这些权重。该公司于 2026 年 8 月 14 日推出该模型的托管访问服务,但因其后训练流程产生了出乎意料强大的网络安全能力,延后了权重发布。
核心结果是厂商报告的 CyberGym 84.5% 得分,较 GLM-5.2 的 77.2% 提高了 7.3 个百分点。根据 Z.ai 当前的对比表,在该公司的评估设置下,GLM-5.3 高于 Fable 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%。
这一结果需要一项重要限定:它由 Z.ai 产生,而非由独立基准测试运营方得出。不过,该公司公布了异常详尽的信息,说明本次运行所用的智能体框架、任务数量、推理设置、网络限制和评分方法。
一、提升来自后训练,而非新的基础模型
GLM-5.3 与 GLM-5.2 使用相同的基础模型。Z.ai 表示,所有报告中的提升都来自两次发布之间一个月内对后训练的扩展,而非再次进行预训练或更改底层基础模型。
该公司扩大了用于训练模型处理长程任务的可执行环境的数量和多样性。这些环境要求智能体与工具交互、观察中间结果、修正方法,并持续执行,直至完成任务或耗尽预算。
Z.ai 的训练技术栈将用于长上下文处理的 IndexShare、用于长程任务强化学习的 SAO,以及其开源异步强化学习框架 slime 结合在一起。Slime 将基于 Megatron 的训练与 SGLang rollout 连接起来,并使代码沙箱、验证器、数学任务和智能体环境能够作为数据生成组件进入训练流程。
对于 GLM-5.3,Z.ai 在后训练混合数据中加入了漏洞发现示例和交互式安全环境。预期结果是一个能够检查代码并推理漏洞的模型。该公司称,模型在漏洞利用后续阶段的表现提升速度超出预期。
这一区别很重要,因为“相同的基础模型”并不意味着模型行为基本保持不变。强化学习能够改变一个固定预训练模型在长任务中规划、使用工具、在失败后坚持执行以及选择行动的方式。GLM-5.3 表明,即使没有进行新的基础模型训练,这些变化也能实质性扩展双重用途能力。
二、CyberGym 衡量可复现的漏洞触发能力
CyberGym 由加州大学伯克利分校的研究人员推出,是一个用于评估智能体应对真实软件漏洞能力的基准测试。其数据集包含来自 188 个软件项目的 1,507 个漏洞,这些漏洞均来自已经发现并修复的缺陷。
该基准测试主要要求智能体生成一个能够复现已知漏洞的概念验证输入。成功需要在代码库中定位相关执行路径,并生成能从程序入口点触发故障的输入。它比回答网络安全问题更具体,但比对未知目标实施完整攻击更狭窄。
Z.ai 使用 Claude Code 2.1.207 作为智能体框架,在全部 1,507 项任务上评估 GLM-5.3。该公司将推理强度设为最高等级,禁用网络工具,允许最多生成 128,000 个 token,并且不设单项任务超时限制。其报告的是单次运行的 Pass@1 得分。
智能体在每项任务容器内运行。Z.ai 表示,它移除了 Git 元数据,并将网络访问限制在一个小型域名白名单内,其中包括工具安装所需的软件包来源,以减少检索答案或使用外部服务的机会。
这些设置让 84.5% 的结果更易于解读,但并不使其成为独立复现的得分。智能体基准测试对周边框架、可用工具、上下文、重试策略、时间预算和反作弊控制都很敏感。当每个模型均在同一套公开配置下测试时,对比才最有说服力。
CyberGym 也不应被理解为通用的“黑客攻击”得分。它衡量的是智能体能否依据源代码和相关任务材料复现已知漏洞。发现未知缺陷、构建可靠的利用程序、在已部署目标中进行操作,以及维持端到端攻击,都需要额外能力。
三、漏洞利用能力大幅提升,但仍落后于专有模型
Z.ai 在另外两个旨在代表漏洞复现之后阶段的基准测试中测试了 GLM-5.3。
在 ExploitBench 上,GLM-5.3 得分为 54.4%,而 GLM-5.2 为 24.4%。30 个百分点的提升使前代模型得分增加了一倍以上,但 Z.ai 当前表格显示,Fable 5 为 78.0%,GPT-5.6 Sol 为 76.5%。
ExploitBench 评估使用相同的 Claude Code 框架,禁用网络访问,并最多允许 300 轮智能体—环境交互。Z.ai 计算了 41 项任务的平均覆盖率,每项任务均跨 3 个修订版本运行。
在 ExploitGym 上,GLM-5.3 在两小时标准化预算内完成 105 项任务,在六小时预算内完成 130 项。GLM-5.2 分别完成 29 项和 39 项。根据 Z.ai 的表格,Fable 5 分别完成 181 项和 247 项,而 GPT-5.6 Sol 分别完成 216 项和 293 项。
ExploitGym 包含 869 项任务。其时间预算采用模型特定的 token 生成速度进行标准化,因此这些数字代表受控比较,而非在相同硬件上的实际经过时间。
综合来看,结果显示两点。GLM-5.3 相较 GLM-5.2 的最大增益出现在要求更高的漏洞利用评估中,但在相同测试上,该模型仍明显落后于最强的专有系统。因此,CyberGym 领先并不能证明其在自主进攻性安全方面整体领先。
四、安全延迟已结束,权重现已可用
在 8 月 14 日发布时,Z.ai 表示将在完成安全评估和加固期间,将开放权重发布推迟两周。Axios 报道称,在此期间,经过筛选的安全合作伙伴可获得受控访问权限。
这一暂缓措施现已不再适用。截至 9 月 2 日,官方 Hugging Face 仓库已包含 GLM-5.3 模型文件,以及通过 Transformers、vLLM、SGLang、KTransformers 和其他推理框架运行模型的说明。Hugging Face 将该检查点标识为一个 7530 亿参数模型,并列出自定义的 glm-5.3 许可证。
模型卡还提供了三种推理强度设置:low、high 和 max,其中默认使用 max,且复现 Z.ai 报告的基准测试配置必须使用该设置。
发布权重改变了安全边界。托管服务提供商可以监控请求、限制工具、更新安全措施或撤销访问权限。下载的权重可以被私下部署、修改、微调,并连接至任意智能体框架,而无需原始开发者持续监督。
Z.ai 尚未公布足够信息,供外部独立评估两周加固期间发生了哪些变化。发布公告说明了延迟目的,但未提供详细安全报告、缓解措施清单,或展示其效果的前后对比评估。
该公司将此次发布定位为防御性安全工具。该公司称,经专家审查、筛选和去重后,GLM 模型已在 269 个真实项目中识别出 2,436 个漏洞,其中包括 1,097 个被评为中等至高严重性的漏洞。这些总数涵盖自 GLM-5.2 以来开展的工作,不应完全归因于 GLM-5.3。
对于安全团队和开源维护者而言,实际变化在于,如今可以在不将私有代码发送给托管服务提供商的情况下,评估和部署一个能力很强的漏洞分析模型。相应的风险是,同样的自主性、代码导航和概念验证生成能力可以在没有 Z.ai 访问控制的情况下被应用。
常见问题
什么是 GLM-5.3?
GLM-5.3 是 Z.ai 面向编程、工具使用、长程智能体任务和网络安全工作的 7530 亿参数语言模型。它与 GLM-5.2 使用相同的基础模型,但增加了后训练。
GLM-5.3 是否独立实现了 CyberGym 84.5% 的得分?
目前没有引用任何独立复现结果。84.5% 的结果由 Z.ai 使用其公开的基于 Claude Code 的评估配置报告。
CyberGym 结果是否意味着 GLM-5.3 是最适合黑客攻击的模型?
不是。CyberGym 聚焦于根据源代码复现已知漏洞。在 Z.ai 难度更高的 ExploitBench 和 ExploitGym 对比中,GLM-5.3 落后于 Fable 5 和 GPT-5.6 Sol。
GLM-5.3 权重现在可以获取吗?
可以。官方 Hugging Face 仓库目前在 glm-5.3 许可证下提供可下载模型及本地部署说明。
Z.ai 为什么延迟发布权重?
Z.ai 表示,该模型的网络安全能力在后训练期间发展速度快于预期,因此其暂缓发布权重两周,以进行额外安全评估和加固。
参考来源
Share