Z.ai 在網絡安全審查後發布 GLM-5.3 權重
GLM-5.3 在後訓練後於 CyberGym 取得供應商報告的 84.5%,促使 Z.ai 延遲發布其可下載權重以進行安全測試。
文章目錄 · 11
Z.ai 在暫緩發布兩星期、以進行額外安全評估及強化措施後,已發布 GLM-5.3 的可下載權重。該公司於 2026 年 8 月 14 日推出模型的託管存取服務,但由於其後訓練流程產生了意料之外強大的網絡安全能力,因而延遲發布權重。
最受矚目的結果,是供應商報告 GLM-5.3 在 CyberGym 取得 84.5%,較 GLM-5.2 的 77.2% 高出 7.3 個百分點。Z.ai 目前的比較表顯示,在該公司的評估設定下,GLM-5.3 領先 Fable 5 的 83.8% 及 GPT-5.6 Sol 的 83.6%。
此結果需要一項重要補充說明:它由 Z.ai 產生,而非由獨立基準測試營運方得出。不過,該公司已公開這次運行所使用的代理程式框架、任務數量、推理設定、網絡限制及評分方法等異常詳盡的資料。
一、提升來自後訓練,而非新的基礎模型
GLM-5.3 使用與 GLM-5.2 相同的基礎模型。Z.ai 表示,所有報告的提升均來自兩次發布之間一個月內擴大後訓練規模,而非再次進行預訓練,或更改底層基礎模型。
該公司擴大了用來訓練模型處理長跨度任務的可執行環境數量及多樣性。這些環境要求代理程式與工具互動、觀察中間結果、修正其做法,並持續進行,直至完成任務或耗盡其預算為止。
Z.ai 的訓練技術堆疊結合了用於長語境處理的 IndexShare、用於長跨度任務強化學習的 SAO,以及其開源非同步強化學習框架 slime。Slime 將基於 Megatron 的訓練與 SGLang rollout 連接起來,並容許程式碼沙盒、驗證器、數學任務及代理程式環境作為資料生成組件進入訓練流程。
就 GLM-5.3 而言,Z.ai 在該後訓練組合中加入漏洞發現示例及互動式安全環境。目標是讓模型能夠檢查程式碼並推理漏洞。該公司表示,模型在漏洞利用後期階段的表現提升速度超出預期。
這項分別很重要,因為「相同基礎模型」不代表模型行為大致維持不變。強化學習可以改變固定預訓練模型如何規劃、使用工具、在失敗中堅持,以及如何在長任務中選擇行動。GLM-5.3 證明,即使沒有進行新的基礎模型訓練,這些改變也能顯著擴展雙重用途能力。
二、CyberGym 衡量可重現的漏洞觸發能力
CyberGym 由加州大學柏克萊分校研究人員提出,是用於評估代理程式應對真實軟件漏洞的基準測試。其資料集包含橫跨 188 個軟件項目的 1,507 個漏洞,取自已被發現及修補的錯誤。
該基準測試主要要求代理程式產生可重現已知漏洞的概念驗證輸入。成功需要在程式碼庫中導航、找出相關執行路徑,並產生從程式進入點觸發故障的輸入。這比回答網絡安全問題更具體,但範圍亦較對未知目標進行完整攻擊為窄。
Z.ai 使用 Claude Code 2.1.207 作為代理程式框架,在全部 1,507 項任務上評估 GLM-5.3。該公司把推理強度設為最高級別、停用網絡工具、容許最多生成 128,000 個 token,並沒有設定每項任務的逾時限制。它報告了單次運行的 Pass@1 分數。
代理程式在每個任務容器內運行。Z.ai 表示,它移除了 Git 中繼資料,並把網絡存取限制於小型網域白名單,包括安裝工具所需的套件來源,以減少檢索答案或使用外部服務的機會。
這些設定令 84.5% 的結果更容易理解,但並不令它成為獨立重現的分數。代理程式基準測試對周邊框架、可用工具、語境、重試政策、時間預算及反作弊控制均很敏感。當每個模型都在相同且已公開的配置下測試時,比較才最有說服力。
CyberGym 亦不應被理解為一般的「黑客攻擊」分數。它衡量的是代理程式能否根據原始碼及相關任務材料重現已知漏洞。找出未知缺陷、建立可靠的漏洞利用程式、在已部署目標中導航,以及持續進行端對端攻擊,都需要額外能力。
三、漏洞利用能力顯著提升,但仍落後於專有模型
Z.ai 在另外兩項基準測試中測試 GLM-5.3,旨在代表超越漏洞重現後的不同階段。
在 ExploitBench 上,GLM-5.3 取得 54.4%,GLM-5.2 則為 24.4%。這 30 個百分點的增長不僅令前代模型分數倍增,但 Z.ai 目前的表格報告 Fable 5 為 78.0%,GPT-5.6 Sol 為 76.5%。
ExploitBench 評估使用相同的 Claude Code 框架,停用網絡存取,並最多容許 300 輪代理程式與環境互動。Z.ai 計算了 41 項任務的平均覆蓋率,每項任務均跨 3 次修訂運行。
在 ExploitGym 上,GLM-5.3 在兩小時的標準化預算下完成 105 項任務,在六小時預算下完成 130 項。GLM-5.2 分別完成 29 項及 39 項。Z.ai 的表格顯示,Fable 5 分別完成 181 項及 247 項,而 GPT-5.6 Sol 則分別完成 216 項及 293 項。
ExploitGym 包含 869 項任務。其時間預算以模型特定的 token 生成速度作標準化,因此這些數字代表受控比較,而非在相同硬件上的實際經過時間。
綜合而言,結果顯示兩點。GLM-5.3 相比 GLM-5.2 的最大進展,出現在要求較高的漏洞利用評估上,但模型在相同測試中仍明顯落後於最強的專有系統。因此,CyberGym 的領先並不能證明它在自主進攻性安全方面整體領先。
四、安全延遲已結束,權重現已提供
在 8 月 14 日發布時,Z.ai 表示會暫緩開放權重發布兩星期,以完成安全評估及強化措施。Axios 報道,獲選安全合作夥伴可在過渡期間獲得受控存取。
這項暫緩已不再是現況。截至 9 月 2 日,官方 Hugging Face 儲存庫已包含 GLM-5.3 模型檔案,以及透過 Transformers、vLLM、SGLang、KTransformers 及其他推理框架運行模型的指示。Hugging Face 將該 checkpoint 識別為 7,530 億參數模型,並列出自訂 glm-5.3 授權條款。
模型卡亦提供三種推理強度設定:low、high 及 max,其中 max 預設使用,亦是重現 Z.ai 所報告基準測試配置所必需的設定。
發布權重改變了安全邊界。託管供應商可以監察請求、限制工具、更新保障措施或撤銷存取權。下載的權重可以在原始開發者持續監督以外私下部署、修改、微調,並連接至任意代理程式框架。
Z.ai 尚未發布足夠資料,讓外界獨立評估兩星期強化期間的改變。發布公告說明了延遲目的,但沒有提供詳細的安全報告、緩解措施清單,或顯示其效果的前後評估。
該公司將這次發布定位為防禦性安全工具。它表示,在專家審查、篩選及去重後,GLM 模型自 GLM-5.2 以來已在 269 個真實世界項目中識別出 2,436 個漏洞,其中包括 1,097 個被評為中等至高嚴重程度的問題。這些總數涵蓋自 GLM-5.2 以來進行的工作,不應完全歸因於 GLM-5.3。
對安全團隊及開源維護者而言,實際改變是,現時可以在不把私有程式碼傳送至託管供應商的情況下,評估及部署具備高能力的漏洞分析模型。相應風險是,相同的自主性、程式碼導航及概念驗證生成功能,可以在沒有 Z.ai 存取控制的情況下應用。
常見問題
GLM-5.3 是甚麼?
GLM-5.3 是 Z.ai 的 7,530 億參數語言模型,適用於編程、工具使用、長跨度代理程式任務及網絡安全工作。它使用與 GLM-5.2 相同的基礎模型,並加入額外後訓練。
GLM-5.3 是否獨立取得 CyberGym 的 84.5%?
沒有引用任何獨立重現結果。84.5% 的結果由 Z.ai 使用其已公開的 Claude Code 為本評估配置報告。
CyberGym 結果是否代表 GLM-5.3 是最適合黑客攻擊的模型?
不是。CyberGym 專注於根據原始碼重現已知漏洞。在 Z.ai 難度較高的 ExploitBench 及 ExploitGym 比較中,GLM-5.3 落後於 Fable 5 及 GPT-5.6 Sol。
GLM-5.3 權重現時可供下載嗎?
可以。官方 Hugging Face 儲存庫目前在 glm-5.3 授權條款下提供可下載模型及本地服務指示。
Z.ai 為何延遲發布權重?
Z.ai 表示,模型的網絡安全能力在後訓練期間發展得比預期快,因此暫緩發布權重兩星期,以進行額外安全評估及強化措施。
參考來源
Share