關鍵要點:
- GLM-5.3 在 ExploitBench 的得分從 24.4% 翻倍以上至 54.4%
- 編碼能力在長程任務上提升最顯著:Terminal-Bench 3.0 從 4.6 躍升至 28.3
- 權重將在安全加固兩週後發布;API 現已要求啟用思考模式
關鍵要點:

Z.ai 的 GLM-5.3 完全透過在與前代相同的基礎模型上進行後訓練構建而成,其漏洞利用鏈評測分數翻倍以上,同時縮小了與 Anthropic Fable 5 的編碼能力差距。
Z.ai 於 8 月 14 日發布的 GLM-5.3,其所有能力提升均來自於在與 GLM-5.2 相同的基礎模型上擴大規模的後訓練,然而其漏洞利用基準評測分數提升了兩倍以上,並縮小了與 Anthropic Fable 5 在編碼方面的差距。這家總部位於北京的公司(亦稱智譜)表示,該模型是其迄今為止測量到的最強開放權重編碼系統,在內部 Z.ai Code Bench 上比 GLM-5.2 提升了 50%。
該公司在新聞稿中表示:「基準在漏洞利用鏈上的位置越靠前,從 GLM-5.2 獲得的提升就越大」,並描述隨著訓練規模擴大,網路能力「發展速度超出我們的預期」。Z.ai 表示,該模型開始在漏洞利用的多個階段進行推理,形成針對完整鏈路的連貫計畫,而非孤立的漏洞查找。
在需要對真實漏洞進行更深層推理的 ExploitBench 上,GLM-5.3 達到了 54.4%,是 GLM-5.2 的 24.4% 的兩倍以上。在 ExploitGym 上,它在兩小時內完成了 105 項任務、六小時內完成 130 項,而前代僅分別完成 29 項和 39 項,預算已按各模型吞吐量進行標準化。在 CyberGym 上,它得到 84.5% 的成績,領先 Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%。編碼能力的提升在最長期的評測中最為顯著:Terminal-Bench 3.0 從 4.6 躍升至 28.3,DeepSWE v1.1 從 46.2 上升至 66.9。
該模型在 269 個開源專案中識別出 2,436 個漏洞,其中包括 1,097 個被評為嚴重或高危的漏洞,最古老的漏洞可追溯至 1981 年,平均發現滯後時間為 26.6 年。Z.ai 將在安全評估和加固兩週後發布權重,API 現在要求在低、高、最大三個努力等級下啟用思考模式——這對於先前在關閉思考模式下運行的應用程式來說是一項破壞性變更。
GLM-5.3 使用與 GLM-5.2 相同的約 7,000 億參數的基礎模型,所有提升均來自環境擴展而非架構變更。Z.ai 建立了整合合成長程任務環境的管線,研究代理將真實工作模式轉化為可執行的任務,評判代理則驗證每個任務均可解決。某些環境代表了一名經驗豐富的工程師數天的工作量,例如一項 ML 基礎設施任務,模型必須在整個訓練堆疊中診斷瓶頸、實施優化,並交付可衡量的端到端加速。
訓練在 Z.ai 的開源後訓練框架 slime 上運行,該公司表示,透過工作負載感知調度和分層快取,長程編碼任務的端到端強化學習吞吐量提升了 2.3 倍以上。訓練展開的一致性被收緊至 1e-7 logprob 差異,相較先前的設定減少了 99.99% 以上。
這些結果將 GLM-5.3 置於一個競爭激烈的中國開放權重挑戰者陣營之中——包括 DeepSeek-V4 Pro、Moonshot 的 Kimi K3 和阿里的 Qwen3.8-Max——以及 Anthropic 和 OpenAI 的封閉模型。在 Z.ai 私有的 Code Bench 上,GLM-5.3 在 High 努力等級下以每項任務約 5 萬輸出 token 達到了 31.4%,超過 Claude Opus 4.8 以 12 萬 token 取得的 29.5%,但仍落後於在 Max 努力等級下以 39.5% 領先的 Fable 5。在公開評測套件上,GLM-5.3 在包括 Terminal-Bench 3.0 和 DeepSWE 在內的更難編碼評測上仍落後於 GPT-5.6 Sol 和 Fable 5,而 Mythos 5 在 ExploitGym 上以 181 和 247 項任務大幅領先。
公告與權重發布之間的兩週間隔在此次發布中承擔了重要角色:正在被加固的模型,正是 Z.ai 自己描述為攻擊性安全能力發展速度快於預期的模型,其最大提升集中在漏洞利用鏈的末端。這些發現被納入 Z.ai 的公開安全揭露帳本,發布時有 53 個問題公開揭露、2,383 個處於保密狀態,其中包括 Linux 核心中的 use-after-free 漏洞,以及影響 Apple Safari 的 WebKit 記憶體處理缺陷。
Z.ai 股價(02513.HK)在公告後回落,午盤下跌 3.9% 至 1,266 港元,成交額達 141 億港元,即便摩根士丹利將其目標價上調至 1,700 港元。獨立評估機構是否會複製廠商報告的數字——尤其是內部 Code Bench 成績以及在 Z.ai 自有測試環境配置下運行的網路安全分數——將決定本次發布在多大程度上是開放權重編碼模型的真正進步。預計於 8 月底前後發布的權重,將是測試開始之時。
本文僅供資訊參考,不構成投資建議。