智譜發了GLM-5.3,重回國模一哥地位,GLM-5.3 的基座和 GLM-5.2 是同一個,沒有換,通過對 743B 基礎模型進行後訓練,實現了頂尖的程式設計和Agent能力;網路安全領域也實現重大飛躍,開源新標準。
官方跑分:
Terminal-Bench 3.0(衡量模型在真實終端環境中完成複雜任務的能力):GLM-5.3 從 GLM-5.2 的 4.6 分幹到了 28.3 分
DeepSWE v1.1(長程軟體工程與持續程式碼修改):從 46.2 提升到 66.9
Agents' Last Exam(跨工具協作與長程任務,覆蓋多類真實專業場景):從 23.8 提升到 28.5
智譜還有一個自建的體感評測叫 Z.ai Code Bench,模擬的是開發者實際使用 Coding Agent 時的場景,把模型放到真實的本地開發環境裡跑端到端任務。
測試結果:High 檔位下,GLM-5.3 精準率 31.4%,超過了 Claude Opus 4.8 最高檔位的 29.5%。更值得關注的是效率:GLM-5.3 完成同等任務平均消耗約 5 萬 token,Opus 4.8 需要約 12 萬,不到它的一半。
然後我自己測了一下
case1:
還是我的經典題目,prompt 很簡單,但屢試不爽,特別能考驗Agent和coding能力,我是從DeepSeek R1一路測下來的,模型到了Agent時代才可以勉強完成測試,能真實的感受的各家模型巨大進步,Agent做物理模擬需要同時處理材質、軌道力學、大氣層著色、著陸器姿態控制、推進器減速這一堆東西,同時還要進行3d建模,單shot
用 HTML 和 Three.js 製作一個火星登陸模擬過程,全程要符合物理過程,逼真,發揮你最大的想像力,開始吧。為了便於比較我是用cc測試的,GLM-5.3用了50分鐘左右,單次shot結果非常震撼,同樣的測試我最近用Kimi K3(用時1.5小時),前天的DeepSeek V4 pro 0813(用時半小時左右,DeepSeek Harness用時1.5小時,效果差不多),DeepSeek V4 flash 0731(用時20分鐘左右)
交付結果對比:
這個結果我是沒想到的,因為GLM-5.3還是個瞎子,Kimi K3在完成這個任務時我能清楚的看到它一邊截圖一邊端到端測試,視覺能力對完成這個測試很重要,我的預期是GLM-5.3會很接近Kimi K3,但沒想到GLM-5.3模擬整個物理過程,尤其是火星車登陸模擬之準確和精細震撼到我了,特意設計了登陸地形圖,一舉超越K3,也不知道智譜施了什麼魔法。
case2:
GitHub 分析面板,這個項目是我前兩天在測試Zcode新功能(goal,子Agent,遠端控制,閒時任務)時一個項目,詳細資訊可以看我這篇文章百萬使用者全員額度重設!實測 ZCode 史詩級進化,GLM 竟然能跑出 180% 的量當時用的的GLM-5.2,跑了四輪goal才做出來的,今天我用GLM-5.3跑一個循環測一下。
完整 Goal 指令
/goal 用 Vite + React 從零開始,建構一個 GitHub 開發者分析工具。
項目從空目錄開始,包含初始化、依賴安裝、完整功能實現到測試全流程。
【模組一:使用者分析】
1. 頂部搜尋框,輸入 GitHub 使用者名稱後拉取資料並展示
2. 用 Recharts 展示該使用者所有公開倉庫的 Star 總量、Fork 總量、
程式語言分佈餅圖,所有圖表配色統一,使用漸變色填充,
hover 有 tooltip 互動
3. 最近 12 個月 commit 活躍度熱力圖,顏色深淺表示活躍程度,
點選某一天展開查看當日倉庫活躍明細
4. 倉庫列表支援按 Star 數、最近更新時間排序,支援按語言篩選
5. API 請求帶本地快取,同一使用者 5 分鐘內不重複請求 GitHub API
6. 網路錯誤、使用者不存在、超出 API 限流(403/429)時
分別給出不同的友好提示
7. 搜尋過的使用者可以收藏,收藏列表持久化到 localStorage,
下次打開直接從我的最愛進入
8. 支援同時輸入兩個使用者名稱進行對比,並排展示 Star 總量、
語言分佈、活躍度熱力圖,佈局不錯亂
9. 倉庫資料支援匯出為 CSV,檔案能正常打開,資料完整
【模組二:今日熱榜】
10. 新增「今日熱榜」Tab,與使用者搜尋並列
11. 通過抓取 https://github.com/trending 獲取今日 Top 10 熱門倉庫,
封包括:排名、倉庫名、作者、描述、語言、
今日新增 Star 數、總 Star 數、Fork 數
12. 熱榜資料快取 1 小時,1 小時內切換 Tab 不重複請求
13. 每條資料展示今日新增 Star 趨勢標籤(用顏色區分熱度高低)
【模組三:AI 解讀 + 對話】
14. 熱榜每個倉庫有「AI 解讀」按鈕,點選後呼叫 GLM API 生成解讀
15. AI 解讀包含四個維度,以結構化方式展示:
- 這個項目是做什麼的(一句話說清楚)
- 今天為什麼突然火(結合 Star 增速判斷)
- 適合那類開發者關注
- 值不值得現在 Star
16. 解讀採用流式輸出,打字機效果逐字顯示,
不能等全部生成完再顯示
17. 解讀完成後,下方自然出現對話輸入框,
可針對該倉庫繼續追問
18. AI 以該倉庫完整資訊(名稱、描述、語言、Star 數、
今日增速)作為上下文進行多輪迴答,
能記住本次會話內的上下文
19. 對話方塊初始展示三個預設快捷追問按鈕,點選直接傳送:
「這個項目適合新手學習嗎?」
「有沒有類似的替代項目?」
「怎麼快速上手這個項目?」
20. 每個倉庫的對話上下文相互獨立,切換倉庫不串話
21. 對話方塊頂部顯示當前正在聊的倉庫名
22. 輸入框支援 Enter 傳送、Shift+Enter 換行
23. AI 回覆過程中輸入框停用,回覆完成後恢復
24. 單次對話超過 10 輪時提示使用者上下文較長,
詢問是否清空重來
25. AI 解讀結果按倉庫名快取到 localStorage,
同一倉庫當天不重複請求 GLM API
【視覺規範】
26. 整體深色主題,背景 #0d1117(GitHub 同款深色),
卡片用 #161b22,主色呼叫藍紫漸變
27. 卡片式佈局,卡片間有明確視覺層級和陰影
28. 資料載入時有 skeleton 佔位動畫,
頁面切換有過渡動效,不能硬切
29. 響應式佈局,移動端 375px 和桌面端 1280px 都正常顯示
30. 所有互動元素有 hover 狀態
【工程規範】
31. GLM API Key 通過右上角設定面板配置,
保存到 localStorage,不硬編碼在程式碼裡
32. 所有 AI 請求超時 15 秒,超時後提示使用者並支援一鍵重試
33. 每個元件檔案不超過 150 行,超過則拆分
34. 核心模組(快取邏輯、資料處理、AI 呼叫)
單元測試覆蓋率 80% 以上
35. 所有元件有 TypeScript 類型聲明,不允許使用 any
36. ESLint 檢查通過,零警告
37. npm run build 無報錯無警告
38. Lighthouse 性能評分 85 分以上
【驗收標準】
- 搜尋「torvalds」能正常展示資料,三種圖表渲染無報錯
- 搜尋不存在的使用者名稱,頁面不崩潰,顯示專屬提示
- 同時對比「torvalds」和「gaearon」,
兩列資料並排展示,佈局不錯亂
- 收藏一個使用者,刷新頁面後收藏仍在
- 匯出 CSV,檔案能正常打開,資料完整
- 「今日熱榜」Tab 展示 10 條真實倉庫資料
- 點選任意熱榜倉庫的「AI 解讀」,
流式輸出正常,打字機效果流暢
- 同一倉庫第二次點「AI 解讀」,
直接讀快取,控制台無新的 GLM API 請求
- 連續追問 3 輪,AI 回覆始終能引用之前對話內容
- 兩個倉庫同時展開對話,內容不串話
- 移動端 375px 寬度下佈局正常,無橫向捲軸
- npm run test 通過率 100%
- ESLint 零警告
- Lighthouse 性能評分 ≥ 85
這是交付結果:
全程大概1小時,而GLM-5.2至少耗時三小時以上才完成,交付質量也很高,沒有任何bug,這個面板可以幫助我快速分析GitHub倉庫,進行開發者對比,即時獲取GitHub熱榜,並利用AI對每個感興趣的項目進行深入分析理解學習,流式輸出,可以一鍵下載某開發者所有項目為csv文件
GLM-5.3總體給我的感覺非常絲滑,Coding能力比肩Claude Fable 5和GPT-5.6-Sol,Coding體感超過Kimi K3、DeepSeek-V4-Pro-0813
網路安全這件事
GLM-5.3 這次還有一個比較重要的方向,是網路安全。
客觀來說,這個方向比 Coding 更難評估,因為它不是普通使用者會直接接觸到的能力,很多人也沒有背景知識來判斷模型的表現意味著什麼。
我儘量把它翻譯成你能理解的資訊。
安全領域的測評一般分三段:
第一段,程式碼審查和漏洞發現。模型讀一段程式碼,找出那裡有問題。這是最基礎的。
第二段,漏洞驗證。找到之後,能不能證明這個漏洞是真實可觸發的,而不是誤報。
第三段,漏洞利用。能不能寫出完整的攻擊程式碼,在真實環境中把漏洞打穿。
GLM-5.3 目前的優勢集中在第一段和第二段。在 CyberGym(白盒程式碼審查與漏洞驗證)測試上,GLM-5.3 得分 84.5%,比 Claude Mythos 5 的 83.8% 略高,也高於 GPT-5.6 Sol 的 83.6%。
但在 ExploitBench(需要完整理解漏洞成因、完成利用)上,GLM-5.3 得了 54.4%,Claude Mythos 5 是 78.0%,差距還比較明顯。
發現漏洞這件事,有點嚇到我
發佈之前,智譜聯合了一批安全團隊:清華大學、南開大學、雲起無垠、綠盟科技、賽博崑崙、DARKNAVY、華順信安、奇安信、騰訊玄武、雲鼎實驗室等對 GLM-5.3 的能力做了密集的紅隊測試。
順帶用模型做了一輪漏洞發現。
結果:累計發現漏洞 2436 個,其中 1097 個中高危,部分漏洞潛伏了45 年都沒人發現。
這些漏洞覆蓋的範圍很廣:系統核心、作業系統、瀏覽器引擎、開源基礎元件。
這些不是在實驗室裡設計好的 CTF 題目,是在真實系統裡找到的真實漏洞。按照全球漏洞交易與賞金市場的參考報價,這批漏洞創造的經濟價值據估算超過 3000 萬元。
最後說一下現在怎麼用
GLM-5.3 已經上線了智譜的程式設計工具 ZCode 和效率工具 AutoClaw,面向 GLM Coding Plan 全量使用者開放,也開放訂閱。API 預計近期上線,完整模型權重兩周內開源。
此外 TraeWork、TraeCode、扣子、WorkBuddy、CodeBuddy、Qoder、QwenWork、CatPaw、JoyCode、OpenCode 等編碼平台已經開放搶先體驗。
GLM Coding Plan 全員額度已重設,後台"用量統計"可以看到額度回滿。
對 Coding 場景有需求的可以先進 ZCode 試試,後續有更完整的對比實測會更新。 (AI寒武紀)
