AI獵殺漏洞這件事,徹底捲起來了。
兩個月前,Anthropic的Mythos自主挖出FreeBSD裡藏了17年的漏洞,安全圈集體失眠。
就在剛剛,Cursor也被一個中國AI翻了。
清華NASP實驗室用它深入底層架構,直接在權限校驗邏輯裡撕開了一道口子。攻擊者一旦利用,可以任意寫入檔案,甚至接管Cursor整個開發環境。
這個AI,是智譜剛發佈的GLM-5.3。7530億參數,體量只有Mythos的十分之一,安全評測的得分卻實現了正面反超,國內安全圈今天也沸騰起來。
01. 2436個漏洞,有些藏了45年
從GLM-5.2發佈以來,智譜拉上國內頂尖安全團隊,一個多月後,戰報定格在2436個漏洞。
其中1097個中高危,觸角橫跨系統核心、瀏覽器引擎、開源元件,一路探到網際網路底層協議,涉及269個項目。
最老的一個,可以追到45年前。參照Zerodium、Pwn2Own的公開懸賞,漏洞估值高達3000萬元。
這些漏洞離你有多近?
一款日活數億的國民級通訊軟體,被翻出了一個「零點選」漏洞。不用騙你點連結,不用騙你下檔案,對方發來一條看著完全正常的消息,你的手機就可能直接換主人。
這個漏洞蟄伏在私有協議和記憶體管理的交界處,觸發條件極難復現,公開資料幾乎為零。
而研究人員則靠著GLM-5.3從海量二進制程式碼裡定位異常、還原邏輯,趕在漏洞被利用之前把路堵死了。
一場可能席捲數億人的安全風暴,就這樣被扼殺在了搖籃裡。
同時,企業信箱也沒跑掉。
賽博崑崙用GLM一口氣挖出三枚微軟漏洞,串聯起來就是一條完整攻擊鏈:預覽一封郵件就可能中招,伺服器端可被遠端打穿。
2021年同類漏洞在ProxyLogon事件中讓全球大量Exchange伺服器淪陷。
這一次,災難在引爆前被悄然解除。微軟完成修復後,官方致謝了「Kunlun Lab & GLM」。
但2436個漏洞裡,最讓人後怕的,藏在DNS裡。
DNS是整個網際網路的導航樞紐。你在瀏覽器敲個網址,DNS把你領到正確的伺服器。
沒有它,網際網路就是一片沒有門牌號的廢墟。這套協議誕生於1983年,比絕大多數網際網路公司都老。
43年了,全世界安全研究員拿著放大鏡審了一遍又一遍,無數輪自動化掃描反覆過篩。沒人發現問題。
如今,GLM-5.3隻用兩周時間,就找到了一類初期就潛伏在裡面的協議級漏洞。
攻擊手法並不花哨,卻招招致命。
攻擊者傳送少量特殊構造的請求,就能把伺服器的計算壓力放大近8萬倍。一個人在門外敲門,門裡驟然炸開8萬人的砸門巨響。伺服器直接過載。
後果就是,網站打不開,郵件中斷,雲服務癱瘓。潛在影響超過1000萬處公網DNS服務。
不過,在GLM-5.3的幫助下,這顆埋在網際網路地基裡45年的定時炸彈,在引爆前就已經被拆了。
02. 追兇Neo:攻擊的是AI,抓住它的也是AI
更厲害的是,GLM不只會挖漏洞,還能順藤摸瓜抓人。
7月,安全團隊盯上了一台巴西的可疑伺服器。GLM-5.3接手一查,發現背後藏著的不是人類駭客,而是一個AI Agent,代號「Neo」。
Neo專門盯A國的會計師事務所和稅務機構。
不到兩個月,它自己搭了4台伺服器、註冊7個域名、爬取6萬個信箱地址、寫了100多個指令碼,發出18567封釣魚郵件。全自動,不知疲倦。
但Neo把犯罪痕跡散落在數千個目錄、數萬份日誌裡,靠人工幾乎不可能拼回去。
但這並沒有難倒GLM-5.3。
通過對海量資料的分析,它把整條攻擊鏈還原了出來:誰是獵物、郵件系統怎麼搭的、怎麼偽裝成客戶把惡意檔案投出去。
最終,Neo被逮了個正著。
03. 十分之一的體量,正面反超
實戰夠硬了,評測榜上又是什麼水平?
CyberGym考的是看懂程式碼、定位漏洞、判斷危害等級的綜合能力,安全圈公認的硬指標。
在這裡,GLM-5.3直接拿到了84.5%的高分,10倍體量的Mythos是83.8%,OpenAI旗艦GPT-5.6是83.6%。參數量差了一個數量級,得分反而最高。
而到真正要親手打穿漏洞的ExploitBench和ExploitGym上,GLM-5.3還沒追上Mythos,但比上一代翻了兩到三倍,差距正在被快速壓縮。
看到這,我們也迫不及待地用Vibe Coding搭了幾個產品,讓GLM-5.3幫忙看看。
首先,是一套版本化素材庫AssetFlow。
我們上傳了紫色的v2去替換藍色的v1,頁面上版本號和預覽圖全都刷新了,看起來沒任何問題。
但點了「下載最新版本」之後,拿到的檔案還是v1。表面一切正常,打開檔案才發現版本對不上。
GLM-5.3沿著上傳、記憶體、索引、下載四個環節逐一追查,最終定位到快取層只區分了素材ID,沒有區分版本號。
它給出的修複方案也不是簡單地清空快取繞過問題,而是讓系統先鎖定版本號再去讀快取,把三條鏈路真正隔離開。
接下來是團隊看板SprintBoard。
操作的時候我們發現,用普通成員何川登錄時竟然能打開屬於周一的任務,甚至菜單裡居然還提供了「刪除」選項。點了一下之後,任務就真的沒了。
而且,不止權限在裸奔,資料也沒有全部寫進資料庫。
多人同時編輯同一條任務的時候,後保存的人會覆蓋前面的內容,完全沒有衝突檢測。
GLM-5.3接手之後,把權限判斷挪到了伺服器端,資料做了持久化,並行編輯加上了衝突提示,一個「能用但不安全」的原型被改造成了可以交付的產品。
最硬核的一個是3D智能倉庫。
8台AGV機器人自己接單、尋路、搬貨架、排隊充電,整套調度邏輯都能跑通。但跑通不等於安全。
我們直接讓GLM-5.3把這套系統接進了攻防閉環,身份認證、消息簽名、防重放、異常檢測、雜湊鏈審計、安全模式急停全部加上。
跑起來毛病一堆,它順著伺服器端、前端、遙測資料一路查回去,一個一個修掉,最終33項攻防加業務測試全部通過。
04. 開源Coding一哥,殺回來了
當然,安全只是GLM-5.3的一面。寫程式碼,它也沒打算讓任何人。
在六項主流程式設計評測中,GLM-5.3全部拿下開源第一。
Terminal-Bench 3.0衡量真實終端環境裡的複雜任務能力,GLM-5.3從上一代的4.6直接拉到28.3。
Agents' Last Exam考跨工具協作和長程任務,GLM-5.3拿了28.5,逼平GPT-5.6 Sol的28.6。
而在AutomationBench和GDPVal-AA v2上,GLM-5.3乾脆反超了所有閉源模型,拿下全場第一。
效率方面,在模擬真實編碼體驗的Z.ai Code Bench上,GLM-5.3 High達到了31.4%的精準率,超過Claude Opus 4.8 Max的29.5%。
不僅如此,每個任務GLM-5.3平均只要5萬tokens,而Opus 4.8需要12萬。
開源Coding一哥的名號,智譜這一代算是給奪回來了。
話不多說,我們又用真實項目試了試。
上來先做一個經典的迷宮吃豆遊戲。地圖建模、碰撞檢測、路徑演算法、多個實體的狀態管理,GLM-5.3一次生成全部到位。
甚至沒人要求,它自己還給加了個偵錯模式——把每個敵人的目標點和預測線路都展示了出來。
接下來,我們又把俄羅斯方塊從平面變成了3D立體的。
方塊可以繞X、Y、Z三條軸翻滾,以前是琢磨「往那兒塞」,現在是琢磨「從那個角度給懟進去」。
好玩是挺好玩的,就是到後面大腦的空間想像力直接當機了。
最後,我們又測了一下場景還原的能力。
一張木頭玩具桌上擺下了半個倫敦,大本鐘、塔橋、倫敦眼全在上面,8列小火車沿三條線路同時跑。
這裡的難點在於車廂跟隨。小火車不是各算各的位置,而是車頭留下一條軌跡佇列,後面車廂按「落後多少米」回溯採樣。
以前,這是資深圖形工程師才會做的最佳化決策,現在GLM-5.3一次生成就安排上了。
技術到位了。但誰能用上這些能力,是一個比技術本身更大的問題。
05. 閉源的矛,刺穿了自己人
6月,Anthropic放出Claude Mythos Preview,目前最強的AI漏洞獵手。但只對約150家大型機構開放。
這就造成了一個荒謬的局面:攻擊者拿AI找漏洞不需要任何人批准,但防禦者想用同等能力的AI來守,得先擠進那150家的名單。全球5000萬中小企業、4億個開放原始碼專案,統統排不上號。
7月這個矛盾炸了。
OpenAI的智能體入侵Hugging Face,安全團隊想調閉源模型分析攻擊日誌,換來的是一道冰冷的拒絕。
走投無路,Hugging Face把智譜GLM-5.2部署在自家伺服器上,硬是拼出了1.7萬條攻擊事件的完整攻擊鏈。
能用,不是因為GLM-5.2比Mythos強,而是因為它生來開源,部署在自己的機器上,不需要看任何人的臉色。
這場危機直接推了黃仁勳一把。他在X上發出自己的第二條推文,宣佈聯合37家機構成立「開放安全AI聯盟」。
OpenAI、Anthropic、Google三大閉源巨頭,無一在列。
他的判斷很直接:當攻擊者已經擁有前沿AI,防禦者不能還被鎖在門外。
06. 最好的盾,必須屬於所有人
兩周,2436個漏洞,從Cursor到DNS,GLM-5.3用實戰證明了一件事:開源模型的安全能力,已經追上了閉源前沿。
而且它對所有人開放。
每一個開發者、每一個安全團隊、每一個被攻擊時叫天天不應的中小企業,都能部署在自己的伺服器上跑。不用排隊,不用審批,不用把程式碼交給別人。
不僅如此,智譜還上線了漏洞披露帳簿(cvd.z.ai),每一個發現、每一次修復,全程可查。而且,所有漏洞也全部進入了CNVD、CNNVD負責任披露流程,逐一聯絡廠商修復,可利用程式碼不予公開。
並肩作戰的,有清華、南開兩所高校,有雲起無垠、綠盟科技、賽博崑崙、DARKNAVY、奇安信、騰訊玄武等十余支國內頂級安全團隊。
智譜同步啟動了「開放原始碼的盾」計畫:
對重點開放原始碼專案持續安全審計,幫維護者免費發現和修復風險。
向開源社區開放免費模型額度,安全審計不再是有錢人的遊戲。
在ZCode裡上線程式碼審計功能,讓安全檢查進入每個開發者的日常工作流。
當最強的矛握在少數人手裡的時候,最好的盾必須屬於所有人。 (新智元)
