Z.ai發布GLM-5.3:未換底模,靠後訓練衝出資安與編碼雙躍進
Z.ai發布GLM-5.3,沿用GLM-5.2的743億參數底模、只擴大後訓練規模;Terminal-Bench 3.0從4.6分升至28.3分,CyberGym漏洞測試達84.5%;z.ai員工稱其已在Cursor中發現「潛在嚴重漏洞」,權重將於兩週後釋出。
同一套長程代理訓練,讓模型「更會寫程式」與「更會挖漏洞」同步暴衝,迫使一向主打開放權重的Z.ai首度對敏感能力設下存取門檻,與closed lab面臨相同的能力與開放兩難。
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
Z.ai(前身智譜AI)今日發布GLM-5.3,重點不在換模型,而在證明後訓練這條路還能榨出多少東西。GLM-5.3沿用GLM-5.2那顆743億參數的底模,Z.ai自己講得很白:「GLM-5.3我們只做了一件事——擴大後訓練規模。」結果是Terminal-Bench 3.0從4.6分跳到28.3分,DeepSWE v1.1從46.2衝到66.9,幅度不小,但離GPT-5.6 Sol的34.6分、72.7分還有一段距離——GLM-5.3不是拿第一,是拿到「便宜的第一」:同一私有評測上,GLM-5.3只用約7.5萬個輸出token就拿下34.5%,GLM-5.2要用近9.6萬token才拿23.4%。省token,對正在跑編碼代理的企業來說,直接等於省成本。
真正該讓人多看一眼的是資安。Z.ai原本只是想讓模型更會抓漏洞,結果訓練規模一拉大,能力自己往「找到漏洞之後怎麼打穿」那一段爬過去了——公司自己都說「比我們預期的快」。CyberGym漏洞驗證測試,GLM-5.3拿84.5%,反而小贏GPT-5.6 Sol的83.6%;ExploitBench(完整攻擊鏈)雖然只有54.4%、仍落後GPT-5.6 Sol的76.5%,但比上一代GLM-5.2的24.4%已經翻了一倍多。z.ai開發者關係人員Lou在X上還爆料,GLM-5.3已經在SpaceX新收購的Cursor身上,揪出一個「潛在嚴重漏洞」——這事VentureBeat已向Cursor求證中,尚無回應。路透社則報導,Z.ai已經對這類敏感能力加了「可信存取」的門檻管控。
這才是這次發布真正的看點:一個以開放權重、低價著稱的模型公司,把「更會寫程式」和「更會挖漏洞」練成了同一種能力的兩面。這不是巧合,是所有做長程代理(long-horizon agent)的公司遲早要撞上的牆——能讓AI連續好幾天自主診斷、修改、驗證一套系統的能力,本來就跟滲透測試沒有本質差別。也因此,GLM-5.3這次先只開放給GLM Coding Plan與自家ZCode環境用,API跟開源權重都要等「安全評估與強化完成」才放,權重預計發布後兩週釋出。對一路標榜開源、低成本、相容主流編碼代理生態的Z.ai來說,這是頭一次要在能力和開放之間認真做取捨——跟OpenAI、Anthropic這些closed lab面對的難題,其實是同一題。GLM-5.3還有個容易踩雷的細節:這次不能關閉思考模式了,舊代碼裡寫`thinking.type: disabled`的呼叫方式會直接失敗,企業要遷移得先改參數,不是換個模型名稱就能無痛升級。
看完今天的,讓明天的自己送上門
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
已出刊 95 期 ・ 隨時可退訂
