
智譜發布GLM-5.1的時候,盤中漲幅一度接近19%,收盤漲幅11.5%。到了GLM-5.2,當天暴漲32.8%,一周後市值突破萬億。按照這個邏輯來看,GLM-5.3發布後,智譜股價不得起飛嘍?
可事與願違,8月14日發布GLM-5.3當天,智譜跌3.57%,日內回撤超11%。
智譜GLM-5.3的成績單很亮眼。DeepSWE的66.9分超過了V4 Pro的62.7,Terminal Bench 3.0從5.2的4.6分暴漲到 28.3分拿下開源第一,CyberGym以84.5%登頂全球,在高難度編程任務上,只用了不到Claude Opus 4.8一半的 token,就拿到了更高的完成率。
在智譜官方放出的性能圖裏,編程、終端操作、Agent任務、網絡安全等八方面,贏過了DeepSeek V4 Pro正式版七項,對DeepSeek形成了「精準狙擊」。

但是卻很少有人注意到,GLM-5.3其實並非「新」模型,它和GLM-5.2 用的是同一個7430億參數基座,所有提升全靠後訓練。這和DeepSeek V4 Pro從預覽版到正式版的邏輯是一樣的,後者也都是同一個1.6T基座,能力躍遷同樣來自後訓練。
GLM-5.3之於5.2,就是V4 Pro正式版之於預覽版。兩者的不同在於,智譜沒有漲價,DeepSeek卻漲了一大截。從8月17日0點開始,DeepSeek API新一輪調價,全面引入峯谷分時定價機制,整體價格較此前出現大幅上調,全計費項漲幅區間為50%至1100%。
還有一點,那就是在自進化這塊,智譜已經和DeepSeek形成了初步交鋒。GLM-5.3的新後訓練方法,本質上是一種模型自進化。而DeepSeek V4 Pro同步發布的DeepSeek Harness,其插件即一切的策略,也是為了自進化。
自進化是公認通往AGI的賽道,眼下國產大模型的 AGI 賽道,本質上就是智譜、DeepSeek、Kimi 三家的競速。 都喊着 AGI,都在拼誰的模型更像一個能獨立幹活的 "人"。

兩家的方法論究竟有何不同?
先看智譜這邊。GLM-5.2到5.3最核心的變化是加入了一套「自己出真題自己做」的環境合成流水線。
在GLM-5.2的時期,訓練環境還主要靠人工搭建,所以題型有限、場景也偏模擬題。
到了5.3,智譜引入了一個全自動的環境生成機制。
具體來講,智譜用了一個「AI研究員」(研究Agent)去真實場景裏面抄題目。比如它會觀察工程師到底怎麼幹活,把真活兒變成考題。
其實很早之前的生成對抗就採用了類似的邏輯,用機器給機器出題。
可機器出題沒法保證每道題都是好題。 有的題可能根本解不出來(出題時條件給錯了),有的題可能缺關鍵信息(做到一半卡死),有的題可能是「無解題」(mission impossible)。如果這些廢題混進訓練題庫,模型辛辛苦苦刷了半天,刷的是一道根本做不出來的題。
因此智譜用了一個AI判卷員(判斷Agent),先自己做一遍。 相當於出題人出完卷子,先自己答一遍,確認「這題真的能解出來」,不是道廢題。防止出那種連老師都不會做、純粹難為學生的怪題。
判卷員在做題過程中,不許看參考答案,只看解題過程。
如果是帶着答案做題,那麼模型可能學會「背答案」或者「抄近路」。表面上得分高,實際啥也沒學會。所以判卷員得盯着解題軌跡,看它是不是一步一個腳印真解出來的,有沒有鑽漏洞、走捷徑。只有「題能出、能做、過程乾淨」三道關卡全過了,這道題才配進訓練題庫。
這套流水線讓訓練環境規模擴大了數倍。

除了方法改變以外,刷題的整個基礎設施也得到了升級。
slime是智譜從GLM-5時代就一直在用的一套訓練框架,你可以把它理解成一個自動化的刷題工廠。
5.3在這套工廠上做了兩層大改造。第一層是算法層面,新增了一批技術配置,最關鍵的一個改動,是讓練習和考試的環境幾乎完全一致。兩者計算結果的平均差異控制在千萬分之一的量級,比之前精確了99.99%。
AI的強化學習,本質上是成千上萬輪的循環。先考試生成一批答卷,再根據答卷講課更新模型,然後再考試、再講課,無限循環。
如果練習和考試的環境有一點點不一樣,每一輪都帶入一點誤差,一萬輪下來誤差就滾成了大雪球,模型可能學歪甚至直接崩掉。
就好比NBA比賽中,三分線弧頂距離是7.24米,底角是6.7米,但是FIBA國際籃聯的三分線是6.75米,如果練習的時候以FIBA的標準,那麼到了NBA中就適應不了那麼遠的三分線。
第二層是系統層面,智譜給這個出題工廠加了一堆效率優化。
常用的數據放到近處緩存,不用每次去遠處取。相當於教材室緊挨教室,拿到教材就可以立馬發給學生。
多個老師還可以自動切換,還能提前備好課,任務調度讓每台機器都不閒着,還能根據題型自動調整到最優配置。這些優化疊在一起,長程編碼任務的整體訓練速度翻了2.3倍。
在Agent領域影響力最大的Terminal Bench 3.0基準數,得分從5.2的4.6分,暴漲到了5.3的28.3分,拿下開源模型第一。DeepSWE v1.1從46.2漲到66.9,Agents' Last Exam從23.8漲到28.5,AutomationBench從26.2漲到48.2。
再看DeepSeek這邊,從預覽版到正式版,DeepSeek V4 Pro也強化了後訓練。預覽版的監督微調數據以通用問答和基礎代碼為主,而在正式版當中,新增了大量Agent專用的多步驟工具調用對話範例。
以前教模型的例子,是「幫我寫封郵件」這種一問一答。現在換成「把文件夾裏所有PDF轉成Word」這種真活兒。AI得先掃文件夾,然後識別PDF,並逐個進行轉換。一切都完成後,匯總報告,一環扣一環。
同時,DeepSeek把GRPO強化學習的獎勵函數給重新設計了一遍。
預覽版在Agent場景下有兩個常見的硬傷,其一是工具調用死循環,反覆調用同一工具但提取不到有用信息;其二是參數解析錯誤,JSON格式錯、必填字段漏。
正式版的獎勵信號專門針對這兩類失敗做了懲罰,在需要35次工具調用的複雜任務中,正式版基本可以一次跑通不再卡死。

唐傑vs梁文鋒+崔添翼
技術路線的背後從來都是人的理念。智譜和DeepSeek這場對抗,本質上是兩種AGI路徑的對撞。
智譜創始人唐傑在7月11日發布了內部信《巨浪已來》,宣佈啓動「Touch High(摸高)計劃」。信中寫到,未來兩年不把重心放在商業變現上,集中資源衝AGI的下一個高地。
唐傑把AGI的突破拆解為三座必須翻越的大山,第一座是記憶,長上下文和RAG已經逼近記憶雛形;第二座是完全自治的智能體系統(Autonomous Agent System,即持續學習和自我評判),模型迭代頻次的提升本身就在逼近持續學習,前沿模型已顯露自我評判的萌芽;第三座是自進化(Self-Evolving)。
唐傑表示,「AI訓練AI已經成型,模型自己寫代碼、自己清洗與合成數據、自己訓練自己。這或許會消耗一些算力,卻節省了最寶貴的人力與時間。而在大模型時代,速度是最重要的,快速迭代會直接拉開認知的代際差距。」
前文提到的GLM-5.3後訓練辦法,本質上就是一種自進化。
不過自進化最有魅力的地方,並不在於它如何實現了開發者一開始給它規定的目標。就比如GLM-5.3,的確通過自進化,讓性能更強了。但最有魅力的地方在於,GLM-5.3獲得了極強的網絡安全能力。
智譜給GLM-5.3做後訓練時,確實往訓練環境里加了一些漏洞挖掘的任務。初衷很簡單,讓模型找漏洞、分析漏洞的能力強一點。
結果訓練規模上去了,事態也跟着失控了。

官方博客中寫到,「我們本來以為它只是更會找單個漏洞,但出乎意料的是,它開始跨越漏洞利用的多個階段,形成完整的攻擊鏈計劃。」
在CyberGym測試中,任務要求模型從白盒源碼出發識別並驗證漏洞,GLM-5.3拿到了84.5%分,全球第一,壓過了Anthropic的Claude Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%)。
DeepSeek在自進化這道題上,給出的答案是「插件」。梁文鋒把模型基座凍結在1.6T不動,崔添翼帶隊的DSH框架則把「自進化」發生的場所,從模型內部搬到了模型外部。
DSH的核心設計原則只有五個字,「一切皆插件」(Everything is a Plugin)。模型接入、工具註冊表、會話日誌、審批策略、沙箱、存儲、上下文管理、甚至驅動 Agent 運轉的主循環本身,全都是可以拔插的積木。
底層的Cordis微內核只負責插件的加載、卸載和依賴管理,其他什麼都不管。
DSH在GitHub宣佈開源的當天,也發布了一篇長達88頁的論文《時空可組合性的編程範式》,來闡述DSH的理論基礎。
Cordis最關鍵的特性叫「可逆效應」。它指的是,每個插件註冊時產生的所有副作用都被追蹤,卸載時自動回收,不留垃圾、不漏內存。
這意味着Agent可以在運行過程中隨時更換插件,覺得這個搜索引擎不好用。OK,馬上換下一個。甚至可以在Agent跑任務的時候換掉它的決策策略,類似於「熱插拔」一樣,即便更改插件,運行狀態也不會崩。
簡單來說,傳統的Agent非常死板,師傅怎麼教,他就怎麼學,只要超出知識點就會無能為力。DSH發現缺扳手時,現場自己鍛造一把、插到手上接着擰螺絲,用完還能拆下來。
插件化還有另外一層含義,那就是相互獨立。傳統軟件之間存在強依賴關係,改了A,可能B就會受牽連。插件之間相互獨立,因此可以相互演化,進而帶動整個模型實現自進化。
DSH發布不到兩天,就在GitHub就收穫10萬顆以上的星星,可見開發者社區對它的青睞。
但智譜和DeepSeek其實是兩種完全不同的自進化觀。
唐傑追求的是「模型自己變聰明」,進化發生在訓練階段,目標是提升模型本身的智商;梁文鋒和崔添翼追求的是 「模型的身體可以無限重組」,進化發生在推理和運行階段,模型本身的智商不變,但它的「手腳」和「器官」可以隨時替換、擴展、升級,能力邊界由插件生態的豐富程度決定。
如果說唐傑的自進化是生物學意義上的進化 ,基因在迭代中變得更聰明。那梁文鋒+崔添翼的自進化就是工具意義上的進化,人本身沒變,但從石器到青銅器到蒸汽機,工具的重組讓人的能力指數級擴張。
兩條路線誰對誰錯,沒人能定奪,然而智譜的股價成了這場對抗的風向標,甚至被網友戲稱為「衡量DeepSeek模型能力最好的測試集」。
4月24日DeepSeek V4預覽版發布當天,智譜暴跌逾9%,隨後幾個交易日持續下挫,4月28日盤中一度跌超13%、跌破千元大關。
市場的邏輯是,DeepSeek又強又便宜還開源,而智譜這邊卻在漲價。
從2月開始智譜連續上調API定價,一季度累計漲幅約83%,4月GLM-5.1發布時完成年內第三次提價。
這就導致智譜的商業化空間被擠壓,估值邏輯遭到了質疑。
8月13日,V4 Pro正式版遭遇烏龍事件,凌晨靜默發布、白天官網橫幅撤下公告刪除、後端指紋改回Preview狀態、不到24小時又重新發布。當天智譜股價反而從開盤1230港元漲到收盤1317港元,漲幅約9%。
對手「翻車」被解讀為自身利好,說明市場已經從「DeepSeek出模型 = 智譜利空」的簡單零和邏輯,轉向了對兩家路線可持續性的更微妙博弈。
8月14日GLM-5.3發布當天,智譜股價高開低走,開盤1356港元、盤中最高衝到1435港元,收盤卻跌到1270港元,跌幅3.57%,從日內最高點算回撤超過11%。
這可能意味着投資者不再只看模型的性能本身,而是唐傑的「自進化閉環」和梁文鋒+崔添翼的「插件化生態」之間,哪條路更可能跑到AGI的終點。
GLM-5.3雖然八項贏七項,但市場認為這是「符合預期」的後訓練迭代,沒有超出基座不變的框架。V4 Pro+DSH的組合,或許纔是長期變量。

從「價格屠夫」到集體漲價
前面說完了智譜漲價,現在該說說DeepSeek漲價了。
DeepSeek一直以「價格屠夫」著稱,早在V3時代,DeepSeek就用極致的性價比,打穿了整個行業的價格底線。後面到了V4預覽版,DeepSeek又延續了這個策略,緩存命中輸入低至0.025元/百萬token,未命中輸入3元,輸出6元,幾乎是海外旗艦模型的幾十分之一。
但8月13日晚間,DeepSeek在發布V4 Pro正式版的同時官宣了API調價,從8月17日零點生效。
在這次價格調整中,DeepSeek首次引入了峯谷分時定價,高峯時段為北京時間9:00-12:00和14:00-18:00,空閒時段價格為高峯的一半。
V4 Pro高峯時段緩存命中輸入從0.025元漲到0.3元,漲幅12倍;未命中輸入從3元漲到9元,漲幅3倍;輸出從6 元漲到27元,是原來的4.5倍。空閒時段則分別為0.15 元、4.5元和13.5元。V4 Flash也同步調價,空閒時段緩存命中0.05元、未命中1.5元、輸出4.5元,高峯翻倍。
對於一個以「便宜」為核心競爭力的公司來說,DeepSeek這番漲價勢必削弱了公司的吸引力。
開發者圈子裏,從「梁文鋒的恩情還不完」的論調,變成了「梁聖變樑子」的調侃。社區吐槽稱,DeepSeek每貴一塊錢,就要破產幾百家OPC(單人公司),現在漲了好幾倍,幾乎已經不給這些獨立開發者留退路了。
不過漲價的並非只有DeepSeek和智譜,全行業都在漲價。
DeepSeek作為最後一個堅持低價的頭部玩家,它的漲價標誌着一個時代的結束。用低價換規模、用補貼換市場份額的階段,正式落幕了。

漲價的本質不是算力貴了,這是所有人都能用的藉口。真正的原因是公司長大了。
AGI研發是個無底洞,唐傑的摸高計劃要投入百億級做可解釋性、建合成數據工廠、搞自治智能體系統,梁文鋒要除了迭代模型以外,現在還要養DSH的開源生態。
不能一直靠孖展和燒錢,終究得靠自己造血。當模型能力逼近海外第一梯隊,而模型價格卻繼續保持海外頭部的幾十分之一出售時,本質上是在賤賣自己的技術溢價,也是在告訴資本市場我還沒準備好掙錢。
漲價是從成本加成定價轉向價值定價,模型值多少錢,應該由它能替用戶創造多少價值決定。