一連六日、在AI開發者社群被戲稱「牛來」的神秘匿名模型「Ox Alpha」,真實身份終於揭曉——正是來自中國AI獨角獸智譜(2513.HK)的最新力作GLM-5.3 Flash。截至發稿,智譜股價升逾7%,報1109港元。GLM-5.3 Flash已納入Z.ai Coding Plan,同步開放API調用,上線首兩周更執行半價優惠。
這款模型於8月20日以「隱身模式」突然現身OpenRouter及OpenCode平台,免費提供100萬token上下文服務。由於表現與頂尖閉源模型不相上下,迅速引爆全球開發者社群。短短五日,Ox Alpha累計處理Token流量突破50萬億,更在OpenRouter平台使用量超越DeepSeek一倍以上,登上榜首。
8月26日晚,智譜正式發布並開源GLM-5.3-Flash(320B-A18B),同步在Hugging Face以MIT授權開放權重。這是GLM-5系列首個原生多模態模型,支援文字、圖片、影片全輸入。
性能上,GLM-5.3 Flash已進入全球前沿模型能力區間。 在全球權威的Artificial Analysis Intelligence Index(AA綜合智能指數)中,它與Anthropic旗艦模型Claude Opus 4.8同獲57分;在智譜自研的Z.ai Code Bench編程體感評估中,兩者表現亦旗鼓相當。
技術架構方面,模型採用MoE混合專家架構,總參數320B、實際激活僅18B。智譜首次在GLM系列引入稀疏注意力與線性注意力混合架構,搭配流形約束超連接(mHC)機制,大幅降低長上下文推理成本。與非Flash版本相比,注意力計算量減少3倍,KV快取縮小4.4倍。
最震撼市場的,是它的定價策略。 GLM-5.3 Flash定價僅為GLM-5.3的十分之一,限時折扣期再減至二十分之一。與Claude Opus 4.8相比,價格更低至四十分之一——意味著開發者可以約0.125美元處理百萬輸入Token,對比Opus 4.8的5美元定價,成本優勢懸殊。
更值得注意的是,如此低廉的價格並非建基於海外GPU集群。智譜披露,GLM-5.3 Flash整個匿名測試期間,全部在超過10萬張國產AI芯片上執行。這是智譜首次以大規模國產芯片集群直接承載全球開發者的真實線上流量。
為克服國產芯片在內存容量與帶寬上的瓶頸,智譜基於SGLang構建專用推理引擎,並採用EP分離式架構(Encode-Prefill-Decode),將多模態編碼、提示預填充和逐Token解碼拆分為獨立調度的工作池。官方稱,與同一硬件初始基線相比,端到端服務性能提升3倍,硬件效率及單Token成本已達與主流NVIDIA GPU相當的水平。
半導體研究機構SemiAnalysis隨即評論:「所有流量均由國產芯片承載,硬件效率和單Token成本已可與NVIDIA GPU媲美……CUDA護城河再度受到考驗。」市場傳聞這批芯片供應商或來自華為、摩爾線程與海光,惟智譜官方未予置評。