兩款模型令「Flash」由低配經濟版,變成可以應付日常寫 code、文件處理同 AI agent 工作嘅實用旗艦級選擇。 GLM 5.3 Flash 支援 100 萬 token 上下文,限時優惠價為每百萬 token 輸入 0.4 元、輸出 1.4 元;Qwen3.8 Flash 初始定價則為輸入 1 元、輸出 3 元。
研究答案

Create a landscape editorial hero image for this Studio Global article: How did Zhipu AI’s open sourced GLM 5.3 Flash and Alibaba’s Qwen3.8 Flash, released on August 28, 2026, reshape China’s LLM flagship market. Article summary: These releases turned “Flash” from a lower capability, economy tier into a viable default flagship tier: long context, multimodal or next generation architecture, strong coding/agent performance, open weights, and API pr. Topic tags: general web, llm, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
兩款模型嘅主要發布時間其實係 2026 年 8 月 26 日,8 月 28 日主要係相關報道集中出街,並非正式發布日。 1
2
但市場訊號相當清晰:「Flash」已經唔再單純代表功能較少、價格較平嘅次級模型,而係開始變成企業同開發者可以直接採用嘅預設旗艦級方案。 長上下文、多模態或新一代架構、編程及 agent 表現,加上開放權重同低 API 收費,令高頻率使用終於變得實際。
智譜嘅 GLM-5.3-Flash 係 GLM-5 系列首款原生多模態模型,支援 100 萬 token 上下文。阿里 Qwen3.8-Flash 預設支援 262,144 token,亦可以擴展至 100 萬 token。換句話講,開發者可以一次過處理大型程式碼庫、長篇研究資料、辦公室文件、圖片,以及持續時間較長嘅 agent 工作流程,而唔一定要升級到最昂貴嘅旗艦模型。 4
1
對實際用家嚟講,重點唔只係「容量大」:長上下文令模型可以保留更多專案背景,減少反覆貼文件、拆分程式碼或者重新交代工作要求。對企業內部知識庫、文件分析同自動化工作,使用門檻因此降低。
GLM-5.3-Flash 原價為每百萬 token 輸入 0.8 元、輸出 2.8 元;限時五折優惠期間,實際收費降至輸入 0.4 元、輸出 1.4 元,優惠期截至 9 月 9 日。相關比較指,優惠價約為 GLM-5.3 成本嘅二十分之一。 15
1
11
Qwen3.8-Flash 初始 API 定價係每百萬 token 輸入 1 元、輸出 3 元,之後阿里雲再將價格調低至輸入 0.8 元、輸出 2.7 元。 1
11
以 DeepSeek V4 Flash 非繁忙時段輸入 1.5 元、輸出 4.5 元作比較,GLM 優惠價兩邊都平約 73%;Qwen 初始 API 價格亦大約低三分之一。 8
15
1
呢個改變對企業特別重要。當模型要每日處理大量客服對話、文件抽取、程式碼檢查或者辦公室自動化任務時,模型能力固然重要,但每百萬 token 嘅成本往往先決定到項目可唔可以正式上線。
GLM-5.3-Flash 喺 Terminal-Bench 2.1 報稱取得 84.3 分,接近 Claude Opus 4.8 嘅 85.0 分。呢項結果令佢喺編程及 agent 類工作上,至少具備同高階閉源模型比較嘅條件。 3
2
模型採用稀疏混合專家(MoE)設計,總參數約 3,200 億,但每個 token 只啟用約 180 億參數。即係模型可以保留大型架構嘅能力,同時控制實際推理時嘅計算量。 2
10
呢一點正正打破過往「Flash」品牌嘅既定印象:平啲唔一定代表只適合分類、摘要或者簡單聊天,亦可以處理認真嘅軟件開發工作。
GLM-5.3-Flash 以開源/開放權重形式發布;阿里則開放 Qwen3.8-Flash-Next 權重。後者係一款多模態 MoE 預覽模型,每個 token 約啟用 60 億參數,並被定位為下一代 Qwen4 架構嘅早期預覽。 4
5
對企業嚟講,選擇唔再局限於單一供應商:可以直接使用低價託管 API,亦可以視乎硬件、私隱及合規要求,考慮自行部署開放權重模型。呢種「託管或者自建」嘅彈性,會削弱企業對任何一家專有模型供應商嘅依賴,亦提高買方議價能力。
智譜表示,GLM-5.3-Flash 嘅網上推理流量,全部由超過 10 萬枚中國本土製造嘅 AI 晶片支援。 4
如果呢種部署方式可以持續喺生產環境運作,佢所展示嘅就唔只係一張模型成績表,而係另一個訊號:具競爭力嘅低成本推理,可以建立喺中國本土加速器生態之上,而唔係只能依靠供應有限嘅進口 GPU。
當然,單靠公司公布嘅部署數字,未能獨立證明整個系統長期效率;但對中國模型市場而言,硬件、推理軟件同模型架構一齊優化,已經成為壓低 token 成本嘅重要戰線。
DeepSeek V4 Flash 仍然提供 100 萬 token 上下文,並透過 cache 命中價等方式維持吸引力,所以今次競爭唔係單純比較公開價目表。 2
3
不過,智譜同時帶來較低嘅非 cache 輸入及輸出價格、接近 Opus 嘅編程測試結果、多模態能力、開放權重,以及使用排名上嘅挑戰。呢種組合削弱咗 DeepSeek 過去作為「最抵用預設選擇」嘅明顯優勢。
市場亦出現 GLM 結束 DeepSeek 連續 56 日 OpenCode 領先嘅說法,但呢類結論主要建基於平台排名同特定時間段嘅使用數據,未必代表所有企業工作負載都已經逆轉。
今次發布最值得注意嘅,唔係某一個單獨 benchmark 數字,而係幾個條件首次同時出現:
但讀者亦要留意,GLM 終結 DeepSeek OpenCode 領先、Qwen 辦公室場景節省 75% token,以及多項 benchmark 對比,當中不少都來自平台排名或模型開發商自行公布嘅測試。不同測試可能採用唔同 harness、提示設定同評分方法,因此未足以證明任何一款模型喺所有編程及辦公室工作上都全面優勝。 3
較穩妥嘅結論係:GLM-5.3-Flash 同 Qwen3.8-Flash 將「Flash」由預算層級推向實用旗艦層級,迫使中國大模型市場由「邊個最強」進一步轉向「邊個可以用更低成本,穩定處理最多日常工作」。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
兩款模型令「Flash」由低配經濟版,變成可以應付日常寫 code、文件處理同 AI agent 工作嘅實用旗艦級選擇。
兩款模型令「Flash」由低配經濟版,變成可以應付日常寫 code、文件處理同 AI agent 工作嘅實用旗艦級選擇。 GLM 5.3 Flash 支援 100 萬 token 上下文,限時優惠價為每百萬 token 輸入 0.4 元、輸出 1.4 元;Qwen3.8 Flash 初始定價則為輸入 1 元、輸出 3 元。
不過,GLM 終結 DeepSeek 連續 56 日 OpenCode 領先、Qwen 辦公場景少用 75% token 等說法,主要仍依賴平台排名或模型開發商自行公布嘅測試,未足以證明全面勝出。