GLM 5.3 FlashX 是智譜為 GLM 5.3 Flash 提供的高速託管推理層,於 2026 年 9 月 18 日推出。 API 已可用,模型 ID 為 glm 5.3 flashx;報道亦指可在智譜的體驗中心使用。 智譜稱效能來自約 10 萬枚國產加速器的推理算力,加上基建投資及推理優化;不過每秒 200 token 屬峰值說法,應按實際流量自行驗證。
發布者使用 GPT-5.6 Terra 編輯圖片由 GPT Image 2 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Zhipu AI’s GLM-5.3-FlashX, when was it launched and where is it available, what peak inference speed does Zhipu claim and what domes. Article summary: GLM-5.3-FlashX is Z.ai/Zhipu AI’s high-speed hosted serving tier for GLM-5.3-Flash, rather than a separate base model. It was launched on September 18, 2026; Z.ai says it is live through its API as `glm-5.3-flashx`, whil. Topic tags: general, documentation, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
FlashX 最值得留意嘅,唔單止係「每秒 200 個 token」呢個數字,而係佢其實係 GLM-5.3-Flash 的高速託管推理方案,唔係另一款重新訓練嘅底層模型。
智譜 AI 在 2026 年 9 月 18 日推出 GLM-5.3-FlashX,並聲稱其峰值生成速度最高可達 每秒 200 個 token。API 已經上線,模型 ID 為 glm-5.3-flashx。 10
12
要分清楚兩層:
glm-5.3-flashx;發布報道亦指智譜已在體驗中心開放使用。 有報道稱 FlashX 早前曾以 **「Ox Alpha」**之名向全球開發者提供。不過,現有 Z.ai 文件未有確認呢段命名歷史,所以較穩妥嘅講法係:呢個屬於媒體報道,並非已有一手文件完整證實嘅產品時間線。 10
Z.ai 將 GLM-5.3-Flash 與 FlashX 描述為 GLM-5 系列首批原生多模態模型:可接收文字、圖片、影片及檔案,輸出則為文字。 1
GLM-5.3-Flash 公開嘅架構重點包括:
Z.ai 聲稱,相對 GLM-5.3,呢種注意力設計可令注意力運算減少 3.01 倍、KV cache 用量減少 4.44 倍。呢啲係廠商提出嘅架構效益數據,但亦解釋咗點解 Flash 會被定位為兼顧超長上下文與較低服務成本嘅模型。 1
智譜稱 FlashX 峰值可達 每秒 200 個 token;發布報道形容,速度約為既有 GLM-5.3-Flash 服務嘅 5 倍。 12
16
公司將呢項表現歸因於約 10 萬枚國產加速器提供嘅推理算力,以及額外基建投入同推理優化。 9
10
不過,呢點好關鍵:200 token/秒係特定託管服務嘅峰值推理聲稱,不等於你自己部署開源 Flash 模型都必然跑到同一數字。
實際速度會受好多因素影響,包括:
另有報道指,一個由 GLM-5.3 驅動嘅「Infra Agent」曾協助優化服務堆疊。不過,現有公開資料未有足夠技術細節,令人可以獨立核實當中涉及嘅實際瓶頸、核心程式修補、服務堆疊改動、測試設定,或者優化前後嘅具體效率數字。 15
報道指 FlashX 定價為標準 Flash 嘅 2.5 倍。 12
16
如果你嘅產品極度依賴生成延遲,例如互動式助手、即時程式編寫、需要縮短完成時間嘅 agent 工作流,較高單價可能有其價值:用更快輸出換取更好體驗、更多處理容量或更短任務時間。
但如果工作屬於批量處理,或者瓶頸其實係長提示詞預填、工具呼叫、外部 API、檔案處理,而唔係文字解碼速度,標準 Flash 未必輸蝕,成本效益甚至可能更好。
與其只睇峰值數字,不如用接近正式環境嘅請求做壓力測試。建議至少量度:
尤其係長上下文或 agent 系統,單一峰值解碼速度未能反映完整體驗。檢索、工具使用、檔案處理、重試,以及高並發流量,都可能先係真正影響用戶感受同成本嘅地方。
GLM-5.3-FlashX 可以理解為智譜針對開放 GLM-5.3-Flash 模型推出嘅高階高速託管版本。公開講法相當清楚:依靠以約 10 萬枚國產加速器為基礎嘅推理能力,加上基建與推理優化,峰值可達每秒 200 個 token。 9
10
15
但對實際營運者而言,重點唔係個峰值標題有幾吸引,而係 FlashX 喺自己嘅流量、並發量同任務類型之下,能否帶來足以抵銷較高價格嘅端到端延遲或容量改善。 12
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
GLM 5.3 FlashX 是智譜為 GLM 5.3 Flash 提供的高速託管推理層,於 2026 年 9 月 18 日推出。
GLM 5.3 FlashX 是智譜為 GLM 5.3 Flash 提供的高速託管推理層,於 2026 年 9 月 18 日推出。 API 已可用,模型 ID 為 glm 5.3 flashx;報道亦指可在智譜的體驗中心使用。
智譜稱效能來自約 10 萬枚國產加速器的推理算力,加上基建投資及推理優化;不過每秒 200 token 屬峰值說法,應按實際流量自行驗證。