DeepSeek V4 Flash 在 OpenRouter 的早期領先,核心是低價、超長上下文,以及聚合平台降低模型試用門檻的組合。 7 月 27 日至 8 月 2 日的 7.22 兆 Token 統計,涵蓋 7 月 31 日正式版推出前的預覽路由流量,不能全算作新版帶來的用量。
研究答案

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek V4-Flash, launched in public API beta on July 31, 2026, become OpenRouter’s most-used model within four days—reaching 7.1 t. Article summary: The reported surge is best explained by an unusually strong cost–capability–context combination, amplified by OpenRouter’s low-friction routing and likely substantial trial traffic—not by architecture alone. But several . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek-V4-Flash-0731 的爆發,說明模型「預設選項」可以改變得多快:只要每 Token 價格夠低、可容納的上下文夠大,加上聚合平台讓開發者容易接入,原本不會優先考慮的模型,也可能迅速進入大量測試與實作流程。
不過,OpenRouter 週榜第一、7.22 兆 Token 的數字雖然值得注意,解讀時仍要保留幾個重要但書。5
7 月 31 日發布的版本採用稀疏型混合專家(Mixture-of-Experts,MoE)架構:總參數為 2,840 億,但每個 Token 僅啟用約 130 億參數。OpenRouter 將其定位為適合程式開發、推理與代理(agent)工作流程的模型,並列出 1,310,720 Token 的上下文視窗。1
這樣的規格特別適合 Token 用量很大的工作:
MoE 架構本身不保證實際成本更低,也不等於品質一定更好。它的經濟意義在於:每個 Token 只啟用一部分參數,理論上能在維持較大模型容量的同時,避免承擔同等總參數量之稠密模型的完整運算負擔。至於應用端能否真正受益,仍取決於延遲、供應商容量、路由方式、提示詞設計與輸出長度等條件。
TechNode 報導指出,DeepSeek V4 Flash 在 2026 年 7 月 27 日至 8 月 2 日的 OpenRouter 週模型用量排行中位居第一,處理量達 7.22 兆 Token;同一報導也指出,中國模型包辦前四名,而 V4 Flash 0731 與 V4 Pro 均進入前六名。5
但這個統計週期早於 7 月 31 日的公開測試版發布。V4 Flash 先前已有預覽路由,而 0731 版本是接替預覽版、並由 deepseek-v4-flash API 端點自動指向的版本。3 因此,不能把整週用量都描述成「新版上市後四天」所產生的流量。
另一項更關鍵的因素是免費使用。報導稱,OpenCode 在 8 月 1 日為該模型處理 8 兆 Token,其中 5 兆 Token 來自免費試用,3 兆 Token 由開發者付費。5
免費試用並非沒有價值:它可降低評估新模型的摩擦,讓更多開發者把模型放進測試流程。但它與可長期維持的付費生產需求不同。更精確的結論應是:V4 Flash 取得了極快的分發與試用規模;現有證據尚不足以證明,所有早期用量都是付費遷移或穩定的正式環境需求。
模型價格會因供應商、路由、折扣、快取狀態與時間而異。7 月 31 日版本的報導所引官方價格為:每百萬 Token 未快取輸入 0.14 美元、輸出 0.28 美元;而 OpenRouter 在 8 月初所列的路由價格並不相同。3
OpenRouter 後來對指定版本 deepseek-v4-flash-0731 的頁面則列出:
若以這組 OpenRouter 列價,與所提供比較資料中的其他模型相比,價差十分明顯:
| 模型 | 每百萬 Token 列示輸入/輸出價格 | 相較 V4-Flash 的 0.05/0.16 美元 |
|---|---|---|
| DeepSeek V4-Flash-0731 | 0.05/0.16 美元 |
基準 |
| Kimi K3 | 3/15 美元 |
約高 60 倍/94 倍 |
| GPT-5.6 Sol | 5/30 美元 |
約高 100 倍/188 倍 |
| Claude Fable 5 | 10/50 美元 |
約高 200 倍/313 倍 |
這些是公開列價的算術比較,不是模型在品質、速度、工具呼叫可靠性、安全行為或服務穩定性上相同的證明。它們也不能直接推導出通用的「每項任務成本」:實際帳單還會受輸入與輸出長度、快取命中、重試、工具呼叫、供應商選擇,以及是否需升級至其他模型處理影響。
即使都可用於進階程式開發或代理工作流程,Kimi K3、GPT-5.6 Sol 與 Claude Fable 5 並非可完全互換。所提供的比較資料將 Kimi K3 描述為 2.8 兆參數的 MoE 模型、具 100 萬 Token 上下文;GPT-5.6 Sol 的上下文為 105 萬 Token;Claude Fable 5 則為 100 萬 Token。17
實務上,比起爭論哪個模型「絕對最好」,更有用的是依工作型態區分:
公開基準可協助建立候選清單,但單一分數不能決定正式環境的預設模型。原始說法中的「Agent Ultimate」25.2 對 25.7 分比較,未獲提供的一手風格來源獨立支持,因此不宜作為模型近乎等效的證據。DeepSeek 的發布資料確實列出 V4 Flash 在 Terminal Bench 2.1 得 82.7、NL2Repo 得 54.2,但基準表現仍需要以特定工作負載驗證。10
對中型開發團隊來說,決策通常不是「哪一個模型排行榜第一」,而是:哪個模型在我們的真實工作上夠可靠,且能在計入失敗與路由成本後,實際節省足夠預算?
可採取以下評估流程:
因此,即使初期 Token 數字受試用流量推升,V4-Flash 的崛起仍具意義:它顯示多模型聚合平台可以讓開發者立刻測試一個極低成本、超長上下文的選項。只要它在正式環境的評測中表現達標,就可能將大量例行工作從更昂貴的預設模型移走。
現有資料支持 OpenRouter 週榜 7.22 兆 Token、統計期間與預覽版重疊,以及 OpenCode 免費試用流量占比的報導。3
5 但資料不足以證實以下說法:中國模型占據前 10 名中的 9 席、連續 14 週超過美國模型呼叫量、歐美開發者大規模遷移、實現 60% 至 85% 的實際推論成本下降,或迫使 GPT-5.6 Luna 特定降價 80%。
這類主張需要 OpenRouter 儀表板的直接資料、供應商正式價格紀錄,或可重現的工作負載研究來支持。在此之前,較穩健的結論是:DeepSeek V4-Flash 在開發者正積極尋找更便宜的代理與程式模型時,結合了極低的列示路由價格、大型上下文視窗與廣泛接入性;這足以帶來迅速的使用量成長,但單靠這點,仍不足以證明市場已永久重新洗牌。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
DeepSeek V4 Flash 在 OpenRouter 的早期領先,核心是低價、超長上下文,以及聚合平台降低模型試用門檻的組合。
DeepSeek V4 Flash 在 OpenRouter 的早期領先,核心是低價、超長上下文,以及聚合平台降低模型試用門檻的組合。 7 月 27 日至 8 月 2 日的 7.22 兆 Token 統計,涵蓋 7 月 31 日正式版推出前的預覽路由流量,不能全算作新版帶來的用量。
免費試用是重要干擾因素:報導稱 OpenCode 在 8 月 1 日處理的 8 兆 Token 中,有 5 兆來自免費試用。