DeepSeek V4 Flash 在 OpenRouter 的早期領先,主要來自極低路由價格、逾 131 萬 token 上下文,以及聚合平台帶來的低門檻試用。 7 月 27 日至 8 月 2 日錄得的 7.22 兆 token 用量,涵蓋 7 月 31 日正式版推出前的預覽版本,不能當成新版本四日內獨力創造的成績。
研究答案

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek V4-Flash, launched in public API beta on July 31, 2026, become OpenRouter’s most-used model within four days—reaching 7.1 t. Article summary: The reported surge is best explained by an unusually strong cost–capability–context combination, amplified by OpenRouter’s low-friction routing and likely substantial trial traffic—not by architecture alone. But several . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek-V4-Flash-0731 的爆紅,反映一件事:當一個模型同時有極低 token 價、超長上下文(context window),又可經 OpenRouter 這類模型聚合平台即插即用,開發者的預設選擇可以轉得好快。
不過,「一推出四日就完全靠正式版衝上第一」並不是現有證據能支持的說法。較準確的結論是:V4-Flash 在短時間內獲得極廣泛的分發和測試,而試用流量很可能推高了早期 token 數字。5
7 月 31 日推出的 V4-Flash-0731,是一個稀疏混合專家模型(Mixture-of-Experts,MoE):總參數為 2,840 億,但每個 token 只啟用約 130 億參數。OpenRouter 列出的上下文窗口為 1,310,720 token,定位是編程、推理及 AI agent 工作流程。1
這組合對以下工作尤其吸引:
MoE 架構本身不等於實際一定更平或更好用。它的經濟意義在於:每個 token 只運行部分參數,理論上可在保留較大模型容量的同時,避免承擔同等總參數稠密模型的完整逐 token 運算成本。實際效果仍取決於延遲、服務商容量、路由方式、提示詞設計和輸出長度。
TechNode 報道,DeepSeek V4 Flash 在 OpenRouter 於 2026 年 7 月 27 日至 8 月 2 日的每周用量榜中排名第一,處理了 7.22 兆 token;報道亦指中國模型佔據頭四位,V4 Flash 0731 和 V4 Pro 均在前六名。5
但這個統計週期在 7 月 31 日公開 beta/正式版本推出之前已開始。V4 Flash 早已有預覽路由,而 0731 版本是在 deepseek-v4-flash API 端點取代該預覽版。3 因此,不能把該周的 7.22 兆 token 全部歸功於剛推出的 0731 版本。
更要留意的是免費流量。同一報道稱,OpenCode 在 8 月 1 日為此模型處理 8 兆 token,其中 5 兆來自免費試用,開發者付費部分為 3 兆。5 免費試用很有策略價值:它降低團隊評估新模型的門檻;但它與持續、付費的生產環境需求並不是同一回事。
所以較穩妥的判讀是:V4-Flash 的分發與試用速度非常快,但現有資料未足以證明所有早期用量都是付費遷移,或代表長期生產需求。
模型價格會隨服務商、路由、折扣、快取狀態和日期而變。7 月 31 日推出時的報道所引用官方價格,是每百萬未快取輸入 token 0.14 美元、輸出 token 0.28 美元;而 OpenRouter 在早期 8 月列出的路由價格並不相同。3
OpenRouter 之後對指定 deepseek-v4-flash-0731 路由的列價則是:每百萬輸入 token 0.05 美元、輸出 token 0.16 美元,讀取快取 token 為 0.013 美元。1
以這組 OpenRouter 列價計算,跟提供的比較價格差距相當大:
| 模型 | 每百萬 token 列價(輸入/輸出) | 相對 V4-Flash 的 0.05/0.16 美元 |
|---|---|---|
| DeepSeek V4-Flash-0731 | 0.05/0.16 美元 |
基準 |
| Kimi K3 | 3/15 美元 |
約高 60 倍/94 倍 |
| GPT-5.6 Sol | 5/30 美元 |
約高 100 倍/188 倍 |
| Claude Fable 5 | 10/50 美元 |
約高 200 倍/313 倍 |
這只是公開列價的算術比較,不代表模型質素、速度、工具可靠性、安全行為或服務穩定性相同。更不等於有一個放諸四海皆準的「每項任務成本」:最終帳單還會受輸入輸出長度、快取、重試、工具呼叫、供應商,以及要否升級至另一模型影響。
即使幾個模型都可處理進階編程和 agent 情境,也不應視為可直接互換。提供的比較資料將 Kimi K3 描述為 2.8 兆參數的 MoE 模型,具 100 萬 token 上下文;GPT-5.6 Sol 為 105 萬 token;Claude Fable 5 為 100 萬 token。17
對採購或工程團隊來說,最實際的分別在運作層面:
公開 benchmark 可幫手建立候選名單,但單一分數不足以決定生產環境預設模型。原有說法中「Agent Ultimate」25.2 對 25.7 的比較,未能從提供的主要來源獨立核實,因此不宜當作兩者近乎等效的證據。DeepSeek 的發布材料確有列出 V4-Flash 在 Terminal Bench 2.1 得分 82.7、NL2Repo 得分 54.2,但 benchmark 仍必須用實際工作負載驗證。10
對中型開發團隊來說,問題通常不是「哪個模型贏排行榜」,而是:哪個模型在我們真實任務上夠可靠,並在計入路由和失敗成本後仍然慳到錢?
可以按以下方式評估:
這亦解釋了為何即使早期數字受試用流量帶動,V4-Flash 的崛起仍然重要:OpenRouter 這類聚合平台,讓開發者可以立即試用一個極低價、長上下文的選項。只要它在生產評測中表現達標,部分日常工作量就有可能由較昂貴的預設模型轉移過去。
現有證據支持 V4-Flash 在 OpenRouter 該周以 7.22 兆 token 奪冠、統計期與預覽版重疊,以及 OpenCode 的免費試用流量佔相當部分。3
5
但資料不足以證實「中國模型佔前十名中九席」、「連續 14 周超越美國 call volume」、「美國及歐洲開發者大規模遷移」、「實際推論成本普遍降低 60% 至 85%」,或「GPT-5.6 Luna 因此減價 80%」等說法。
這些主張需要 OpenRouter 儀表板原始數據、服務商定價紀錄或可重現的工作負載研究支持。在有更直接證據前,較符合事實的總結是:DeepSeek V4-Flash 在開發者正積極尋找更便宜 agent 和編程模型之際,結合了低列價、大上下文和廣泛接入條件,足以引爆快速用量增長;但單靠這點,仍不足以證明市場已永久改寫。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
DeepSeek V4 Flash 在 OpenRouter 的早期領先,主要來自極低路由價格、逾 131 萬 token 上下文,以及聚合平台帶來的低門檻試用。
DeepSeek V4 Flash 在 OpenRouter 的早期領先,主要來自極低路由價格、逾 131 萬 token 上下文,以及聚合平台帶來的低門檻試用。 7 月 27 日至 8 月 2 日錄得的 7.22 兆 token 用量,涵蓋 7 月 31 日正式版推出前的預覽版本,不能當成新版本四日內獨力創造的成績。
免費試用是重要干擾因素:報道指 OpenCode 在 8 月 1 日處理的 8 兆 token 中,有 5 兆來自免費試用。