DeepSeek V4 Flash 的快取命中輸入每百萬 token 為 0.0028 美元,快取未命中則為 0.14 美元,價差達 50 倍;這使長時間運作的編程代理特別受惠。 第三方平台可能提供更低的 token 牌價,但模型版本、量化方式、路由、快取保留時間、延遲與服務水準未必相同。
研究答案

Create a landscape editorial hero image for this Studio Global article: How can DeepSeek V4 Flash remain the cheapest major AI model—and potentially stay cheapest even after a 30× list-price increase—given that t. Article summary: DeepSeek V4 Flash can remain cheapest in effective cost because “price per input token” is the wrong unit for long-running agents. The decisive variable is the share of input that is served from a reusable prefix cache: . Topic tags: general, general web, user generated, documentation, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, w
DeepSeek V4 Flash 看似「漲很多仍然便宜」,關鍵不在新聞標題裡的單一 token 價格,而在一個常被忽略的細節:快取命中與快取未命中的輸入,收費方式完全不同。
依照較早公布的價格表,快取未命中輸入為每百萬 token 0.14 美元,快取命中輸入僅 0.0028 美元,輸出則為 0.28 美元。12
這讓 Flash 對編程代理尤其有吸引力。代理在每一輪請求中,往往會重複送出相同的系統指令、工具定義、程式碼庫背景,或其他很長的提示前綴。不過,這並不保證它對每位使用者、每個工作流程或每條供應商路由都是最便宜的選擇。
token 單價只是代理帳單的一部分。假設工作流程中有比例 h 的輸入命中快取,混合後的輸入價格大約是:
h × 快取命中價格 + (1 − h) × 快取未命中價格
以原先價格計算,若 99% 的輸入都命中快取,每百萬 token 的混合輸入成本約為 0.00417 美元,約是 0.14 美元快取未命中價格的 1/34。這項計算尚未包含輸出 token;對於會產生大量程式碼、解釋文字或工具結果的工作流程,輸出費用可能反而成為主要成本。
因此,同一個 API 可能帶來截然不同的使用體驗:
DeepSeek 表示,其 API 採用自動的前綴快取:重複出現的提示前綴會以較低的快取命中價格計費。12 實務上的要求是「嚴格重用」——提示開頭的變動,可能讓後續內容也失去快取效益。
第三方服務商可能列出低於官方 API 的價格。例如,DeepInfra 目前的價格頁面列出 V4 Flash 不同版本,輸入約為每百萬 token 0.08 至 0.09 美元、輸出 0.18 美元,另有獨立的快取輸入價格。29 OpenRouter 也列出多個 V4 Flash 快照與供應商,實際價格會隨版本與路由變化。
21
22
這些服務未必是完全相同的產品。要進行有意義的比較,至少應確認:
如果工作流程幾乎沒有快取重用,較低的第三方牌價可能確實帶來更低成本;但對於長時間執行、且前綴始終穩定的工作,官方路由也可能更划算。真正該問的不是「哪家輸入價格最低」,而是:哪條路由能以最低且可靠的成本完成任務?
「漲價 30 倍」比較適合作為敏感度測試,而不是價格預測。若把原先每百萬 token 0.0028 美元的快取命中價格乘以 30,結果是 0.084 美元,仍低於原先 0.14 美元的快取未命中價格。
但這只放大了其中一個收費項目。假如輸出價格也同步上漲 30 倍,原先 0.28 美元的輸出價格將變成 8.40 美元。對大量生成內容的編程代理而言,即使快取輸入仍相對便宜,總成本也可能大幅增加。經常發生快取未命中的工作流程,同樣會直接承受較高的輸入費用。
因此,較準確的結論是:
DeepSeek V4 Flash 即使面臨非常大的名目漲幅,仍可能保有由快取驅動的成本優勢;但在不同的快取命中率、未命中率、輸出量與供應商費用組合下,它不會永遠是最便宜的選擇。
後續公布的價格表引入離峰與尖峰時段。V4 Flash 的離峰價格列為:快取未命中輸入每百萬 token 0.22 美元、快取命中輸入 0.007 美元、輸出 0.66 美元;尖峰時段則分別為 0.44、0.014 與 1.32 美元。10
20
這些價格相較於早期的 0.14/0.0028/0.28 美元都有明顯上升,但並非統一上漲 30 倍。按時段收費,可能有助於把可延後的批次工作移離繁忙時段,或在容量有限時調節需求;但僅憑時間定價,無法證明背後究竟是服務成本上升、需求持續過高,還是兩者兼有。
對買方而言,實際教訓更直接:代理在什麼時間執行,可能已成為成本模型的一部分。如果工作可以排程,就應分別計算尖峰與離峰帳單,而不是只看一個名目價格。
一項由社群回報、涵蓋 20,000 次請求的實驗指出,DeepSeek 在 12 小時期間維持 100% 快取命中率;相較之下,GLM 在 5 分鐘後的命中率降至較低水平,其他模型則介於兩者之間。31
這項觀察之所以值得注意,是因為它說明長時間運作的代理,可能會對供應商得出與短提示完全不同的排名。不過,這不是經獨立重複驗證的跨模型基準測試。快取結果會受精確前綴建構、快取淘汰、路由、並發量、保留設定,以及客戶端提示格式影響。
開發者應使用自己的代理軌跡重做測試,並分別記錄快取命中與未命中的 token 數量。穩定的提示架構——把固定指令放在前面、變動任務資料放在後面——可能讓經濟效益大幅改善,但結果應以實測為準,不能只靠假設。
OpenCode Go 與直接使用 API 是兩種不同產品。其文件描述,Go 是每月 10 美元的訂閱方案,包含 DeepSeek V4 Flash,並採用以美元使用額度計算的滾動限制:5 小時 12 美元、每週 30 美元、每月 60 美元。1
因此,不能只看月費或供應商 token 價格,就把這個訂閱方案與直接 API 直接對比。OpenCode 會控制路由與實際可用額度;直接 API 則提供 token 層級的計費與快取行為。相關報導也指出,漲價後,V4 Flash 在 OpenCode Go 中對應的使用價值有所調整。6
若要證明 Go 在長時間工作階段中會比直接 API 貴 2 至 10 倍,必須讓相同的提示串流經過兩條路由,並記錄:
在沒有這種受控比較之前,較穩妥的結論是:訂閱方案在紙面上可能較便宜,但若其路由無法保留可重用上下文,實際有效成本也可能更高;結果仍取決於工作負載。
要做出貼近實際的比較,應衡量每項已完成任務的成本,而不是只看每百萬輸入 token 的價格。請在不同供應商之間使用相同的模型快照與提示序列,並記錄:
測試時至少應涵蓋兩種流程:一種適合快取重用,另一種刻意讓上下文頻繁變動。前者可顯示穩定前綴的成本優勢,後者則能反映代理持續改寫上下文時的實際代價。
DeepSeek V4 Flash 之所以可能在長時間運作的編程代理中維持低成本,是因為前綴快取改變了重複上下文的經濟效益。第三方路由可能提供更低的牌價,而即使名目價格大幅上升,快取命中輸入仍可能具備競爭力;但這兩點都不能證明 Flash 對所有工作流程都是最便宜的模型。
真正決定帳單的,是快取命中率、輸出量、尖峰定價、供應商實作,以及能否可靠完成任務。對生產環境系統而言,這些實測數據比任何單一牌價比較都更重要。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
DeepSeek V4 Flash 的快取命中輸入每百萬 token 為 0.0028 美元,快取未命中則為 0.14 美元,價差達 50 倍;這使長時間運作的編程代理特別受惠。
DeepSeek V4 Flash 的快取命中輸入每百萬 token 為 0.0028 美元,快取未命中則為 0.14 美元,價差達 50 倍;這使長時間運作的編程代理特別受惠。 第三方平台可能提供更低的 token 牌價,但模型版本、量化方式、路由、快取保留時間、延遲與服務水準未必相同。
若以原先價格為基準,假設快取命中價格上漲 30 倍,將變成每百萬 token 0.084 美元,仍低於原本 0.14 美元的快取未命中價格;但這不代表 Flash 對所有工作負載都最便宜。