DeepSeek V4 API 由原本嘅固定價目,改為按高峰及非高峰時段收費。新制度喺 2026 年 8 月 17 日凌晨 0 時(北京時間) 生效,即香港時間同樣係 8 月 17 日凌晨 0 時,亦即 8 月 16 日 16:00 UTC。非高峰價固定係高峰價一半,但同舊有固定價格相比,新價按模型、token 類別及使用時間計,升幅由 50% 至 1,100% 不等。
1
2
DeepSeek V4 價格改咗啲乜?
新收費適用於 DeepSeek-V4-Flash 同 DeepSeek-V4-Pro:
- 高峰時段一:09:00–12:00(北京時間)
- 高峰時段二:14:00–18:00(北京時間)
- 其餘時間全部屬於非高峰時段
每個請求會按照平台伺服器收到請求嗰一刻嘅北京時間計價。換句話講,就算請求之後處理咗一段時間,只要平台喺高峰時段收到,該請求就會按高峰價收費。
2
7
重點唔只係「加價」咁簡單,而係同一個模型呼叫,喺高峰時段會比非高峰時段貴一倍。對有得揀時間處理嘅工作嚟講,排程本身就成為成本控制工具。
V4-Flash 同 V4-Pro 每百萬 tokens 價目
以下全部係 每百萬 tokens、人民幣 價格。Cache hit 即輸入內容可以重用之前快取咗嘅提示詞前綴;cache miss 即未能命中快取,要按較高嘅未快取輸入價處理。
| 模型/token 類別 |
舊固定價 |
非高峰價 |
較舊價變化 |
高峰價 |
較舊價變化 |
| V4-Flash 快取命中輸入 |
¥0.02 |
¥0.05 |
+150% |
¥0.10 |
+400% |
| V4-Flash 快取未命中輸入 |
¥1.00 |
¥1.50 |
+50% |
¥3.00 |
+200% |
| V4-Flash 輸出 |
¥2.00 |
¥4.50 |
+125% |
¥9.00 |
+350% |
| V4-Pro 快取命中輸入 |
¥0.025 |
¥0.15 |
+500% |
¥0.30 |
+1,100% |
| V4-Pro 快取未命中輸入 |
¥3.00 |
¥4.50 |
+50% |
¥9.00 |
+200% |
| V4-Pro 輸出 |
¥6.00 |
¥13.50 |
+125% |
¥27.00 |
+350% |
以 V4-Flash 為例,非高峰時段嘅快取命中輸入、快取未命中輸入及輸出,分別係每百萬 tokens ¥0.05、¥1.50 及 ¥4.50;高峰時段就升至 ¥0.10、¥3 及 ¥9。
2 Reuters 報道指,今次整體加幅介乎 50% 至 1,100%,視乎模型、token 類別同使用時段而定。
1
8
邊類工作受影響最大?
可延遲嘅批次工作:改時間就有機會慳一半
模型評測、文件索引、資料回填、合成數據生成,以及其他唔需要即時完成嘅工作,可以安排喺兩段高峰時間以外執行。由於非高峰價係高峰價一半,單靠改排程,已經可以明顯降低呢類彈性工作嘅成本。
2
對 AI 基礎設施團隊嚟講,時區依家變成新嘅運算變數。排程系統可以同時睇工作死線同北京時間收費窗口,將唔趕急嘅任務放入非高峰隊列,而唔使轉模型或者削減 token 預算。
互動式應用:未必可以避開高峰價
客服機械人、編程助手同即時代理通常要配合用戶使用時間運作,難以將所有流量推遲到非高峰時段。呢類應用可能要承受高峰價,但仍然可以透過以下方法控制成本:
- 重用提示詞同文件上下文
- 設計更容易命中快取嘅請求
- 縮短不必要嘅輸出
- 將一般工作路由到 Flash,較複雜任務先用 Pro
快取尤其重要,因為兩款模型嘅快取命中輸入,都遠低於快取未命中輸入。對於會不斷重複傳送相同系統指令、工具定義或者文件內容嘅高流量系統,提高 cache-hit 比率,可能比單純減少請求數量更加有效。
輸出量大嘅應用:絕對支出增加得更明顯
長篇推理過程、報告生成同大段程式碼回覆,都會消耗大量輸出 tokens。高峰時段,Flash 輸出每百萬 tokens 係 ¥9,Pro 就係 ¥27。開發者可以考慮收緊輸出上限、日常對話使用 Flash,只有當 Pro 額外能力值得支付溢價時先切換過去。
1
2
Pro 快取命中輸入:百分比升幅最大
V4-Pro 高峰時段嘅快取命中輸入價,係舊有固定價嘅 12 倍,係今次調整入面百分比升幅最大嘅項目。雖然以每百萬 tokens 計,絕對金額仍然低過未命中輸入同輸出,但對大量處理重複快取提示詞嘅系統,影響會較實際。
1
19
8 月 13 日 V4-Pro 發布同今次加價有咩關係?
今次價格調整,緊接住 DeepSeek-V4-Pro-0813 正式推出,並透過 deepseek-v4-pro endpoint 提供一般使用。公開規格指,呢款文字模型擁有 100 萬 tokens context window,最大輸出為 384,000 tokens,採用混合專家(Mixture of Experts,MoE)架構,總參數約 1.6 萬億,每個 token 實際啟用約 490 億參數。
29
33
DeepSeek 公開嘅帳戶級並發限制亦分開兩個級別:
- V4-Pro:500 個同時請求
- V4-Flash:2,500 個同時請求
一個請求由開始處理至完成都會佔用一個名額,串流回應亦包括在內。
28
將價格同並發限制放埋一齊睇,可以推斷產品定位大致係:Flash 較適合高吞吐量、較例行嘅流量;Pro 就係資源較有限、面向高難度推理及超長上下文工作嘅級別。不過,呢個係根據公開價格及限制作出嘅推論,並非 DeepSeek 對所有使用場景嘅直接定義。
2
28
分時收費反映 AI 基建行業咩變化?
DeepSeek 呢個做法有啲似 GPU 推理服務嘅「需求調節」。互動式用戶集中上線嘅時段,運算需求通常較高;批次工作就有機會等一等。高峰加價、其他時間減價,可以鼓勵開發者將可延遲嘅運算分散到一日唔同時段。
對開發團隊而言,成本優化唔再只係揀邊個模型同計 token 數量,仲要處理以下幾個問題:
- 邊啲請求一定要即時完成?
- 邊啲工作可以放入非高峰隊列?
- 有幾多提示詞內容可以透過快取重用?
- 乜嘢任務應該由 Pro 改用 Flash?
- 應用程式實際上需要生成幾長嘅答案?
更大嘅訊號係,大型模型嘅價格競爭,可能由單一固定價,逐步轉向按運算容量稀缺程度定價。DeepSeek 仍然為有彈性嘅需求提供較低成本時段,但亦令高階推理嘅價格更加取決於「幾時用」而唔係淨係「用邊個模型」。Reuters 形容今次係按模型、token 類別及使用時段而異嘅大幅調整,而唔係一刀切加收同一個附加費。
1
對正在使用 DeepSeek V4 嘅團隊,最實際嘅結論係:要將排程、快取、模型路由同輸出控制,一齊納入 API 成本模型。無法改時間嘅即時工作,可能要轉用另一款模型或者收窄 token 預算;可以等嘅批次工作,則有機會靠非高峰執行,保留大部分成本效益。