DeepSeek 在 2026 年 9 月 10 日正式推出 DeepSeek-V4.1-Flash。對 API 開發者而言,今次唔只係加咗一個新模型:公司計劃由 **9 月 14 日 12:00(北京時間,亦即香港時間)**起,把原本發往 V4-Pro 嘅請求自動轉去 V4.1-Flash,並暫時按 Flash 價格計費,直至 V4.1-Pro 面世。
3
即係話,如果團隊目前仍然用緊 V4-Pro endpoint,即使自己冇改程式,背後實際運行嘅模型都會改變。對用於客服、自動化工作流、編程 agent 或其他重要生產環境嘅團隊,最好預早以自家測試集核對輸出質素、延遲同工具調用表現。
V4.1-Flash 有咩新嘢?
DeepSeek 形容 V4.1-Flash 係新架構系列中最細嘅模型。官方指新架構目標係提升能力上限、推論速度同吞吐量,並可擴展至更大模型;另一個重點係原生視覺理解,即圖像與文字由模型核心一併處理,而唔係另外加一個視覺外掛。
10
16
開發者可在 DeepSeek API 用模型名稱 deepseek-flash 呼叫新模型。舊有嘅 V4-Flash 與 V4-Flash-Vision-Exp 已經退役。
10
16
DeepSeek 的公布及相關報道指出,V4.1-Flash 屬於 5,520 億參數嘅專家混合(MoE)模型,採用因果編碼器—解碼器架構;處理輸入時活躍參數為 80 億,生成輸出時則為 160 億。報道亦指模型權重按 MIT 授權釋出。
16
聲稱更快、更強,但要分清楚係廠商說法
DeepSeek 表示,新設計可帶來更高能力、更快推論及更高吞吐量;有關發布的報道亦稱,V4.1-Flash 在編程和 agent 任務上勝過 V4-Pro,運行成本則更低。
1
不過,呢啲比較目前主要屬於 DeepSeek 的說法,並無資料顯示已有獨立測試證明 V4.1-Flash 在所有工作負載下,都必然快過或好過 V4-Pro 及其他前沿模型。實際表現仍會受提示詞、任務類型、硬件、併發量及工具調用設定影響。
實用角度睇,若你要做睇圖加文字嘅應用、程式開發流程,或者高頻 agent 工作,V4.1-Flash 值得納入測試清單,尤其適合需要兼顧輸出質素、吞吐量同推論成本嘅情況。
Flash API 新收費:非繁忙時段每 100 萬 tokens 最低 0.003 美元
DeepSeek 由 9 月 10 日起調整 Flash 系列價格。非繁忙時段收費如下:
- 快取命中輸入:每 100 萬 tokens 0.003 美元
- 未快取輸入:每 100 萬 tokens 0.15 美元
- 輸出:每 100 萬 tokens 0.60 美元
繁忙時段價格為非繁忙時段的兩倍。
15
「快取命中」一般指重複使用過的提示詞內容可由快取讀取,毋須重新完整處理;對有固定系統提示詞、重複文件背景或大量類似查詢嘅應用,呢個價差尤其重要。
V4-Pro 會點樣被取代?
DeepSeek 同時藉今次更新簡化產品線。由 9 月 14 日 04:00 UTC,即香港時間中午 12:00開始,V4-Pro 請求會自動轉送至 V4.1-Flash,並以 Flash 收費計算,直至 V4.1-Pro 推出為止。
3
因此,呢次唔係一般「新模型上架、舊模型照用」嘅發布。V4-Pro 用戶應預期模型行為可能有改變,尤其要留意:
- 關鍵提示詞嘅答案格式及穩定性;
- 回應時間與高峰期併發表現;
- function calling/工具調用的可靠度;
- 圖像輸入流程及安全過濾設定。
低價策略背後:搶用量,亦考驗收入能力
咁低嘅 token 收費反映 DeepSeek 不只競爭模型能力,亦競爭部署成本。對開發者而言,成本下跌可令大規模 agent 呼叫、長對話或多模態請求變得較可負擔。
但對模型供應商來講,低價亦係兩面刃:用量同市佔或會上升,但每個 token 的收入與毛利壓力亦會增加。現有資料未足以證實 MiniMax、Z.AI 或阿里巴巴等公司的即時股價反應或具體市場影響,因此不宜把特定市場波動直接歸因於此次發布。
IPO 傳聞下的新產品敘事
發布前一日,路透社報道 DeepSeek 已聘請中信證券,為可能在上海科創板進行的境內首次公開招股(IPO)作準備。消息人士稱,公司目標在 2026 年啟動上市程序,但發售時間表和集資規模仍未明朗。
原生多模態、開放權重及低 API 價格,或有助 DeepSeek 在潛在上市前建立更完整嘅產品故事;不過,將發布直接解讀為 IPO 考量,仍然只係推論,並非公司公開交代的理由。低價策略最終能否靠更高使用量補回較低單位收入,亦會是投資者會問的問題。
中美 AI 角力同時升溫
在 V4.1-Flash 發布前幾日,美國政府聯合公告指控 DeepSeek、月之暗面(Moonshot AI)、阿里巴巴、MiniMax、StepFun 及 Z.AI,透過大規模「知識蒸餾」系統性抽取美國前沿模型的能力。公告聲稱,相關公司自至少 2024 年底起,透過數以百萬計請求抽取數十億 tokens,涉及 Claude、GPT、Gemini 及 Grok 等模型,並稱中國政府很可能知情。
17
這些屬於美國政府指控,並非法院裁決。中國則否認指控,形容說法毫無根據,並批評美方意圖維持 AI 產業壟斷;中方同時強調科技自立自強,但未排除對話可能。
一邊係模型技術同價格競爭加速,另一邊係模型存取、訓練資料和跨境科技流動面對更嚴格審視。V4.1-Flash 的登場,正好落喺呢兩股力量交疊的時點。
總結:V4-Pro 用戶最需要做嘅事
V4.1-Flash 的賣點包括原生多模態、開放權重、DeepSeek 所稱的效率提升,以及極低 API 定價。
10
15
16
不過,短期最實際的改變是:V4-Pro 請求將於 9 月 14 日中午(香港時間)開始自動轉用 V4.1-Flash。 若系統屬關鍵業務用途,應在轉換前後持續做 A/B 測試和監察,而非單靠基準分數或廠商宣傳作判斷。
3
17