DeepSeek V4 是一組開放權重的預覽模型,包含面向高難度任務的 V4 Pro,以及更快、更低成本的 V4 Flash。 兩款模型都採用混合專家架構,支援最多 100 萬 token 上下文;V4 Pro 為 1.6 兆總參數、每次啟用 490 億參數,V4 Flash 則為 2,840 億總參數、每次啟用 130 億參數。[14][10] DeepSeek 宣稱 V4 Pro 的推理、知識、程式設計與代理任務表現接近頂尖閉源模型,但這些仍是預覽版的官方說法,尚待更廣泛的獨立測試驗證。[14][15]
研究答案

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek V4, released as a preview on April 24, 2026, and why does it matter despite being unlikely to replicate the global shock ca. Article summary: DeepSeek V4 is DeepSeek’s open weight, preview generation model family: a large frontier oriented model (V4 Pro) and a smaller, faster model (V4 Flash).. Topic tags: general web, llm, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layout
DeepSeek V4 是中國 AI 公司 DeepSeek 於 2026 年 4 月 24 日推出的開放權重預覽模型系列,包含兩款定位不同的模型:面向複雜推理、程式設計與 AI 代理工作的 V4-Pro,以及主打速度與成本效益的 V4-Flash。1415
它不太可能重現 DeepSeek R1 當年引發的全球突襲式震撼。如今市場已經預期中國團隊能推出能力不俗、價格較低的模型,因此 V4 的新鮮感不在於「中國模型也能做到」這件事本身,而在於它試圖把模型能力、長上下文應用、開放部署,以及中國本土晶片與軟體堆疊連成一條可運作的路線。
DeepSeek 在 4 月 24 日發布 V4 預覽版,包含:
兩者都是混合專家(Mixture of Experts,MoE)模型,並支援 100 萬 token 的上下文視窗。換句話說,開發者可以把大型程式碼庫、長篇研究資料或長時間累積的工作記錄放進同一個工作脈絡中。141015
與完全封閉、只能透過官方服務使用的模型不同,DeepSeek 同時提供可下載的模型權重與 API。這讓企業和開發者可以選擇自行部署、交由雲端運行,或直接接入 API,而不必只依賴單一託管服務。1415
DeepSeek 表示,V4-Pro 的表現可與全球頂尖閉源模型競爭,並特別強調數學與 STEM 推理、程式設計、世界知識,以及使用工具和執行多步驟任務的代理能力。1415
不過,這些數據與定位目前主要來自模型發布方及相關資料,且 V4 仍是預覽版本。基準測試成績不等於在真實工作流程中必然與 Claude 或其他頂尖閉源模型相當;模型在長程式碼維護、工具呼叫穩定性、錯誤率、資訊安全與不同語言任務上的表現,仍需要更多獨立測試。
因此,較穩妥的說法是:V4 提供了一個價格更具吸引力、可自行部署或經由 API 使用的替代方案,而不是已經全面取代現有前沿模型。1415
V4 的長上下文不只是把數字從幾十萬 token 推高到 100 萬 token。它採用混合式、選擇性的注意力設計,對近期內容保留較詳細的處理,同時把較早的資訊壓縮成更小的記憶表示,避免每一步都完整處理整段歷史資料。1016
DeepSeek 與 Hugging Face 的資料指出,在 100 萬 token 上下文下:
若這些數字能在實際部署中大致成立,影響將不只是一項基準測試紀錄。長期維護的程式碼庫、龐大的研究文件、企業內部知識庫,以及需要持續記住任務狀態的 AI 代理,都可能因此變得更容易負擔。對這類應用而言,能否以合理成本維持長上下文,往往比單次回答的最高分數更關鍵。
DeepSeek 將 V4 定位為適合程式設計和工具型 AI 代理的模型,並提到可與 Claude Code、OpenClaw、CodeBuddy 等開發者代理環境整合。14
這裡需要分清楚「能夠接入」與「能力相同」的差別。支援這些工作流程,代表開發者可以在熟悉的代理環境中測試一個較低成本、可自行託管或透過 API 提供的模型;這並不自動證明它在程式碼品質、工具使用、任務完成率或可靠性上已與 Claude 等閉源模型持平。
但從產業角度看,這種相容性仍然重要。模型若能被直接放進既有的編程代理工作流,開放權重的價值就不再只是「下載後聊天」,而是可能進入企業的程式開發、文件搜尋、測試與自動化流程。14
R1 帶來的最大衝擊,是讓全球重新評估中國 AI 團隊以相對低成本打造強大推理模型的能力。V4 延續了這條路線,但把重點從一次性的「能力展示」推向更實際的「如何部署」。
一方面,V4-Pro 和 V4-Flash 都以開放權重形式提供,讓研究者與企業有機會自行調整和部署;另一方面,Flash 透過較少的啟用參數,瞄準高併發、低延遲的服務需求。再加上百萬 token 上下文與選擇性注意力,V4 的競爭力可能來自整體使用成本,而不只是模型排行榜上的單一分數。141516
V4 的另一個關鍵變化,是它成為 DeepSeek 首個針對華為 Ascend AI 晶片進行重要適配的主要模型,而不再主要依賴 Nvidia GPU 生態。23
在美國限制先進 AI 晶片出口的背景下,這項適配具有戰略意義。它有助於驗證一條由中國本土模型、晶片、編譯工具與軟體框架共同構成的路徑,也符合中國推動 AI 供應鏈自主化、降低對海外硬體與軟體依賴的方向。23
路透社報道稱,V4 發布後,華為 Ascend 950 晶片需求上升,多家中國大型網路公司爭相訂購。若華為的超節點系統能在效能、軟體工具、供應量與總持有成本之間取得平衡,V4 類模型的效率優勢可能進一步放大,並促成一套與 Nvidia 主導的全球 AI 基礎設施並行的中國方案。1
模型能在 Ascend 上運行,與取代 Nvidia 仍是兩回事。Nvidia 的優勢不只在 GPU 晶片本身,也包括高速互連、CUDA 程式生態、成熟的最佳化函式庫、開發者熟悉度,以及全球雲端供應商的部署經驗。
此外,公開報道目前沒有充分說明 V4 完整訓練過程中有多少比例使用中國本土晶片,也難以把「針對 Ascend 進行最佳化」與「完全使用本土晶片訓練」混為一談。關於 V4 完全以中國晶片訓練的說法,應視為尚未獲充分驗證的主張。23
同樣地,Ascend 950 超節點能否在大規模訓練與推理中提供穩定效能、足夠供應和具競爭力的總成本,也仍有待實際部署證明。它代表一條可能成形的戰略路徑,而不是已經完成對 Nvidia 全球軟硬體堆疊的替代。1
DeepSeek R1 改變了市場對中國 AI 推理能力與成本的想像;DeepSeek V4 則可能把這種影響推向更務實的層面:
所以,V4 未必會像 R1 一樣令全球市場措手不及,但它可能更深刻地影響 AI 的實際部署方式:不只是誰擁有最強模型,也包括誰能以更低成本、更長上下文,以及更少的外部供應鏈依賴,把模型真正運行起來。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
DeepSeek V4 是一組開放權重的預覽模型,包含面向高難度任務的 V4 Pro,以及更快、更低成本的 V4 Flash。
DeepSeek V4 是一組開放權重的預覽模型,包含面向高難度任務的 V4 Pro,以及更快、更低成本的 V4 Flash。 兩款模型都採用混合專家架構,支援最多 100 萬 token 上下文;V4 Pro 為 1.6 兆總參數、每次啟用 490 億參數,V4 Flash 則為 2,840 億總參數、每次啟用 130 億參數。[14][10]
DeepSeek 宣稱 V4 Pro 的推理、知識、程式設計與代理任務表現接近頂尖閉源模型,但這些仍是預覽版的官方說法,尚待更廣泛的獨立測試驗證。[14][15]