DeepSeek V4-Flash-Vision-Exp 的重要性,可能不在於它是否已經建立持久的能力領先,而在於它釋放出的價格訊號。
這款實驗性模型在 V4-Flash 架構上加入圖像理解。DeepSeek 表示,它保留文字模型的推理能力、代理任務能力與世界知識,並讓多模態代理的表現接近 Anthropic 的 Claude Opus 4.8;圖片則沿用 V4-Flash 的價格,每張圖片最多使用 384 個輸入 token。64
如果這些能力能在實際產品中穩定運作,視覺 AI 的部署成本可能顯著下降。不過,商業結果仍遠未確定:目前的基準比較主要來自公司公布的數據或與其關係密切的報導,真正影響企業採用的,還包括可靠度、供應情況、延遲、資料治理與長期支援。
為什麼價格比模型名稱更值得關注
視覺理解過去常被視為高階功能,原因在於大量處理圖片可能需要更多計算資源與模型容量。DeepSeek 的做法有所不同:它把圖像輸入放進 Flash 等級,而不是另設一個更昂貴的視覺模型價格。
據報,V4-Flash-Vision-Exp 在離峰時段的價格為:每百萬個未命中快取的輸入 token 收費 0.22 美元,輸出 token 收費 0.66 美元;尖峰時段則分別升至 0.44 美元與 1.32 美元,命中快取的輸入價格更低。51
這種定價對反覆處理截圖、表格、收據、技術圖表、儀表板或瀏覽器介面的應用尤其重要。只要模型能以足夠穩定的品質完成這類日常任務,開發者就可能在相同預算內加入更多視覺檢查、重試與代理步驟。
但 384 token 上限是一項不能忽略的限制。它有助於壓低圖片處理成本,卻可能影響依賴細微視覺資訊、密集文字或精準空間關係的工作。換句話說,圖片便宜,不代表模型在所有視覺任務上都能提供高品質結果。53
DeepSeek 宣稱了什麼,基準測試又沒有證明什麼
DeepSeek 表示,這款視覺模型相較純文字版 V4-Flash,在多模態代理評測上有大幅進步,並接近 Opus 4.8。已公布的比較呈現的是「接近但不全面領先」的結果:在 ApexBench Pass@1 中,V4-Flash-Vision-Exp 得分 36.5,低於 Opus 4.8 的 39.4;但在 Agents’ Last Exam 中以 27.3 領先 25.7,在 ZeroBench 中則以 35.0 高於 34.0。58
這些數據值得注意,卻不能直接等同於生產環境的能力相當。企業與開發者還應測試:
- 多次重跑後的任務完成率;
- 對密集文件、小字與複雜版面的視覺準確度;
- 工具選擇與錯誤復原能力;
- 延遲、正常運作時間與速率限制;
- 面對模糊、具誤導性或對抗性圖片時的表現;
- 資料處理方式、地區供應情況與企業級控管功能。
下一步關鍵在於獨立且可重現的測試。在這些證據出現以前,最穩妥的結論是:DeepSeek 已提出一項可信的低成本挑戰,但還不能說它已確定超越主流前沿模型。
Anthropic、OpenAI 與 Google 將面臨什麼壓力
如果 V4-Flash-Vision-Exp 脫離 DeepSeek 自行評測的環境後,仍能在實際部署中保持可靠,它可能削弱 Anthropic、OpenAI 與 Google 僅憑一般推理或視覺理解能力收取高額溢價的空間。壓力最可能先出現在高流量、成本敏感的應用:這些工作只要模型「夠好」,不一定需要最強的能力。
高價模型供應商仍有多種防守方式,包括長時間工作流程的可靠度、工具生態系、安全與治理、客戶支援、雲端整合及產品分發。一款模型即使在某項基準測試中稍微便宜或更強,若在企業部署時造成更多失敗、需要額外監控,或缺乏必要的控管功能,最終仍可能不是較便宜的選擇。
市場因此可能進一步分層:
- 低成本多模態模型:用於大量文件處理、截圖理解、客服流程與例行代理任務。
- 高階前沿模型:用於艱難推理、複雜程式設計、高風險準確性要求、合規敏感的部署,以及一次錯誤所造成的損失遠高於 API 節省的情境。
對高價供應商而言,風險未必是需求驟降,而是客戶對「沒有差異化的能力」降低付費意願。企業可能同時採用多個模型,把簡單的視覺工作分配給較便宜的系統,再將高價模型保留給真正需要品質的任務。
DeepSeek 自己的調價,也讓「價格歸零」故事變得複雜
DeepSeek 並不是單純地全面降價。8 月推出 V4-Pro 後,公司為 V4-Pro 與 V4-Flash 引入尖峰及離峰定價;據報價格會視模型、token 類型與使用時段不同,上調 50% 至 1,100%。17
這顯示 DeepSeek 同時在管理容量與需求,而不只是無限期壓低競爭對手的價格。它可能把 Flash Vision 當作低成本的入門渠道,再從高階推理、更高吞吐量或尖峰時段使用中獲取收入。
對開發者而言,真正應計算的是實際總成本,而不是最低的宣傳價格。預算需要納入尖峰時段、輸出 token、快取命中率、重試次數、延遲與失敗率。一個單價便宜、卻必須多嘗試幾次才能完成任務的模型,實際上未必比較省錢。
對 Anthropic 投資者意味著什麼
DeepSeek 發布新模型之際,Anthropic 仍呈現強勁的需求訊號。路透社報導,Anthropic 截至 7 月底的年化營收跑率已超過 650 億美元,5 月時為 470 億美元。年化營收跑率是把近期表現外推至全年,並不等同於已入帳的全年營收,也不能保證未來利潤率。33
這項區分很重要。DeepSeek 的模型並沒有抹去 Anthropic 目前的成長訊號,但可能挑戰其未來定價能力與基礎設施投資回報的假設。若客戶把例行工作轉移到更便宜的多模態模型,Anthropic 可能需要提供更多折扣,或增加支出以維持市場份額。
Amazon 的直接曝險尤其明顯。Amazon 已同意立即投資 Anthropic 50 億美元,另有最多 200 億美元與商業里程碑掛鉤;Anthropic 也承諾在 10 年內於 Amazon 的雲端技術上支出超過 1,000 億美元。1
如果 Claude 的需求持續強勁,Amazon 可同時受惠於 Anthropic 的雲端用量,以及自身所持 Anthropic 投資的價值上升。反過來,若低成本競爭對手持續削弱 Anthropic 的使用增長或定價能力,這項協議也可能令市場重新檢視龐大基礎設施承諾的利用率與回報。對 Amazon 而言,這項合作既帶來可觀上行空間,也讓部分 AI 投資論述更集中於 Anthropic 能否持續擴張。
Alphabet 的曝險方式不同。它既是 Anthropic 的投資者,也透過 Gemini 與 Google Cloud 直接競爭。6 若市場出現具可信度且更便宜的多模態模型,整體價格都可能承壓,包括 Google 的 API 與雲端 AI 服務。Alphabet 從 Anthropic 估值上升所獲得的間接利益,必須與自身 AI 產品面對的競爭壓力一併衡量。
哪些指標能真正定調
接下來的證據,比發布消息本身更重要。投資者與開發者應留意:
- 獨立多模態評測:涵蓋視覺推理、代理任務完成、工具使用與錯誤復原,而不只是公司自行公布的比較。
- 持續的 API 採用:包括流量、重複使用率、開發者遷移、正常運作時間與企業部署案例。
- 實際工作負載成本:納入尖峰定價、輸出 token、快取、重試與營運失敗。
- 競爭對手反應:觀察 Anthropic、OpenAI 與 Google 是否調整牌價、企業折扣、模型路由產品或用量承諾。
- Anthropic 的業務品質:特別是營收留存、實際成交價格、利潤率,以及 AWS 用量相對於其基礎設施承諾的變化。
結論:多模態 AI 可能從比能力,轉向比每一美元能完成多少工作
DeepSeek V4-Flash-Vision-Exp 可能加速 AI 產業從「能力競賽」轉向「價格效能競賽」。它最重要的地方,或許不是在部分評測中偶爾追上或超越 Opus 4.8,而是宣稱能把實用的多模態代理能力帶進低成本的 Flash 等級。
但只有當模型可靠到足以支撐長期生產部署,這項發布才會真正造成財務上的顛覆。現階段,它更適合被視為給高價 AI 供應商及其投資者的一項可信警告:前沿模型的定價、客戶黏著度與基礎設施回報,必須靠可量化的產品優勢來守住,而不能只靠基準測試的聲望。