DeepSeek V4-Flash-Vision-Exp 的重要性,可能不在於它是否已經建立持久的能力優勢,而在於它向市場發出了一個非常清晰的價格訊號:視覺理解未必需要另收一層高端模型溢價。
這款實驗性模型在 V4-Flash 架構上加入圖片理解。DeepSeek 表示,它保留文字模型的推理及代理能力,多模態代理表現更接近 Anthropic 的 Claude Opus 4.8;圖片則沿用 V4-Flash 收費,每張輸入圖片最多計算 384 tokens。64
如果這些能力可以在實際環境中穩定運作,視覺 AI 的部署成本有機會顯著下降。不過,現階段不少基準測試主要來自公司自行公布,或由接近原始資料的報道整理而成。對企業客戶而言,穩定性、供應情況、延遲、數據處理及實際採用率,往往比發布當日的一個分數更加重要。
點解價格可能比模型名更重要?
過往,視覺能力通常被視為高級功能。涉及大量圖片的應用,可能需要額外處理能力及模型容量,因此供應商往往會將視覺模型放在較昂貴的產品層級。
DeepSeek 的做法則不同:它將圖片輸入放入 Flash 級別,而不是另設一個收費更高的視覺模型級別。
據報,V4-Flash-Vision-Exp 在非繁忙時段的收費為每 100 萬個未命中快取的輸入 tokens 0.22 美元、輸出 tokens 0.66 美元;繁忙時段則升至 0.44 美元及 1.32 美元。命中快取的輸入收費更低。51
對需要反覆處理截圖、表格、儀表板、收據、技術圖表或瀏覽器介面的應用來說,這個成本結構尤其值得留意。如果模型能以低廉輸入成本完成足夠可靠的日常工作,開發者便可能在相同預算內加入更多視覺檢查、重試及代理步驟。
但 384-token 上限亦是一個不能忽略的限制。它有助壓低圖片處理成本,卻可能限制模型應付細節密集、文字很細,或需要準確理解空間關係的任務。圖片輸入便宜,並不代表所有視覺工作都能獲得同等高質素的結果。53
DeepSeek 聲稱了甚麼?基準測試又證明不了甚麼?
DeepSeek 表示,這款視覺模型相較純文字版 V4-Flash,在多模態代理評測上有大幅進步,並接近 Opus 4.8。已報道的比較結果呈現的是一幅各有高低的圖像,而非全面勝出:在 ApexBench Pass@1,V4-Flash-Vision-Exp 得分 36.5,低於 Opus 4.8 的 39.4;但在 Agents’ Last Exam,則以 27.3 對 25.7 勝出;在 ZeroBench,亦以 35.0 對 34.0 略高。58
這些結果確實值得關注,但接近基準測試分數,並不等於在生產環境達到同一水平。採購者還應測試:
- 多次重複執行時的任務完成率;
- 對密集文件、細小文字的視覺準確度;
- 工具選擇及出錯後的復原能力;
- 延遲、服務可用率及速率限制;
- 面對具誤導性或含糊圖片時的表現;
- 數據處理、地區供應及企業管控功能。
下一步最關鍵,是由獨立機構進行可重複的測試。在這些資料出現之前,最穩妥的結論是:DeepSeek 已經提出一個可信的低成本挑戰,但尚未足以證明自己全面超越領先的前沿模型。
Anthropic、OpenAI、Google 面對更大定價壓力
如果 V4-Flash-Vision-Exp 證明在 DeepSeek 自家評測以外仍然可靠,Anthropic、OpenAI 及 Google 單靠一般推理或視覺理解能力收取大幅溢價的空間,可能會被削弱。壓力最可能出現在高用量、對成本敏感的類別,因為這些工作只要模型「夠用」,未必需要最強的前沿模型。
不過,高端供應商仍有多種方式維持其商業模式,包括:
- 長時間、具連續性的工作流程中更高的可靠性;
- 更完整的工具生態、保安、治理、支援及雲端整合;
- 企業客戶熟悉的產品分發渠道及開發者生態。
一個模型即使在某個基準測試稍為便宜或稍勝一籌,投入企業環境後仍可能因為錯誤較多、需要額外監察,或缺乏必要管控而失去優勢。
因此,市場可能逐步分成兩層:
- 低成本多模態模型:處理大量文件、解讀截圖、客戶服務流程及日常代理任務;
- 高端前沿模型:處理複雜推理、高風險準確度要求、複雜編程、合規敏感部署,以及一次出錯的代價遠高於 API 節省額的工作。
對高端供應商而言,真正的風險未必是需求突然消失,而是客戶不再願意為沒有明顯差異的能力支付溢價。企業可能同時採用多個模型,把簡單的視覺工作交給較平的系統,再將高端模型留給最需要質素的情況。
DeepSeek 自己加價,令「價格鬥到零」故事變得複雜
DeepSeek 並不是單純地將整條產品線全面減價。8 月,公司為 V4-Pro 及 V4-Flash 引入繁忙及非繁忙時段收費;視乎模型、token 類型及使用時段,部分新價格據報較原有水平高 50% 至 1,100%。17
這顯示 DeepSeek 同時在管理容量及需求,而不只是無止境地壓低競爭對手價格。它可能將 Flash Vision 定位成低成本的入門渠道,再從高級推理、更高吞吐量,或資源緊張時段的用量中取得收入。
對開發者來說,真正應計算的是實際總成本,而非廣告上最吸引的最低單價。預算需要包括繁忙時段用量、輸出 tokens、快取命中率、重試、延遲及失敗率。一個單價便宜的模型,如果每次任務都要多試幾次,實際上未必更便宜。
對 Anthropic 投資者有甚麼意義?
DeepSeek 發布模型之際,Anthropic 的需求訊號仍然強勁。路透社報道,Anthropic 的年化收入跑速截至 7 月底超過 650 億美元,較 5 月的 470 億美元上升。所謂「跑速」是將近期表現推算至全年,並不等於已入賬的全年收入,也不代表未來利潤率一定可以維持。33
這個分別相當重要。DeepSeek 的模型沒有抹去 Anthropic 當前的增長訊號,但它可能挑戰市場對 Anthropic 未來定價能力及基礎設施回報的假設。如果客戶將日常工作轉移到較便宜的多模態模型,Anthropic 可能需要提供更多折扣,或增加投資以守住市場份額。
Amazon 的風險敞口尤其直接。Amazon 已同意即時投資 Anthropic 50 億美元,另外最多 200 億美元則與商業里程碑掛鈎。Anthropic 亦承諾在 10 年內使用超過 1,000 億美元的 Amazon 雲端技術。1
如果 Claude 的需求持續強勁,AWS 可同時受惠於 Anthropic 的雲端用量,以及 Amazon 所持 Anthropic 投資的價值。相反,如果低成本競爭對手令 Anthropic 的用量增長或定價能力明顯受壓,這項安排便可能令人重新審視大型基礎設施承諾是否足以帶來合理回報。對 Amazon 而言,協議帶來可觀上行空間,但亦令其 AI 投資論述部分集中於 Anthropic 能否繼續高速擴張。
Alphabet 的情況有所不同。它既是 Anthropic 的投資者,同時亦透過 Gemini 及 Google Cloud 直接競爭。6 有可信的低價多模態模型進入市場,可能推低整個行業的價格,包括 Google 的 API 及雲端 AI 產品。Alphabet 從 Anthropic 估值上升所得的間接利益,需要與自身產品面對的競爭壓力一併衡量。
哪些指標可以真正定案?
下一輪證據比發布公告本身更重要。投資者及開發者應留意以下幾點:
- 獨立多模態評測:涵蓋視覺推理、代理任務完成、工具使用及錯誤復原,而不只是公司自行公布的比較。
- 持續 API 採用:包括流量、重複使用、開發者遷移、服務可用率及企業部署證據。
- 實際工作負載成本:計入繁忙時段收費、輸出 tokens、快取、重試及營運失敗。
- 競爭對手回應:觀察 Anthropic、OpenAI 及 Google 是否調整牌價、企業折扣、路由產品或用量承諾。
- Anthropic 的業務質素:尤其是收入留存率、實際成交價格、利潤率,以及 AWS 用量是否足以支持其基礎設施承諾。
總結
DeepSeek V4-Flash-Vision-Exp 可能加快 AI 市場由「能力競賽」轉向「性價比競賽」。它最具破壞力的地方,未必是偶爾在個別評測中追平或超越 Opus 4.8,而是聲稱可以將有實用價值的多模態代理能力,帶到低價 Flash 級別。
但要真正造成財務上的震盪,前提是模型要可靠到足以長期投入生產環境。現階段,它更適合被視為對高端 AI 供應商及投資者的一個可信警告:前沿模型的定價、客戶黏性及基礎設施回報,最終要靠可量度的產品優勢來捍衛,而不能只靠基準測試聲譽。