OpenCode 回報 DeepSeek V4 Flash 在 8 月 1 日處理了 8 兆 Token。這個數字的意義,不只是某一個模型突然爆紅,而是 AI 工作的基本單位正在改變。
開發者愈來愈不是為一次回答付費,而是在使用一個 Agent 循環:讀取程式庫、規劃做法、修改檔案、執行程式、查看錯誤,再嘗試一次。對這類工作而言,Token 不再只是回覆長度的計量,而是完成任務所需的反覆運算燃料。
OpenCode 表示,這 8 兆 Token 中,5 兆來自免費試用額度,3 兆則透過付費的 Go 方案使用。另一個多模型聚合平台 OpenRouter 的 7 月 27 日至 8 月 2 日週榜中,V4 Flash 在該平台一週處理量為 7.22 兆 Token。這些均為平台自行公布的數字,並非對全市場模型使用量的獨立稽核;不過,兩者的對照仍可看出 Agent 工作流所能帶來的龐大規模。
20
23
29
為何 AI Agent 特別「吃 Token」?
一般聊天機器人的單次提問,通常是有限的提示詞加上一段有限回覆;寫程式的 Agent 卻要維持大得多的工作集合,包括原始碼、終端機輸出、測試失敗訊息、先前決策、產生的修補內容,以及一連串工具呼叫。
它在嘗試完成任務時,往往必須反覆讀取大量相同脈絡。OpenCode 公開的 V4 Flash 資料顯示,平均每個工作階段約有 1,200 萬 Token,輸入 Token 的快取比例則為 95%。這無法證明每個工作階段都是完全自主的程式代理任務,但確實較符合長上下文、反覆迭代的工作模式,而不是短篇聊天。
25
因此,使用者真正看重的不是模型吐出了多少 Token,而是能否交付可合併的 pull request、通過的測試套件、能運作的原型,或正確完成的流程。較實用的評估方式可寫成:
每個驗收任務的成本 = 模型與工具循環總成本 ÷ 任務達到要求標準的機率
這裡的成本還包括失敗嘗試、重試、人工作業審查、等待時間,以及修正錯誤的代價;不能只看 API 標示的輸入與輸出單價。
Token 夠便宜,才負擔得起多次重試
與 V4 Flash 相關的報導指出,其第一方公布價格為:每百萬輸入 Token 0.14 美元、每百萬輸出 Token 0.28 美元。
12 在這種價格下,開發者可以用比高價模型更低的成本保留更多脈絡、增加迭代次數,並自動執行更多測試。
重點不是「便宜模型一定更好」,而是當 Agent 必須經過很多回合才能完成例行工作時,若品質差距不大,巨大的成本差距可能反而更具決定性。
例如,一項比較指出,Artificial Analysis Intelligence Index v4.1 中,V4 Flash Max 得分為 50,Claude Opus 4.8 Max 為 56;但跑完整套評測的模型呼叫成本,前者約為 72.02 美元,後者則為 3,752.55 美元。六分的評測差距,伴隨著極大的成本落差;但這是評測比較,並不代表兩者在真實世界任務中的可靠性必然相同。
16
對困難或高風險工作來說,若高階模型能明顯減少錯誤部署、人工監督或返工,它仍可能在「每個驗收成果」上更省。結論不是所有任務都該選最便宜的模型,而是應依照達成可接受結果的完整成本來分流任務。
「DeepSeek 斬殺線」壓力最大的是中階模型
所謂「DeepSeek 斬殺線」,較適合視為一個市場比喻:當低成本、接近前沿能力的模型出現時,價格高得多卻沒有交付明顯更佳任務成果的模型,將受到壓力。
不同層級受到的影響並不相同:
- 低價路由模型:仍適合分類、擷取、短文字轉換與大量初步分流;這些情境重視速度與最低單位成本,未必需要複雜推理。
- 頂級旗艦模型:仍有其位置,尤其是長時間推理、極高可靠度、多模態任務、治理要求較高,或人工覆核代價昂貴的工作。
- 中階模型:面臨最嚴格考驗。若價格明顯高於 Flash,就必須證明自己在完成率、延遲、工具使用、整合能力、支援服務或企業控制上有足夠優勢,而不只是基準分數略高。
換言之,低成本 Agent 模型可能成為大範圍、重複性工作的預設執行者;頂級模型則成為需要升級處理的專家。夾在中間的產品,必須證明自己確實能降低任務總成本。
V4 Flash 為何能瞄準 Agent 級的成本結構?
DeepSeek V4 Flash 是一個混合專家模型(Mixture-of-Experts,MoE):總參數為 2,840 億,但每個 Token 約只啟用 130 億參數,並支援 100 萬 Token 的上下文視窗。
17 這種設計將模型整體容量與每次產生 Token 時實際動用的運算量分開。
其效率策略可概括為:
- MoE 路由:每個 Token 只啟用部分專家,避免每次推論都執行所有參數所需的運算。
17
- 混合注意力機制:V4 系列結合壓縮稀疏注意力(CSA)與高度壓縮注意力(HCA),目標是降低超長上下文的注意力與記憶體負擔。
17
33
- 降低快取負擔:NVIDIA 指出,V4 系列的注意力創新,在所引比較中瞄準相較 DeepSeek-V3.2 將每 Token 推論 FLOPs 降低 73%、KV 快取記憶體負擔降低 90%。
33
- 快取感知的工作流:Agent 工作階段會反覆送出重疊的程式庫與工具脈絡,高快取重用率會實際影響成本。OpenCode 回報的 95% 快取比例,正說明這個營運細節的重要性。
25
這些並不只是技術規格。它們決定了讓 Agent 檢視大型程式碼庫、執行工具,並在出錯後多次復原嘗試,是否在財務上可行。
新前沿:能力、可靠度與每次迭代的邊際成本
基準測試依然重要,但對 Agent 而言,它已不是唯一的前沿指標。更有用的是三方面的權衡:
- 能力:模型能否解決這類任務?
- 可靠度:在不需要昂貴人工介入的前提下,它多常能交付可接受結果?
- 迭代邊際成本:多一次工具呼叫、修訂、測試或錯誤復原,成本有多高?
OpenCode 所回報的單日 8 兆 Token,讓第三項因素變得格外清楚。當 AI 從一次性問答走向 Agent,Token 用量可以呈數個數量級增加。能讓長上下文與反覆重試保持低成本的模型,可能會成為廣泛、重複性 Agent 工作的預設選擇;至於最困難的任務,能力更強的旗艦模型仍可能是更好的答案。
20
25
33