OpenCode 報稱 DeepSeek V4 Flash 喺 8 月 1 日單日處理咗 8 萬億 token。重點唔只係某個模型忽然爆紅,而係 AI 工作嘅基本單位正在改變:開發者愈來愈多買緊嘅,唔係一次過問答,而係一個完整嘅 Agent 循環——讀取 repository、規劃、修改檔案、執行程式、睇錯誤訊息,然後再試。
OpenCode 所公布嘅 8 萬億 token,當中 5 萬億係免費試用額度,3 萬億經付費 Go 服務使用。另一邊,模型聚合平台 OpenRouter 嘅 7 月 27 日至 8 月 2 日周榜,V4 Flash 喺該平台全周處理 7.22 萬億 token。呢啲都係平台自行公布嘅數字,唔係對全市場模型使用量嘅獨立審計;不過兩組數字足以反映,Agent 工作流可以推動到幾大規模。
20
23
29
點解 Agent 特別「食 token」?
普通 chatbot 一問一答,prompt 同回覆通常有上限;coding Agent 嘅工作記憶就大得多:原始碼檔案、終端機輸出、測試失敗記錄、之前嘅決策、產生過嘅 patch,同埋一連串工具呼叫。做任務時,佢可能要一次又一次重讀呢啲上下文。
OpenCode 公開嘅 V4 Flash 數據顯示,平均每個 session 約 1,200 萬 token,而輸入 token 快取比例有 95%。數字本身唔足以證明每個 session 都係全自動寫 code,但同長上下文、反覆迭代嘅工作型態相當吻合,唔似一般短對話。
25
而用家重視嘅,從來唔係模型吐咗幾多 token。佢哋要嘅係可以 merge 嘅 pull request、通過嘅測試套件、可運行嘅 prototype,或者正確完成嘅工作流程。因此,較實際嘅評估方法係:
每宗獲接納任務成本 = 模型及工具循環總成本 ÷ 任務達到所需標準嘅機率
呢條數唔只計 API 標價,仲要計失敗嘗試、重試、人手覆核、等待時間,同埋修正錯誤嘅成本。
Token 平,代表可以負擔更多次嘗試
有報道引述 V4 Flash 第一方定價:每 100 萬輸入 token 為 0.14 美元,每 100 萬輸出 token 為 0.28 美元。
12 呢個價位令開發者可以用較低成本做更多輪修訂、保留更多上下文,以及跑更多自動測試;相比價格高得多嘅模型,Agent「試錯」嘅空間大咗。
重點唔係平模型必定較好,而係對於大量例行工作,當 Agent 需要多輪先完成任務時,細小嘅能力差距有可能俾巨大嘅成本差距蓋過。
例如有比較指出,Artificial Analysis Intelligence Index v4.1 入面,V4 Flash Max 得 50 分,Claude Opus 4.8 Max 得 56 分;但跑完整套評測嘅模型調用成本,前者約為 72.02 美元,後者約為 3,752.55 美元。即係話,兩者相差 6 分,同時成本卻相差極遠;不過呢個只係評測比較,唔代表真實工作可靠性必然相同。
16
面對困難或者後果嚴重嘅工作,如果高階模型能夠顯著減少部署失敗、人手監督同返工,佢每個「獲接納結果」嘅成本仍然可能更低。結論唔係「全世界都用最平模型」,而係要按達成合格成果嘅整體成本去分流任務。
所謂「DeepSeek 斬殺線」,主要斬中邊個?
「DeepSeek 斬殺線」較適合當成市場比喻:當有一款成本極低、能力又接近前沿嘅模型出現,定價高得多但交付結果未見明顯更好嘅產品,就會受壓。
受影響程度,三個層次唔一樣:
- 平價路由模型:仍適合做分類、資料擷取、短文本轉換同大批量初步分流。呢類工作最重視速度同極低單位成本,未必需要強推理能力。
- 頂級旗艦模型:依然有位置,尤其係長期推理、極高可靠性、多模態工作、合規與管治要求高,或者人手覆核很昂貴嘅場景。
- 中階模型:壓力最大。如果價錢明顯高過 Flash,就要證明自己有更高完成率、更低延遲、更佳工具使用、更好整合、支援服務或企業控制能力;淨係基準測試略高,未必夠。
換句話講,低成本 Agent 模型可以做「預設工人」;旗艦模型就變成處理棘手個案嘅升級專家。夾喺中間嗰批模型,要證明自己真係可以降低每宗任務嘅總成本。
V4 Flash 點樣瞄準 Agent 級別嘅成本?
DeepSeek V4 Flash 係一個專家混合(Mixture-of-Experts,MoE)模型,總參數有 2,840 億,但每次生成 token 約只啟動 130 億參數,並支援 100 萬 token 上下文視窗。
17 呢種設計將模型整體容量,同每粒 token 實際要用嘅運算量分開。
佢嘅效率策略包括:
- MoE 路由:每粒 token 只啟動部分專家,而唔係將所有參數一齊運行,從而減少實際運算量。
17
- 混合注意力機制:V4 系列結合 Compressed Sparse Attention(CSA)同 Heavily Compressed Attention(HCA),目標係減低超長上下文所需嘅注意力運算同記憶體負擔。
17
33
- 較低 KV cache 壓力:NVIDIA 指 V4 系列嘅注意力創新,在引用嘅 V3.2 對比下,目標係將每 token 推理 FLOPs 減少 73%,KV cache 記憶體負擔減少 90%。
33
- 善用快取嘅工作流:Agent session 會重複提交大量重疊嘅 repository 同工具上下文,高快取重用率會直接影響實際成本。OpenCode 所報嘅 95% 快取比例,正好說明呢個操作細節點解重要。
25
呢啲唔係純粹規格表上嘅賣點,而係決定咗:可唔可以喺合理成本內,畀 Agent 掃描大型 codebase、用工具做事,出錯後仲有本錢重試幾次。
新前沿:能力、可靠性,同每次迭代嘅邊際成本
基準測試當然仍然重要,但對 Agent 而言,唔應該係唯一指標。更有用嘅比較,係三方面一齊睇:
- 能力:模型可唔可以處理嗰類任務?
- 可靠性:佢有幾多次可以唔靠昂貴介入,就交出合格結果?
- 迭代邊際成本:再多一次工具呼叫、修改、測試或失敗後恢復,究竟有幾平?
OpenCode 報稱嘅單日 8 萬億 token,令第三點變得特別清楚。當 AI 由一次性查詢變成 Agent 循環,token 用量可以以數個量級上升。能夠將長上下文同反覆重試成本壓低嘅模型,即使未必喺最難題目上贏過最強旗艦,都可以成為大量、重複性 Agent 工作嘅預設選擇;而旗艦模型則更適合留作升級處理。
20
25
33