| 模型 | Token類別 | 舊劃一收費 | 非繁忙(新) | 繁忙(新) | 加幅 |
|---|---|---|---|---|---|
| V4-Flash | 輸入(cache miss) | $0.14 | $0.21 | $0.42 | 非繁忙+50%,繁忙+200% |
| V4-Flash | 輸入(cache hit) | $0.0028 | $0.007 | $0.014 | 非繁忙+150%,繁忙+400% |
| V4-Flash | 輸出 | $0.28 | $0.42 | $0.84 | 非繁忙+50%,繁忙+200% |
| V4-Pro | 輸入(cache miss) | $0.435 | $0.99 | $1.98 | 非繁忙+128%,繁忙+355% |
| V4-Pro | 輸入(cache hit) | $0.003625 | $0.03 | $0.06 | 非繁忙+728%,繁忙+1,555% |
| V4-Pro | 輸出 | $0.87 | $1.98 | $3.96 | 非繁忙+128%,繁忙+355% |
加幅最誇張係V4-Pro嘅cache-hit輸入token,由$0.003625升至繁忙時段嘅$0.06——即大約1,555% 。DeepSeek解釋,改動係為咗更有效分配資源,鼓勵用戶將非緊急工作安排喺非繁忙時段
。
2026年8月,獨立測試公司Composio用8種唔同嘅agent編排框架(harness),對DeepSeek V4 Flash進行咗30項刻意刁鑽、涉及多個步驟嘅工作流程測試,用嘅係真實API,包括Gmail、GitHub、Slack同Google Sheets 。每項任務時限900秒,所有框架都用同一套Composio MCP工具
。
| 框架 | 通過率(30項中) | 每項成功任務成本 |
|---|---|---|
| Pi Agent | 20/30(66.7%) | $0.028 |
| Prime Agent | ~15/24(62.5%有效運行) | $0.131 |
| OMP(Oh My Pi) | 17/30(56.7%) | $0.103 |
| Claude Code | 16/30(53.3%) | $0.195 |
| Codex | 16/30(53.3%) | $0.081 |
| Deep Agents(LangChain) | 16/30(53.3%) | $0.045 |
| Hermes Agent | 15/30(50.0%) | $0.056 |
| OpenCode | 14/30(46.7%) | $0.067 |
Pi Agent無論喺成功率(20/30)定成本效益(每項$0.028)都係最好 。唔同框架喺成功率、成本同速度三個指標上各有勝場——即係話揀咩框架,同揀邊個模型一樣重要
。最好同最差框架之間有成20個百分點嘅差距,顯示agent框架、工具設定、快取機制、重試邏輯同供應商組合對最終效果影響極大
。
加價加上唔穩定嘅實測結果,令分析師對DeepSeek V4嘅企業適用性有咗新睇法。
VentureBeat指出,同一款V4 Flash模型,用唔同框架、工具組合同快取設定,結果可以差好遠——企業投資模型嘅同時,必須提升編排成熟度 。Composio自己嘅分析都話,單係換個框架,成功率可以相差3項任務,成本相差接近3倍,速度相差2.2倍
。
DeepSeek官方agent基準分數好靚(Terminal-Bench 2.1得82.7,Toolathlon-Verified得70.3),但53.8%嘅真實世界通過率提醒大家,排行榜分數唔代表喺有真實API、有rate limit、有狀態嘅生產環境入面一樣可靠 。