至於價錢,部分價格追蹤同報道記錄 Opus 4.7 約為每 100 萬 input tokens US$5、每 100 萬 output tokens US$25,與 Opus 4.6 相近。 不過,上 production 前仍然應該重新核對 Claude API 官方 pricing,因為官方文件會分開 base input tokens、cache writes、cache hits 同 output tokens;prompt caching 同 batch processing 亦有各自規則。
| Workload | 建議決定 | 點解 |
|---|---|---|
| 大型 refactor、多檔案 debug、困難 coding task | 即刻 pilot | 呢類最貼近 Anthropic 強調嘅 coding 同 multi-step tasks。 |
| 需要用多個 tool、跑好多輪嘅 AI agent | 有限 budget 下 pilot | Opus 4.7 被定位為 agents 表現更強,而 task budgets 亦係 agent workflow 值得測試嘅新功能。 |
| 重要 code review | 將部分高風險 review route 去 Opus 4.7 | 如果可以減少漏 bug 或返工,較高成本可能值得;但要用自己團隊數據驗證。 |
| 短、重複、高吞吐量任務 | 暫時唔好改預設 | 官方重點係較困難、多步驟任務;新 tokenizer 亦可能令 token 數增加。 |
| 成本極敏感系統 | 先 canary 或 A/B test | 標價可能同 Opus 4.6 相近,但 tokenizer 改變會令實際 token 數不同。 |
如果只睇每 100 萬 token 標價,Opus 4.7 好似好容易決定:部分追蹤來源記錄約為 US$5 input、US$25 output。 但真實 production 成本通常唔止咁簡單,仲會受長 input、長 output、tool calls、retry、prompt caching、agent 跑幾多輪影響。
最需要重新量度嘅係 tokenization。Anthropic 指 Opus 4.7 嘅新 tokenizer 處理文字時,視乎內容,可能用到過往 model 約 1x–1.35x token;/v1/messages/count_tokens endpoint 喺 Opus 4.7 同 Opus 4.6 亦可能回傳唔同 token 數。
所以,工程團隊應該優先優化嘅唔係 cost per million tokens,而係 cost per completed task。如果 Opus 4.7 可以用更少修正輪次完成困難 task、減少 rollback、減少人手介入,token 成本高少少都可能值得。相反,如果質素冇明顯改善但 token 數增加,升級只會令成本邊際變差。
好嘅 pilot 唔應該只用 demo prompt。最好抽一批真實 task:backlog、舊 bug、已 merge pull request,或者現有 model 曾經做得唔好嘅 case。可以分成幾組:
測試時,Opus 4.7 應該同而家使用緊嘅 model 並行比較;prompt、tool、repo 權限、評分標準都盡量保持一致。最低限度要量度以下指標:
如果冇自動化測試,就用 blind review 或固定 rubric 評分。冇內部數據,好容易將通用 benchmark 誤當成自己 repo 嘅真實收益。
claude-opus-4-7 加做可選 model,唔好即刻改全系統預設。如果 Opus 4.7 能夠提升困難 task 完成率、減少人手介入、降低 tool errors,或者幫 agent 完成現有 model 經常放棄嘅工作,就值得逐步擴大使用。pilot 嘅理由係清楚嘅:Anthropic 將 Opus 4.7 定位為更強於 coding、agents 同 multi-step tasks,並提供 API model ID 供開發者使用。
但如果你主要 workload 係短、重複、唔太需要多步 reasoning 嘅任務,又或者 A/B test 顯示 cost/task 上升但質素冇明顯改善,就應該保留現有 model 做預設。對 Claude Opus 4.7 嚟講,正確升級唔係「全流量一刀切」,而係將佢 route 去最難、最值得用高階 model 解決嘅工作。