| 计费项目 | Claude Opus 4.7 公开价 |
|---|---|
| Base input tokens | $5 / 1M tokens |
| Output tokens | $25 / 1M tokens |
| 5 分钟 cache write | $6.25 / 1M tokens |
| 1 小时 cache write | $10 / 1M tokens |
| Cache hit / refresh | $0.50 / 1M tokens |
不用缓存时,最基础的 API 成本公式是:
成本 = input_tokens / 1,000,000 × 5
+ output_tokens / 1,000,000 × 25
使用 prompt caching 时,要把可复用上下文拆开算:第一次写入 5 分钟 cache 的部分按 $6.25/MTok,第一次写入 1 小时 cache 的部分按 $10/MTok,后续 cache hit / refresh 按 $0.50/MTok;未被缓存的新问题、新消息仍按普通 input 价格计算,模型输出仍按 output 价格计算。
如果一份文档只分析一次,没有后续追问,预算最简单:文档、系统提示词和问题都算 input tokens,模型回答算 output tokens。以下示例均按 Claude API 公开价估算。
| 场景 | Input | Output | 估算成本 |
|---|---|---|---|
| 较短的长文档摘要 | 100k | 5k | 约 $0.625 |
| 中大型文档分析 | 300k | 8k | 约 $1.70 |
| 超大型文档分析 | 1M | 10k | 约 $5.25 |
以 300k input + 8k output 为例:
300,000 / 1,000,000 × 5 = 1.50
8,000 / 1,000,000 × 25 = 0.20
合计 = 1.70 美元
如果是从旧模型迁移到 Opus 4.7,不建议直接沿用原来的 token 估算。Anthropic 定价文档说明,Opus 4.7 使用新的 tokenizer,同一段固定文本的 token 数最高可能增加 35%。
例如原本估 300k input,保守可先按 405k input 计算;搭配 8k output 时:
405,000 / 1,000,000 × 5 = 2.025
8,000 / 1,000,000 × 25 = 0.20
合计 ≈ 2.23 美元
长文档产品最常低估的成本,不是单次输出,而是同一份大文档在每轮对话里反复作为 input 计费。只要用户会围绕同一份文档多次提问,就应该先把 prompt caching 放进预算模型。
假设:
| 做法 | 成本组成 | 估算成本 |
|---|---|---|
| 第一次:建立 5 分钟 cache | 300k × $6.25/MTok + 2k × $5/MTok + 2k × $25/MTok | 约 $1.935 |
| 后续:cache hit | 300k × $0.50/MTok + 2k × $5/MTok + 2k × $25/MTok | 约 $0.21 |
| 不用 cache:每次重送全文 | 302k × $5/MTok + 2k × $25/MTok | 约 $1.56 |
在这个例子里,第一轮建立 cache 比不用 cache 还贵;但只要同一份文档进入第二轮请求,总成本就低于每次重送全文:
不用 cache,两轮:约 1.56 × 2 = 3.12 美元
用 5 分钟 cache,两轮:约 1.935 + 0.21 = 2.145 美元
所以,长文档问答的预算重点是 cache hit rate:用户是否真的会连续追问、追问是否落在缓存有效期内,以及每轮是否仍带入大量未缓存的新内容。
长对话的成本逻辑和长文档类似。如果应用每轮都把大量历史消息送回模型,input 成本会很快累积。可复用、相对稳定的历史上下文,应优先评估 prompt caching。
假设:
| 做法 | 估算成本 |
|---|---|
| 不用 cache:每轮带 200k 历史 + 1k 新消息 + 2k 输出 | 约 $1.055 / 轮 |
| 先把 200k 历史写入 5 分钟 cache:第一次那轮 | 约 $1.305 |
| 5 分钟 cache hit 后:每轮 | 约 $0.155 / 轮 |
| 先把 200k 历史写入 1 小时 cache:第一次那轮 | 约 $2.055 |
| 1 小时 cache hit 后:每轮 | 约 $0.155 / 轮 |
选 5 分钟还是 1 小时 cache,不应只看写入单价,而要看真实使用行为:
批量任务常见于离线分析、数据标注、批量摘要或大规模分类。在尚未确认你的账号、合约或平台端点适用的 batch pricing 前,正式预算不应提前写入未经核实的折扣。更稳妥的做法,是先按同步 API 公开价估算,再用实际确认的批量价格下修。
同步公开价公式仍然是:
总成本 = 总 input tokens / 1,000,000 × 5
+ 总 output tokens / 1,000,000 × 25
例:10,000 笔任务,每笔 2k input + 500 output。
总 input = 10,000 × 2,000 = 20,000,000 tokens
总 output = 10,000 × 500 = 5,000,000 tokens
input 成本 = 20 × 5 = 100 美元
output 成本 = 5 × 25 = 125 美元
合计 = 225 美元
这个 $225 是不计入任何 batch discount 的保守同步价估算。后续如果确认有适用的批量价格,再把单价替换为实际价格即可。
另外,如果不是直连 Anthropic Claude API,而是通过云平台或第三方模型路由商,实际账单可能不同。第三方资料 CloudPrice 列出,Opus 4.7 在 Anthropic / global 类型下为 $5 input / $25 output per MTok,也列出部分 AWS Bedrock 区域型代码为 $5.50 input / $27.50 output per MTok;这类资料适合作为检查提醒,正式采购仍应以你的平台账务页、合约与官方文件为准。
如果还没有真实 token 分布,纯用理论值通常会偏乐观。至少把三件事纳入安全垫:
可采用的非官方预算安全垫如下:
| 阶段 | 建议预算系数 |
|---|---|
| PoC / 试跑 | 理论值 × 1.2 到 1.5 |
| 正式上线、流量稳定 | 理论值 × 1.35 到 1.6 |
| 从旧模型迁移到 Opus 4.7,且大量依赖长上下文 | 理论值 × 1.5 到 1.8 |
这些系数不是 Anthropic 官方报价,而是预算管理上的保守抓法。正式上线后,应把真实 token 日志、cache hit rate 与发票数据回填到模型里。
没有 cache 时,可以先用月成本公式:
月成本 ≈ 每日请求数 × 30
× (平均 input tokens / 1,000,000 × 5
+ 平均 output tokens / 1,000,000 × 25)
有 cache 时,务必拆开算:
月成本 ≈ 普通 input 成本
+ cache write 成本
+ cache hit / refresh 成本
+ output 成本
实作前至少填入这些变量:
| 变量 | 示例 |
|---|---|
| 每次平均 input tokens | 300,000 |
| 每次平均 output tokens | 8,000 |
| 每日请求数 | 1,000 |
| Cache write tokens | 每份文档 300,000 |
| Cache hit tokens | 每次命中 300,000 |
| Cache hit rate | 60% |
| Tokenizer 迁移 buffer | 最高先抓 × 1.35 |
| 运营 buffer | 例如 × 1.35 到 1.6 |
一次性长文档分析,直接用 $5/MTok input + $25/MTok output 估算即可。
同一份长文档反复问答,或长对话每轮都带大量历史,应先试算 prompt caching。在 300k 文档、2k 问题、2k 输出的例子中,5 分钟 cache 第二轮命中约 $0.21,而每次重送全文约 $1.56。
批量任务先用同步 API 公开价抓保守预算,等确认实际 batch pricing、云平台价格或合约单价后再下修。若从旧模型迁移到 Opus 4.7,先把 input token 预估最高乘以 1.35,再加运营 buffer,通常会比只看标价更接近真实账单。