Neste guia, MTok significa 1.000.000 de tokens. A documentação de preços da Anthropic separa Base Input Tokens, Cache Writes, Cache Hits e Output Tokens; na prática, a sua planilha ou telemetria também deveria separar esses itens.
| Item cobrado | Preço | Como entra na conta |
|---|---|---|
| Base input tokens | US$ 5/MTok | Tokens enviados ao modelo, quando não entram como escrita ou leitura de cache. |
| Output tokens | US$ 25/MTok | Tokens gerados pelo Claude na resposta. |
| Prompt cache write, TTL de 5 min | US$ 6,25/MTok | Primeira gravação de um prompt reutilizável no cache, com tempo de vida de 5 minutos. |
| Prompt cache write, TTL de 1 h | US$ 10/MTok | Gravação de cache com tempo de vida de 1 hora. |
| Cache read / hit | US$ 0,50/MTok | Leitura de conteúdo já cacheado quando há hit. |
O ponto importante: input, output, escrita de cache e leitura de cache têm preços diferentes. Se seu aplicativo usa prompt caching, ou cache de prompt, trate cada categoria como uma linha de custo própria.
A conta básica é:
custo em US$ = (input_tokens / 1.000.000 × 5) + (output_tokens / 1.000.000 × 25)
Exemplo: uma requisição com 200.000 tokens de entrada e 20.000 tokens de saída custa US$ 1,00 + US$ 0,50 = US$ 1,50, antes de qualquer regra extra de plataforma ou provedor.
Quando há cache de prompt, some cada componente separadamente:
custo em US$ = (base_input_tokens / 1.000.000 × 5) + (output_tokens / 1.000.000 × 25) + (cache_write_5m_tokens / 1.000.000 × 6,25) + (cache_write_1h_tokens / 1.000.000 × 10) + (cache_read_input_tokens / 1.000.000 × 0,50)
Se você só usa um tipo de TTL, mantenha apenas a linha de cache write correspondente. A documentação de streaming mostra que o usage pode incluir campos como input_tokens, output_tokens, cache_creation_input_tokens e cache_read_input_tokens; a página de preços, por sua vez, cobra cache write e cache hit de formas diferentes.
count_tokensNão tente estimar custo por número de caracteres, palavras ou tamanho visual do texto. A Anthropic oferece o endpoint /v1/messages/count_tokens para calcular tokens antes de enviar a mensagem ao Claude; ele aceita uma estrutura parecida com a criação de mensagens, incluindo system prompts, tools, imagens e PDFs, e retorna o total de tokens de entrada. Todos os modelos ativos oferecem suporte à contagem de tokens.
O fluxo mais seguro é enviar ao count_tokens exatamente o payload que irá para a Messages API: system prompt, histórico de mensagens, definições de tools, imagens ou PDFs. Isso permite estimar custo antes da chamada real e também ajuda a impor limites de orçamento dentro do produto.
usage realQuando a requisição terminar, registre o campo usage retornado pela API. Os exemplos da Messages API mostram usage com input_tokens e output_tokens, e a documentação de streaming mostra também campos ligados a cache, como cache_creation_input_tokens e cache_read_input_tokens.
Se você usa streaming, atenção especial: a Anthropic informa que as contagens de tokens em message_delta.usage são acumuladas, não incrementais por evento. Se você somar cada delta como se fosse um novo bloco independente, vai contar tokens repetidos.
Logs por requisição são úteis para alertas em tempo real e limites dentro do produto. Para fechamento mensal, rateio por workspace ou análise histórica, a Anthropic oferece a Usage & Cost Admin API, com acesso programático e granular a dados históricos de uso e custo. A API permite relatórios com quebras por modelo, workspace e service tier.
Na prática: use o usage de cada resposta para controle operacional, mas faça a conciliação formal com os dados históricos de uso e custo da Usage & Cost Admin API.
O Opus 4.7 introduz um novo tokenizer. Segundo a documentação da Anthropic, ao processar texto ele pode usar cerca de 1x a 1,35x a quantidade de tokens de modelos anteriores, chegando a aproximadamente 35% a mais dependendo do conteúdo. A própria chamada /v1/messages/count_tokens pode retornar números diferentes para o mesmo input no Opus 4.7 e no Opus 4.6.
Por isso, o fato de o preço base continuar em US$ 5/MTok para input e US$ 25/MTok para output não garante que a fatura real fique igual. Antes de trocar o modelo em produção, rode /v1/messages/count_tokens em prompts de alto tráfego, contextos longos, payloads com tool definitions e fluxos que costumam concentrar custo.
claude-opus-4-7./v1/messages/count_tokens em payloads representativos.input_tokens, output_tokens, cache write e cache read separadamente; não salve apenas um total.message_delta.usage é acumulado e não deve ser somado evento a evento.Em resumo: o preço base do Claude Opus 4.7 é fácil de memorizar, US$ 5/MTok de entrada e US$ 25/MTok de saída. A conta correta, porém, depende de contar tokens antes com count_tokens, registrar o usage depois e incluir prompt caching e o novo tokenizer no seu modelo de custo.