Economiza $0.33 (43.33%) $0.75 sem cache → $0.43 com cache · 5 solicitações Ponto de equilíbrio: 13 acertos de cache — as leituras devem compensar um prêmio de escrita
sem cache = acertos × (prompt×in$/M + saída×out$/M) / 1M
= 5 × (10,000×$10 + 1,000×$50) / 1M = $0.75
com cache = (prompt×write$/M + acertos × (prompt×read$/M + saída×out$/M)) / 1M
= (10,000×$12.5 + 5 × (10,000×$1 + 1,000×$50)) / 1M = $0.43
break-even hits = ceil(write$/M / read$/M) = ceil($12.5 / $1) = 13Dados em 2026-09-27T12:03:11.094Z
O que faz
A Calculadora de Economia com Cache mostra o que o prompt caching realmente economiza em uma carga de trabalho repetida. Informe as contagens de tokens de prompt e de saída, mais quantas requisições reutilizam o prompt em cache, escolha um modelo, e ela compara a conta sem cache contra a com cache - incluindo o caso honesto em que o cache custa mais.
A nuance central que ela captura é o prêmio de escrita: a primeira requisição paga extra para armazenar o prompt, e cada acerto posterior paga uma taxa de leitura de cache muito mais barata em vez do preço integral de entrada. A figura de equilíbrio diz quantos acertos são necessários para que as leituras baratas paguem aquela única escrita.
Como usar
- Defina Prompt tokens / request, Output tokens / request e Cache hits com os steppers.
- Escolha um Model - modelos com preço de cache vêm primeiro; modelos sem taxas de cache publicadas são marcados como “no cache rates” e mostram o estado vazio explicativo.
- Leia o resultado principal: verde quando o cache economiza dinheiro, vermelho quando custa mais (acertos demais poucos para amortizar a escrita).
- Confira o bloco The math - ambas as fórmulas renderizadas com as taxas ao vivo do seu modelo e seus números substituídos nelas.
- Use Copy savings ou Copy share link para enviar o cenário exato.
Exemplos
Um prompt repetido de 10k tokens (5 acertos)
Entrada: 10.000 tokens de prompt, 1.000 tokens de saída, 5 acertos de cache, a $10/M de entrada, $50/M de saída, $1/M de leitura de cache, $12.5/M de escrita de cache:
uncached = 5 × (10,000×$10 + 1,000×$50) / 1M = $0.75
cached = (10,000×$12.5 + 5 × (10,000×$1 + 1,000×$50)) / 1M = $0.425
savings = $0.325 (43.33%) · break-even = ceil(12.5 / 1) = 13 hits
Uma única requisição - o cache perde
Mesmo formato, 1 acerto de cache:
uncached = $0.15 · cached = $0.185 · savings = −$0.035
Um acerto nunca amortiza o prêmio de escrita; a ferramenta mostra o resultado negativo em tom de erro em vez de escondê-lo.
Bom saber
- O ponto de equilíbrio conta leituras, não requisições.
ceil(write$/M ÷ read$/M)é quantos acertos de cache são necessários para que o gasto acumulado de leitura iguale um prêmio de escrita - abaixo disso, o cache custa mais. - As taxas são um retrato de um instante. Cada figura flui de um snapshot de modelos com data - confira a linha “Data as of” para atualidade; modelos sem taxas de cache publicadas não retornam resultado em vez de uma matemática parcial.
- Privado: tudo roda 100% no cliente - nenhuma contagem de tokens ou taxa sai do seu navegador.
- Ferramentas relacionadas: LLM Cost Calculator, Token Estimator, Embedding Chunk Planner.