Ahorra $0.33 (43.33%) $0.75 sin caché → $0.43 con caché · 5 solicitudes Punto de equilibrio: 13 aciertos de caché — las lecturas deben amortizar una prima de escritura
sin caché = aciertos × (prompt×in$/M + salida×out$/M) / 1M
= 5 × (10,000×$10 + 1,000×$50) / 1M = $0.75
con caché = (prompt×write$/M + aciertos × (prompt×read$/M + salida×out$/M)) / 1M
= (10,000×$12.5 + 5 × (10,000×$1 + 1,000×$50)) / 1M = $0.43
break-even hits = ceil(write$/M / read$/M) = ceil($12.5 / $1) = 13Datos a fecha de 2026-09-27T12:03:11.094Z
Qué hace
La calculadora de ahorro de caché muestra qué ahorra de verdad el caché de prompts en una carga de trabajo repetida. Introduce tus conteos de tokens de prompt y de salida más cuántas peticiones reutilizan el prompt cacheado, elige un modelo, y compara la factura sin caché contra la cacheada — incluido el caso honesto en que el caché cuesta más.
El matiz clave que captura es la prima de escritura: la primera petición paga un extra por almacenar el prompt, y cada acierto posterior paga una tarifa de lectura de caché mucho más barata en lugar del precio completo de entrada. La cifra de punto de equilibrio te dice cuántos aciertos hacen falta para que las lecturas baratas paguen esa única escritura.
Cómo usarlo
- Ajusta Prompt tokens / request, Output tokens / request y Cache hits con los steppers.
- Elige un Model — los modelos con precio de caché se ordenan primero; los modelos sin tarifas de caché publicadas se marcan “no cache rates” y muestran el estado vacío explicativo.
- Lee el titular: verde cuando el caché ahorra dinero, rojo cuando cuesta más (demasiados pocos aciertos para amortizar la escritura).
- Revisa el bloque The math — ambas fórmulas renderizadas con las tarifas en vivo de tu modelo y tus números sustituidos dentro.
- Copy savings o Copy share link para enviar el escenario exacto.
Ejemplos
Un prompt repetido de 10k tokens (5 aciertos)
Entrada: 10.000 tokens de prompt, 1.000 tokens de salida, 5 aciertos de caché, a $10/M de entrada, $50/M de salida, $1/M de lectura de caché, $12.5/M de escritura de caché:
uncached = 5 × (10,000×$10 + 1,000×$50) / 1M = $0.75
cached = (10,000×$12.5 + 5 × (10,000×$1 + 1,000×$50)) / 1M = $0.425
savings = $0.325 (43.33%) · break-even = ceil(12.5 / 1) = 13 hits
Una única petición — el caché pierde
La misma forma, 1 acierto de caché:
uncached = $0.15 · cached = $0.185 · savings = −$0.035
Un solo acierto nunca amortiza la prima de escritura; la herramienta muestra el resultado negativo en tono de error en lugar de ocultarlo.
Buen saber
- El punto de equilibrio cuenta lecturas, no peticiones.
ceil(write$/M ÷ read$/M)es cuántos aciertos de caché hacen falta para que el gasto acumulado de lecturas iguale una prima de escritura — por debajo de eso, el caché cuesta más. - Las tarifas son una instantánea. Cada cifra fluye de una instantánea de modelos con fecha — consulta la línea “Data as of” para comprobar la frescura; los modelos sin tarifas de caché publicadas no devuelven ningún resultado en lugar de una matemática parcial.
- Privado: todo se ejecuta 100% en el cliente - ningún conteo de tokens ni tarifa sale de tu navegador.
- Herramientas relacionadas: LLM Cost Calculator, Token Estimator, Embedding Chunk Planner.