Économise $0.33 (43.33%) $0.75 sans cache → $0.43 avec cache · 5 requêtes Seuil de rentabilité: 13 accès au cache — les lectures doivent rembourser une prime d’écriture
sans cache = accès × (prompt×in$/M + sortie×out$/M) / 1M
= 5 × (10,000×$10 + 1,000×$50) / 1M = $0.75
avec cache = (prompt×write$/M + accès × (prompt×read$/M + sortie×out$/M)) / 1M
= (10,000×$12.5 + 5 × (10,000×$1 + 1,000×$50)) / 1M = $0.43
break-even hits = ceil(write$/M / read$/M) = ceil($12.5 / $1) = 13Données au 2026-09-27T12:03:11.094Z
Ce que ça fait
Le Calculateur d’économies de cache montre ce que le prompt caching économise réellement sur une charge de travail répétée. Entrez vos nombres de tokens de prompt et de sortie, plus le nombre de requêtes qui réutilisent le prompt en cache, choisissez un modèle, et il compare la facture sans cache contre la facture avec cache — y compris le cas honnête où le cache coûte plus cher.
La nuance clé qu’il capture est la prime d’écriture : la première requête paie un supplément pour stocker le prompt, et chaque hit ultérieur paie un tarif de lecture de cache bien moins cher au lieu du prix d’entrée plein. Le chiffre du point d’équilibre vous dit combien de hits il faut pour que les lectures bon marché remboursent cette unique écriture.
Comment l’utiliser
- Réglez Tokens de prompt / requête, Tokens de sortie / requête et Hits de cache avec les steppers.
- Choisissez un modèle — les modèles avec tarifs de cache sont triés en premier ; les modèles sans tarifs de cache publiés sont marqués « no cache rates » et affichent l’état vide explicatif.
- Lisez le titre : vert quand le cache économise de l’argent, rouge quand il coûte plus cher (trop peu de hits pour amortir l’écriture).
- Vérifiez le bloc Le calcul — les deux formules rendues avec les tarifs en direct de votre modèle et vos nombres substitués dedans.
- Copier l’économie ou Copier le lien de partage pour envoyer le scénario exact.
Exemples
Un prompt de 10k tokens répété (5 hits)
Entrée : 10 000 tokens de prompt, 1 000 tokens de sortie, 5 hits de cache, à 10 $/M en entrée, 50 $/M en sortie, 1 $/M en lecture de cache, 12,5 $/M en écriture de cache :
uncached = 5 × (10,000×$10 + 1,000×$50) / 1M = $0.75
cached = (10,000×$12.5 + 5 × (10,000×$1 + 1,000×$50)) / 1M = $0.425
savings = $0.325 (43.33%) · break-even = ceil(12.5 / 1) = 13 hits
Une requête unique — le cache perd
Même forme, 1 hit de cache :
uncached = $0.15 · cached = $0.185 · savings = −$0.035
Un hit unique n’amortit jamais la prime d’écriture ; l’outil affiche le résultat négatif dans un ton d’erreur plutôt que de le cacher.
Bon à savoir
- Le point d’équilibre compte les lectures, pas les requêtes.
ceil(write$/M ÷ read$/M)est le nombre de hits de cache nécessaires pour que la dépense cumulative en lecture égale une prime d’écriture — en dessous, le cache coûte plus cher. - Les tarifs sont un instantané. Chaque chiffre découle d’un instantané de modèles daté — vérifiez la ligne « Data as of » pour la fraîcheur ; les modèles sans tarifs de cache publiés ne renvoient aucun résultat plutôt qu’un calcul partiel.
- Privé : tout tourne 100 % côté client — aucun nombre de tokens ni tarif ne quitte votre navigateur.
- Outils liés : LLM Cost Calculator, Token Estimator, Embedding Chunk Planner.