Spart $0.33 (43.33%) $0.75 ungecacht → $0.43 gecacht · 5 Anfragen Break-even: 13 Cache-Treffer — Lesezugriffe müssen eine Schreibprämie ausgleichen
ungecacht = Treffer × (Prompt×in$/M + Output×out$/M) / 1M
= 5 × (10,000×$10 + 1,000×$50) / 1M = $0.75
gecacht = (Prompt×write$/M + Treffer × (Prompt×read$/M + Output×out$/M)) / 1M
= (10,000×$12.5 + 5 × (10,000×$1 + 1,000×$50)) / 1M = $0.43
break-even hits = ceil(write$/M / read$/M) = ceil($12.5 / $1) = 13Daten Stand 2026-09-27T12:03:11.094Z
Was es tut
Der Cache Savings Calculator zeigt, was Prompt-Caching bei einer wiederholten Arbeitslast tatsächlich spart. Gib deine Prompt- und Output-Tokenzahlen ein plus die Anzahl der Anfragen, die den gecachten Prompt wiederverwenden, wähle ein Modell - und er vergleicht die ungecachte Rechnung mit der gecachten, einschließlich des ehrlichen Falls, in dem Caching mehr kostet.
Die zentrale Feinheit, die er abbildet, ist die Schreibprämie (write premium): die erste Anfrage zahlt extra, um den Prompt zu speichern, und jeder spätere Treffer zahlt einen viel billigeren Cache-Lesetarif statt des vollen Eingabepreises. Die Break-even-Zahl sagt dir, wie viele Treffer nötig sind, bis die billigen Lesevorgänge diese eine Schreibprämie abbezahlt haben.
So verwendest du es
- Setze Prompt tokens / request, Output tokens / request und Cache hits mit den Steppern.
- Wähle ein Model - Modelle mit Cache-Preisen sortieren zuerst; Modelle ohne veröffentlichte Cache-Tarife sind mit “no cache rates” markiert und zeigen den erklärenden Leerezustand.
- Lies die Schlagzeile: grün, wenn Caching Geld spart, rot, wenn es mehr kostet (zu wenige Treffer, um den Schreibvorgang zu amortisieren).
- Prüfe den Block The math - beide Formeln gerendert mit den Live-Tarifen deines Modells und eingesetzten Zahlen.
- Copy savings oder Copy share link, um exakt dieses Szenario weiterzugeben.
Beispiele
Ein wiederholter 10k-Token-Prompt (5 Treffer)
Eingabe: 10.000 Prompt-Tokens, 1.000 Output-Tokens, 5 Cache-Treffer, bei $10/M Input, $50/M Output, $1/M Cache-Lesen, $12.5/M Cache-Schreiben:
uncached = 5 × (10,000×$10 + 1,000×$50) / 1M = $0.75
cached = (10,000×$12.5 + 5 × (10,000×$1 + 1,000×$50)) / 1M = $0.425
savings = $0.325 (43.33%) · break-even = ceil(12.5 / 1) = 13 hits
Eine einzelne Anfrage - Caching verliert
Gleiche Form, 1 Cache-Treffer:
uncached = $0.15 · cached = $0.185 · savings = −$0.035
Ein Treffer amortisiert die Schreibprämie nie; das Tool zeigt das negative Ergebnis im Fehler-Ton, statt es zu verbergen.
Gut zu wissen
- Break-even zählt Lesevorgänge, nicht Anfragen.
ceil(write$/M ÷ read$/M)ist die Anzahl Cache-Treffer, bis die kumulierte Leseausgabe einer Schreibprämie entspricht - darunter kostet Caching mehr. - Tarife sind eine Momentaufnahme. Jede Zahl fließt aus einem datierten Modell-Snapshot - prüfe die Zeile “Data as of” auf Frische; Modelle ohne veröffentlichte Cache-Tarife liefern kein Ergebnis statt Teilrechnungen.
- Privat: alles läuft zu 100 % clientseitig - keine Tokenzahlen oder Tarife verlassen deinen Browser.
- Verwandte Tools: LLM Cost Calculator, Token Estimator, Embedding Chunk Planner.