節約 $0.33 (43.33%) $0.75 キャッシュなし → $0.43 キャッシュあり · 5 リクエスト 損益分岐点: 13 キャッシュヒット — 読み取りで書き込みプレミアムを回収する必要があります
キャッシュなし = ヒット数 × (プロンプト×in$/M + 出力×out$/M) / 1M
= 5 × (10,000×$10 + 1,000×$50) / 1M = $0.75
キャッシュあり = (プロンプト×write$/M + ヒット数 × (プロンプト×read$/M + 出力×out$/M)) / 1M
= (10,000×$12.5 + 5 × (10,000×$1 + 1,000×$50)) / 1M = $0.43
break-even hits = ceil(write$/M / read$/M) = ceil($12.5 / $1) = 13データ時点 2026-09-27T12:03:11.094Z
機能の説明
Cache Savings Calculator は、プロンプトキャッシングが繰り返しワークロードで実際にどれだけ節約するかを示します。プロンプトと出力のトークン数、そしてキャッシュされたプロンプトを再利用するリクエスト数を入力し、モデルを選ぶと、キャッシュなしの請求とキャッシュありの請求を比較します - キャッシングがかえって高くつく正直なケースも含めてです。
このツールが捉える鍵となるニュアンスは書き込みプレミアムです:最初のリクエストはプロンプトの保存に追加料金を支払い、以降のヒットはすべて入力フル価格の代わりにはるかに安いキャッシュ読み取りレートを支払います。損益分岐の数値は、その安い読み取りが 1 回の書き込みを回収するのに何ヒット必要かを示します。
使い方
- ステッパーで Prompt tokens / request、Output tokens / request、Cache hits を設定します。
- Model を選びます - キャッシュ価格付きのモデルが先頭にソートされ、キャッシュレートを公表していないモデルには “no cache rates” と表示され、説明付きの空状態になります。
- 見出しを読みます:キャッシングが節約する場合は緑、余計にかかる場合は赤(書き込みを償却するにはヒットが少なすぎます)。
- The math ブロックを確認します - 両方の数式に、選んだモデルのライブレートとあなたの数値が代入されて表示されます。
- Copy savings または Copy share link で、正確なシナリオをそのまま送ります。
例
10k トークンのプロンプトを繰り返すケース(5 ヒット)
入力:プロンプト 10,000 トークン、出力 1,000 トークン、キャッシュヒット 5、$10/M 入力、$50/M 出力、$1/M キャッシュ読み取り、$12.5/M キャッシュ書き込み:
uncached = 5 × (10,000×$10 + 1,000×$50) / 1M = $0.75
cached = (10,000×$12.5 + 5 × (10,000×$1 + 1,000×$50)) / 1M = $0.425
savings = $0.325 (43.33%) · break-even = ceil(12.5 / 1) = 13 hits
単発リクエスト - キャッシングは負け
同じ構成で、キャッシュヒット 1:
uncached = $0.15 · cached = $0.185 · savings = −$0.035
1 ヒットで書き込みプレミアムが償却されることはありません。ツールは負の結果を隠さず、エラートーンで表示します。
補足事項
- 損益分岐はリクエスト数ではなく読み取り数を数える。
ceil(write$/M ÷ read$/M)は、累積の読み取り支出が書き込みプレミアム 1 回分と等しくなるのに必要なキャッシュヒット数です - これ未満ではキャッシングの方が高くつきます。 - レートはスナップショット。 すべての数値は 1 つの日付付きモデルスナップショットから流れます - 新しさは “Data as of” 行で確認してください。キャッシュレートを公表していないモデルは、中途半端な計算ではなく結果なしを返します。
- プライベート: すべて 100% クライアントサイドで実行されます - トークン数もレートもブラウザーの外に出ません。
- 関連ツール: LLM Cost Calculator、Token Estimator、Embedding Chunk Planner。